Jev를 공개 데이터와 실제 업무에 시험하다: 분류기인가, 필터인가?

1 week ago 26

Jev를 약 1만 6,000회 호출해 공개 데이터와 실제 문서/이메일 업무에 시험한 결과, 모든 판단을 맡기기보다 쉬운 판단을 먼저 처리하고 애매한 것은 기존 모델에 넘기는 방식이 효과적이었음 공개 데이터셋 4개 중 3개에서 소형 GPT 모델보다 높은 정확도를 기록했으며, 선택지별 확률을 반환하는 조건에서 비용은 5~56배 낮고 응답시간 중앙값은 1초 미만이었음 실제 문서 처리에서는 불필요한 페이지를 먼저 걸러내, 검증한 5회 실행에서 최종 결과를 그대로 유지하면서 문서 라우팅 호출을 50~67% 줄였음 짧은 입력과 명확한 분류에는 강했지만, 문서 전체나 업무 규칙을 해석하는 작업에서는 약했고 이메일에서는 실제 요청을 확신 있게 제외하는 오류도 있었음 확신이 높은 답만 직접 처리하고 나머지는 기존 모델에 맡기되, 처리와 제외의 기준은 실제 업무 데이터로 정하고 별도 데이터로 검증하는 방식이 적합함 Jev의 출력 방식과 평가 조건 TypeSafe는 9월 15일 Jev의 얼리 액세스를 시작함 출시 당시 비교 대상은 텍스트를 생성하는 프런티어 모델이었지만, 실제 파이프라인의 반복 분류는 대체로 소형 고속 모델이 담당함 이번 평가는 그에 맞춰 gpt-5.4-mini와 gpt-5.6-luna를 비교 대상으로 삼고, 이틀 동안 약 1만 6,000회 호출함 Jev는 텍스트를 생성하지 않으며, 입력 텍스트와 고정된 답변 후보를 받아 각 답변의 확률을 반환함 choice는 최대 255개 선택지를 지원하고, 선택 결과와 선택지별 확률, confidence를 반환함 TypeSafe가 예/아니요 질문에 붙인 이름인 noul은 예일 확률 하나를 반환하므로, 0.05는 확신 있는 아니요, 0.95는 확신 있는 예에 해당함 한 번의 호출에 여러 질문을 담을 수 있음 영화 리뷰 감성 분류 예제에서 jev-latest의 실제 응답 모델은 jev-1.13.0 이었음 입력은 336토큰이며, 노트북에서 측정한 응답시간은 850ms, 비용은 0.000014달러였음 입력 가격은 100만 토큰당 0.042달러이며, 출력 토큰이 없어 출력 비용도 없음 confidence의 계산 방식은 비공개이며, 가장 높은 선택지 확률과도 다름 예제에서는 선택지 확률이 0.97인데 confidence는 0.93이었음 공개 데이터셋에서 최고 확률로 필터링해도 결과 차이는 1%포인트 이내였음 평가상 ‘확신 있음’은 choice의 confidence가 0.9 이상이거나, 예...

Read Entire Article