Show GN: Malkuth - 다국어 한국어 분류 특화 Jev like system one model (4B/2B)

1 hour ago 2

텍스트와 질문, 선택지를 주면 답을 생성하는 대신 각 선택지의 확률을 돌려주는 모델
4B와 2B 두 가지. Kev(Apache-2.0) 체크포인트에서 post-training했고 TypeSafe System One API와 호환

측정

  • 공개 벤치마크 29개 suite, 약 129,000 질문. 모든 모델이 같은 문항을 풀었고 Jev는 API로 직접 호출해 측정
모델 held-out 정확도 Brier
Jev API 0.754 0.355
Malkuth-4B 0.724 0.385
Malkuth-2B 0.703 0.412
Kev-9B 0.700 0.407
Kev-4B 0.686 0.407
Laya (4종 중 최고) 0.544 0.654

캘리브레이션

  • Jev의 문항별 확률을 확보해 confidence 구간별 실제 정답률을 비교
  • 모든 모델이 과신하며, Jev의 편차가 0.066~0.088로 가장 좁음. Malkuth-4B는 중간 구간에서 0.139까지 벌어짐
  • 2B가 4B보다 잘 보정돼 있음
Read Entire Article