텍스트와 질문, 선택지를 주면 답을 생성하는 대신 각 선택지의 확률을 돌려주는 모델
4B와 2B 두 가지. Kev(Apache-2.0) 체크포인트에서 post-training했고 TypeSafe System One API와 호환
측정
- 공개 벤치마크 29개 suite, 약 129,000 질문. 모든 모델이 같은 문항을 풀었고 Jev는 API로 직접 호출해 측정
| Jev API | 0.754 | 0.355 |
| Malkuth-4B | 0.724 | 0.385 |
| Malkuth-2B | 0.703 | 0.412 |
| Kev-9B | 0.700 | 0.407 |
| Kev-4B | 0.686 | 0.407 |
| Laya (4종 중 최고) | 0.544 | 0.654 |
캘리브레이션
- Jev의 문항별 확률을 확보해 confidence 구간별 실제 정답률을 비교
- 모든 모델이 과신하며, Jev의 편차가 0.066~0.088로 가장 좁음. Malkuth-4B는 중간 구간에서 0.139까지 벌어짐
- 2B가 4B보다 잘 보정돼 있음

1 hour ago
2
![[속보] 네팔 홍수로 고립됐던 한국인 10명 중 9명 안전지역 이송](https://amuse.peoplentools.com/site/assets/img/broken.gif)

![베테랑 김현수 끝내기안타…KT 선두 지켰다, 4년차 김정운은 데뷔 첫 승 감격 [SD 수원 스타]](https://dimg.donga.com/wps/SPORTS/IMAGE/2026/08/26/134552496.1.jpg)





English (US) ·