텍스트와 질문, 선택지를 주면 답을 생성하는 대신 각 선택지의 확률을 돌려주는 모델
4B와 2B 두 가지. Kev(Apache-2.0) 체크포인트에서 post-training했고 TypeSafe System One API와 호환
측정
- 공개 벤치마크 29개 suite, 약 129,000 질문. 모든 모델이 같은 문항을 풀었고 Jev는 API로 직접 호출해 측정
| 모델 | held-out 정확도 | Brier |
|---|---|---|
| Jev API | 0.754 | 0.355 |
| Malkuth-4B | 0.724 | 0.385 |
| Malkuth-2B | 0.703 | 0.412 |
| Kev-9B | 0.700 | 0.407 |
| Kev-4B | 0.686 | 0.407 |
| Laya (4종 중 최고) | 0.544 | 0.654 |
캘리브레이션
- Jev의 문항별 확률을 확보해 confidence 구간별 실제 정답률을 비교
- 모든 모델이 과신하며, Jev의 편차가 0.066~0.088로 가장 좁음. Malkuth-4B는 중간 구간에서 0.139까지 벌어짐
- 2B가 4B보다 잘 보정돼 있음