Jev, 분류기 평가에서 품질과 속도 모두 우세
Malte Ubl이 TypeSafe AI의 Jev를 기존 분류기 평가에 적용한 결과, 품질에서 평가를 포화시켰고 Gemini 2.5 Flash Lite보다 6배 빨랐다.
Jev와 9개의 오픈 체크포인트를 22개 태스크에서 평가한 결과, Jev는 매크로 정확도에서 앞섰지만 오픈 4B 모델이 더 나은 확률 보정을 보였으며 jev-bench는 완전 공개되어 있다.
Jev Tests: Accuracy gave one ranking. Calibration gave another. We evaluated Jev and nine open checkpoints across 22 tasks. Jev led on macro accuracy. But an open 4B model produced better-calibrated probabilities. jev-bench is fully open 👇