Back to explore

Jev 벤치마크: 정확도와 보정 비교 평가

Jev와 9개의 오픈 체크포인트를 22개 태스크에서 평가한 결과, Jev는 매크로 정확도에서 앞섰지만 오픈 4B 모델이 더 나은 확률 보정을 보였으며 jev-bench는 완전 공개되어 있다.

Jev Tests: Accuracy gave one ranking. Calibration gave another. We evaluated Jev and nine open checkpoints across 22 tasks. Jev led on macro accuracy. But an open 4B model produced better-calibrated probabilities. jev-bench is fully open 👇

· 0 likesOpen on X