Back to explore

Jevベンチマーク:精度とキャリブレーションの比較評価

Jevと9つのオープンチェックポイントを22タスクで評価した結果、Jevはマクロ精度でリードするが、オープンな4Bモデルの方が確率キャリブレーションに優れる。jev-benchは完全公開。

Jev Tests: Accuracy gave one ranking. Calibration gave another. We evaluated Jev and nine open checkpoints across 22 tasks. Jev led on macro accuracy. But an open 4B model produced better-calibrated probabilities. jev-bench is fully open 👇

· 0 likesOpen on X