Back to explore

Jev-benchmarks: nauwkeurigheid vs. kalibratie

Evaluatie van Jev en negen open checkpoints op 22 taken toont dat Jev leidt in macro-nauwkeurigheid, maar een open 4B-model beter gekalibreerde waarschijnlijkheden produceert; jev-bench is volledig open.

Jev Tests: Accuracy gave one ranking. Calibration gave another. We evaluated Jev and nine open checkpoints across 22 tasks. Jev led on macro accuracy. But an open 4B model produced better-calibrated probabilities. jev-bench is fully open 👇

· 0 likesOpen on X