Back to explore

Benchmarks Jev : évaluation précision vs calibration

L'évaluation de Jev et de neuf checkpoints ouverts sur 22 tâches montre que Jev mène en précision macro, mais un modèle ouvert de 4B produit des probabilités mieux calibrées ; jev-bench est entièrement ouvert.

Jev Tests: Accuracy gave one ranking. Calibration gave another. We evaluated Jev and nine open checkpoints across 22 tasks. Jev led on macro accuracy. But an open 4B model produced better-calibrated probabilities. jev-bench is fully open 👇

· 0 likesOpen on X