Back to explore

Benchmarks de Jev: evaluación de precisión vs. calibración

La evaluación de Jev y nueve checkpoints abiertos en 22 tareas muestra que Jev lidera en precisión macro, pero un modelo abierto de 4B produce probabilidades mejor calibradas; jev-bench es totalmente abierto.

Jev Tests: Accuracy gave one ranking. Calibration gave another. We evaluated Jev and nine open checkpoints across 22 tasks. Jev led on macro accuracy. But an open 4B model produced better-calibrated probabilities. jev-bench is fully open 👇

· 0 likesOpen on X