Back to explore

Benchmarks do Jev: avaliação de precisão vs. calibração

A avaliação do Jev e de nove checkpoints abertos em 22 tarefas mostra que o Jev lidera em precisão macro, mas um modelo aberto de 4B produz probabilidades melhor calibradas; o jev-bench é totalmente aberto.

Jev Tests: Accuracy gave one ranking. Calibration gave another. We evaluated Jev and nine open checkpoints across 22 tasks. Jev led on macro accuracy. But an open 4B model produced better-calibrated probabilities. jev-bench is fully open 👇

· 0 likesOpen on X