Back to explore

Benchmark Jev: valutazione accuratezza vs calibrazione

La valutazione di Jev e nove checkpoint aperti su 22 attività mostra che Jev è in testa per accuratezza macro, ma un modello aperto da 4B produce probabilità meglio calibrate; jev-bench è completamente aperto.

Jev Tests: Accuracy gave one ranking. Calibration gave another. We evaluated Jev and nine open checkpoints across 22 tasks. Jev led on macro accuracy. But an open 4B model produced better-calibrated probabilities. jev-bench is fully open 👇

· 0 likesOpen on X