Back to explore

Benchmark Jev: Evaluasi Akurasi vs Kalibrasi

Evaluasi Jev dan sembilan checkpoint terbuka pada 22 tugas menunjukkan Jev unggul dalam akurasi makro, tetapi model 4B terbuka menghasilkan probabilitas yang lebih terkalibrasi; jev-bench sepenuhnya terbuka.

Jev Tests: Accuracy gave one ranking. Calibration gave another. We evaluated Jev and nine open checkpoints across 22 tasks. Jev led on macro accuracy. But an open 4B model produced better-calibrated probabilities. jev-bench is fully open 👇

· 0 likesOpen on X