Back to explore

Jev-Benchmarks: Genauigkeit vs. Kalibrierung

Die Bewertung von Jev und neun offenen Checkpoints über 22 Aufgaben zeigt, dass Jev bei der Makro-Genauigkeit führt, aber ein offenes 4B-Modell besser kalibrierte Wahrscheinlichkeiten liefert; jev-bench ist vollständig offen.

Jev Tests: Accuracy gave one ranking. Calibration gave another. We evaluated Jev and nine open checkpoints across 22 tasks. Jev led on macro accuracy. But an open 4B model produced better-calibrated probabilities. jev-bench is fully open 👇

· 0 likesOpen on X