Back to explore

Benchmarki Jev: ocena dokładności i kalibracji

Ocena Jev i dziewięciu otwartych checkpointów na 22 zadaniach pokazuje, że Jev prowadzi w dokładności makro, ale otwarty model 4B daje lepiej skalibrowane prawdopodobieństwa; jev-bench jest w pełni otwarty.

Jev Tests: Accuracy gave one ranking. Calibration gave another. We evaluated Jev and nine open checkpoints across 22 tasks. Jev led on macro accuracy. But an open 4B model produced better-calibrated probabilities. jev-bench is fully open 👇

· 0 likesOpen on X