Jev verslaat Gemini 2.5 Flash Lite op kwaliteit en snelheid in classifier-evaluatie
Malte Ubl voerde Jev van TypeSafe AI uit op een bestaande classifier-evaluatie: het verzadigde de evaluatie op kwaliteit en was 6x sneller dan Gemini 2.5 Flash Lite.
Evaluatie van Jev en negen open checkpoints op 22 taken toont dat Jev leidt in macro-nauwkeurigheid, maar een open 4B-model beter gekalibreerde waarschijnlijkheden produceert; jev-bench is volledig open.
Jev Tests: Accuracy gave one ranking. Calibration gave another. We evaluated Jev and nine open checkpoints across 22 tasks. Jev led on macro accuracy. But an open 4B model produced better-calibrated probabilities. jev-bench is fully open 👇