Jev slår Gemini 2.5 Flash Lite i kvalitet och hastighet i klassificerarutvärdering
Malte Ubl körde TypeSafe AI:s Jev mot en befintlig klassificerarutvärdering: den mättade utvärderingen i kvalitet och var 6x snabbare än Gemini 2.5 Flash Lite.
Utvärdering av Jev och nio öppna checkpoints över 22 uppgifter visar att Jev leder i makronoggrannhet, men en öppen 4B-modell ger bättre kalibrerade sannolikheter; jev-bench är helt öppen.
Jev Tests: Accuracy gave one ranking. Calibration gave another. We evaluated Jev and nine open checkpoints across 22 tasks. Jev led on macro accuracy. But an open 4B model produced better-calibrated probabilities. jev-bench is fully open 👇