Jev ชนะ Gemini 2.5 Flash Lite ทั้งด้านคุณภาพและความเร็วในการประเมินตัวจำแนก
Malte Ubl ทดลองใช้ Jev ของ TypeSafe AI กับชุดประเมินตัวจำแนกที่มีอยู่ โดยทำคะแนนคุณภาพได้เต็มชุดประเมินและเร็วกว่า Gemini 2.5 Flash Lite 6 เท่า
การประเมิน Jev และเช็คพอยต์เปิดเก้ารายการใน 22 งานพบว่า Jev นำด้านความแม่นยำระดับมหภาค แต่โมเดล 4B แบบเปิดให้ความน่าจะเป็นที่ปรับเทียบได้ดีกว่า โดย jev-bench เปิดทั้งหมด
Jev Tests: Accuracy gave one ranking. Calibration gave another. We evaluated Jev and nine open checkpoints across 22 tasks. Jev led on macro accuracy. But an open 4B model produced better-calibrated probabilities. jev-bench is fully open 👇