Jev ชนะ Gemini 2.5 Flash Lite ทั้งด้านคุณภาพและความเร็วในการประเมินตัวจำแนก
Malte Ubl ทดลองใช้ Jev ของ TypeSafe AI กับชุดประเมินตัวจำแนกที่มีอยู่ โดยทำคะแนนคุณภาพได้เต็มชุดประเมินและเร็วกว่า Gemini 2.5 Flash Lite 6 เท่า
ผู้ใช้แชร์ข้อมูลการรัน Jev: 300 หน้าเว็บ, 9 การตัดสินใจต่อหน้า, 2 เซนต์; Opus 5 ให้คะแนน 900 การตัดสินใจ และเกือบทุกข้อผิดพลาดอยู่ตรงที่ Jev เองรายงานความน่าจะเป็นต่ำ จึงต้องตรวจเฉพาะกรณีที่น่าสงสัย
2.3K papers for 14 cents lines up with my run: 300 web pages, 9 decisions each, 2 cents. On the confidence worry: Opus 5 graded 900 of the decisions, and nearly every miss sat where Jev itself reported a low probability. So you only review the doubt: