Jev ชนะ Gemini 2.5 Flash Lite ทั้งด้านคุณภาพและความเร็วในการประเมินตัวจำแนก
Malte Ubl ทดลองใช้ Jev ของ TypeSafe AI กับชุดประเมินตัวจำแนกที่มีอยู่ โดยทำคะแนนคุณภาพได้เต็มชุดประเมินและเร็วกว่า Gemini 2.5 Flash Lite 6 เท่า
การเปรียบเทียบ JevBench ของ Benchmark Heaven แสดงให้เห็นว่า Jev 1.13.0 ได้ 86.6% ชุดสาธารณะ และ 36.7% ชุดปิดผนึก ขณะที่ GPT-6 Luna ได้ 99.6% และ 95.5% Luna ยังคงอยู่อันดับ #30 ใน JevBench โดยแกนต้นทุน ($0.135 เทียบกับ $0.040 ต่อ 1,000 การตัดสินใจ) และเกณฑ์ต่ำกว่า 50 เป็นปัจจัยอธิบายหลัก
GPT-6 Luna (medium) gets nearly everything right: 99.6% public, 95.5% sealed. Jev 1.13.0: 86.6% and 36.7%. Luna still ranks #30 on JevBench. One column explains it: $0.135 per 1,000 decisions vs $0.040, Cost axis 36.0. Below 50, the gate applies. https://benchmarkheaven.com/jev-models/v1.4.1?compare=jev-1.13.0,gpt-6-luna…