Jev verslaat Gemini 2.5 Flash Lite op kwaliteit en snelheid in classifier-evaluatie
Malte Ubl voerde Jev van TypeSafe AI uit op een bestaande classifier-evaluatie: het verzadigde de evaluatie op kwaliteit en was 6x sneller dan Gemini 2.5 Flash Lite.
De JevBench-vergelijking van Benchmark Heaven toont Jev 1.13.0 met 86,6% openbaar en 36,7% verzegeld, terwijl GPT-6 Luna 99,6% en 95,5% haalt. Luna staat nog steeds op #30 op JevBench; de kosten-as ($0,135 vs $0,040 per 1.000 beslissingen) en de drempel onder 50 zijn belangrijke verklaringen.
GPT-6 Luna (medium) gets nearly everything right: 99.6% public, 95.5% sealed. Jev 1.13.0: 86.6% and 36.7%. Luna still ranks #30 on JevBench. One column explains it: $0.135 per 1,000 decisions vs $0.040, Cost axis 36.0. Below 50, the gate applies. https://benchmarkheaven.com/jev-models/v1.4.1?compare=jev-1.13.0,gpt-6-luna…