Jev slår Gemini 2.5 Flash Lite i kvalitet och hastighet i klassificerarutvärdering
Malte Ubl körde TypeSafe AI:s Jev mot en befintlig klassificerarutvärdering: den mättade utvärderingen i kvalitet och var 6x snabbare än Gemini 2.5 Flash Lite.
Benchmark Heavens JevBench-jämförelse visar att Jev 1.13.0 får 86,6 % offentligt och 36,7 % förseglat, medan GPT-6 Luna når 99,6 % och 95,5 %. Luna ligger fortfarande på plats #30 på JevBench; kostnadsaxeln ($0,135 vs $0,040 per 1 000 beslut) och grinden under 50 är förklarande faktorer.
GPT-6 Luna (medium) gets nearly everything right: 99.6% public, 95.5% sealed. Jev 1.13.0: 86.6% and 36.7%. Luna still ranks #30 on JevBench. One column explains it: $0.135 per 1,000 decisions vs $0.040, Cost axis 36.0. Below 50, the gate applies. https://benchmarkheaven.com/jev-models/v1.4.1?compare=jev-1.13.0,gpt-6-luna…