Jev, 분류기 평가에서 품질과 속도 모두 우세
Malte Ubl이 TypeSafe AI의 Jev를 기존 분류기 평가에 적용한 결과, 품질에서 평가를 포화시켰고 Gemini 2.5 Flash Lite보다 6배 빨랐다.
Benchmark Heaven의 JevBench 비교에 따르면 Jev 1.13.0은 공개/봉인 테스트에서 86.6% / 36.7%, GPT-6 Luna는 99.6% / 95.5%를 기록했습니다. Luna는 여전히 JevBench 30위이며, 비용 축(1,000회당 0.135달러 vs 0.040달러)과 50 미만 게이트 적용이 주요 설명 요인입니다.
GPT-6 Luna (medium) gets nearly everything right: 99.6% public, 95.5% sealed. Jev 1.13.0: 86.6% and 36.7%. Luna still ranks #30 on JevBench. One column explains it: $0.135 per 1,000 decisions vs $0.040, Cost axis 36.0. Below 50, the gate applies. https://benchmarkheaven.com/jev-models/v1.4.1?compare=jev-1.13.0,gpt-6-luna…