Einen Codebase-Klassifikator mit Jev erstellen
Ein Entwickler teilt den Bau eines Codebase-Klassifikators mit Jev, der überentwickelten Code von Agenten lösen könnte, und fragt, was als Nächstes getestet werden soll.
Der Vergleich von Benchmark Heaven zeigt, dass Jev 1.13.0 bei öffentlicher Genauigkeit und Kosten fast auf dem Niveau von Winnow-12B Q8 liegt, mit Jev führend bei Kalibrierung und Punktzahl.
Winnow-12B Q8 (#4) and Jev 1.13.0 (#1) are nearly level on public accuracy, 85.7% vs 86.6%, and on Cost, 52.9 vs 52.0. The gap is confidence. Calibration 64.8 vs 76.3; sealed set 33.1% vs 36.7%. Score 55.58 vs 63.29. https://benchmarkheaven.com/jev-models/v1.4.1?compare=jev-1.13.0,winnow-12b…