Einen Codebase-Klassifikator mit Jev erstellen
Ein Entwickler teilt den Bau eines Codebase-Klassifikators mit Jev, der überentwickelten Code von Agenten lösen könnte, und fragt, was als Nächstes getestet werden soll.
Braintrust testete Jev als Judge-Modell: schnell, günstig und wettbewerbsfähig bei Groundedness, aber hinter Reasoning-Modellen in Mathematik und Code. Für bestimmte Eval-Aufgaben geeignet, kein vollständiger Ersatz für LLM-as-a-judge.
We tested where Jev holds up as a judge. Jev was fast, cheap, and highly competitive for judging groundedness. But it lagged behind models with reasoning for math and code domains. Use it for certain eval tasks, but don't throw out your LLM-as-a-judge just yet. Read more →