Een codebase-classificator bouwen met Jev
Een ontwikkelaar deelt het bouwen van een codebase-classificator met Jev, suggereert dat dit overgeëngineerde code van agents kan oplossen, en vraagt wat er nu getest moet worden.
Braintrust testte Jev als judge-model: snel, goedkoop en competitief voor groundedness, maar achter op redeneermodellen bij wiskunde en code. Geschikt voor bepaalde evaluatietaken, geen volledige vervanging van LLM-as-a-judge.
We tested where Jev holds up as a judge. Jev was fast, cheap, and highly competitive for judging groundedness. But it lagged behind models with reasoning for math and code domains. Use it for certain eval tasks, but don't throw out your LLM-as-a-judge just yet. Read more →