Bygga en kodbas-klassificerare med Jev
En utvecklare delar bygget av en kodbas-klassificerare med Jev, föreslår att det kan lösa överkonstruerad kod från agenter, och frågar vad som ska testas härnäst.
Braintrust testade Jev som domarmodell: snabb, billig och konkurrenskraftig för groundedness, men efter resonemangsmodeller inom matematik och kod. Lämplig för vissa utvärderingsuppgifter, ersätter inte LLM-as-a-judge helt.
We tested where Jev holds up as a judge. Jev was fast, cheap, and highly competitive for judging groundedness. But it lagged behind models with reasoning for math and code domains. Use it for certain eval tasks, but don't throw out your LLM-as-a-judge just yet. Read more →