Criando um classificador de código com Jev
Um desenvolvedor compartilha a criação de um classificador de código com Jev, sugerindo que pode resolver código superengenheirado por agentes, e pergunta o que testar a seguir.
A Braintrust testou o Jev como modelo juiz: rápido, barato e competitivo em groundedness, mas atrás de modelos com raciocínio em matemática e código. Indicado para certas tarefas de avaliação, sem substituir totalmente o LLM-as-a-judge.
We tested where Jev holds up as a judge. Jev was fast, cheap, and highly competitive for judging groundedness. But it lagged behind models with reasoning for math and code domains. Use it for certain eval tasks, but don't throw out your LLM-as-a-judge just yet. Read more →