Creando un clasificador de código con Jev
Un desarrollador comparte la creación de un clasificador de código con Jev, sugiere que puede resolver código sobrediseñado por agentes y pregunta qué probar después.
Braintrust probó a Jev como modelo juez: rápido, económico y competitivo en groundedness, pero por detrás de modelos con razonamiento en matemáticas y código. Útil para ciertas tareas de evaluación, sin reemplazar por completo el LLM-as-a-judge.
We tested where Jev holds up as a judge. Jev was fast, cheap, and highly competitive for judging groundedness. But it lagged behind models with reasoning for math and code domains. Use it for certain eval tasks, but don't throw out your LLM-as-a-judge just yet. Read more →