Créer un classificateur de base de code avec Jev
Un développeur partage la création d'un classificateur de base de code avec Jev, suggérant qu'il peut résoudre le code surconçu des agents, et demande quoi tester ensuite.
Braintrust a testé Jev comme modèle juge : rapide, économique et compétitif pour le groundedness, mais en retrait face aux modèles de raisonnement en mathématiques et en code. À utiliser pour certaines tâches d'évaluation, sans remplacer entièrement le LLM-as-a-judge.
We tested where Jev holds up as a judge. Jev was fast, cheap, and highly competitive for judging groundedness. But it lagged behind models with reasoning for math and code domains. Use it for certain eval tasks, but don't throw out your LLM-as-a-judge just yet. Read more →