Создание классификатора кодовой базы с помощью Jev
Разработчик делится созданием классификатора кодовой базы с помощью Jev, предполагая, что это может решить проблему переусложнённого кода от агентов, и спрашивает, что тестировать дальше.
Braintrust протестировала Jev в роли модели-судьи: быстрый, дешёвый и конкурентный в оценке groundedness, но уступает моделям с рассуждением в математике и коде. Подходит для отдельных задач оценки, но не заменяет LLM-as-a-judge полностью.
We tested where Jev holds up as a judge. Jev was fast, cheap, and highly competitive for judging groundedness. But it lagged behind models with reasoning for math and code domains. Use it for certain eval tasks, but don't throw out your LLM-as-a-judge just yet. Read more →