Створення класифікатора кодової бази з Jev
Розробник ділиться створенням класифікатора кодової бази з Jev, припускаючи, що це може вирішити проблему переускладненого коду від агентів, і запитує, що тестувати далі.
Braintrust протестувала Jev як модель-суддю: швидкий, дешевий і конкурентний в оцінці groundedness, але поступається моделям із міркуванням у математиці та коді. Підходить для окремих завдань оцінювання, не замінює LLM-as-a-judge повністю.
We tested where Jev holds up as a judge. Jev was fast, cheap, and highly competitive for judging groundedness. But it lagged behind models with reasoning for math and code domains. Use it for certain eval tasks, but don't throw out your LLM-as-a-judge just yet. Read more →