Einen Codebase-Klassifikator mit Jev erstellen
Ein Entwickler teilt den Bau eines Codebase-Klassifikators mit Jev, der überentwickelten Code von Agenten lösen könnte, und fragt, was als Nächstes getestet werden soll.
Hamel Husain weist darauf hin, dass Jev für LLM-Evaluierungen genutzt werden kann, da ein LLM Judge im Wesentlichen ein Klassifikator ist, und rät, Klassifikatoren mit menschlichen Labels zu testen und Overfitting zu vermeiden.
Can you use Jev for Evals? Yes! Remember that a LLM Judge is also classifier*. Make sure to test your classifiers against human labels and don't overfit. Hope this helps! * https://hamel.dev/blog/posts/evals-faq/why-do-you-recommend-binary-passfail-evaluations-instead-of-1-5-ratings-likert-scales.html…