Bygga en kodbas-klassificerare med Jev
En utvecklare delar bygget av en kodbas-klassificerare med Jev, föreslår att det kan lösa överkonstruerad kod från agenter, och frågar vad som ska testas härnäst.
Hamel Husain påpekar att Jev kan användas för LLM-utvärderingar eftersom en LLM Judge i grunden är en klassificerare, och råder att testa klassificerare mot mänskliga etiketter och undvika överanpassning.
Can you use Jev for Evals? Yes! Remember that a LLM Judge is also classifier*. Make sure to test your classifiers against human labels and don't overfit. Hope this helps! * https://hamel.dev/blog/posts/evals-faq/why-do-you-recommend-binary-passfail-evaluations-instead-of-1-5-ratings-likert-scales.html…