بناء مصنف قاعدة كود باستخدام Jev
يشارك مطور بناء مصنف قاعدة كود باستخدام Jev، ويقترح أنه قد يحل مشكلة الكود المفرط الهندسة من الوكلاء، ويسأل عما يجب اختباره بعد ذلك.
اختبرت Braintrust نموذج Jev كحكم: سريع ورخيص وتنافسي في تقييم groundedness، لكنه متأخر عن نماذج الاستدلال في الرياضيات والبرمجة. مناسب لمهام تقييم معينة دون استبدال LLM-as-a-judge بالكامل.
We tested where Jev holds up as a judge. Jev was fast, cheap, and highly competitive for judging groundedness. But it lagged behind models with reasoning for math and code domains. Use it for certain eval tasks, but don't throw out your LLM-as-a-judge just yet. Read more →