สร้างตัวจำแนกโค้ดเบสด้วย Jev
นักพัฒนแชร์การสร้างตัวจำแนกโค้ดเบสด้วย Jev โดยเสนอว่าอาจแก้ปัญหาโค้ดที่ซับซ้อนเกินไปจากเอเจนต์ และถามว่าควรทดสอบอะไรต่อไป
Braintrust ทดสอบ Jev เป็นโมเดลผู้ตัดสิน: เร็ว ราคาถูก และแข่งขันได้ในการประเมิน groundedness แต่ตามหลังโมเดลที่มีการให้เหตุผลในด้านคณิตศาสตร์และโค้ด เหมาะกับงานประเมินบางประเภท ไม่ใช่ตัวแทน LLM-as-a-judge ทั้งหมด
We tested where Jev holds up as a judge. Jev was fast, cheap, and highly competitive for judging groundedness. But it lagged behind models with reasoning for math and code domains. Use it for certain eval tasks, but don't throw out your LLM-as-a-judge just yet. Read more →