Membangun pengklasifikasi basis kode dengan Jev
Seorang pengembang membagikan pembuatan pengklasifikasi basis kode dengan Jev, menyarankan ini dapat mengatasi kode berlebihan dari agen, dan bertanya apa yang harus diuji selanjutnya.
Braintrust menguji Jev sebagai model juri: cepat, murah, dan kompetitif untuk penilaian groundedness, tetapi tertinggal dari model penalaran di bidang matematika dan kode. Cocok untuk tugas evaluasi tertentu, bukan pengganti penuh LLM-as-a-judge.
We tested where Jev holds up as a judge. Jev was fast, cheap, and highly competitive for judging groundedness. But it lagged behind models with reasoning for math and code domains. Use it for certain eval tasks, but don't throw out your LLM-as-a-judge just yet. Read more →