Xây dựng bộ phân loại cơ sở mã với Jev
Một nhà phát triển chia sẻ việc xây dựng bộ phân loại cơ sở mã với Jev, cho rằng có thể giải quyết mã quá phức tạp do tác nhân tạo ra, và hỏi nên thử nghiệm gì tiếp theo.
Braintrust thử nghiệm Jev như mô hình giám khảo: nhanh, rẻ và cạnh tranh ở đánh giá groundedness, nhưng kém hơn các mô hình suy luận ở toán và mã. Phù hợp cho một số tác vụ đánh giá, không thay thế hoàn toàn LLM-as-a-judge.
We tested where Jev holds up as a judge. Jev was fast, cheap, and highly competitive for judging groundedness. But it lagged behind models with reasoning for math and code domains. Use it for certain eval tasks, but don't throw out your LLM-as-a-judge just yet. Read more →