Xây dựng bộ phân loại cơ sở mã với Jev
Một nhà phát triển chia sẻ việc xây dựng bộ phân loại cơ sở mã với Jev, cho rằng có thể giải quyết mã quá phức tạp do tác nhân tạo ra, và hỏi nên thử nghiệm gì tiếp theo.
Trên 113 lỗi Defects4J, mô hình Jev sắp xếp bộ kiểm thử để 96% bài kiểm tra thất bại xuất hiện trong top 10%, vượt trội so với BM25 và GPT-5.4 nano để làm cho bản dựng thất bại nhanh hơn.
Question: given a patch, can you rank a test suite so the tests that fail show up first? On 113 Defects4J bugs, how often is a failing test in the first 10%? BM25 → 73% GPT-5.4 nano → 92% Jev → 96% fail your builds quicker instead of waiting :)