Membangun pengklasifikasi basis kode dengan Jev
Seorang pengembang membagikan pembuatan pengklasifikasi basis kode dengan Jev, menyarankan ini dapat mengatasi kode berlebihan dari agen, dan bertanya apa yang harus diuji selanjutnya.
Pada 113 bug Defects4J, model Jev mengurutkan suite pengujian sehingga 96% tes yang gagal muncul di 10% teratas, mengungguli BM25 dan GPT-5.4 nano untuk membuat build gagal lebih cepat.
Question: given a patch, can you rank a test suite so the tests that fail show up first? On 113 Defects4J bugs, how often is a failing test in the first 10%? BM25 → 73% GPT-5.4 nano → 92% Jev → 96% fail your builds quicker instead of waiting :)