Jev ile kod tabanı sınıflandırıcısı oluşturma
Bir geliştirici Jev ile kod tabanı sınıflandırıcısı oluşturduğunu paylaşıyor, ajanların ürettiği aşırı mühendislik kodunu çözebileceğini öne sürüyor ve sırada neyin test edileceğini soruyor.
Defects4J'deki 113 hata üzerinde Jev modeli, test paketlerini başarısız testlerin %96'sı ilk %10'da görünecek şekilde sıralar; BM25 ve GPT-5.4 nano'yu geride bırakarak derlemeleri daha hızlı başarısız ettirir.
Question: given a patch, can you rank a test suite so the tests that fail show up first? On 113 Defects4J bugs, how often is a failing test in the first 10%? BM25 → 73% GPT-5.4 nano → 92% Jev → 96% fail your builds quicker instead of waiting :)