Bygga en kodbas-klassificerare med Jev
En utvecklare delar bygget av en kodbas-klassificerare med Jev, föreslår att det kan lösa överkonstruerad kod från agenter, och frågar vad som ska testas härnäst.
På 113 Defects4J-buggar sorterar Jev-modellen testsviter så att 96 % av misslyckade tester visas i de översta 10 %, och överträffar BM25 och GPT-5.4 nano för att få byggen att misslyckas snabbare.
Question: given a patch, can you rank a test suite so the tests that fail show up first? On 113 Defects4J bugs, how often is a failing test in the first 10%? BM25 → 73% GPT-5.4 nano → 92% Jev → 96% fail your builds quicker instead of waiting :)