Een codebase-classificator bouwen met Jev
Een ontwikkelaar deelt het bouwen van een codebase-classificator met Jev, suggereert dat dit overgeëngineerde code van agents kan oplossen, en vraagt wat er nu getest moet worden.
Bij 113 Defects4J-bugs sorteert het Jev-model testsuites zodat 96% van de falende tests in de top 10% verschijnt, beter dan BM25 en GPT-5.4 nano om builds sneller te laten falen.
Question: given a patch, can you rank a test suite so the tests that fail show up first? On 113 Defects4J bugs, how often is a failing test in the first 10%? BM25 → 73% GPT-5.4 nano → 92% Jev → 96% fail your builds quicker instead of waiting :)