Создание классификатора кодовой базы с помощью Jev
Разработчик делится созданием классификатора кодовой базы с помощью Jev, предполагая, что это может решить проблему переусложнённого кода от агентов, и спрашивает, что тестировать дальше.
На 113 багах Defects4J модель Jev ранжирует тестовые наборы так, что 96% падающих тестов оказываются в первых 10%, превосходя BM25 и GPT-5.4 nano для более быстрого обнаружения сбоев сборки.
Question: given a patch, can you rank a test suite so the tests that fail show up first? On 113 Defects4J bugs, how often is a failing test in the first 10%? BM25 → 73% GPT-5.4 nano → 92% Jev → 96% fail your builds quicker instead of waiting :)