Budowanie klasyfikatora bazy kodu z Jev
Deweloper dzieli się budową klasyfikatora bazy kodu z Jev, sugerując, że może rozwiązać problem przekombinowanego kodu od agentów, i pyta, co testować dalej.
Na 113 błędach Defects4J model Jev sortuje zestawy testów tak, że 96% nieudanych testów pojawia się w pierwszych 10%, przewyższając BM25 i GPT-5.4 nano, aby szybciej wykrywać niepowodzenia buildów.
Question: given a patch, can you rank a test suite so the tests that fail show up first? On 113 Defects4J bugs, how often is a failing test in the first 10%? BM25 → 73% GPT-5.4 nano → 92% Jev → 96% fail your builds quicker instead of waiting :)