Creando un clasificador de código con Jev
Un desarrollador comparte la creación de un clasificador de código con Jev, sugiere que puede resolver código sobrediseñado por agentes y pregunta qué probar después.
En 113 bugs de Defects4J, el modelo Jev ordena las suites de pruebas para que el 96% de las pruebas fallidas aparezcan en el 10% superior, superando a BM25 y GPT-5.4 nano para fallar builds más rápido.
Question: given a patch, can you rank a test suite so the tests that fail show up first? On 113 Defects4J bugs, how often is a failing test in the first 10%? BM25 → 73% GPT-5.4 nano → 92% Jev → 96% fail your builds quicker instead of waiting :)