Criando um classificador de código com Jev
Um desenvolvedor compartilha a criação de um classificador de código com Jev, sugerindo que pode resolver código superengenheirado por agentes, e pergunta o que testar a seguir.
Em 113 bugs do Defects4J, o modelo Jev classifica as suítes de teste para que 96% dos testes com falha apareçam nos 10% principais, superando BM25 e GPT-5.4 nano para falhar builds mais rapidamente.
Question: given a patch, can you rank a test suite so the tests that fail show up first? On 113 Defects4J bugs, how often is a failing test in the first 10%? BM25 → 73% GPT-5.4 nano → 92% Jev → 96% fail your builds quicker instead of waiting :)