Jev로 코드베이스 분류기 구축
개발자가 Jev로 코드베이스 분류기를 구축하고 에이전트가 생성하는 과도하게 설계된 코드 문제를 해결할 수 있다고 언급하며 다음 테스트 대상을 묻습니다.
Defects4J의 113개 버그에서 Jev 모델이 테스트 스위트를 정렬하여 실패 테스트의 96%가 상위 10%에 나타납니다. BM25와 GPT-5.4 nano를 능가하며 빌드 실패를 더 빨리 감지합니다.
Question: given a patch, can you rank a test suite so the tests that fail show up first? On 113 Defects4J bugs, how often is a failing test in the first 10%? BM25 → 73% GPT-5.4 nano → 92% Jev → 96% fail your builds quicker instead of waiting :)