Jevでコードベース分類器を構築
開発者がJevでコードベース分類器を構築し、エージェントが生成する過剰設計なコードの解決策になり得ると述べ、次のテスト対象を尋ねている。
Defects4Jの113バグにおいて、Jevモデルがテストスイートを並べ替え、失敗テストの96%が上位10%に出現。BM25やGPT-5.4 nanoを上回り、ビルドの失敗をより早く検出します。
Question: given a patch, can you rank a test suite so the tests that fail show up first? On 113 Defects4J bugs, how often is a failing test in the first 10%? BM25 → 73% GPT-5.4 nano → 92% Jev → 96% fail your builds quicker instead of waiting :)