بناء مصنف قاعدة كود باستخدام Jev
يشارك مطور بناء مصنف قاعدة كود باستخدام Jev، ويقترح أنه قد يحل مشكلة الكود المفرط الهندسة من الوكلاء، ويسأل عما يجب اختباره بعد ذلك.
على 113 خطأ في Defects4J، يقوم نموذج Jev بترتيب مجموعات الاختبار بحيث تظهر 96% من الاختبارات الفاشلة في أعلى 10%، متفوقًا على BM25 وGPT-5.4 nano لفشل البنيات بشكل أسرع.
Question: given a patch, can you rank a test suite so the tests that fail show up first? On 113 Defects4J bugs, how often is a failing test in the first 10%? BM25 → 73% GPT-5.4 nano → 92% Jev → 96% fail your builds quicker instead of waiting :)