Jev slår Gemini 2.5 Flash Lite i kvalitet och hastighet i klassificerarutvärdering
Malte Ubl körde TypeSafe AI:s Jev mot en befintlig klassificerarutvärdering: den mättade utvärderingen i kvalitet och var 6x snabbare än Gemini 2.5 Flash Lite.
Författaren delar ett första försök med Jev: 33 411 par skickades in för att avgöra om de beskriver samma händelse, med de returnerade sannolikheterna som trösklar—under 0,3 som olika, 0,3–0,7 vidare till en LLM, över 0,7 som samma—och rapporterar ungefär halva tiden.
איך עשיתי את זה עם Jev? (ניסיון ראשון) נתתי כל פעם זוג ולשאול האם מתארים את אותו הדבר, סה״כ אצלי 33,411 זוגות. הוא מחזיר הסתברות, אז הגדרתי טווח: - אם מתחת ל-0.3 - זה לא אותו אירוע - אם בין 0.3 ל0.7 - לא בטוח, נשלח ל-LLM להחליט - אם מעל 0.7 - זה אותו האירוע ובחצי מהמהירות