Back to explore

Jev показывает хорошие результаты в бенчмарке ScopeJudge

Dreadnode сообщает, что Jev от TypeSafe конкурентоспособен с ведущими LLM-судьями в бенчмарке ScopeJudge, выявляя нарушения области агентов за центы на тысячу проверок при среднем отклике 130 мс.

Does Jev live up to the hype? Based on the results of running it against our ScopeJudge benchmark, it does. @typesafeai's Jev was competitive with leading LLM judges, catching agent scope violations at pennies per thousand checks, with 130 millisecond responses on average. [1/4]

Jev показывает хорошие результаты в бенчмарке ScopeJudge 1
· 26 likesOpen on X