Back to explore

Jev performe sur le benchmark ScopeJudge

Dreadnode rapporte que Jev de TypeSafe rivalise avec les principaux juges LLM sur le benchmark ScopeJudge, détectant les violations de périmètre des agents à quelques centimes les mille vérifications, avec des réponses de 130 ms en moyenne.

Does Jev live up to the hype? Based on the results of running it against our ScopeJudge benchmark, it does. @typesafeai's Jev was competitive with leading LLM judges, catching agent scope violations at pennies per thousand checks, with 130 millisecond responses on average. [1/4]

Jev performe sur le benchmark ScopeJudge 1
· 26 likesOpen on X