Back to explore

Jev se destaca no benchmark ScopeJudge

A Dreadnode relata que o Jev da TypeSafe é competitivo com os principais juízes LLM no benchmark ScopeJudge, detectando violações de escopo de agentes a centavos por mil verificações, com respostas médias de 130 ms.

Does Jev live up to the hype? Based on the results of running it against our ScopeJudge benchmark, it does. @typesafeai's Jev was competitive with leading LLM judges, catching agent scope violations at pennies per thousand checks, with 130 millisecond responses on average. [1/4]

Jev se destaca no benchmark ScopeJudge 1
· 26 likesOpen on X