Back to explore

Jev überzeugt im ScopeJudge-Benchmark

Dreadnode berichtet, dass TypeSafes Jev im ScopeJudge-Benchmark mit führenden LLM-Juroren konkurriert, Scope-Verstöße von Agenten erkennt und durchschnittlich 130 ms pro Antwort bei wenigen Cent pro tausend Prüfungen benötigt.

Does Jev live up to the hype? Based on the results of running it against our ScopeJudge benchmark, it does. @typesafeai's Jev was competitive with leading LLM judges, catching agent scope violations at pennies per thousand checks, with 130 millisecond responses on average. [1/4]

Jev überzeugt im ScopeJudge-Benchmark 1
· 26 likesOpen on X