Back to explore

Jev tampil baik di benchmark ScopeJudge

Dreadnode melaporkan Jev dari TypeSafe bersaing dengan juri LLM terkemuka di benchmark ScopeJudge, mendeteksi pelanggaran cakupan agen dengan biaya beberapa sen per seribu pemeriksaan dan respons rata-rata 130 ms.

Does Jev live up to the hype? Based on the results of running it against our ScopeJudge benchmark, it does. @typesafeai's Jev was competitive with leading LLM judges, catching agent scope violations at pennies per thousand checks, with 130 millisecond responses on average. [1/4]

Jev tampil baik di benchmark ScopeJudge 1
· 26 likesOpen on X