Back to explore

Jev erreicht 100 % Aufgabenabschluss im WebMCP-Benchmark

Jev in Kombination mit Mercury 2.5 unter Verwendung von WebMCP löste 100 % der Aufgaben in einem Benchmark, bei etwa 112-mal geringeren Modellkosten als GPT-6 Astra mit Computer Use und Codeausführung.

We just ran Jev on our WebMCP benchmark. The result: basically broke the benchmark. Jev + Mercury 2.5 (a fast, low-cost LLM) using WebMCP solved 100% of the tasks at roughly 112× lower model cost than GPT-6 Astra using computer use with code execution. Compared to Astra using

Jev erreicht 100 % Aufgabenabschluss im WebMCP-Benchmark 1
· 2023 likesOpen on X