Back to explore

Jev behaalt 100% taakvoltooiing op WebMCP-benchmark

Jev gecombineerd met Mercury 2.5 via WebMCP loste 100% van de taken op in een benchmark, tegen ongeveer 112× lagere modelkosten dan GPT-6 Astra met computer use en code-uitvoering.

We just ran Jev on our WebMCP benchmark. The result: basically broke the benchmark. Jev + Mercury 2.5 (a fast, low-cost LLM) using WebMCP solved 100% of the tasks at roughly 112× lower model cost than GPT-6 Astra using computer use with code execution. Compared to Astra using

Jev behaalt 100% taakvoltooiing op WebMCP-benchmark 1
· 2K likesOpen on X