Back to explore

Jev osiąga 100% ukończenia zadań w benchmarku WebMCP

Jev w połączeniu z Mercury 2.5 przy użyciu WebMCP rozwiązał 100% zadań w benchmarku, przy około 112 razy niższym koszcie modelu niż GPT-6 Astra używający computer use z wykonywaniem kodu.

We just ran Jev on our WebMCP benchmark. The result: basically broke the benchmark. Jev + Mercury 2.5 (a fast, low-cost LLM) using WebMCP solved 100% of the tasks at roughly 112× lower model cost than GPT-6 Astra using computer use with code execution. Compared to Astra using

Jev osiąga 100% ukończenia zadań w benchmarku WebMCP 1
· 2 tys. likesOpen on X