Back to explore

Jev atteint 100 % de réussite sur le benchmark WebMCP

Jev combiné à Mercury 2.5 utilisant WebMCP a résolu 100 % des tâches d'un benchmark, avec un coût de modèle environ 112 fois inférieur à GPT-6 Astra utilisant computer use avec exécution de code.

We just ran Jev on our WebMCP benchmark. The result: basically broke the benchmark. Jev + Mercury 2.5 (a fast, low-cost LLM) using WebMCP solved 100% of the tasks at roughly 112× lower model cost than GPT-6 Astra using computer use with code execution. Compared to Astra using

Jev atteint 100 % de réussite sur le benchmark WebMCP 1
· 2 k likesOpen on X