Back to explore

Jev überzeugt im WebMCP-Benchmark

Im WebMCP-Benchmark löst Jev allein auf dem rohen DOM 25/49 Aufgaben. Mit WebMCP-Toolauswahl und von Mercury 2.5 geschriebenen Argumenten erreicht es 49/49 bei etwa 112-mal geringeren Modellkosten als GPT-6 Astra.

🧪 The WebMCP benchmark by @0xidanlevin is the best stress test so far. Jev alone on the raw DOM: 25/49 tasks. Jev picking WebMCP tools + Mercury 2.5 writing args: 49/49, ~112x lower model cost than GPT-6 Astra. https://webmcp.com/benchmark

Jev überzeugt im WebMCP-Benchmark 1
· 0 likesOpen on X