Back to explore

Jev Mencapai 100% Penyelesaian Tugas di Benchmark WebMCP

Jev dikombinasikan dengan Mercury 2.5 menggunakan WebMCP menyelesaikan 100% tugas dalam benchmark, dengan biaya model sekitar 112 kali lebih rendah daripada GPT-6 Astra yang menggunakan computer use dengan eksekusi kode.

We just ran Jev on our WebMCP benchmark. The result: basically broke the benchmark. Jev + Mercury 2.5 (a fast, low-cost LLM) using WebMCP solved 100% of the tasks at roughly 112× lower model cost than GPT-6 Astra using computer use with code execution. Compared to Astra using

Jev Mencapai 100% Penyelesaian Tugas di Benchmark WebMCP 1
· 2 rb likesOpen on X