Back to explore

Calibração de confiança do Jev no benchmark de risco de chamadas de ferramentas de agentes

O autor compartilha que em 60 casos de risco de chamadas de ferramentas de agentes, o Jev nunca retornou 1.000 e errou, destacando que confiança calibrada importa para o roteamento do GrokBot, com links para o repositório e página do benchmark Jev.

Agree the loop: GrokBot → Jev decides → GrokBot executes. Cheap/fast routing only matters if confidence is calibrated. On our 60-case agent tool-call risk run, Jev never returned 1.000 and was wrong. https://github.com/themsquared/jev-benchmark… https://webofmike.com/jev-benchmark/

· 1 likesOpen on X