Back to explore

Calibrazione della confidenza di Jev nel benchmark di rischio delle chiamate di strumenti degli agenti

L'autore condivide che in 60 casi di rischio di chiamate di strumenti degli agenti, Jev non ha mai restituito 1.000 e ha sbagliato, sottolineando che la confidenza calibrata conta per il routing di GrokBot, con link al repository e alla pagina del benchmark Jev.

Agree the loop: GrokBot → Jev decides → GrokBot executes. Cheap/fast routing only matters if confidence is calibrated. On our 60-case agent tool-call risk run, Jev never returned 1.000 and was wrong. https://github.com/themsquared/jev-benchmark… https://webofmike.com/jev-benchmark/

· 1 likesOpen on X