Dati Jevals: benchmark indipendente per TypeSafe Jev
Dati di benchmark indipendenti che confrontano Jev (modello System One) di TypeSafe AI con vari LLM su punteggio di decisione, accuratezza, calibrazione, costo e latenza.
Un'arena di calibrazione per TypeSafe Jev, che misura l'affidabilità della probabilità nativa tramite Brier/ECE su mondi casuali analiticamente noti, con risultati API dal vivo.
该仓库是一个针对 TypeSafe Jev 的校准评测竞技场,包含真实 API 实测、Brier/ECE 可靠性分析及可运行 demo,明确集成并深入研究 Jev / System One 模型。