Datos de Jevals: benchmark independiente para TypeSafe Jev
Datos de referencia independientes que comparan Jev (modelo System One) de TypeSafe AI con varios LLM en puntuación de decisión, precisión, calibración, costo y latencia.
Un arena de calibración para TypeSafe Jev, que mide la fiabilidad de la probabilidad nativa mediante Brier/ECE en mundos aleatorios analíticamente conocidos, con resultados de API en vivo.
该仓库是一个针对 TypeSafe Jev 的校准评测竞技场,包含真实 API 实测、Brier/ECE 可靠性分析及可运行 demo,明确集成并深入研究 Jev / System One 模型。