Dados Jevals: benchmark independente para TypeSafe Jev
Dados de benchmark independentes comparando o Jev (modelo System One) da TypeSafe AI com vários LLMs em pontuação de decisão, precisão, calibração, custo e latência.
Uma arena de calibração para TypeSafe Jev, medindo a confiabilidade da probabilidade nativa via Brier/ECE em mundos aleatórios analiticamente conhecidos, com resultados de API ao vivo.
该仓库是一个针对 TypeSafe Jev 的校准评测竞技场,包含真实 API 实测、Brier/ECE 可靠性分析及可运行 demo,明确集成并深入研究 Jev / System One 模型。