Données Jevals : benchmark indépendant pour TypeSafe Jev
Données de référence indépendantes comparant Jev (modèle System One) de TypeSafe AI à plusieurs LLM sur le score de décision, la précision, la calibration, le coût et la latence.
Une arène d'étalonnage pour TypeSafe Jev, mesurant la fiabilité des probabilités natives via Brier/ECE sur des mondes aléatoires analytiquement connus, avec résultats d'API en direct.
该仓库是一个针对 TypeSafe Jev 的校准评测竞技场,包含真实 API 实测、Brier/ECE 可靠性分析及可运行 demo,明确集成并深入研究 Jev / System One 模型。