Jevals-Daten: unabhängiger Benchmark für TypeSafe Jev
Unabhängige Benchmark-Daten, die TypeSafe AIs Jev (System One Modell) mit mehreren LLMs in Entscheidungs-Score, Genauigkeit, Kalibrierung, Kosten und Latenz vergleichen.
Eine Kalibrierungsarena für TypeSafe Jev, die die Zuverlässigkeit nativer Wahrscheinlichkeiten mittels Brier/ECE auf analytisch bekannten Zufallswelten misst, mit Live-API-Ergebnissen.
该仓库是一个针对 TypeSafe Jev 的校准评测竞技场,包含真实 API 实测、Brier/ECE 可靠性分析及可运行 demo,明确集成并深入研究 Jev / System One 模型。