Jevals-Daten: unabhängiger Benchmark für TypeSafe Jev
Unabhängige Benchmark-Daten, die TypeSafe AIs Jev (System One Modell) mit mehreren LLMs in Entscheidungs-Score, Genauigkeit, Kalibrierung, Kosten und Latenz vergleichen.
Dieses Repository ist eine offene Reproduktion des Jev-Modells von TypeSafe AI und bietet eine nicht-autoregressive typisierte Entscheidungs-Engine mit 150M Parametern. Es erreicht eine Genauigkeit von 0,697 auf dem typed-decisions-Benchmark (Jev: 0,727), mit besserer Kalibrierung, und kann kostenlos auf Colab trainiert werden.
该仓库明确复现 TypeSafe AI 的 Jev 模型,包含完整代码、训练与评估流程,并在 typed-decisions 基准上与 Jev 对比,属于深入研究/复现项目。