Jevals 数据:TypeSafe Jev 基准测试数据集
独立的基准数据,比较 TypeSafe AI 的 Jev(System One 模型)与多种 LLM 在判定任务上的决策分数、准确率、校准、成本与延迟。
100CC-BY-4.0
该仓库开源复现 TypeSafe AI 的 Jev 模型,提供一个 150M 参数的非自回归类型决策引擎。在 typed-decisions 基准上准确率 0.697(Jev 为 0.727),校准更优,且可免费在 Colab 训练。
该仓库明确复现 TypeSafe AI 的 Jev 模型,包含完整代码、训练与评估流程,并在 typed-decisions 基准上与 Jev 对比,属于深入研究/复现项目。