Jevals 数据:TypeSafe Jev 基准测试数据集
独立的基准数据,比较 TypeSafe AI 的 Jev(System One 模型)与多种 LLM 在判定任务上的决策分数、准确率、校准、成本与延迟。
100CC-BY-4.0
对 TypeSafe AI 的 Jev / System One 模型进行独立评估,包含 50 条中文实测、143 条可回溯数据表和复现脚本。
该仓库是 Jev 模型的中文独立研究报告,包含 50 条实际 API 调用测试、复现脚本和 143 条可溯源数据表,深度研究了 TypeSafe AI 的 Jev / System One 模型。