返回 GitHub 项目

Jevals 数据:TypeSafe Jev 基准测试数据集

独立的基准数据,比较 TypeSafe AI 的 Jev(System One 模型)与多种 LLM 在判定任务上的决策分数、准确率、校准、成本与延迟。

该仓库是 TypeSafe AI 的 Jev(System One 模型)的独立基准数据,包含实测准确率、校准、成本与延迟,并直接引用 Jev 及 Vercel AI Gateway 调用方式,属于对 Jev 的实质评估与数据集分享。

· 1 Stars在 GitHub 打开