Jevals 数据:TypeSafe Jev 基准测试数据集
独立的基准数据,比较 TypeSafe AI 的 Jev(System One 模型)与多种 LLM 在判定任务上的决策分数、准确率、校准、成本与延迟。
100CC-BY-4.0
对 TypeSafe AI 的 Jev 模型在西班牙语上的准确性、校准和 token 成本进行预注册审计,并提供 CLI 用于比较自己的标注数据。
该仓库是对 TypeSafe AI 的 Jev (System One) 模型在西班牙语上的预注册审计,包含准确性、校准和 token 成本评测,并提供 CLI 工具,与 Jev 直接相关。