Jevals 数据:TypeSafe Jev 基准测试数据集
独立的基准数据,比较 TypeSafe AI 的 Jev(System One 模型)与多种 LLM 在判定任务上的决策分数、准确率、校准、成本与延迟。
100CC-BY-4.0
对 TypeSafe Jev / System One 模型的实证实验与 API 研究仓库,通过受控实验评估模型行为并保存原始证据。
仓库明确针对 TypeSafe Jev / System One,包含 Jev API 客户端、实验脚本、测试与原始结果,是真实的 API 集成和实证评估研究。