Jevals 数据:TypeSafe Jev 基准测试数据集
独立的基准数据,比较 TypeSafe AI 的 Jev(System One 模型)与多种 LLM 在判定任务上的决策分数、准确率、校准、成本与延迟。
100CC-BY-4.0
AnyJev 是一个底层研究库,可将任意开放 LLM 转换为 Jev 风格的决策模型,支持类型化输出、真实概率与无需训练的 L0/L1 校准,并提供与 Jev 的基准对比。
该仓库是一个实质性的研究项目,实现并评测了Jev风格的决策模型(AnyJev),将任意LLM转换为带类型化决策和可靠概率的模型,并与TypeSafe AI的Jev结果进行对比,属于深入研究Jev/System One思路的技术资源。