Jevals 数据:TypeSafe Jev 基准测试数据集
独立的基准数据,比较 TypeSafe AI 的 Jev(System One 模型)与多种 LLM 在判定任务上的决策分数、准确率、校准、成本与延迟。
100CC-BY-4.0
对 TypeSafe 闭源 Jev 决策模型的实验性最小重建,包含训练、评估和服务 API。它使用指针头从隐藏状态中读取选项概率,以回答类型化问题。
该仓库明确以TypeSafe AI的Jev/System One决策模型为主题,基于公开文档和黑盒探针研究进行假设性重建,实现了无解码循环的指针头架构,并提供训练、评估和服务API,属于实质性的实验研究。