Jevals 数据:TypeSafe Jev 基准测试数据集
独立的基准数据,比较 TypeSafe AI 的 Jev(System One 模型)与多种 LLM 在判定任务上的决策分数、准确率、校准、成本与延迟。
100CC-BY-4.0
JevAny 是一个研究仓库,实现基于 Qwen3.8-27B 的决策模型,包含监督微调与校准感知强化学习,并提供 API 服务、训练脚本以及在保留评估集上与 Jev 的对比结果。
该仓库以 Jev 为对照进行评测,包含 Jev 主题、System One 风格接口以及模型训练/API/评估代码,属于对 TypeSafe Jev/System One 的实质性研究与评测,而非单纯堆关键词。