Jevals 数据:TypeSafe Jev 基准测试数据集
独立的基准数据,比较 TypeSafe AI 的 Jev(System One 模型)与多种 LLM 在判定任务上的决策分数、准确率、校准、成本与延迟。
100CC-BY-4.0
将TypeSafe Jev接入宝可梦Showdown,记录40场对战、940次API决策,附可复现结果、数据集与注释回放。独立研究,非官方基准。
该仓库真实连接并调用 TypeSafe Jev API,在 Pokémon Showdown 中进行了 40 场对战、940 次 API 决策实验,提供完整代码、数据、结果与回放,属于实质性的集成与评估项目。