Jevals 数据:TypeSafe Jev 基准测试数据集
独立的基准数据,比较 TypeSafe AI 的 Jev(System One 模型)与多种 LLM 在判定任务上的决策分数、准确率、校准、成本与延迟。
100CC-BY-4.0
六个通过 OpenRouter 调用 TypeSafe Jev 的录播国际象棋实验:独立下棋、战术过滤、Stockfish 辅助和 Jev 自我审视循环,包含完整请求记录、回放与费用数据。
仓库 README 明确说明通过 OpenRouter 调用 TypeSafe Jev 进行六次国际象棋对局实验,包含完整请求/响应、回放和成本记录,并附有运行脚本与测试,属于实质性的 Jev 实验项目。