Jevals 数据:TypeSafe Jev 基准测试数据集
独立的基准数据,比较 TypeSafe AI 的 Jev(System One 模型)与多种 LLM 在判定任务上的决策分数、准确率、校准、成本与延迟。
100CC-BY-4.0
一个学习项目,在 Qwen3-0.6B 基座上加 LoRA 实现 TypeSafe Jev/System One 风格的决策接口,并附带 OpenAI 兼容的对话/生成服务及 MiniJev 兼容评测。非生产软件。
README 明确以 TypeSafe Jev/System One 的概念和 API 规范为基础,实现了 /v1/systemone 决策接口,并在 Qwen3-0.6B + LoRA 上进行训练、服务与评测,包含 MiniJev 对照和 holdout 结果,属于真实深入的研究/实验项目。