Jevals 数据:TypeSafe Jev 基准测试数据集
独立的基准数据,比较 TypeSafe AI 的 Jev(System One 模型)与多种 LLM 在判定任务上的决策分数、准确率、校准、成本与延迟。
100CC-BY-4.0
基于 Qwen3.5-0.8B 微调的多模态模型,从原始像素实时玩十款浏览器游戏,提供演示、训练代码和评估。
该仓库直接引用 TypeSafe Jev/System One,并实现了 JEV-like 多模态游戏模型,提供可运行 demo、训练代码、评估结果,属于实质研究。