Jevals 数据:TypeSafe Jev 基准测试数据集
独立的基准数据,比较 TypeSafe AI 的 Jev(System One 模型)与多种 LLM 在判定任务上的决策分数、准确率、校准、成本与延迟。
100CC-BY-4.0
基于 ModernBERT 的 151M 参数决策引擎,在 LocalLLaMA/typed-decisions 基准上以 77.10% 准确率和 0.0636 Brier 分数超越 TypeSafe Jev 与 Laya,并提供 WebGPU 浏览器演示。
该仓库构建并评测了一个基于 ModernBERT 的非自回归决策引擎,在 LocalLLaMA/typed-decisions 基准上与 TypeSafe Jev 1.13.0 对比,受 Jev 架构启发,并提供 WebGPU 可运行 demo,属于对 TypeSafe Jev 模型的深入研究。