返回探索

Jev 基准测试:准确率与校准的对比评估

对 Jev 及九个开放检查点在 22 项任务上的评估显示,Jev 在宏观准确率上领先,但一个开放 4B 模型在概率校准上表现更优,jev-bench 完全开放。

Jev Tests: Accuracy gave one ranking. Calibration gave another. We evaluated Jev and nine open checkpoints across 22 tasks. Jev led on macro accuracy. But an open 4B model produced better-calibrated probabilities. jev-bench is fully open 👇

· 0 次赞在 X 打开