返回探索

Jev 伦理基准测试:与 Luna 对比,正确率相当或略高

用户测试了 Jev 模型在伦理问题基准上的表现,并与 Luna 模型对比。结果显示 Jev 的正确率与 Luna 相当或略高;有趣的是,Luna 在不确定时更倾向选择“无法判断”。

Jevは判断させるモデル、と言うことで倫理問題ベンチマークを試してみた 比較としてLunaも試したが、正解率は同等かやや上で良さげ 検証目的とは逸れるが、Luna が迷うと「判断できない」を選びがちだったのが興味深い

Jev 伦理基准测试:与 Luna 对比,正确率相当或略高 1
· 0 次赞在 X 打开