Back to explore

Jev Ethics Benchmark: Performance Comparable or Slightly Better Than Luna

A user tested Jev on an ethics question benchmark and compared it with Luna. The accuracy is comparable or slightly higher. Notably, Luna tended to choose 'cannot determine' when uncertain.

Jevは判断させるモデル、と言うことで倫理問題ベンチマークを試してみた 比較としてLunaも試したが、正解率は同等かやや上で良さげ 検証目的とは逸れるが、Luna が迷うと「判断できない」を選びがちだったのが興味深い

Jev Ethics Benchmark: Performance Comparable or Slightly Better Than Luna 1
· 0 likesOpen on X