Jev проти моделей генерації тексту
Jev не генерує довільний текст. Порівняльне відео показує різницю між паралельним ухваленням рішень і генерацією тексту токен за токеном.

Користувач дав Jev два однакові diff з мітками A і B і запитав, який кращий; порядок аргументів і мітки впливають на оцінку, A тримається близько 0,95, а результати змінюються при зміні порядку.
(2/5) hit some wild results. argument order and labels both move the score i gave jev 2 identical diffs (labelled A and B) and asked which is better. the results were shocking: fork A at 0.95 (five runs: 0.95, 0.96, 0.95, 0.96, 0.96) put B first with the same names and A is