Jev против моделей генерации текста
Jev не генерирует свободный текст. Сравнительное видео показывает различие между параллельным принятием решений и генерацией текста по токенам.

Пользователь дал Jev два одинаковых diff с метками A и B и спросил, какой лучше; порядок аргументов и метки влияют на оценку, A держится около 0,95, а при смене порядка результат меняется.
(2/5) hit some wild results. argument order and labels both move the score i gave jev 2 identical diffs (labelled A and B) and asked which is better. the results were shocking: fork A at 0.95 (five runs: 0.95, 0.96, 0.95, 0.96, 0.96) put B first with the same names and A is