Jev versus modelos de geração de texto
Jev não gera texto livre. Um vídeo lado a lado compara decisões paralelas com geração de texto token por token.

Um usuário deu ao Jev dois diffs idênticos rotulados A e B e perguntou qual é melhor, descobrindo que a ordem e os rótulos afetam a pontuação, com A em torno de 0,95 e mudanças ao inverter a ordem.
(2/5) hit some wild results. argument order and labels both move the score i gave jev 2 identical diffs (labelled A and B) and asked which is better. the results were shocking: fork A at 0.95 (five runs: 0.95, 0.96, 0.95, 0.96, 0.96) put B first with the same names and A is