Back to explore

La conception des questions prime sur le modèle : test Jev vs Laya

Dans le même test de 430 cas, Jev a laissé passer 68 à 92 % des faux rapports d'agents et Laya 84 à 88 % avec preuves ; en posant une question littérale à la place, Jev n'a laissé passer qu'environ 1 % d'erreurs. La question compte plus que le modèle.

Same 430-case test, two AI judges. Shown the evidence, Jev passed 68 to 92% of the false agent reports and Laya 84 to 88%. Asked one literal question instead, Jev let through about 1% of wrong counts and files. The question matters more than the model. https://cejel.dev/experiments

La conception des questions prime sur le modèle : test Jev vs Laya 1
· 0 likesOpen on X