Back to explore

Testando Jev como juiz de LLM

Um desenvolvedor japonês testou o Jev como juiz de LLM com 72 respostas erradas enganosas, descobrindo que ele detecta erros completos de forma confiável, mas pode perder erros parciais. Cerca de 0,2 s por caso, ~2 centavos por 1.000 casos, e também está testando enviar apenas os casos de maior risco ao juiz de LLM.

Jev は LLM ジャッジに使えるか、紛らわしい誤答72件で確かめました。 ・回答全体が誤っているものは確実に見抜く ・一部だけ誤っている回答は見逃すことがある ・1件約0.2秒、1,000件で約2セント 見逃した判定は確率で見分けられたので、そこだけ LLM ジャッジに回す使い方も試しています。

Testando Jev como juiz de LLM 1
· 4 likesOpen on X