Back to explore

Probando Jev como juez de LLM

Un desarrollador japonés probó Jev como juez de LLM con 72 respuestas erróneas engañosas, descubriendo que detecta errores completos de forma fiable pero a veces omite errores parciales. Tarda ~0,2 s por caso, ~2 centavos por cada 1 000 casos, y también está probando enviar solo los casos con mayor probabilidad de omisión al juez de LLM.

Jev は LLM ジャッジに使えるか、紛らわしい誤答72件で確かめました。 ・回答全体が誤っているものは確実に見抜く ・一部だけ誤っている回答は見逃すことがある ・1件約0.2秒、1,000件で約2セント 見逃した判定は確率で見分けられたので、そこだけ LLM ジャッジに回す使い方も試しています。

Probando Jev como juez de LLM 1
· 4 likesOpen on X