Bygga en kodbas-klassificerare med Jev
En utvecklare delar bygget av en kodbas-klassificerare med Jev, föreslår att det kan lösa överkonstruerad kod från agenter, och frågar vad som ska testas härnäst.
Författaren körde en leksakspipeline som delar upp textbaserade rubriker i strukturerade svar för att jämföra Jev och Codex Luna som bedömare i kodsmaksuppgifter i FrontierCode-stil.
ran a toy pipeline comparing jev vs codex luna as graders on FrontierCode style "code taste" tasks: decomposed text-based rubrics into structured answers (e.g. are all changes necessary? do all changes consistently use the abstractions required by the task?) -> run both models in