Budowanie klasyfikatora bazy kodu z Jev
Deweloper dzieli się budową klasyfikatora bazy kodu z Jev, sugerując, że może rozwiązać problem przekombinowanego kodu od agentów, i pyta, co testować dalej.
Autor uruchomił zabawkowy potok rozkładający tekstowe rubryki na ustrukturyzowane odpowiedzi, aby porównać Jev i Codex Luna jako oceniających w zadaniach wyczucia kodu w stylu FrontierCode.
ran a toy pipeline comparing jev vs codex luna as graders on FrontierCode style "code taste" tasks: decomposed text-based rubrics into structured answers (e.g. are all changes necessary? do all changes consistently use the abstractions required by the task?) -> run both models in