Creando un clasificador de código con Jev
Un desarrollador comparte la creación de un clasificador de código con Jev, sugiere que puede resolver código sobrediseñado por agentes y pregunta qué probar después.
El autor ejecutó un pipeline de juguete que descompone rúbricas textuales en respuestas estructuradas para comparar Jev y Codex Luna como evaluadores en tareas de gusto de código estilo FrontierCode.
ran a toy pipeline comparing jev vs codex luna as graders on FrontierCode style "code taste" tasks: decomposed text-based rubrics into structured answers (e.g. are all changes necessary? do all changes consistently use the abstractions required by the task?) -> run both models in