Back to explore

Comparación de Jev vs Codex Luna como evaluadores en tareas de gusto de código

El autor ejecutó un pipeline de juguete que descompone rúbricas textuales en respuestas estructuradas para comparar Jev y Codex Luna como evaluadores en tareas de gusto de código estilo FrontierCode.

ran a toy pipeline comparing jev vs codex luna as graders on FrontierCode style "code taste" tasks: decomposed text-based rubrics into structured answers (e.g. are all changes necessary? do all changes consistently use the abstractions required by the task?) -> run both models in

· 0 likesOpen on X