Back to explore

Comparaison de Jev et Codex Luna comme évaluateurs sur des tâches de goût du code

L'auteur a exécuté un pipeline jouet décomposant des rubriques textuelles en réponses structurées pour comparer Jev et Codex Luna comme évaluateurs sur des tâches de goût du code de style FrontierCode.

ran a toy pipeline comparing jev vs codex luna as graders on FrontierCode style "code taste" tasks: decomposed text-based rubrics into structured answers (e.g. are all changes necessary? do all changes consistently use the abstractions required by the task?) -> run both models in

· 0 likesOpen on X