Back to explore

Vergelijking van Jev vs Codex Luna als beoordelaars bij code-taste-taken

De auteur voerde een speelgoedpipeline uit die tekstgebaseerde rubrieken opsplitst in gestructureerde antwoorden om Jev en Codex Luna als beoordelaars te vergelijken bij code-taste-taken in FrontierCode-stijl.

ran a toy pipeline comparing jev vs codex luna as graders on FrontierCode style "code taste" tasks: decomposed text-based rubrics into structured answers (e.g. are all changes necessary? do all changes consistently use the abstractions required by the task?) -> run both models in

· 0 likesOpen on X