Back to explore

Сравнение Jev и Codex Luna в роли оценщиков на задачах «вкуса кода»

Автор запустил игрушечный пайплайн, разбивающий текстовые рубрики на структурированные ответы, чтобы сравнить Jev и Codex Luna в роли оценщиков на задачах «вкуса кода» в стиле FrontierCode.

ran a toy pipeline comparing jev vs codex luna as graders on FrontierCode style "code taste" tasks: decomposed text-based rubrics into structured answers (e.g. are all changes necessary? do all changes consistently use the abstractions required by the task?) -> run both models in

· 0 likesOpen on X