Back to explore

เปรียบเทียบ Jev กับ Codex Luna ในฐานะผู้ให้คะแนนงานด้านรสนิยมโค้ด

ผู้เขียนได้รันไปป์ไลน์ทดลองที่แยกเกณฑ์การให้คะแนนแบบข้อความออกเป็นคำตอบที่มีโครงสร้าง เพื่อเปรียบเทียบ Jev กับ Codex Luna ในฐานะผู้ให้คะแนนงานด้านรสนิยมโค้ดสไตล์ FrontierCode

ran a toy pipeline comparing jev vs codex luna as graders on FrontierCode style "code taste" tasks: decomposed text-based rubrics into structured answers (e.g. are all changes necessary? do all changes consistently use the abstractions required by the task?) -> run both models in

· 0 likesOpen on X