Een codebase-classificator bouwen met Jev
Een ontwikkelaar deelt het bouwen van een codebase-classificator met Jev, suggereert dat dit overgeëngineerde code van agents kan oplossen, en vraagt wat er nu getest moet worden.
De auteur voerde een speelgoedpipeline uit die tekstgebaseerde rubrieken opsplitst in gestructureerde antwoorden om Jev en Codex Luna als beoordelaars te vergelijken bij code-taste-taken in FrontierCode-stijl.
ran a toy pipeline comparing jev vs codex luna as graders on FrontierCode style "code taste" tasks: decomposed text-based rubrics into structured answers (e.g. are all changes necessary? do all changes consistently use the abstractions required by the task?) -> run both models in