Jevでコードベース分類器を構築
開発者がJevでコードベース分類器を構築し、エージェントが生成する過剰設計なコードの解決策になり得ると述べ、次のテスト対象を尋ねている。
著者はテキストベースのルーブリックを構造化回答に分解するトイパイプラインを実行し、FrontierCode風のコード品味タスクでJevとCodex Lunaのグレーダー性能を比較した。
ran a toy pipeline comparing jev vs codex luna as graders on FrontierCode style "code taste" tasks: decomposed text-based rubrics into structured answers (e.g. are all changes necessary? do all changes consistently use the abstractions required by the task?) -> run both models in