Jevの分類モデルで有効な次トークンを選びC++を書く
TypeSafeのJev決定/分類モデルを使い、各ステップで文法的に有効な次トークンだけを提示してC++コードを生成する実験。
Dorian Smiley氏によるステートマシン実装ベンチマーク。Gemini Flash Lite 3.1の総合75.6%に対し、Jevは総合72.2%、定型的タスクで100%、約6倍高速。ミスは新規の組み合わせに集中。
New state machine programming benchmark: Gemini Flash Lite 3.1: 75.6% overall, 66.7% generalization. Jev: 72.2% overall, 61.4% generalization, but 100% on canonical tasks and ~6× faster. Jev’s misses are concentrated in specific novel compositions, not broad task failure. It is