テクノロジー 26Bクラスのローカルモデルはエージェントとして成立するのか──Gemma 4 26BとQwen3.6 35BをCodex CLIで6タスク×3回ずつ回したら、片方は21戦全勝、片方は「I’ll use apply_patch.」と1,476回つぶやいた(性能評価編)
Hyper-V上のCodex CLI + ホストのLM Studioという環境で、gemma-4-26b-a4b-qatとqwen3.6-35b-a3bに同じ6タスク(探索・バグ修正・ブロック崩し作成・誤誘導バグの根本修正・リファクタ・禁止ファイルの制約)を3回ずつやらせました。結果はqwen 21/21、gemma 10/21。生成速度は同じなのに、使ったトークンは13倍、時間は14倍。gemmaはバグの診断は正しいのにapply_patchを呼べずにループし、64Kコンテキストを使い切る実験が8回。差は推論力ではなく「ツールが期待どおり動かないときの振る舞い」でした。ブロック崩しは両者とも遊べます。