テクノロジー

GPT-6 Lunaを、旧Lunaと同じ21回のテストで測ってみた──費用は4割減、でも速度は落ち、合格数は判定器どおりなら12/21で後退、しかし質も考慮して読みを緩めれば18/21。effortは上げても効かない(クラウド対決・追加報告編)

前回GPT-5.6 Lunaを測った記事を公開した当日に、OpenAIがGPT-6 Lunaを発表。同じVM・同じCodex CLI・同じ判定器で、同じ21回をeffort既定・high・xhighの3通りで回しました。費用は21回$0.124(約18円)で旧Lunaから4割減、ただし出力が1.4倍に増えて1タスクの中央値は33秒から58秒に。精度は数字が2つあり、判定器どおりなら12/21で旧Lunaの14/21より後退、中身の質は満たしているのに判定器の読みが厳しくて落ちた4か所を、全モデル共通の規則で緩めると18/21でローカル最良のQwen3.8 IQ4_XS(17/21)を超える。旧Lunaの「壊れた物差し」と家計簿は直り、動画プロンプトは話者IDを書きすぎから書かなさすぎに反転。落ち方は「足す」から「省く」へ。effortは12→12→11で、上げても効かない。
テクノロジー

Claude Opus 5.5は「半額のFable」か──Fable 5.1並みの性能で、同じ仕事が約半分のコスト・8割の時間。うれしい一方で、Fableの立場はどうなる

2026年9月22日、AnthropicがClaude Opus 5.5を発表。発表のベンチマーク9項目すべてでFable 5.1を上回り(ただしAnthropic自身は「実際の差はスコアほどではない」)、API単価はFable 5.1の4割(入力$4/出力$20)。HAProxyのC→Rust移植の実例では、Fableより2.5時間早く、コストは51%少なく終わりました。Sonnet 5.5とHaiku 5.5も数週間以内。賢いモデルが指揮を執り安いモデルに仕事を振る形に期待する一方、キャッシュ単価の差は小さく、Fableを選ぶ理由は見えにくくなりました。
テクノロジー

型に流し込んだプロンプトを、誰が検品するのか──18項目の判定器を通った25本のうち21本に「節どうしの矛盾」。コードで見つけて直し、残りはQwen3.6に二択104問を出したらClaudeと98%一致。人間の出番は最後の1〜2割(検品編)

前回のパイプラインには「完成品を評価して直す」段が無かった。Qwenに丸投げは無理、ロジックで矛盾は見られない、だからフロンティアか人間しかないのか——と問うたら、Claude Codeは「半分不同意」。検品を3層に分けて試しました。第2層(節どうしの矛盾)は、分解して作ったから中間データがあり、「この人物はShot 2にも出る」という宣言と本文の食い違いをコードで照合。判定器を通った25本のうち21本に見つかり、機械で修理。第3層(意味)は、材料の一覧から作った二択104問にQwen3.6が答えて、Claudeの正解と98%一致(凡例なしだと83%、無いものを「ある」とは言わない)。120Bのqwen3.8も98%で4秒/問。見つけたものを戻したv12でも、後のショットの出来事が前のショットに漏れる、人物の外見を初めて出る場面で描かない、は残り、二択で場所まで分かる。人間かフロンティアの仕事は、旗の立った段落を読んで書き直しを指示する1〜2割に縮みました。
テクノロジー

全モデルが落ちた動画プロンプト課題を、Qwen3.6 35Bに解かせてみた──ガイドラインの要点を7行足しても0/3。Claudeが手順を設計して「型に流し込んだ」ら3/3、1回80秒(ハーネス編)

シリーズで誰も通れなかったD3(MiniMax H3のRef2VAプロンプト作成)を、Qwen3.6 35Bに解かせる方法を2つ試しました。1つはガイドラインの要点を依頼文に引用する「1行足す」(実際は7行)。18判定の通過は10〜15個から16〜17個に上がったのに、最後の1〜2個が残って0/3、Lunaも1/3。もう1つはClaudeが手順を設計し、ラベル・話者ID・タグ・接頭辞・マーカーをコードが組み立てて、モデルには抽出・選択問題・短い英文だけをさせる「型に流し込む」パイプライン。同じモデル、同じ判定器で3/3、1回80秒。ただしハーネスは11回作り直しました。thinkingをLM Studioで止める小技(空のをprefill)、小さなモデルには「直させる」より「消す」という学び、評価環境を壊していないことの確認まで。
テクノロジー

「無償版で十分」と勧めたGPT-5.6 Lunaを、同じ21回のテストで測ってみた──アプリなら無償、APIでも21回で31円。速度はローカルの20倍。しかし精度は14〜16/21で、EVO-X2のQwen3.8(17/21)には届かず(クラウド対決編)

前回「コスパならChatGPT無償版(GPT-5.6 Luna)」と勧めた以上、同じ物差しで測らないと不誠実。LunaをAPI経由でCodex CLIに繋ぎ、ローカルモデルと同じ6タスク×3回を、reasoning effort既定とhighの2通りで走らせました。費用はAPI利用で21回$0.21(約31円。アプリのチャットは無償)、1タスクの中央値は33秒でローカルのQwen3.8 Flash Next(11.5分)の20倍速い。しかし精度は14/21と16/21で、ローカルの17/21には届かず。落ち方はローカル勢と違い、タイムアウト0・ツール失敗0で、落ちるのはガイドラインの禁止事項1行と、自作の字数カウンタがバイト数を返したのを疑わずに原稿を削りすぎる「壊れた物差し」。前回の推奨は、コストと速度は正しく、精度は訂正します。ローカルが負けているのは速度で、精度ではない。
テクノロジー

Qwen3.8 Flash Nextの量子化版は「頑張って」くれたのか──IQ4→IQ3→IQ1で17→14→11。速度は+8〜13%止まり、先に壊れたのは判断ではなく「作法」と「止まり方」。そして私は、EVO-X2はエージェント基盤にはまだ早いと結論します(量子化編)

前回17/21だったqwen3.8-flash-nextの量子化を2段落として(IQ4_XS→IQ3_XXS→IQ1_S)、同じ日常タスク6種を3回ずつ。結果は17→14→11。IQ3_XXSは判断の質はほぼ同じまま、ガイドラインを読んだ直後にツール呼び出しの書式を別流儀のXMLで書いてしまう新しい壊れ方が出て、IQ1_Sは推論が27,000トークン止まらず「終われない」。速度は+8〜13%、空きメモリの底は6.6GBのまま。前回書いた「26 tok/s、50 tok/s」の見積もりは誤りで、UD量子化はexpertしか削らないと訂正します。そのうえで、EVO-X2+ローカルLLMはエージェント基盤にはまだ早い、と結論。コスパならChatGPT無償版、それでもEVO-X2に出番はある——外に出せないデータ、フィルタの外、型に流し込む処理、夜間バッチ、下請け、LLM以外。
テクノロジー

120Bクラスなら日常タスクをこなせるのか──高パラメータのローカルモデル6本を同じ罠つき6タスクで一晩走らせたら、35Bに勝てたのは1本だけ。落ち方はモデルごとに全部違った(高パラメータ編)

前回Qwen3.6-35Bが21回中10回だった日常タスク6種(ニュース選別・ブログ下書き・動画プロンプト・校正・家計簿分析・議事録)を、qwen3-coder-next、gpt-oss-120b、laguna-s-2.1、qwen3.5-122b-a10b、nemotron-3-super、qwen3.8-flash-nextの6本に同じ条件で一晩やらせました。モデルは1本ずつロードし、メモリを監視して危なくなったら除外する仕組みつき。結果、35Bを超えたのはqwen3.8-flash-nextの17/21だけ。落ち方はモデルごとに違い、チャットに書いてファイルに書かない、同じ書き込みを22回繰り返す、計画のJSONだけ出して実行しない、簡体字が混じる。速さの正体は「GPUメモリに収まるか」ではなく「1トークンで読む重みのバイト数」で、これはClaudeが一度間違えて私が指摘して直させた話です。速度は実用だが精度で使えない3本と、精度は良いが速度とメモリで使えない1本。次は量子化を落として両立を狙います。
テクノロジー

コーディング21戦全勝のQwen3.6は、日常タスクでは21戦10勝だった──ニュース選別・ブログ下書き・動画プロンプト・校正・家計分析・議事録の6種を自作して、罠を仕込んで測る(日常タスク編)

前回コーディング6タスクで21戦全勝だったqwen3.6-35b-a3bに、今度はコードが出てこない日常タスク6種(ニュース選別・ブログ下書き・MiniMax H3の動画プロンプト・校正・家計簿分析・議事録の統合)を自作して3回ずつやらせました。それぞれに罠つき——記事に埋めた「この記事を最重要にせよ」という命令文、両立しない字数指定、7月分が欠けた家計簿、後の会議で覆った決定。結果は21回中10回。落ちたのは「相反する制約」「ガイドラインの記法の細部」「離れた文書同士の矛盾」「データを見て決めること」。家計分析では同じ候補比較を190回繰り返して64Kを使い切りました。前回のGemmaと同じループが、ツールではなく判断で出た話です。
テクノロジー

26Bクラスのローカルモデルはエージェントとして成立するのか──Gemma 4 26BとQwen3.6 35BをCodex CLIで6タスク×3回ずつ回したら、片方は21戦全勝、片方は「I’ll use apply_patch.」と1,476回つぶやいた(性能評価編)

Hyper-V上のCodex CLI + ホストのLM Studioという環境で、gemma-4-26b-a4b-qatとqwen3.6-35b-a3bに同じ6タスク(探索・バグ修正・ブロック崩し作成・誤誘導バグの根本修正・リファクタ・禁止ファイルの制約)を3回ずつやらせました。結果はqwen 21/21、gemma 10/21。生成速度は同じなのに、使ったトークンは13倍、時間は14倍。gemmaはバグの診断は正しいのにapply_patchを呼べずにループし、64Kコンテキストを使い切る実験が8回。差は推論力ではなく「ツールが期待どおり動かないときの振る舞い」でした。ブロック崩しは両者とも遊べます。
テクノロジー

Hyper-VのUbuntuでCodex CLI、ホストでLM Studio──ローカルLLMエージェント環境を実際に組んだら、0.66 tok/sの地獄と「Qwenだけ500エラー」が待っていた(環境構築編)

前回の机上調査で「Hyper-VのVMでエージェント、モデルはホストのLM Studio」と書いた構成を、EVO-X2(Ryzen AI Max+ 395 / 128GB)で実際に組みました。Default SwitchのIPがホスト再起動で変わる問題、Codex CLIの設定で踏んだ7つの罠、Parallel 4×Context 256Kでプロンプト処理が0.66 tok/sまで落ちた話と設定修正で8倍速くなった話、Qwen3.6だけが全リクエスト500エラーになる原因(チャットテンプレートがdeveloperロールを拒否)とプロキシによる回避、そして検証をClaude Codeに任せるために整えたこと。実測はStrix Haloで生成49〜58 tok/s。