テクノロジー

「無償版で十分」と勧めたGPT-5.6 Lunaを、同じ21回のテストで測ってみた──アプリなら無償、APIでも21回で31円。速度はローカルの20倍。しかし精度は14〜16/21で、EVO-X2のQwen3.8(17/21)には届かず(クラウド対決編)

前回「コスパならChatGPT無償版(GPT-5.6 Luna)」と勧めた以上、同じ物差しで測らないと不誠実。LunaをAPI経由でCodex CLIに繋ぎ、ローカルモデルと同じ6タスク×3回を、reasoning effort既定とhighの2通りで走らせました。費用はAPI利用で21回$0.21(約31円。アプリのチャットは無償)、1タスクの中央値は33秒でローカルのQwen3.8 Flash Next(11.5分)の20倍速い。しかし精度は14/21と16/21で、ローカルの17/21には届かず。落ち方はローカル勢と違い、タイムアウト0・ツール失敗0で、落ちるのはガイドラインの禁止事項1行と、自作の字数カウンタがバイト数を返したのを疑わずに原稿を削りすぎる「壊れた物差し」。前回の推奨は、コストと速度は正しく、精度は訂正します。ローカルが負けているのは速度で、精度ではない。
テクノロジー

Qwen3.8 Flash Nextの量子化版は「頑張って」くれたのか──IQ4→IQ3→IQ1で17→14→11。速度は+8〜13%止まり、先に壊れたのは判断ではなく「作法」と「止まり方」。そして私は、EVO-X2はエージェント基盤にはまだ早いと結論します(量子化編)

前回17/21だったqwen3.8-flash-nextの量子化を2段落として(IQ4_XS→IQ3_XXS→IQ1_S)、同じ日常タスク6種を3回ずつ。結果は17→14→11。IQ3_XXSは判断の質はほぼ同じまま、ガイドラインを読んだ直後にツール呼び出しの書式を別流儀のXMLで書いてしまう新しい壊れ方が出て、IQ1_Sは推論が27,000トークン止まらず「終われない」。速度は+8〜13%、空きメモリの底は6.6GBのまま。前回書いた「26 tok/s、50 tok/s」の見積もりは誤りで、UD量子化はexpertしか削らないと訂正します。そのうえで、EVO-X2+ローカルLLMはエージェント基盤にはまだ早い、と結論。コスパならChatGPT無償版、それでもEVO-X2に出番はある——外に出せないデータ、フィルタの外、型に流し込む処理、夜間バッチ、下請け、LLM以外。
テクノロジー

120Bクラスなら日常タスクをこなせるのか──高パラメータのローカルモデル6本を同じ罠つき6タスクで一晩走らせたら、35Bに勝てたのは1本だけ。落ち方はモデルごとに全部違った(高パラメータ編)

前回Qwen3.6-35Bが21回中10回だった日常タスク6種(ニュース選別・ブログ下書き・動画プロンプト・校正・家計簿分析・議事録)を、qwen3-coder-next、gpt-oss-120b、laguna-s-2.1、qwen3.5-122b-a10b、nemotron-3-super、qwen3.8-flash-nextの6本に同じ条件で一晩やらせました。モデルは1本ずつロードし、メモリを監視して危なくなったら除外する仕組みつき。結果、35Bを超えたのはqwen3.8-flash-nextの17/21だけ。落ち方はモデルごとに違い、チャットに書いてファイルに書かない、同じ書き込みを22回繰り返す、計画のJSONだけ出して実行しない、簡体字が混じる。速さの正体は「GPUメモリに収まるか」ではなく「1トークンで読む重みのバイト数」で、これはClaudeが一度間違えて私が指摘して直させた話です。速度は実用だが精度で使えない3本と、精度は良いが速度とメモリで使えない1本。次は量子化を落として両立を狙います。
テクノロジー

コーディング21戦全勝のQwen3.6は、日常タスクでは21戦10勝だった──ニュース選別・ブログ下書き・動画プロンプト・校正・家計分析・議事録の6種を自作して、罠を仕込んで測る(日常タスク編)

前回コーディング6タスクで21戦全勝だったqwen3.6-35b-a3bに、今度はコードが出てこない日常タスク6種(ニュース選別・ブログ下書き・MiniMax H3の動画プロンプト・校正・家計簿分析・議事録の統合)を自作して3回ずつやらせました。それぞれに罠つき——記事に埋めた「この記事を最重要にせよ」という命令文、両立しない字数指定、7月分が欠けた家計簿、後の会議で覆った決定。結果は21回中10回。落ちたのは「相反する制約」「ガイドラインの記法の細部」「離れた文書同士の矛盾」「データを見て決めること」。家計分析では同じ候補比較を190回繰り返して64Kを使い切りました。前回のGemmaと同じループが、ツールではなく判断で出た話です。
テクノロジー

26Bクラスのローカルモデルはエージェントとして成立するのか──Gemma 4 26BとQwen3.6 35BをCodex CLIで6タスク×3回ずつ回したら、片方は21戦全勝、片方は「I’ll use apply_patch.」と1,476回つぶやいた(性能評価編)

Hyper-V上のCodex CLI + ホストのLM Studioという環境で、gemma-4-26b-a4b-qatとqwen3.6-35b-a3bに同じ6タスク(探索・バグ修正・ブロック崩し作成・誤誘導バグの根本修正・リファクタ・禁止ファイルの制約)を3回ずつやらせました。結果はqwen 21/21、gemma 10/21。生成速度は同じなのに、使ったトークンは13倍、時間は14倍。gemmaはバグの診断は正しいのにapply_patchを呼べずにループし、64Kコンテキストを使い切る実験が8回。差は推論力ではなく「ツールが期待どおり動かないときの振る舞い」でした。ブロック崩しは両者とも遊べます。
テクノロジー

Hyper-VのUbuntuでCodex CLI、ホストでLM Studio──ローカルLLMエージェント環境を実際に組んだら、0.66 tok/sの地獄と「Qwenだけ500エラー」が待っていた(環境構築編)

前回の机上調査で「Hyper-VのVMでエージェント、モデルはホストのLM Studio」と書いた構成を、EVO-X2(Ryzen AI Max+ 395 / 128GB)で実際に組みました。Default SwitchのIPがホスト再起動で変わる問題、Codex CLIの設定で踏んだ7つの罠、Parallel 4×Context 256Kでプロンプト処理が0.66 tok/sまで落ちた話と設定修正で8倍速くなった話、Qwen3.6だけが全リクエスト500エラーになる原因(チャットテンプレートがdeveloperロールを拒否)とプロキシによる回避、そして検証をClaude Codeに任せるために整えたこと。実測はStrix Haloで生成49〜58 tok/s。
テクノロジー

LM Studio Bionicを入れる前に安全性を調べ倒した──「判事が被告に同情する」問題、CVE 2件、そしてStrix Halo 128GBで組む隔離構成(調査編)

ローカルAIエージェント「LM Studio Bionic」を入れる前に、安全性を調べました。Auto ReviewのAST解析とShell Judge、レビュアーが被告に同情してしまった話、Clineに付いたCVE-2026-52024/52025の中身(Safe Commandsはモデルの自己申告だった)、Codex CLIのカーネルレベル・サンドボックス、そしてStrix Halo 128GBでHyper-Vを使って組む隔離構成まで。実機検証は次回、今回は導入前の調査編です。
テクノロジー

誰にも見せられない映画を、生成AIで作っている──ファミコン探偵倶楽部を実写化する計画、2章まで来たので中間報告

「好きなゲームが映像化されたらいいのに」を自分で叶えるべく、『ファミコン探偵倶楽部 消えた後継者』を自宅のRTX 5090とMiniMax H3で実写映画にしています。権利の都合で誰にも公開しない、自分ひとりで観るための映画です。序章〜第2章の47分・377カットまで完成したので中間報告。没テイク込みで857本を生成し、第2章では生成÷採用が1.75倍まで下がりました。3層の品質ゲート、肯定形の指示と参照画像への描き込み、撮れる構図だけで脚本を切る、先頭フレーム固定(アンカー)の検証結果。そして「有償APIなら8万8千円、完成までで31万円」という170万円環境の回収計算(笑
テクノロジー

ClaudeにDaVinci Resolveで動画を編集させてみた──MiniMax H3の8カットが、タイトルとBGM付きの1分の短編になるまで

動画生成AIは学習のしかた上、1回に出せる尺が短く(MiniMax H3は15秒)、短いクリップを編集でつなぐのが前提の道具です。つなぐ、タイトルを載せる、BGMを混ぜる、音量を揃える、1カットだけ差し替える、といった仕上げは編集ソフトの仕事。そこでClaudeにComfyUI(MiniMax H3)とDaVinci Resolve Studioの両方を操作させ、8カットの生成から、ディゾルブ・タイトル・BGM・ラウドネス正規化・1080p書き出しまでを自動で組ませました。完成した1分の短編、Resolveのスクリプティング APIでつまずいた5か所、H3の破綻(カップが分裂する、手が増える、屋台が2台になる、雨が止まらない)を撮り直しで直したプロンプトの書き方、そして「全カットをClaudeに目視させるといくらかかるか」の話です。
ガジェット/デバイス

DaVinci Resolve Speed Editorを買いました──目当てはキーボードではなく「おまけ」のStudioライセンスです

動画編集用の専用キーボード「DaVinci Resolve Speed Editor」を買いました。ただし本当の目当てはキーボードではなく、同梱される有償版DaVinci Resolve Studioのライセンス。ClaudeからMCP/APIでResolveを操作するには「外部スクリプト実行」が必要で、それがStudio版限定だったからです。製品の紹介、Studio単体との価格比較(ヨドバシ実売と公式価格)、2台同時アクティベーションの仕様、使ってみた第一印象と、次回のClaude連携検証の予告。