テクノロジー 「無償版で十分」と勧めたGPT-5.6 Lunaを、同じ21回のテストで測ってみた──アプリなら無償、APIでも21回で31円。速度はローカルの20倍。しかし精度は14〜16/21で、EVO-X2のQwen3.8(17/21)には届かず(クラウド対決編)
前回「コスパならChatGPT無償版(GPT-5.6 Luna)」と勧めた以上、同じ物差しで測らないと不誠実。LunaをAPI経由でCodex CLIに繋ぎ、ローカルモデルと同じ6タスク×3回を、reasoning effort既定とhighの2通りで走らせました。費用はAPI利用で21回$0.21(約31円。アプリのチャットは無償)、1タスクの中央値は33秒でローカルのQwen3.8 Flash Next(11.5分)の20倍速い。しかし精度は14/21と16/21で、ローカルの17/21には届かず。落ち方はローカル勢と違い、タイムアウト0・ツール失敗0で、落ちるのはガイドラインの禁止事項1行と、自作の字数カウンタがバイト数を返したのを疑わずに原稿を削りすぎる「壊れた物差し」。前回の推奨は、コストと速度は正しく、精度は訂正します。ローカルが負けているのは速度で、精度ではない。