前回の中間報告で「序章〜第2章、47分まで来た」と書いてから2週間。『ファミコン探偵倶楽部 消えた後継者』の実写化計画が、ついに最後まで到達しました。序章から第11章、オープニングとエンディングまで、通しで4時間27分53秒です。
中間報告のときは「全11章プラス序章で、まだ4分の1にも届いていません」と書きました。残り4分の3を、12日で走り切ったことになります。RTX 5090は、その間ほぼ休みなく唸り続けていました。
最初に、改めてお断り
前回と同じく、この映画は誰にも公開しません。ゲームのシナリオ、登場人物、台詞は任天堂の著作物で、それを元にした映像を公開すれば二次的著作物の公衆送信になります。私的使用の範囲に収めるのが、この計画の設計条件です。
なので今回も、完成した映画はこのブログに出てきません。出てくるのは数字と、手順と、失敗の話です。完了報告なのに完成品が見せられないという、ブログ記事としてはかなり致命的な構造ですが、どうかお付き合いください(笑
まず、完成品の数字をどうぞ
| 項目 | 数字 |
|---|---|
| 完成版の長さ | 4時間27分53秒(本編4時間24分57秒 + オープニング57秒 + エンディング2分) |
| 本編のカット数 | 2,605カット(序章 + 全11章) |
| 生成した動画 | 5,034本、8時間54分(没テイク・実験込み) |
| 生成した静止画 | 539枚(人物・場所・小道具の参照画像と候補) |
| 登場人物 | 35人(顔と衣装の参照画像、声の参照音声を人数分) |
| 期間 | 2026年9月11日〜9月25日(15日間) |
| GPUの稼働 | 推定135時間(生成の出力間隔から推定) |

| 章 | 採用 | 生成(没テイク込み) | 生成÷採用 |
|---|---|---|---|
| 序章 | 45カット 6.9分 | 193本 32.9分 | 4.8倍 |
| 第1章 | 97カット 13.9分 | 235本 39.8分 | 2.9倍 |
| 第2章 | 235カット 26.5分 | 413本 46.3分 | 1.75倍 |
| 第3章 | 374カット 35.4分 | 521本 49.7分 | 1.40倍 |
| 第4章 | 327カット 32.5分 | 692本 67.7分 | 2.08倍 |
| 第5章 | 168カット 17.4分 | 287本 29.1分 | 1.67倍 |
| 第6章 | 235カット 24.5分 | 416本 43.5分 | 1.77倍 |
| 第7章 | 172カット 17.9分 | 362本 37.5分 | 2.09倍 |
| 第8章 | 339カット 34.1分 | 629本 61.5分 | 1.80倍 |
| 第9章 | 201カット 19.3分 | 465本 45.9分 | 2.37倍 |
| 第10章 | 199カット 18.3分 | 330本 31.2分 | 1.71倍 |
| 第11章 | 213カット 18.2分 | 389本 33.7分 | 1.85倍 |
| 本編合計 | 2,605カット 265分 | 4,932本 519分 | 1.96倍 |
「生成÷採用」は、完成版の1分を作るために何分ぶん生成したかです。一番よかったのは、後述の「固定アンカー方式」を初めて入れた第3章の1.40倍。第4章と第9章は、プレビューを観た私(監督)の指摘で大きな撮り直しが入った章で、倍率が上がっています。直すと決めたのは私なので、この数字は私の責任です(震え声
分担は変わらず、「監督は私、手を動かすのはClaude」
分担は前回から変わっていません。台本の抽出、脚色、参照画像の候補づくり、カット表、生成、検査、結合まで、手を動かすのはほぼ全部Claudeです。私は章ごとのプレビューを観て、「ここの発音がおかしい」「この人物の服装が前のカットと違う」「この場面の場所は原作と違う」と指摘し、直すか許容するかを決めます。
後半で増えた仕事は、こんな感じです。
| 仕事 | 内容 | 担当 |
|---|---|---|
| 夜間の無人運転 | 寝ている間に生成・検査・組み立てを回し、異常があれば止めて記録 | Claude(タスクスケジューラ経由) |
| 監督レビュー | 章ごとのプレビューを観て、時刻付きで指摘を書く | 私 |
| オープニング・エンディング | 原作の構成を分析し、曲を採譜・編曲して、映像と合成 | Claude(曲と字幕の方針は私) |
| 仕上げのレビュー画面 | 全カットを一覧し、コメントを書くと Claude が直す仕組み | Claude が作り、私が使う |
前回以降に分かったこと
中間報告の後、第3章から第11章、オープニングとエンディングを作る中でClaudeと私が見つけたノウハウを、効いた順に書きます。今回も人物名と台詞は出せないので、少し抽象的な書き方になります。
1. 固定アンカー方式の答え合わせ
前回、「シーンと話者ごとに1枚のアンカー(先頭フレーム)を決めて、全カットの0フレーム目に刺す」方式を第3章から使う、と書きました。結果です。
- 先頭フレームの一致は完璧。第3章の227本、第4章の219本すべてで、0フレーム目がアンカーと画素レベルで一致しました。同じ話者の切り返しで背景が変わる問題は、ほぼ消えました
- 撮り直し率が激減。画像検査(Claude)の「要撮り直し」は、第2章後半の14%から、第3章で2.2%まで下がりました。第3章の1.40倍は、この効果が大きいと思います
- 弱点は長尺。先頭は固定されても、6〜8秒のカットでは終盤にカメラが勝手に寄ったり、回り込んだりします。台詞のある一人カットは5秒以内が安全圏。長いものは、Claudeがプロンプトに「三脚に固定、最初と最後のコマは同じ画」と書き足し、seedを替えて当てています
- アンカーの欠点は全カットに複製される。アンカーの画で小物の持ち手が逆なら、そのシーンの全カットで逆になります。Claudeには、アンカーを作った段階で小物・視線・衣装まで拡大して確かめる手順を入れてもらいました
- 口が開いたアンカーは、全カットを喋らせる。H3は台詞をいきなり0フレーム目から喋り始める癖があり、アンカーの8割が口を開けた画でした。黙っているべきカットまで口が動くので、Claudeはアンカーを採るためだけに「口を閉じて黙っている4秒のカット」を別に生成し、そこからアンカーを採り直しました
残った課題は、別のアンカー同士を切り替える境界で、画面が不自然に跳ぶことです。これは次の改善テーマにしています。
2. 心の声は「無音版」と「音声版」を別々に作って合成する
前回は「心の声は、小声でつぶやく台詞にしてしまうのが確実」と書きました。ところが、つぶやきの寄りが何カットも続くと、1本の長い寄りに見えて単調になります。次に、Claudeが口の映らない後ろ姿に切り替えたら、今度は監督の私が「相手と向き合っている最中に、壁を向いて考え込む人はいない」とダメ出ししました。
そこで第5章からは、口を閉じて考えている顔の無音版と、台詞を喋っている音声版を別々に生成し、無音版の映像に音声版の声を移植する方式にしました。電話で相手の声を聞いているカットも同じです。画面の口は動かず、声だけが聞こえる。映画でよく見る、あの心の声になりました。生成は2倍になりますが、数秒のカットなので痛くありません。
3. 声の参照音声に、固有名詞を入れてはいけない
一番「そんなことある?」と思った発見です。ある人物の声の参照音声に、たまたま別の人物の名前を呼ぶ台詞が入っていました。すると、その人物が喋る台詞では、似た響きの別の名前が、全部その名前に化けてしまいました。何度撮り直しても直らず、Claudeが参照音声から名前の部分を切り取ったら、一発で直りました。
参照音声は「声質」だけを渡しているつもりでも、モデルは中身の言葉まで拾っています。参照音声は、固有名詞を含まない文で作る。これは今後の鉄則です。
読み方については、次の法則も分かりました。
- 空白で区切ったかな書きの熟語は崩れる。Claudeが読み間違い対策で漢字をかなに開き、単語の区切りに空白を入れていたら、そこで発音が途切れて別の言葉になりました
- H3が正しく読める漢字は、漢字のまま渡す。かなに開くのは、実際に読み間違えた漢字だけにする
- 章が進むにつれて「かなに開く単語の表」が長くなり、新しい章の熟語を途中で割るようになりました(「熱心」の「熱」だけがかなになる、など)。表を足したら、Claudeが全台詞を一覧して、割れた熟語を目で探す必要があります
4. 衣装は文章ではなく「衣装ごとの参照画像」で渡す
「スーツ姿のまま」と文章で書いても、引きのカットでは白いワイシャツ姿で出てきます。「靴下で、靴は履いていない」と書いても、スニーカーが出ます。結局効いたのは、衣装が変わるたびに、その衣装の4面図(前・横・後ろ・顔)を作って参照画像にすることでした。
- 前を開けて着るシャツは、下に着ているTシャツまで4面図に描く(描かないと素肌に羽織った姿になる)
- 物語の途中で衣装が変わる人物は、「スーツ版」「靴下版」「夏服版」のように、場面ごとに4面図を用意する
- 顔や傷も同じで、文章より、参照画像に描き込んだ方が確実に出ます(前回の絆創膏と同じ理屈です)
5. 撮れる構図の規則が増えた
前回の「撮れる構図だけで脚本を切る」の続きです。
- 二人カットの台詞を、相手の名前の呼びかけで始めない。名前を呼ばれた聞き役の口が動きます。呼びかけで始まる台詞は一人カットにする
- 反応だけのカットは3秒。4秒にすると、後半で黙っているはずの口が開きます
- 小道具の寄り(インサート)は動画にしない。手紙や写真の寄りは、H3で生成すると遅いうえに不安定でした。最終的にClaudeが全部、参照画像の静止画に前後のカットの環境音を敷く形に差し替えました
- 場面の状況は、参照画像に描く。「扉が開いていて、規制線が張られている」は、文章で書くより、そう描いた場所の画像を作る方が確実です
6. 夜は、Claudeに見張りをさせて寝る
1章あたり数百本の生成は、夜の間に回すのが基本になりました。ここでハマったのが、デスクトップアプリのClaudeのセッションは、タブを隠したまま15分放置すると止まることです。夜中に止まって、朝まで何も進んでいない日が2回ありました。
最終的に、Claudeが組んだ次の3層で夜間を回しています。
- 本体: 生成・検査・組み立てのバッチを、Windowsのタスクスケジューラから起動する(Claudeのセッションとは無関係に動く)
- 見張り番: 10分ごとに、出力が進んでいるか、1本あたりの生成時間が急に遅くなっていないか、ComfyUIが生きているかを記録する(AIを使わないただのスクリプト)
- 巡回: 1時間ごとに見張り番の記録を読み、異常があるときだけ Claude(コマンドライン版)を起こして、再開・中断・記録をさせる
画像の検査も、200本をまとめてClaudeに渡すと途中で力尽きるので、Claudeは33本ずつの班に分けて3班並列で回すようにしました。朝起きると、夜の間の出来事が1枚のレポートにまとまっています。ちなみにWindows Updateの自動再起動で、夜の間ずっと止まっていた日もありました。夜間バッチの前には更新を止める。これも鉄則です。
7. オープニングとエンディングは「採譜して編曲」
原作には、序章と第1章の間にオープニング、最後にスタッフロールのエンディングがあります。これも実写で再現しました。
曲は、原曲をそのまま使うのは避けたかったので、原曲を楽譜(ABC記譜法)に書き起こし、移調や構成の変更をしてから、音楽生成AIに演奏させるという手順にしました。作業はClaudeが担当し、全部ComfyUIの中で完結しました。
- 採譜: SheetSage2で、効果音の混ざった原曲から旋律とコード進行を書き起こす
- 編曲: 書き起こした譜面を、オープニングは短3度下げて低音の効いた重い曲に、エンディングは1音下げて2回目のサビを削り、ピアノと弦の曲に
- 演奏: YuE2に譜面とスタイルの指定を渡す。60秒の曲が1本15秒で生成される
- 検証: 生成した曲をもう一度採譜し、アレンジ後の譜面どおりに鳴っているかを確認
映像側は、H3には「動き」だけを任せるのがコツでした。雨、炎、雲、カラスの羽ばたきはH3に生成させ、稲妻の光、カメラの寄りやティルト、空の色の変化、文字は全部Claudeが後処理で入れています。こうすると、曲の小節の区切りに合わせて映像のタイミングを自由に決められます。題字のロゴは、Claudeがゲームの録画のコマからトレースしました(私的視聴だからできることです)。
もう一つの発見は、ゲーム画面を画像編集AIで実写化した背景は、元の絵に引っ張られてイラスト調のまま残ることです。監督の私が観て「ここだけアニメっぽい」と気づいた2カットは、Claudeがゲーム画面を下敷きにせず、構図を文章で指定して画像生成AIで一から作り直しました。夜の場面は、曇りの夕方くらいの明るさで生成して、後処理で夜の暗さに落とす(映画でいうデイ・フォー・ナイト)と、写真らしさが保てます。
8. 仕上げは「全カットを一覧してコメント」
完成版を細かく直していくために、全2,605カットを章・シーン・カットで一覧し、その場で再生して、コメントを書き込めるレビュー画面をClaudeに作ってもらいました(Streamlit製、PCの中だけで動きます)。私がコメントを書くと、Claudeがそれを読んで直し、「対応済み」と書き戻します。
ここに、全テイクを音声認識で聞き取り、台本の読みとの一致度で「怪しい順」に並べる機能も、Claudeが付けました。台詞のある2,344テイクのうち98.2%は一致度0.8以上で、残りの42本が「発音が崩れていそうな候補」として上に出てきます。4時間半を全部見直さなくても、怪しいところから潰していけます。
もし有償APIで作っていたら
さて、恒例の回収計算です。単価は前回と同じ、MiniMax H3の公式API(従量)で768Pが1秒0.08ドル(2026年9月時点)、1ドル150円で換算します。
| 項目 | 量 | 換算 |
|---|---|---|
| 実際の生成(没テイク・実験込み) | 5,034本 / 32,074秒 | 約2,566ドル ≒ 約38万5千円 |
| 撮り直しゼロだった場合(採用分だけ) | 約15,960秒 | 約1,277ドル ≒ 約19万2千円 |
| 電気代(推定135時間 × 約600W) | 約81kWh | 約2,500円 |
| 財布に入ってきたお金 | — | 0円 |
前回は「完成までで31万5千円」と予測していましたが、本編が予想より長くなり、撮り直しも増えたので、7万円ほど上振れしました。

「有償APIなら38万5千円かかるところを、電気代2,500円で作った。38万円の節約だ!」
……と書きたいところですが、よく考えてください。私は最初から、この映画に38万円を払うつもりなどありませんでした。払う予定のなかったお金を払わずに済んだことを「節約」と呼ぶのは、セールで買わなかった服の値段を「貯金」と呼ぶのと同じ理屈です。
財布に入ってきたお金は、0円です。GALLERIA(RTX 5090機)の約118万円は、1円も回収されていません。前回「同じ規模の映画をあと4本作れば元が取れる」と書きましたが、あと何本作っても、キャッシュインが無い限り永遠に回収されません。むしろ電気代2,500円のぶん、赤字は順調に拡大しています(震え声
それでも、この計画を有償APIでやろうとは思わなかったし、思えなかった。5,034回も「もう1回」を許せたのは、手元のGPUが「何回回しても追加料金ゼロ」だったからです。元は取れていませんが、元を取ることを気にせずに回せた。ローカル環境の価値は、たぶんそこにあります(と、自分に言い聞かせています
今後の予定
- 細部のブラッシュアップ: 私がレビュー画面で気になるカットにコメントを付け、Claudeが少しずつ直していきます。発音の怪しい42本からです
- 新しいノウハウの発掘: 一番の宿題は、アンカーを切り替えるカット境界で画面が跳ぶ問題の改善です。Claudeと直しながら、次の作品に持っていける手順を固めます
- 同じシリーズの『うしろに立つ少女』: もしかすると、次はこちらを映像化するかもしれません。同じ探偵事務所の物語なので、主人公や事務所など、今回作った参照画像の一部が生かせるはずです
- その先に、オリジナル作品: ノウハウが固まり、動画生成モデルの性能ももう一段上がったら、少し先になりますが、オリジナルの小説を作り、それを原作にした短編映像作品を作ってみたいと思っています。オリジナルなら、権利を気にせず、完成品をこのブログでお見せできます
まとめ
- 生成5,034本、8時間54分から、4時間28分の映画ができた。生成÷採用は、序章の4.8倍から、全体で1.96倍まで下がった
- 固定アンカーは先頭フレームを完璧に揃えるが、長尺・アンカーの欠点・開いた口はそのまま全カットに広がる
- 心の声は無音版と音声版の合成。参照音声に固有名詞を入れない。衣装は4面図で渡す
- 長編は夜に回す。セッションに頼らず、タスクスケジューラと見張り番で回す
- 曲は採譜して編曲できる。H3には動きだけを任せ、光とカメラと文字は後処理で
- 有償APIなら38万5千円。節約はしたが、キャッシュインは0円。GALLERIAの元は、1円も取れていない
この記事を書いている時点で、私はまだ完成版を通しで観ていません。これから、観客ひとりの上映会です。
4時間28分、トイレ休憩は自分で決められる。それが、私的上映の特権だ。


コメント