型に流し込んだプロンプトを、誰が検品するのか──18項目の判定器を通った25本のうち21本に「節どうしの矛盾」。コードで見つけて直し、残りはQwen3.6に二択104問を出したらClaudeと98%一致。人間の出番は最後の1〜2割(検品編)

テクノロジー

前回、このシリーズで誰も通れなかった動画プロンプト課題を、Claudeが手順を設計した「型に流し込む」パイプラインでQwen3.6 35Bに解かせ、18項目の判定器を3/3通しました。その記事をレビューしていて、自分で引っかかった質問があります。Claude Codeに、まず事実確認として投げました。

パイプライン内に、評価器→評価エラー→修正のループはあるのか。

答えは「ありません」。パイプラインにあるのは、①部品ごとの検査と差し戻し、②決定的な組み立て、の2段で、③出来上がったプロンプト全体を評価して直す段は無い。そこで次の質問を投げました。

③をQwen自体にやらせるのは無理だと思っている(それが出来れば最初から単独でエラーのないプロンプトを組める)。ロジックベースの判定器でセクション間の矛盾を評価するのも難しい。現実的には③はフロンティアモデルか人間が評価するしかないと考えたほうが良いか。

Claude Codeの答えは、半分同意、半分不同意でした。同意する部分は「Qwenに完成品を渡して『評価して直せ』は無理」。不同意の部分は「ロジックでは矛盾を見られない」と「だからフロンティアか人間しかない」。③を3層に分ければ、上の2層はコードとQwenに任せられるのではないか。試しました。

前提を少しだけ

この課題は、動画生成AI(MiniMax H3)に渡すプロンプトを、4万字のガイドラインが定める書式で書くものです。完成品は6つの節からなります。登場する人物・動物・環境・小物にはそれぞれ<Subject 2>のようなラベルを付け、以後の節ではそのラベルで呼ぶ決まりです。今回の話に関係するのは、ラベルごとに「どのショットに出るか」を宣言する節(retention_analysis。以下「宣言の節」)と、ショットごとに何が起きるかを英語で描く本文(detailed_description)の2つです。

前回のパイプラインは、この完成品を一気に書かせません。まず依頼文から材料を抜き出させ(登場するもの、ショットの分割、ショットごとの行動・音・台詞)、次に材料をもとに短い英文を書かせ、書式(ラベル、話者ID、台詞の記法、節の順序)はコードが組み立てる。「型に流し込む」と呼んでいるのはこの分業です。抜き出した材料は、途中で構造化データ(JSON)として残ります。今回はこれが主役です。

題材も前回と同じです。雨の夜の屋台で、店主が客に熱いマグを両手で渡し(Shot 1)、客のアップに黒猫が飛び乗る(Shot 2)、という12秒の動画の依頼。汎用性の確認用に、早朝のパン屋で店主が常連の女子高生にクロワッサンの紙袋を渡す3ショットの依頼も、Claudeが1本作りました。

先に結論を書きます。

  • 第2層(節どうしの矛盾)は、コードで見つかりました。 判定器を通った25本のうち21本に、宣言の節が「この人物はShot 1とShot 2に出る」と言っているのに本文のShot 2にその人物が出てこない、という食い違いがあった。分解して作ったから中間データがあり、中間データがあれば矛盾の検査は「テキスト同士の読み比べ」ではなく「データとテキストの照合」になる
  • 第3層(意味)は、「狭い二択」にすればQwen3.6が答えられました。 材料の一覧から機械的に作った104問で、Claudeの正解と98%一致、1問3秒。依頼に無い出来事を「ある」とは言わない(100%)。ただしラベルの凡例を渡さないと83%に落ちる。質問の設計が精度を決める
  • それでも残るものはある。 見つけた矛盾を直したv12でも、後のショットの出来事が前のショットの本文に漏れる、人物の外見をその人物が初めて出る場面で描いていない(ガイドラインの決まり)、が残った。二択で場所まで分かるが、直すには書き直しが要る。ここが、フロンティアモデルか人間の仕事。旗の立った段落だけ読めばいい

まず、3層の全体像

完成品の検品を3層に分けた。第1層(書式)は前回の組み立てで保証済み。第2層(節どうしの矛盾)はコードで、判定器を通った25本のうち21本に発見。第3層(意味)はQwen3.6の二択でClaudeと98%一致。残り1〜2割が人間かClaude
完成品の検品を3層に分けた。第1層(書式)は前回の組み立てで保証済み。第2層(節どうしの矛盾)はコードで、判定器を通った25本のうち21本に発見。第3層(意味)はQwen3.6の二択でClaudeと98%一致。残り1〜2割が人間かClaude
見るもの誰が今回の結果
第1層:書式ラベルの付け方、決まった語彙、台詞の記法、節の順序、語数コード(組み立てで保証)18/18(前回)
第2層:節どうしの矛盾「出るショット」の宣言と本文の食い違い、定義だけして使わないラベル、出来事の置き場所コード(中間データと照合)25本中21本で発見、機械で修理
第3層:意味出来事の漏れ・混入、初めて出る人物の外見、音Qwen3.6に二択Claudeと98%一致、3秒/問
残りショット間の出来事の漏れ、言い回し人間かフロンティア旗の立った段落だけ

対象は前回のパイプライン出力です。完成品まで出た30本(計測に使った最終版の3本、パン屋の1本、11回作り直した途中の各版26本)で、うち25本は18項目の判定器を通っています(1本は不合格、パン屋の4本は判定器が無い)。判定器も題材も前回と同じで、今回も変えていません。

第2層:「矛盾はロジックで見られない」は、完成品を相手にした場合の話

中間データと完成品を突き合わせた7つの検査。C1(「出るショット」の宣言と本文の食い違い)が30本で49件、C2(定義だけして本文で使わないラベル)が9件。Claudeが目視した範囲では全部本物
中間データと完成品を突き合わせた7つの検査。C1(「出るショット」の宣言と本文の食い違い)が30本で49件、C2(定義だけして本文で使わないラベル)が9件。Claudeが目視した範囲では全部本物

判定器は完成品しか見ません。でもパイプラインは途中で、材料を構造化データとして持っています。どの画像がどの役割か、一貫させる対象とその特徴、ショットごとの行動・音・台詞、ラベルごとの扱いと出るショット。これがあると、「宣言の節と本文が矛盾していないか」は、テキスト同士の読み比べではなく、データの数字と、本文にラベルが出る場所の照合になります。

Claudeが7つの検査を書きました。効いたのは2つです。

  • C1:宣言と本文の食い違い。 宣言の節が「<Subject 2>(店主)は[Shot 1], [Shot 2]に出る」と言うのに、本文のShot 2の段落に<Subject 2>が一度も出てこない。またはその逆。30本で49件、判定器を通った25本に限っても21本にあった。 内訳は、客のアップ(Shot 2)に店主は写らないのに「出る」と宣言する過大申告が34件、Shot 2の本文が屋台の環境や提灯に触れているのに宣言は「[Shot 1]」だけ、という過小申告が15件
  • C2:定義だけして本文で使わないラベル。 9件、5本

Claudeが目視した10件は全部本物でした。宣言が間違っているか、本文がラベルを使わずに名前で書いているか。ガイドラインは「この節には各対象がどこに出るかを記録する」と言っているので、どちらも直すべきものです。

C1は機械で直せます。 本文にそのラベルが実際に出るショットを数えて、宣言のほうを書き換えるだけ。直した後も判定器は3/3のまま。C2は「作り直しの合図」で、機械では直しません。

C3(ある行動が自分のショットの段落に無い、または他のショットの段落に出ている)は、Claudeが語の一致率で判定する作りにしたら、最初48件も出て、ほぼ誤検出でした。前回のハーネスは本文中の「red mug」のような名前を<Subject 5>のようなラベルに機械的に置き換えるので、本文には「mug」という語が残っていない。Claudeが照合の前にラベルを名前に戻すようにして5件。そのうち3件は「Person A speaks」のように台詞を行動として書いていた材料側の問題で、Claudeが見たところ本物の指摘は2件でした。

第3層:評価も「型に流し込む」

材料の一覧から機械的に作った二択104問。Qwen3.6(長考なし)はClaudeの正解と98%一致、1問2.9秒。ラベルの凡例を渡さないと83%(本文は<Subject 2>としか書いていないのに質問は「店主」なので突き合わせられない)。120Bのqwen3.8も98%、4秒
材料の一覧から機械的に作った二択104問。Qwen3.6(長考なし)はClaudeの正解と98%一致、1問2.9秒。ラベルの凡例を渡さないと83%(本文は<Subject 2>としか書いていないのに質問は「店主」なので突き合わせられない)。120Bのqwen3.8も98%、4秒

Qwenに完成品を渡して「評価して直せ」は無理です。それができるなら最初から書けている。ここはClaudeも同意でした。でも、評価を「答えが決まる二択」に分解したらどうか。生成で効いた「型に流し込む」を、評価にも当てる。

材料の一覧(ショットごとの行動・音・台詞)から、Claudeが質問を機械的に作りました。

  • 自分のショットの行動(24問):Shot 1の段落について「この段落は『客が両手でマグを受け取る』と述べているか」。期待はyes、抜けていればno
  • 他のショットの行動(24問):Shot 2の行動をShot 1の段落について聞く。期待はno、yesなら混入
  • 依頼に無い出来事(27問):「犬が吠える」「電話が鳴る」「電気が消える」。期待はno
  • (18問):そのショットの音(雨、陶器の音、猫の着地)が書いてあるか
  • 初めて出る人物の外見(11問):ガイドラインは、人物や動物が初めて画面に出る場面で外見を描くよう求めています。それが2つ以上描かれているか

正解はClaudeが段落を読んで付けました。私は確かめていません(後述)。判定側に渡すのは、段落と、ラベルの凡例(<Subject 2>=店主、のような対応表)と、質問だけ。長考(thinking)は前回と同じ手で止めて、yes/noと根拠の引用を答えさせます。

Qwen3.6 35Bで、104問中102問が一致。 残り2問は、正解を付けたClaudeのほうが甘かった。「雨が降り続く」という描写を「雨の音」に数えたのが1問。もう1問は、モデルが指示文を本文に写してしまった一文(「マグは店主が持ち客に渡されるものと説明される」)を根拠に「手渡しが起きている」と答えたもので、段落を字義どおり読めばQwenが正しい。依頼に無い出来事と、他のショットの行動は100%。無いものを「ある」と言わない。 これが大事で、旗が立ったところだけ人が見る運用が成り立つ根拠です。

凡例を渡さないと83%でした。自分のショットの行動が33%。本文には<Subject 2>としか書いていないのに質問は「店主」なので、「書いていない」と答える。人間の検品者にも凡例は要るので、これは公平な条件です。質問の設計が精度を決める、という当たり前のことを、数字で確かめました。

このシリーズで最も精度が高かった120Bのモデル(qwen3.8-flash-next)でも試しました。書くには遅い(1タスク11分)けれど、読んで判定するだけなら間に合うのではないか、というClaudeの仮説です。4秒/問で、確かに間に合う。 ただし一致率は35Bと同じ98%。この難度の質問には、大きいモデルは要りませんでした。

ループを閉じる:v11 → v12

見つけた矛盾をパイプラインに戻したv12。屋台の3本は判定器3/3のまま第2層の指摘が0に。パン屋では第3層の旗が4本立ち、うち3本が本物:後のショットの出来事が前のショットの本文に漏れている、人物の外見が初めて出る場面で描かれていない
見つけた矛盾をパイプラインに戻したv12。屋台の3本は判定器3/3のまま第2層の指摘が0に。パン屋では第3層の旗が4本立ち、うち3本が本物:後のショットの出来事が前のショットの本文に漏れている、人物の外見が初めて出る場面で描かれていない

見つけたものを、Claudeがパイプラインに戻しました。組み立てのときに、「出るショット」の宣言を本文の実際の出現に合わせて上書きする(C1は構造的に起きなくなる)。第3層の判定が根拠として引用してきた文から、モデルが指示文を本文に写した箇所(「…として識別される」「…は独立した文として表示される」)と、名前をラベルに置き換えたときの副作用(「男性の<Subject 2>」のような二重の呼び方)が見つかったので、機械的に掃除する。台詞の言語タグを略称ではなく正式名に揃える。

屋台の3本は、判定器3/3のまま、第2層の指摘が0になりました。第3層の旗は1〜2本残り、中身はClaudeが見たところ「猫の『黒い』という外見の語が、名前をラベルに置き換えたときに一緒に消えた」「『持っている』と『受け取る』の言葉の差」のような軽微なものでした。

面白いのはパン屋のほうです。第3層の旗が4本立ち、Claudeが目視したところ3本が本物でした。中身は2種類。1つは出来事の漏れ。最後のショットで客が紙袋を胸に抱える、という出来事が、最初のショットと2番目のショットの本文にも書かれてしまっている。もう1つは初めて出る人物の外見。店主は最初のショットで台詞を言うのに、口ひげもコック帽も描かれていない。どちらも18項目の判定器には見えず、第2層のコードにも見えず、二択の質問で場所まで分かった。直すには、そのショットを書き直させるしかない。ここが「残り1〜2割」で、その指示を出すのが人間かフロンティアモデルの仕事です。

で、質問への答え

「③はフロンティアか人間しかないのか」。Claude Codeの答えは、実験を経て私の答えにもなりました。

  • 「ロジックでは矛盾を見られない」は、完成品を相手にした場合の話。 分解して作ったからこそ、矛盾の検査も分解できる。第2層は数行の照合で、判定器を通った25本のうち21本を捕まえた
  • 「Qwenに評価は無理」は、丸投げした場合の話。 答えが決まる二択なら98%。生成と同じで、評価も型に流し込める
  • それでも、フロンティアか人間は要る。 ただし仕事は「完成品を読む」から「旗の立った段落を読んで、書き直しを指示する」に縮む。1本あたり数十秒の目視です

そして、検査の型を作ったのは今回もClaudeでした。どの質問を作るか、凡例を渡すか、C3の語の一致率をどう取るか。C3は1回作り直しています。前回と同じ構造で、型を作るコストはフロンティア側に乗る。

人間がやったこと、Claude Codeに任せたこと

人間(私)Claude Code
「評価→修正のループはあるのか」という事実確認、「③はフロンティアか人間しかないのか」という問いの設定、実験の承認③を3層に分ける整理、第2層の検査7つと修理の実装、第3層の質問生成と判定の実装、104問の正解付け、Qwen3.6とqwen3.8での判定、旗の目視確認、v12への反映、REPORT、この記事の下書きと図
この記事のレビュー

今回は、私が手を動かした部分がほとんどありません。質問を投げただけです。

正直、気になっていること

  • 正解を付けたのも判定の型を作ったのもClaude。 「Claudeと98%一致」は「Claudeの読みと一致」で、その読みが正しいかは、誰も確かめていません。私が見たのは記事だけです。不一致4件については、Claude自身が見直して正解側の甘さを認めています
  • 104問は少ない。 9段落・2種類の依頼からClaudeが作った問題です。「依頼に無い出来事」はClaudeが10個作った定型で、巧妙な捏造(似ているが違う出来事)は含めていません
  • 第2層の「本物」判定は、Claudeの目視10件。 49件全部を確かめてはいません。C1はラベルの出現で見るので、本文が同じ対象を別の言葉で書いていれば「本文側の書き方の問題」として引っかかります
  • 第3層の旗を直す段(書き直しの差し戻し)は、まだありません。 今回は「旗が立つ」ところまでで、「旗を見て直す」は人間かClaude。ここを自動化すれば、また作り直しの記録が伸びる
  • 120Bでの判定は「同じ精度」でしたが、質問が易しすぎた可能性があります。難しい質問を作れば差が出るかもしれない

まとめ

  • パイプラインに③(完成品を評価して直す)は無かった。無いことを前回の記事にも書き足しました
  • ③を3層に分けたら、第2層(節どうしの矛盾)はコードで、判定器を通った25本のうち21本を発見・修理。第3層(意味)はQwen3.6の二択でClaudeと98%一致
  • 凡例が無いと83%。無いものを「ある」と言わないので、旗の立ったところだけ人が見ればいい
  • 残るのは「ショット間の出来事の漏れ」と「初めて出る人物の外見」。二択で場所まで分かるが、直すのは人間かフロンティア。仕事は1〜2割に縮む
  • 型を作るのは今回もClaude。生成の型と検査の型、両方

次にやること

第3層の旗が立った段落を、パイプラインに戻して書き直させる段。それができれば、人間の仕事はさらに「旗の最終確認」だけになります。ただし、差し戻しを重ねると別の所を壊すのは前回見たとおりなので、「旗の立った文だけ直す」形にする必要がある。

それから、この検品の考え方を動画プロンプト以外に。日常タスク編の家計簿課題(D5)なら、中間データは計算結果そのもので、第2層の照合はもっと素直に書けるはずです。

もう1つ、別の種類の記事を。上の分担表を見て「ほとんどClaudeに丸投げじゃないか」と思った読者もいるはずです。実際、このブログの検証は正解付けも検査の設計も目視も、Claudeに任せっぱなしのものが多い。ただ、AIの精度が上がるほど、人間がAIの計画や中間・最終成果物を確かめること自体に意味があるのか、という問いのほうが大きくなります。Anthropicは2026年8月、Claude Codeの既定を「人間が毎回承認」から自動承認に切り替えました。根拠として出された数字は、1,053人の検証で危険なコマンドを人間が止められたのは13.6%、自動判定は89%。人間に委ね続けるほうが悪い結果になる、という話です。人間が確かめるべき領域(感性で決める領域や、AIが信号として捉えにくい事象)と、AIに任せるべき領域(そこで人間が介入するのは品質ではなく責任の所在の話)は、どこで分かれるのか。外部の知見と、「科学的にも倫理的にも意味がないなら人間は介入しない」という私の考えを交えて、このブログのAIと人間の役割分担を一度整理する記事を書くつもりです。

170万円の片翼に仕事の手順を教え、検品の手順も教えた。まだ手放しません。次は「直し方」を教えます(笑

コメント

タイトルとURLをコピーしました