この連載の振付トレース篇(8)と(9)は、「動き」の一貫性の話でした。今回は「物の構造」の一貫性の話です。そして舞台も変わります。これまでの実験はMacBook Pro(M5)とクラウドGPUでしたが、今回はもう一台——Windowsのデスクトップ機(RTX 5060 Ti 16GB・RAM 64GB・ComfyUI)でのローカル生成です。量子化済みの軽量版モデルなら、16GBのVRAMでも動画生成まで回ります。

題材——「ワイヤーで空を飛ぶ装備」を着せる
今回の題材は、AIで生成した20歳の日本人女性に、某人気アニメ風の「ワイヤーで空を飛ぶ装備」一式を着せ、静止画と動画の両方で使い回せる参照を作ることです(作品名は伏せます。登場する人物はすべてAI生成物です)。
この装備、構造がかなり込み入っています。左右の腿に長い直方体の「鞘」。鞘の前端には替え刃を差し込む細いスリットが5本。上面には細長いガスタンクが1本ずつ。鞘とタンクには固定帯が3本ずつ。腰にはワイヤー付きアンカーを射出する装置が左右別々に。刀の柄には指で握るレバーがあり、そこから出た操作ケーブルが腰の装置につながる——部品が多く、部品同士の位置関係に「正解」がある。つまり、画像生成AIが最も苦手とするタイプの題材です。
何が起きたか——直すと、別の場所が壊れる
結論から言うと、プロンプトと参照画像だけで進めた期間は、破綻の連続でした。起きたことを並べます。
- 鞘の前後が逆転する。前端にあるはずのスリットが後端に移り、前端に存在しない部品が生える。
- 鞘の端面が斜めに切断される。直方体のはずが台形になる。
- 鞘に回っているはずの固定帯が、タンク側にだけ残って箱側から消える。
- 腰の射出装置と鞘が融合して一つの部品になる。
- 前から見たとき、奥にある後端ほど太く描かれる(現実の遠近と逆)。
- 金属の装置がプラスチックのような質感になる。
個々の破綻は、言葉で指摘すれば直ります。問題は、直した次の生成で、別の場所が壊れることです。帯を直せば端面が斜めになり、端面を直せば質感が崩れる。もぐら叩きです(本記事の比喩はこれ一つにします)。
原因を一般化するとこうなります。画像生成AIは「それらしい見た目」を作る能力は高いが、「この物体は、どの角度から見ても同一の構造を持つ」という拘束を、言葉からは保持できない。プロンプトで「前端にスリット5本、後端は閉じた板」と書いても、その文は1枚の絵に対する指示にしかならず、次の1枚では再び自由になる。
転機——「言葉で直す」のをやめて、「正解を見せる」ことにした
そこで方針を変えました。構造を言葉で説明するのをやめて、Blenderで装備の3Dモデルを作り、同一モデルから前・横・後ろを機械的に描画して、「同じ物の別角度」という情報ごとAIに渡すことにしたのです。
3Dモデルは嘘をつきません。同じメッシュからカメラだけ変えて描画すれば、前後のスリット位置も、帯の本数も、端面の角度も、全視点で自動的に一致します。多視点の一貫性を「AIに頑張らせる」のではなく、一貫性が構造的に保証された素材を先に作るという発想の転換です。

実はBlenderの投入自体は2回目です。8月に一度、背景セットをBlenderで組んで「シーンの正本」として参照動画に使う実験をしていました。今回はその発想を部品単位に下ろした形で、言わばこれは「装備の正本」です。
「正解」が本当に正解か——メッシュを数値で検査する
ここでもう一段、慎重にやったことがあります。参照にする3Dモデル自体が間違っていたら、間違いが全出力に複製されるだけです。そこで、モデルを見た目ではなくメッシュの座標・面の向き・親子関係で検査しました。スクリプトで保存済みモデルを読み、以下を確認しています。
| 検査項目 | 結果 |
|---|---|
| 鞘本体の長さと高さの比 | 5.5 : 1 |
| 鞘の後ろ下がり角(左右) | ともに28度 |
| 前端のスリット数(左右) | ともに5本、前端側に配置 |
| 後端 | 閉じた端板が存在 |
| 前端面と長手軸の角度 | 90度(面法線が長手軸と平行) |
| タンクの軸 | 鞘の長手軸と平行 |
| 固定帯の位置 | 箱側・タンク側とも前端から20%・54%・79%で一致 |

断っておくと、これらの数値は参照画像から当方が起こした制作上の仮置き値で、公式設定の寸法ではありません。重要なのは値そのものではなく、「参照の正しさを、生成の前に、主観でなく数値で固定する」という手順です。破綻が起きたとき、「参照が悪いのか、生成が悪いのか」を切り分けられる状態を先に作っておく——Botの検証で散々学んだことが、こんなところで再利用されました。
3D描画のままでは使えない——写真調への「仕上げ」
ただし、Blenderの描画をそのまま参照に使うと、今度は質感が足りません。実写風の人物に3DCG丸出しの装備を合わせると、動画側がどちらに寄るべきか迷います。そこで最終形はこうなりました。
①Blenderの多視点描画を「形状の基準」にする → ②それを下敷きに画像生成で写真調に仕上げる → ③人物シート+装備の前斜め+装備の後ろ斜めの3枚セットとして動画生成に渡す。
②の工程では案の定「金属がプラスチックに見える」問題が再発し、明暗の反射・研磨跡・縁の光沢を明示的に指定して仕上げ直しています。形状はBlenderが保証し、質感は画像生成が担う——役割を分けたことで、もぐら叩きがようやく止まりました。
おまけの学び①——参照に写っているものは、全部コピーされる
今回の過程で、象徴的な事件が一つありました。人物のキャラクターシート(正面全身・背面・顔アップを1枚に並べたもの)では、構成上の都合で正面全身図の顔だけぼかしてありました。すると、完成した動画が「顔のぼかされた状態」で始まり、途中から顔が現れたのです。
AIはシートの「レイアウト」や「ぼかし」まで含めて、見えているものを全部「正解」として取り込みます。参照画像に意図しない情報を残さないこと。白背景・文字・ぼかし・横並びレイアウトは「動画に持ち込むな」と明示的に書くこと。これは振付トレース篇の「参照動画の人物に置き換わる」問題と同根で、参照系の生成AI全般に効く教訓だと思います。
おまけの学び②——「どの画像を採用したか」をハッシュで固定する
もう一つ、地味ですが効いた運用があります。修正を重ねると、似た画像が何十枚も溜まります。途中で「直したはずの点が戻っている」「本当に最新版を見ているのか?」という混乱が実際に起きました。そこで後半は、採用した生成ファイルを明示して別名コピーし、コピー元と保存先のSHA-256(ファイル指紋)の一致を確認する運用にしました。生成AIの試行錯誤は、気を抜くとすぐ「どれが正か分からない山」になります。版の固定は、プロンプトの工夫と同じくらい品質に効きます。
正直な現在地
検証が済んでいるのはここまでです。すなわち、構造を数値で検査した3Dモデルと、それを基準にした写真調の多視点参照3枚が静止画として完成した、という段階。この3枚セットで生成した完成動画の検証はこれからです。途中の動画では「らしい動き」が出始めた一方、装備の細部はまだ崩れており、冒頭の移動方向が意図と逆になる問題も残っています。結果が出たら——改善してもしなくても——続報を書きます。上の動画はその検証過程の一本です。どの参照構成で生成した一本かの照合はこれから——「どの設定で焼いたか分からなくなる」問題は、まさにおまけの学び②の教訓そのものです。
まとめ
要点は3つです。第一に、画像生成AIは「見た目」は作れるが「構造」は言葉では保持できない。複雑な装備・小物・メカで多視点の一貫性が要るなら、プロンプトの改良より先に参照の作り方を疑うべきです。第二に、Blenderで作った同一モデルの多視点描画を「形状の正本」とし、質感だけを画像生成に担わせる役割分担が、もぐら叩きを止めました。3DCGのスキルは高くなくていい——直方体と円筒の組み合わせでも「構造の保証」としては十分働きます。第三に、参照そのものを生成前に検査すること。寸法・角度を数値で固定し、採用ファイルをハッシュで固定する。地味な運用が、結局いちばん手戻りを減らしました。
本記事の内容は2026年10月の当方検証に基づきます。登場する人物の画像・動画はすべてAIによる生成物であり、実在の人物とは関係ありません。本記事は個人の技術検証の記録であり、参照した市販製品・映像作品の意匠・デザインに関する権利はそれぞれの権利者に帰属します。

コメント