生成AI実験室(8) 彼女が、あの振り付けで踊った——「簡単にできます」と言う前に

キャラクターシート篇の最後に、「次は彼女にかなり無茶なことをしてもらう」と書きました。約束を回収します。無茶の中身は——ダンスです。

題材にしたのは、秋葉原を拠点に活動することで知られる大人数の女性アイドルグループの、誰もが知る代表曲の振り付け。権利への配慮から、本記事ではグループ名・曲名は記しません(末尾の注記をご覧ください)。そのサビの振り付けを、連載でおなじみの白いチャイナドレスの彼女に、参照動画からのモーショントレースで踊ってもらいました。

完成版15秒——振付トレースの成果物。※AIによる生成物です(音声も生成処理によるもの)

先に、釘を刺させてください

この種の話題では、SNSに「MiniMax-H3なら振付トレースも人物スワップも簡単にできます!」という投稿が定期的に流れてきます。結論から言うと、できます。しかし、簡単ではありません。当方はこの15秒に到達するまで、4日間で30本近く生成しました。「簡単」と言う人は、おそらく成功した1本だけを見せています。失敗の29本がどんな顔をしているかは、この記事の後半でお見せします。

仕組み——「動きを借りて、人を差し替える」

やっていることの構造は単純です。AIに渡すのは3点セット+文章。参照動画(振り付けのお手本)、キャラクターシート(踊らせたい人物=彼女)、背景画像(白いスタジオ)。そして「参照動画の動きを、この人物で再現せよ」という指示文です。お手本の踊り手さんの動きだけを借りて、姿かたちを彼女に差し替える——人物スワップとモーショントレースの併せ技です。

一番手間取ったのはfps——ただし、想像と違う形で

さて本題です。最大の難所はfps(1秒あたりのコマ数)でした。ただし「参照動画のfpsと生成動画のfpsを合わせましょう」という、よくある話ではありませんでした。順を追って書きます。

当初の当方の理解は素朴でした。生成する動画は24fps。なら参照動画も24fpsに揃えれば動きがきれいに移るはず——ところが、揃えても前半の動きだけが数秒遅れるという奇妙な症状が消えない。

そこで参照動画を1コマずつ数えて、気づきました。手元の参照動画は24fps表記なのに、実質は10fpsだったのです。360コマのうち、実際に絵が変わるコマは151コマ。残る209コマは直前のコマの複製でした。つまり元素材がもともと10fpsで撮られていて、24fps化しても同じ絵を2〜3回並べて水増ししているだけ——見かけのfpsと、実質のfpsは別物です。複製でコマ数を増やしても、動きの情報は1ビットも増えない。実測でも、fpsを上げた版は改善しませんでした。「fpsを合わせれば/上げればうまくいく」は、当方の環境では成り立ちませんでした。

では真犯人は何だったか。時刻のズレです。後述のとおり、振り付けは文章でタイムスタンプ付きに記述してAIに渡します。参照動画は長い原本から15秒を切り出して使うのですが、この切り出し位置が0.79秒ずれていた。すると「13秒で回転」と書いた文章と、12秒過ぎに回転が来る映像をAIが同時に見せられて、混乱する。文章と映像が喧嘩を始め、動きが崩れるわけです。

対策として効いたのは、双方の「回転のピーク時刻」を測って合わせることでした。振り付けの中で動きが最大になる瞬間(今回は回転)の時刻を、参照動画とプロンプトの両方で確認して一致させる。地味ですが、これで前半の遅れが消えました。

fpsの罠の図解。参照動画は24fps表記の360コマのうち実の絵は151コマで実質10fps。さらにプロンプトの振付記述と参照動画の切り出し位置が0.79秒ずれると文章と映像が競合して動きが崩れる
fpsの罠——見かけと実質の乖離、そして0.79秒の時刻ズレ

成功に必要だった4条件

30本の失敗から絞り込まれた条件は4つです(1本ずつ変数を潰して確かめました)。

第一に、振り付けをタイムスタンプ付きの文章にする。「参照動画のとおりに踊れ」の一行では動きが合いません。もっと悪いのは、参照動画をよく見ずに「それらしい振り付け」を創作して書くこと——文章と映像が競合して最悪の結果になりました。実物を見て、何秒に何をするかを書く。

第二に、その文章と参照動画の時刻を一致させる。前述の0.79秒問題です。

第三に、「この人物を保て」と明示的に宣言する。これを忘れると、彼女ではなく参照動画の踊り手さんの姿がそのまま出てきます(人物の乗っ取り)。スワップのつもりが、お手本の複製になってしまう。

第四に、音声の扱いを明示する。参照動画に音が入っていても、宣言しなければ引き継がれません。

逆に、効かなかったものも書いておきます。生成ステップ数を上げること(むしろ悪化し、彼女の頭のお団子が巨大な灰色の塊に化けました)。参照動画のfpsを上げること(前述)。このあたりが「簡単です」という投稿には出てこない部分です。

完成動画の13秒地点、回転の瞬間の静止画。白いチャイナドレスのAI生成キャラクターが振り付けの回転動作をしている
13秒地点・回転の瞬間——時刻照合の基準にした「動きのピーク」。※AIによる生成物です

失敗29本の顔ぶれ

正直な記録として、代表的な失敗を並べます。人物の乗っ取り(彼女のはずが、参照動画の女性が踊っている)。尺の暴走(15秒のはずが勝手に20秒になる——ツールの設定1つが原因で、突き止めるのに半日)。頭部の崩壊(お団子ヘアが灰色の塊に)。前半だけの遅延(7秒以降は合うのに、序盤1.5〜5.5秒が遅れる)。どれも「生成ボタンを押せば踊る」という世界の話ではありません。

もうひとつ、この検証で骨身に沁みたことを。同一条件でseed(乱数の種)だけ変えた2本の画質評価が、それなりの幅で揺れました。つまり1本と1本の比較で「効いた/効かない」を断定してはいけない。揺れ幅を超えた差だけを差と呼ぶ——LoRAの回と同じ教訓が、ここでも出ました。

種明かし——この動画は、連載が始まる前のもの

最後に種明かしをひとつ。この動画を焼いたのは実は9月の頭、この連載が始まる前です。当時はまだM5 Macの15秒体制がなく、クラウドGPUを時間借りして焼きました。

つまり時系列はこうです。まずこのダンスが「できてしまった」。できると分かったから、彼女は連載の主役になった。そして第1回からの旅——ローカルM5で動かし、高速化し、15秒を安定させ、LoRAで表情を磨いたのは、全部「あの日クラウドでできたことを、手元のノートPCで、電気代だけで、いつでも再現できるようにする」ための工程でした。工房は、ようやくその入口に立ったところです。

まとめ

要点は3つです。第一に、動画生成AIの振付トレースはできる。ただし簡単ではない——当方は4日・30本を要し、その過程は「簡単です」という紹介には写っていない。第二に、最大の難所はfpsだったが、正体は「見かけと実質のfpsの乖離」と「0.79秒の時刻ズレ」だった——数字の表記ではなく、中身を測ること。第三に、成功の芯は4条件(タイムスタンプ付き記述・時刻一致・人物保持の宣言・音声の宣言)で、これは偶然ではなく、変数を1本ずつ潰した末の再現可能な条件である。

彼女が踊れるようになったので、次はもっと無茶をしてもらう予定です。


本記事の内容は2026年8月末〜9月上旬の当方検証(クラウドGPU環境)に基づきます。本記事中の人物の画像・動画はすべてAIによる生成物です。実在のグループ名・楽曲名は、権利への配慮から記載していません。本検証は個人の技術検証であり、当該グループ・楽曲・振付の権利者とは一切関係ありません。

よかったらシェアしてね!
  • URLをコピーしました!
  • URLをコピーしました!

この記事を書いた人

コメント

コメントする

目次