生成AI実験室(6) 「15秒は破綻する」を訂正します——M5 Mac、量子化なしの15秒動画に到達

今回は訂正から始めます。この連載で当方は2つのことを書きました。第4回で「15秒の生成は技術的には通るが絵が破綻する。運用は10秒以下を基本にする」。第5回で「15秒の動画を実用的な時間で焼けるのは、現状デスクトップ機だけ」。

どちらも、過去の話になりました。M5 Mac(32GB)で、量子化なしの15秒動画が破綻なく焼けるようになったのです。冒頭にその成果物を置きます。

15秒サンプル——0.8MPで生成し、補間とアップスケールで仕上げたもの。※AIによる生成物です

犯人は「長尺」ではなかった

第4回で15秒動画が破綻したとき、当方はこう結論しました——「尺が伸びると、最初に決めた人物を維持できなくなる。モデルの性質だ」。実測では先頭からの乖離が5秒→10秒で8倍。ステップを増やしても改善しない。だから性質だと。

その後の調査で、この結論は早計だったことが分かります。破綻の背後には実装の不具合が2つ隠れていました。ひとつは、プロンプトが参照している3枚の参照画像のうち、3枚目が生成エンジンに届いていなかったこと(画面上は3枚登録されているのに、配線の途中で2枚に減っていた)。もうひとつは、計算を並列で進める仕組みの足並みが揃っていなかったこと。どちらも尺が長いほど影響が蓄積する類の問題で、「長尺で破綻する」という観測とぴったり重なっていたのです。

2つを修正して再試験したところ、同じ15秒が通るようになりました。連載で繰り返してきた「結論には測定条件を添える」に、今回もうひとつ条件が加わります。「実装が正しく動いていること」も、結論の前提条件である。モデルの性質だと断じる前に、自分の配線を疑うべきでした。

達成の中身——量子化なし・ノーカット・362コマ

今回の生成条件と結果を正確に書きます。解像度0.8MP(800×1056)、20ステップ、15秒(362コマ・24fps)、参照画像3枚。モデルは61.7GBのBF16原本のまま——量子化も蒸留も一切なし。補助として、人物表現を高めるLoRA「Realism People」を併用しています(LoRAは既存モデルに小さな追加重みを足す仕組みで、精度を落とす量子化や工程を省く蒸留とは役割が違います。原本の精度はそのままです)。これを1回の生成でノーカット完走です。

品質は全362コマを時系列で確認しました。人物が別人に入れ替わる現象、腕や脚の余剰・欠損、後半の大きな画面崩れは見当たりません(細部では、9秒付近の指先に一時的なブレが残ります。全面合格とまでは言いません)。

メモリの数字が今回も痛快です。生成プロセスの常駐は最大13.5GiB。第4回で書いた「32GBの機体に40GBが載ってスワップが暴れる」世界から、SSDストリーミングによって61.7GBのモデルを流しながら、常駐は搭載メモリの半分以下という世界に変わりました。SSDの読み込み待ちは、10時間の生成を通じて合計0.047秒です。

代償も正直に——1本10時間14分

ここまで良い話を並べたので、代償も並べます。この15秒1本に、10時間14分かかりました(うち生成本体が9時間47分)。夜に仕掛けて、翌朝できている——そういう使い方の道具です。

ただし、この10時間の意味は「安定」で変わりました。破綻するかもしれない10時間は賭けですが、完走と品質の確認が取れた今は違います。夜に仕込めば、朝には要望どおりの高画質動画ができている。電気代以外の追加費用なしに、ノートPCのMac 1台でそれが成立する——10時間という数字だけを見ると非実用に思えますが、寝ている時間に置き換えてしまえば、体感のコストはほぼゼロです。

運用は変わらず二段構えです。当たり取りは低解像度・短尺で数を打ち(1本約100秒)、納得した設定だけを、寝ている間に本番として焼く。15秒が焼けるようになったのは、この「本番」の上限が伸びたという意味であり、何でも15秒で回す時代が来たという意味ではありません。

尺のMac——RTX 5060 Tiとの比較

第5回で「速さのCUDA、精度のMac」と書きました。今回、そこに尺という軸が加わります。

デスクトップ機(RTX 5060 Ti 16GB)も15秒動画を焼けます。それも速い——ただし、量子化と蒸留という「近似」を使った場合です。近似なしの素の条件(0.8MP・20ステップ)では、10秒が限界でした。理由はメモリです。16GBのVRAMは物理的な壁で、尺が伸びて内部データが膨らむと、載らないものは載らない。

Macは逆です。ユニファイドメモリとSSDストリーミングの組み合わせは、尺が伸びてもメモリの増え方が緩やかで、素の条件のまま15秒に到達しました。速さでは負ける。しかし「近似なしでどこまで長く焼けるか」という軸では、10万円台のGPUを積んだデスクトップ機を、ノートPCのMacが上回った——ユニファイドメモリという設計の底力が、いちばん分かりやすく出た実測だと思います。

素の条件(量子化・蒸留なし)における動画の尺の上限比較。デスクトップ機RTX 5060 Tiは10秒でVRAMの壁、M5 Macは15秒(362コマ)をノーカット完走
「尺の壁」——素の条件でのデスクトップ10秒 vs Mac 15秒。メモリ構造の違いが尺の上限を分けた

彼女の衣装替えと、正直な観察

最後に、サンプル動画の彼女について。設定上、この女性は連載に登場してきた白いチャイナドレスの彼女と同一人物です。衣装と化粧を替えた、という設定で新しいキャラクターシートを作りました。

黒ドットブラウス版のキャラクターシート。白チャイナドレスの彼女と同一人物という設定で衣装と化粧を替えたもの
黒ドットブラウス版のキャラクターシート——同一人物の衣装・化粧違い設定。※AIによる生成物です

ただ、正直な観察をひとつ。並べて見ると、少し別人に寄って見えます。同じ基準で作っているのに、衣装と髪型と化粧が変わると、顔の印象まで引っ張られる。第3回で「同一人物の固定は絵で行う」と書きましたが、衣装替えを跨いだ同一性の維持は、その先にあるもう一段難しい課題だと分かりました。ここは今後の宿題として、いずれこの連載で報告します。

断っておくと、これは「簡単」ではない

ここまで読んで「M5 Macを買えば同じことができる」と思われると、それは違うので、再現の前提を正直に書いておきます。

第一に、普通のやり方では載りません。ComfyUIなどの標準的な経路(PyTorch)では、非量子化の61.7GBをM5の32GBで扱うことはできない——第1回で書いた「32GBの機体に40GBが載ってスワップが暴れる」世界に戻るだけです。載せられたのは、第4回で紹介したMac専用の実験的なオープンソース推論エンジンと、そのSSDストリーミングという特殊な仕組みがあってのことです。そしてこの道具自体、当方が自力で見つけたものではなく、「非量子化モデルをMacで動かす方法はないか」をChatGPTに探させて辿り着いたものでした。道具探しからAIとの協働です。

第二に、重みが巨大です。モデル原本一式のダウンロードは約196GB。ディスクに200GB超の空きがなければ、そもそも始められません。

第三に、今回の15秒は改修版での結果です。前述の2つの不具合は、公開されているエンジンにまだ残っており、当方は自前で修正した版を使いました。つまり現時点で、公開版をそのまま導入しても同じ結果は再現できません。

この記事は「M5なら誰でも15秒」という話ではなく、「設計と道具立て次第で、ノートPCがここまで行ける」という到達点の記録として読んでいただくのが正確です。

まとめ

要点は3つです。第一に、過去の結論を2つ訂正した。15秒破綻の主因は長尺ではなく実装の不具合で、「モデルの性質」と断じたのは早計だった——実装の正しさも結論の前提条件に含める。第二に、量子化なし・0.8MP・20ステップ・15秒がM5 Mac 32GBで完走する。常駐13.5GiB、SSD待ち0.047秒。ただし1本10時間、道具の使い方は二段構えのまま。第三に、「速さのCUDA、精度のMac」に「尺のMac」が加わった。近似なしの長尺という軸では、ユニファイドメモリが物理VRAMの壁を越える。

工房の性能は、ここまで来ました。クラウドGPUとデスクトップ機を使い分けてきた当方の動画づくりは、いつの間にかこのMacが主力になりつつあります。連載の本線——彼女に「かなり無茶なこと」をしてもらう日も、近づいています。


本記事の数値は2026年9月時点の当方環境(MacBook Pro M5・ユニファイドメモリ32GB / デスクトップ機 RTX 5060 Ti 16GB)での実測に基づきます。本記事中の人物の画像・動画はすべてAIによる生成物です。

よかったらシェアしてね!
  • URLをコピーしました!
  • URLをコピーしました!

この記事を書いた人

コメント

コメントする

目次