MiniMax H3 ローカル動画生成の実測早見表——M5 Mac 32GB と RTX 5060 Ti 16GB の所要時間・メモリ

このページは、連載「生成AI実験室」で当方が測った数字を1か所に集めた早見表です。記事は経緯を書く場所、このページは数字を引く場所、という分担にしています。新しい測定をしたら行を足します。

最終更新: 2026年10月7日

目次

読み方

  • すべて当方の環境で1台ずつ測った実測です。お手元の環境での所要時間を保証するものではありません。
  • 条件が違う行どうしは、そのまま比べられません。とくに「量子化・蒸留の有無」「尺」「参照動画の有無」が違う行は別物です。
  • 所要時間は、生成を投げてから動画ファイルが出るまでの時間です。モデルを初めて読み込んだ回は「初回」と書いています。
  • H3は24fpsで、コマ数が124(約5.17秒)・243(約10.1秒)・362(約15.08秒)のように決まった刻みに丸められます。表の「5秒」「10秒」「15秒」はこの3つを指します。
  • 解像度の「0.6MP」は約60万画素という意味です。縦横比で実寸が変わるので、実寸も併記しています。

測定環境

呼び名構成
MacMacBook Pro M5・ユニファイドメモリ32GB・SSD 1TB
デスクトップRTX 5060 Ti 16GB・Core i9-10900K・RAM 64GB・Windows 11・ComfyUI 0.36.0(9月20日以降。9月14日〜15日の測定は0.33.1)
クラウドRunPod の A40(48GB)と RTX PRO 6000(96GB)

1. Mac × h3.c(量子化なし・BF16原本)

h3.c は Mac(Apple Silicon)専用のオープンソース推論エンジンです。61.7GBのモデル原本を、SSDから流しながら計算します。ComfyUIの標準経路では、この原本は32GBのMacに載りません。また当方は15秒の本番を、エンジンの不具合を2点直した版で焼いています。なお、15秒で絵が崩れた主な原因は、尺やメモリではなくプロンプトの書き方でした(トラブル早見表にまとめています)。経緯は第4回と第6回、再現手順は有償の手順書にあります。

共通条件: 参照画像から生成(Ref2VA)・全50層・SSDストリーミング・24fps。9月21日の行はVAEタイル288、9月22日以降の行はVAEタイル256です。

スクロールできます
解像度(実寸)尺step所要時間最大常駐メモリ測定日・備考
512×51222コマ(約1秒)487.4秒6.24GB9/21・当たり取り用
0.6MP(672×928)5秒415分48秒8.47GB9/21・しゃがむ動作と顔の寄りで破綻
0.6MP(672×928)5秒826分04秒8.52GB9/21・破綻が解消
0.6MP(672×928)5秒2055分56秒8.48GB9/21
0.6MP(672×928)10秒81時間13分08秒10.77GB9/22
0.6MP(672×928)10秒883分52秒〜84分12秒—9/23・ComfyUIの自作ノード経由(参照2枚/3枚)
0.6MP(672×928)15秒82時間19分38秒11.45GB9/22
0.6MP(672×928)15秒82時間27分〜2時間35分—9/24・9/25(参照2枚/3枚)
0.8MP(800×1056)15秒2010時間14分36秒13.5GiB9/24・うち生成本体9時間47分・映像の復元24分44秒
0.8MP(800×1056)15秒209時間57分〜9時間58分—9/29・9/30・アクションLoRA併用の2本

この表から読める傾向は3つです。

  • step数と時間はほぼ比例します。 生成本体の時間は、4stepで約601秒、8stepで約1,217秒、20stepで約3,009秒でした。
  • メモリはstep数で増えません。 4・8・20stepとも約8.5GBです。step数は時間だけで買えます。
  • 尺を伸ばすと、時間は比例より大きく伸びます。 コマ数を1.49倍(10秒→15秒)にすると、時間は1.91倍でした。

SSDストリーミングの読み込み待ちは、0.8MP・20step・15秒の約10時間を通して合計0.047秒でした。20秒(483コマ)は未測定です。

採用しなかった高速化

試したこと所要時間結果
Turbo LoRAをモデルに焼き込んで5step(0.6MP・5秒)18分17秒(20stepの55分56秒に対し3.06倍速)不採用。暗い衣装の上に白い粒が出て、動きも20stepより粗い
コマ数を73に減らして20step、あとから補間で戻す28分31秒不採用。時間は半分になったが、絵の澄んだ感じが落ちた

2. Mac × ComfyUI(GGUF量子化版)

h3.c に移る前の、ComfyUI経由の数字です。すべて5秒(124コマ)・GGUF量子化版です。行によって生成の方式とstep数が違うので、時間を比べるときは同じ方式・同じstep数の行どうしで見てください。

スクロールできます
方式構成解像度(実寸)step所要時間測定日
参照から本体Q4_K_M(18.49GiB)+Turbo 4step LoRA0.6MP(608×1056)448分47秒8/23
参照から同上約1.0MP42時間03分8/23
先頭・末尾の画像からFL2VA本体Q4_K_M+Turbo 8step LoRA0.2MP(384×544)8約23分9/11
先頭・末尾の画像から同上0.6MP(672×928)887分9/11
先頭・末尾の画像から同上1.0MP84時間28分で中断(未完)9/11
参照から本体Q4_K_M+軽量テキストエンコーダ(ClipProj 4B)+Turbo 4step LoRA0.6MP(672×928)451分41秒9/20
参照から本体Pruned Q4_K_M(10.77GiB)+ClipProj 4B+Turbo 4step LoRA0.6MP(672×928)440分03秒9/20
(参考)h3.c・BF16—0.6MP(672×928)826分04秒9/21

9月20日の2行は、同じseedで、モデルファイルだけを替えた比較です。Pruned(枝刈り)版への差し替えで、総所要は22.5%、生成の中核部分は31%短くなり、常駐メモリは約8.1GB減りました。目視では人物・衣装・背景とも同等で、細部の描き込み量も同等以上でした。

第4回の記事との対応について。 第4回では「87分→40分→26分」と書きました。このうち87分は上の表の「先頭・末尾の画像から・8step」の行、40分03秒は「参照から・4step」の行で、生成の方式とstep数が違います。同じ条件どうしの比較は、51分41秒→40分03秒(モデルの差し替え)です。40分03秒→26分04秒は同じ素材・同じ解像度・同じ尺ですが、エンジンのほかにstep数も4と8で違います。また第4回の「画素差 平均0.45/255」は、顔の描き直しの試験(22コマ)で測った値です。

この経路では、量子化しても合計約40GBのモデルが32GBのメモリに載り、SSDへの退避(スワップ)が常に出入りします。9月20日の測定でもスワップは最大52GBでした。同じ設定でも、機械の状態によって所要時間が4割近く変わった実測があります。

3. Macの仕上げ工程

スクロールできます
工程道具対象所要時間
コマ補間(2倍)RIFE v4.26_heavy(22.9MB)124コマ→247コマ11.7秒
コマ補間(2倍)同上362コマ→723コマ24.5秒
顔の描き直しH3 FaceRefine124コマ34分22秒
拡大(実質2倍)Real-ESRGAN x4plus → 0.5倍40コマ(672×928→1344×1856)289秒(1コマ7.2秒。124コマ換算で約15分)

補間で2倍に増えた約720コマを、同じ実行のまま4倍拡大に通したところ、ComfyUIごと落ちました。生成・補間・拡大は別々に実行するのが安全です。

4. デスクトップ(RTX 5060 Ti 16GB)

4-1. FastH3 V2(8step蒸留モデル)でテキストから生成

モデルは int8_convrot 量子化の FastH3 V2、テキストエンコーダは nvfp4 量子化版です。step数は8固定です。測定は9月20日、seedとプロンプトは固定です。

解像度(実寸)尺所要時間
0.4MP(640×640)5秒1分35秒
0.6MP(608×1056)5秒2分25秒
0.6MP(608×1056)15秒8分21秒
0.8MP(672×1216)15秒11分40秒
1.0MP(768×1376)15秒15分14秒

先頭の画像を1枚渡すと+9秒、先頭と末尾の2枚を渡すと+25秒でした(0.6MP・5秒)。画像2枚から0.8MP(800×1056)・15秒を焼くと13分31秒〜14分05秒です。FastH3 V2 は参照素材からの生成(Ref2VA)には対応していません。

4-2. 参照素材から生成(Ref2VA)+ LightX2V Turbo 8step LoRA

モデルは Ref2VA の Pruned int8_convrot 版です。

スクロールできます
解像度(実寸)尺参照所要時間測定日・備考
0.6MP(608×1056)5秒動画+音声あり6分44秒9/20・LoRA 208件適用を確認
0.6MP(608×1056)15秒動画+音声あり37分55秒9/20・同上
0.6MP(672×928)5秒画像2枚5分04秒10/3・LoRA 208件適用を確認
0.6MP(672×928)10秒画像2枚13分15秒9/23(※)
0.8MP(800×1056)10秒画像2枚22分03秒9/23(※)
1.0MP(896×1184)10秒画像2枚32分29秒9/23(※)
0.6MP(672×928)15秒画像2枚25分00秒〜25分23秒9/23(※)
0.8MP(800×1056)15秒画像2枚43分21秒9/23(※)

(※)9月23日の測定は、LoRAの読み込みに別のノードを使っていました。10月3日に、この組み合わせではLoRAが1件も適用されないと確認しています(当時のログも 0 patches attached でした)。所要時間の目安にはなりますが、画質の評価には使えません。詳細はLoRA一覧表にあります。

尺を5秒から15秒(3倍)にすると、参照動画ありの条件では所要時間が5.6倍になりました。参照動画はコマの列がそのまま計算に乗ります。当方は縮小版(288×512)を渡しています。原寸(720×1280)の参照動画は、メモリ不足の一因でした。

4-3. GGUF量子化版・20step(蒸留なし)

モデルは Ref2VA の Q4_K_M、尺は5秒、参照画像2枚、測定は9月14日〜15日です。

スクロールできます
解像度(実寸)step所要時間備考
0.2MP205分20秒
0.4MP(864×480)2010分04秒
0.6MP(1056×608)2017分53秒初回(モデル読み込みを含む)
1.0MP(1376×768)2035分26秒手の指が正常に描けた
0.4MP(864×480)4+Turbo LoRA3分38秒初回
0.6MP(1056×608)4+Turbo LoRA4分41秒手は画面に入っていない
1.0MP(1376×768)4+Turbo LoRA8分18秒手の指が癒着して崩れた

同じ解像度・同じseedで、4step(Turbo LoRAあり)では手が崩れ、20step(LoRAなし)では正常でした。0.4MPと1.0MPの両方で同じ結果です。ただしstep数とLoRAの有無が同時に違うため、どちらの効果かは分けられていません。

4-4. GPUの換装(RTX 2080 Ti 11GB → RTX 5060 Ti 16GB)

スクロールできます
条件換装前換装後倍率
0.4MP(864×480)・5秒・4step(同一seed)626秒218秒約2.88倍

GPU以外(マザーボード・CPU・メモリ・OS・ComfyUI)は同一です。経緯は第5回にあります。

4-5. 拡大(仕上げ)

Real-ESRGAN x4plus(66.9MB)で4倍にしてから0.5倍に戻し、実質2倍(608×1056→1216×2112)にしています。

スクロールできます
尺コマ数所要時間備考
5秒1208分17秒
10秒24016分21秒
15秒35926分07秒メインメモリのピーク57.6GB(搭載64GB)

時間はコマ数にほぼ比例します(1コマ約4.1〜4.4秒)。制約はVRAMではなくメインメモリです。比較した SeedVR2(7B・nvfp4)は、5秒は9分51秒で通りましたが、15秒はメモリ不足で落ちました。1コマあたりの拡大時間は、Macの約7.2秒に対しデスクトップは約4.1秒です(入力の画素数はほぼ同じです)。

4-6. 静止画

エンジン設定4枚の所要時間
Z-Image Turbo(int8_convrot)3:4・1.0MP・8step26.7秒
SDXL base 1.03:4・1.0MP・25step47.5秒

測定は10月4日です。出てくる絵の違いは第12回に書いています。

5. クラウドGPU(RunPod)

スクロールできます
GPU(時間単価)構成解像度・尺step所要時間メモリ測定日
A40 48GB($0.44)GGUF Q4_K_M+Turbo 4step LoRA・参照動画約11秒あり640×960・約4.5秒610分47秒VRAM最大12.4GiB8/30
同上同上(テキストエンコーダをCPUに置いた場合)同上627分08秒—8/30
RTX PRO 6000 96GB($1.89)BF16・蒸留なし・参照動画15秒あり0.6MP・15秒811分20秒VRAM 71.5〜73.2GiB8/30
同上同上0.6MP・15秒1215分59秒同上8/30
同上同上0.6MP・15秒2025分07秒同上8/30

RTX PRO 6000 の3点は、所要時間が「約2.1分+約1.15分×step数」という直線にほぼ乗りました。step数を2.5倍にしても時間は2.2倍です。BF16ではテキストエンコーダ(約48GiB)がメインメモリ側に退避されるので、VRAMだけでなくメインメモリの量も先に確認が要ります。A40の2本は、テキストエンコーダの置き場所のほかに、プロンプトとseedも違います。ただ、プロンプトが長くなった側のほうが2.5倍速かったので、差はCPUでのテキスト処理によるものと判断しています。時間単価は測定日時点のものです。

6. 機体ごとの使い分け

同じ条件(GGUF Q4_K_M・4step+Turbo LoRA・5秒)で、Macの ComfyUI 経路とデスクトップを並べるとこうなります。Macは8月23日、デスクトップは9月14日の測定です。

スクロールできます
解像度Mac(ComfyUI)デスクトップ倍率
0.6MP48分47秒4分41秒約10.4倍
約1.0MP2時間03分8分18秒約14.8倍

Macは解像度を上げるとメモリが足りなくなり、時間が急に伸びます。専用のVRAMを持つデスクトップには、この崖がありませんでした。

数字を並べた結論は、第5回と第6回に書いたとおりです。1stepあたりの計算はデスクトップが明確に速く、量子化と蒸留を使えば15秒を十数分で焼けます。Macは遅い代わりに、量子化も蒸留もしない原本のまま15秒まで届きます。当方は、試行と量産をデスクトップ、仕上げの1本をMac、という分担にしています。

関連ページ

更新履歴

  • 2026年10月7日 公開(8月21日〜10月4日の測定を収録)

本ページの数値は、記載した測定日時点の当方環境での実測です。モデル・ツールの更新で変わり得ます。実施の際は最新の一次情報をご確認ください。

目次