このページは、連載「生成AI実験室」で当方が測った数字を1か所に集めた早見表です。記事は経緯を書く場所、このページは数字を引く場所、という分担にしています。新しい測定をしたら行を足します。
最終更新: 2026年10月7日
読み方
- すべて当方の環境で1台ずつ測った実測です。お手元の環境での所要時間を保証するものではありません。
- 条件が違う行どうしは、そのまま比べられません。とくに「量子化・蒸留の有無」「尺」「参照動画の有無」が違う行は別物です。
- 所要時間は、生成を投げてから動画ファイルが出るまでの時間です。モデルを初めて読み込んだ回は「初回」と書いています。
- H3は24fpsで、コマ数が124(約5.17秒)・243(約10.1秒)・362(約15.08秒)のように決まった刻みに丸められます。表の「5秒」「10秒」「15秒」はこの3つを指します。
- 解像度の「0.6MP」は約60万画素という意味です。縦横比で実寸が変わるので、実寸も併記しています。
測定環境
| 呼び名 | 構成 |
|---|---|
| Mac | MacBook Pro M5・ユニファイドメモリ32GB・SSD 1TB |
| デスクトップ | RTX 5060 Ti 16GB・Core i9-10900K・RAM 64GB・Windows 11・ComfyUI 0.36.0(9月20日以降。9月14日〜15日の測定は0.33.1) |
| クラウド | RunPod の A40(48GB)と RTX PRO 6000(96GB) |
1. Mac × h3.c(量子化なし・BF16原本)
h3.c は Mac(Apple Silicon)専用のオープンソース推論エンジンです。61.7GBのモデル原本を、SSDから流しながら計算します。ComfyUIの標準経路では、この原本は32GBのMacに載りません。また当方は15秒の本番を、エンジンの不具合を2点直した版で焼いています。なお、15秒で絵が崩れた主な原因は、尺やメモリではなくプロンプトの書き方でした(トラブル早見表にまとめています)。経緯は第4回と第6回、再現手順は有償の手順書にあります。
共通条件: 参照画像から生成(Ref2VA)・全50層・SSDストリーミング・24fps。9月21日の行はVAEタイル288、9月22日以降の行はVAEタイル256です。
| 解像度(実寸) | 尺 | step | 所要時間 | 最大常駐メモリ | 測定日・備考 |
|---|---|---|---|---|---|
| 512×512 | 22コマ(約1秒) | 4 | 87.4秒 | 6.24GB | 9/21・当たり取り用 |
| 0.6MP(672×928) | 5秒 | 4 | 15分48秒 | 8.47GB | 9/21・しゃがむ動作と顔の寄りで破綻 |
| 0.6MP(672×928) | 5秒 | 8 | 26分04秒 | 8.52GB | 9/21・破綻が解消 |
| 0.6MP(672×928) | 5秒 | 20 | 55分56秒 | 8.48GB | 9/21 |
| 0.6MP(672×928) | 10秒 | 8 | 1時間13分08秒 | 10.77GB | 9/22 |
| 0.6MP(672×928) | 10秒 | 8 | 83分52秒〜84分12秒 | — | 9/23・ComfyUIの自作ノード経由(参照2枚/3枚) |
| 0.6MP(672×928) | 15秒 | 8 | 2時間19分38秒 | 11.45GB | 9/22 |
| 0.6MP(672×928) | 15秒 | 8 | 2時間27分〜2時間35分 | — | 9/24・9/25(参照2枚/3枚) |
| 0.8MP(800×1056) | 15秒 | 20 | 10時間14分36秒 | 13.5GiB | 9/24・うち生成本体9時間47分・映像の復元24分44秒 |
| 0.8MP(800×1056) | 15秒 | 20 | 9時間57分〜9時間58分 | — | 9/29・9/30・アクションLoRA併用の2本 |
この表から読める傾向は3つです。
- step数と時間はほぼ比例します。 生成本体の時間は、4stepで約601秒、8stepで約1,217秒、20stepで約3,009秒でした。
- メモリはstep数で増えません。 4・8・20stepとも約8.5GBです。step数は時間だけで買えます。
- 尺を伸ばすと、時間は比例より大きく伸びます。 コマ数を1.49倍(10秒→15秒)にすると、時間は1.91倍でした。
SSDストリーミングの読み込み待ちは、0.8MP・20step・15秒の約10時間を通して合計0.047秒でした。20秒(483コマ)は未測定です。
採用しなかった高速化
| 試したこと | 所要時間 | 結果 |
|---|---|---|
| Turbo LoRAをモデルに焼き込んで5step(0.6MP・5秒) | 18分17秒(20stepの55分56秒に対し3.06倍速) | 不採用。暗い衣装の上に白い粒が出て、動きも20stepより粗い |
| コマ数を73に減らして20step、あとから補間で戻す | 28分31秒 | 不採用。時間は半分になったが、絵の澄んだ感じが落ちた |
2. Mac × ComfyUI(GGUF量子化版)
h3.c に移る前の、ComfyUI経由の数字です。すべて5秒(124コマ)・GGUF量子化版です。行によって生成の方式とstep数が違うので、時間を比べるときは同じ方式・同じstep数の行どうしで見てください。
| 方式 | 構成 | 解像度(実寸) | step | 所要時間 | 測定日 |
|---|---|---|---|---|---|
| 参照から | 本体Q4_K_M(18.49GiB)+Turbo 4step LoRA | 0.6MP(608×1056) | 4 | 48分47秒 | 8/23 |
| 参照から | 同上 | 約1.0MP | 4 | 2時間03分 | 8/23 |
| 先頭・末尾の画像から | FL2VA本体Q4_K_M+Turbo 8step LoRA | 0.2MP(384×544) | 8 | 約23分 | 9/11 |
| 先頭・末尾の画像から | 同上 | 0.6MP(672×928) | 8 | 87分 | 9/11 |
| 先頭・末尾の画像から | 同上 | 1.0MP | 8 | 4時間28分で中断(未完) | 9/11 |
| 参照から | 本体Q4_K_M+軽量テキストエンコーダ(ClipProj 4B)+Turbo 4step LoRA | 0.6MP(672×928) | 4 | 51分41秒 | 9/20 |
| 参照から | 本体Pruned Q4_K_M(10.77GiB)+ClipProj 4B+Turbo 4step LoRA | 0.6MP(672×928) | 4 | 40分03秒 | 9/20 |
| (参考)h3.c・BF16 | — | 0.6MP(672×928) | 8 | 26分04秒 | 9/21 |
9月20日の2行は、同じseedで、モデルファイルだけを替えた比較です。Pruned(枝刈り)版への差し替えで、総所要は22.5%、生成の中核部分は31%短くなり、常駐メモリは約8.1GB減りました。目視では人物・衣装・背景とも同等で、細部の描き込み量も同等以上でした。
第4回の記事との対応について。 第4回では「87分→40分→26分」と書きました。このうち87分は上の表の「先頭・末尾の画像から・8step」の行、40分03秒は「参照から・4step」の行で、生成の方式とstep数が違います。同じ条件どうしの比較は、51分41秒→40分03秒(モデルの差し替え)です。40分03秒→26分04秒は同じ素材・同じ解像度・同じ尺ですが、エンジンのほかにstep数も4と8で違います。また第4回の「画素差 平均0.45/255」は、顔の描き直しの試験(22コマ)で測った値です。
この経路では、量子化しても合計約40GBのモデルが32GBのメモリに載り、SSDへの退避(スワップ)が常に出入りします。9月20日の測定でもスワップは最大52GBでした。同じ設定でも、機械の状態によって所要時間が4割近く変わった実測があります。
3. Macの仕上げ工程
| 工程 | 道具 | 対象 | 所要時間 |
|---|---|---|---|
| コマ補間(2倍) | RIFE v4.26_heavy(22.9MB) | 124コマ→247コマ | 11.7秒 |
| コマ補間(2倍) | 同上 | 362コマ→723コマ | 24.5秒 |
| 顔の描き直し | H3 FaceRefine | 124コマ | 34分22秒 |
| 拡大(実質2倍) | Real-ESRGAN x4plus → 0.5倍 | 40コマ(672×928→1344×1856) | 289秒(1コマ7.2秒。124コマ換算で約15分) |
補間で2倍に増えた約720コマを、同じ実行のまま4倍拡大に通したところ、ComfyUIごと落ちました。生成・補間・拡大は別々に実行するのが安全です。
4. デスクトップ(RTX 5060 Ti 16GB)
4-1. FastH3 V2(8step蒸留モデル)でテキストから生成
モデルは int8_convrot 量子化の FastH3 V2、テキストエンコーダは nvfp4 量子化版です。step数は8固定です。測定は9月20日、seedとプロンプトは固定です。
| 解像度(実寸) | 尺 | 所要時間 |
|---|---|---|
| 0.4MP(640×640) | 5秒 | 1分35秒 |
| 0.6MP(608×1056) | 5秒 | 2分25秒 |
| 0.6MP(608×1056) | 15秒 | 8分21秒 |
| 0.8MP(672×1216) | 15秒 | 11分40秒 |
| 1.0MP(768×1376) | 15秒 | 15分14秒 |
先頭の画像を1枚渡すと+9秒、先頭と末尾の2枚を渡すと+25秒でした(0.6MP・5秒)。画像2枚から0.8MP(800×1056)・15秒を焼くと13分31秒〜14分05秒です。FastH3 V2 は参照素材からの生成(Ref2VA)には対応していません。
4-2. 参照素材から生成(Ref2VA)+ LightX2V Turbo 8step LoRA
モデルは Ref2VA の Pruned int8_convrot 版です。
| 解像度(実寸) | 尺 | 参照 | 所要時間 | 測定日・備考 |
|---|---|---|---|---|
| 0.6MP(608×1056) | 5秒 | 動画+音声あり | 6分44秒 | 9/20・LoRA 208件適用を確認 |
| 0.6MP(608×1056) | 15秒 | 動画+音声あり | 37分55秒 | 9/20・同上 |
| 0.6MP(672×928) | 5秒 | 画像2枚 | 5分04秒 | 10/3・LoRA 208件適用を確認 |
| 0.6MP(672×928) | 10秒 | 画像2枚 | 13分15秒 | 9/23(※) |
| 0.8MP(800×1056) | 10秒 | 画像2枚 | 22分03秒 | 9/23(※) |
| 1.0MP(896×1184) | 10秒 | 画像2枚 | 32分29秒 | 9/23(※) |
| 0.6MP(672×928) | 15秒 | 画像2枚 | 25分00秒〜25分23秒 | 9/23(※) |
| 0.8MP(800×1056) | 15秒 | 画像2枚 | 43分21秒 | 9/23(※) |
(※)9月23日の測定は、LoRAの読み込みに別のノードを使っていました。10月3日に、この組み合わせではLoRAが1件も適用されないと確認しています(当時のログも 0 patches attached でした)。所要時間の目安にはなりますが、画質の評価には使えません。詳細はLoRA一覧表にあります。
尺を5秒から15秒(3倍)にすると、参照動画ありの条件では所要時間が5.6倍になりました。参照動画はコマの列がそのまま計算に乗ります。当方は縮小版(288×512)を渡しています。原寸(720×1280)の参照動画は、メモリ不足の一因でした。
4-3. GGUF量子化版・20step(蒸留なし)
モデルは Ref2VA の Q4_K_M、尺は5秒、参照画像2枚、測定は9月14日〜15日です。
| 解像度(実寸) | step | 所要時間 | 備考 |
|---|---|---|---|
| 0.2MP | 20 | 5分20秒 | |
| 0.4MP(864×480) | 20 | 10分04秒 | |
| 0.6MP(1056×608) | 20 | 17分53秒 | 初回(モデル読み込みを含む) |
| 1.0MP(1376×768) | 20 | 35分26秒 | 手の指が正常に描けた |
| 0.4MP(864×480) | 4+Turbo LoRA | 3分38秒 | 初回 |
| 0.6MP(1056×608) | 4+Turbo LoRA | 4分41秒 | 手は画面に入っていない |
| 1.0MP(1376×768) | 4+Turbo LoRA | 8分18秒 | 手の指が癒着して崩れた |
同じ解像度・同じseedで、4step(Turbo LoRAあり)では手が崩れ、20step(LoRAなし)では正常でした。0.4MPと1.0MPの両方で同じ結果です。ただしstep数とLoRAの有無が同時に違うため、どちらの効果かは分けられていません。
4-4. GPUの換装(RTX 2080 Ti 11GB → RTX 5060 Ti 16GB)
| 条件 | 換装前 | 換装後 | 倍率 |
|---|---|---|---|
| 0.4MP(864×480)・5秒・4step(同一seed) | 626秒 | 218秒 | 約2.88倍 |
GPU以外(マザーボード・CPU・メモリ・OS・ComfyUI)は同一です。経緯は第5回にあります。
4-5. 拡大(仕上げ)
Real-ESRGAN x4plus(66.9MB)で4倍にしてから0.5倍に戻し、実質2倍(608×1056→1216×2112)にしています。
| 尺 | コマ数 | 所要時間 | 備考 |
|---|---|---|---|
| 5秒 | 120 | 8分17秒 | |
| 10秒 | 240 | 16分21秒 | |
| 15秒 | 359 | 26分07秒 | メインメモリのピーク57.6GB(搭載64GB) |
時間はコマ数にほぼ比例します(1コマ約4.1〜4.4秒)。制約はVRAMではなくメインメモリです。比較した SeedVR2(7B・nvfp4)は、5秒は9分51秒で通りましたが、15秒はメモリ不足で落ちました。1コマあたりの拡大時間は、Macの約7.2秒に対しデスクトップは約4.1秒です(入力の画素数はほぼ同じです)。
4-6. 静止画
| エンジン | 設定 | 4枚の所要時間 |
|---|---|---|
| Z-Image Turbo(int8_convrot) | 3:4・1.0MP・8step | 26.7秒 |
| SDXL base 1.0 | 3:4・1.0MP・25step | 47.5秒 |
測定は10月4日です。出てくる絵の違いは第12回に書いています。
5. クラウドGPU(RunPod)
| GPU(時間単価) | 構成 | 解像度・尺 | step | 所要時間 | メモリ | 測定日 |
|---|---|---|---|---|---|---|
| A40 48GB($0.44) | GGUF Q4_K_M+Turbo 4step LoRA・参照動画約11秒あり | 640×960・約4.5秒 | 6 | 10分47秒 | VRAM最大12.4GiB | 8/30 |
| 同上 | 同上(テキストエンコーダをCPUに置いた場合) | 同上 | 6 | 27分08秒 | — | 8/30 |
| RTX PRO 6000 96GB($1.89) | BF16・蒸留なし・参照動画15秒あり | 0.6MP・15秒 | 8 | 11分20秒 | VRAM 71.5〜73.2GiB | 8/30 |
| 同上 | 同上 | 0.6MP・15秒 | 12 | 15分59秒 | 同上 | 8/30 |
| 同上 | 同上 | 0.6MP・15秒 | 20 | 25分07秒 | 同上 | 8/30 |
RTX PRO 6000 の3点は、所要時間が「約2.1分+約1.15分×step数」という直線にほぼ乗りました。step数を2.5倍にしても時間は2.2倍です。BF16ではテキストエンコーダ(約48GiB)がメインメモリ側に退避されるので、VRAMだけでなくメインメモリの量も先に確認が要ります。A40の2本は、テキストエンコーダの置き場所のほかに、プロンプトとseedも違います。ただ、プロンプトが長くなった側のほうが2.5倍速かったので、差はCPUでのテキスト処理によるものと判断しています。時間単価は測定日時点のものです。
6. 機体ごとの使い分け
同じ条件(GGUF Q4_K_M・4step+Turbo LoRA・5秒)で、Macの ComfyUI 経路とデスクトップを並べるとこうなります。Macは8月23日、デスクトップは9月14日の測定です。
| 解像度 | Mac(ComfyUI) | デスクトップ | 倍率 |
|---|---|---|---|
| 0.6MP | 48分47秒 | 4分41秒 | 約10.4倍 |
| 約1.0MP | 2時間03分 | 8分18秒 | 約14.8倍 |
Macは解像度を上げるとメモリが足りなくなり、時間が急に伸びます。専用のVRAMを持つデスクトップには、この崖がありませんでした。
数字を並べた結論は、第5回と第6回に書いたとおりです。1stepあたりの計算はデスクトップが明確に速く、量子化と蒸留を使えば15秒を十数分で焼けます。Macは遅い代わりに、量子化も蒸留もしない原本のまま15秒まで届きます。当方は、試行と量産をデスクトップ、仕上げの1本をMac、という分担にしています。
関連ページ
更新履歴
- 2026年10月7日 公開(8月21日〜10月4日の測定を収録)
本ページの数値は、記載した測定日時点の当方環境での実測です。モデル・ツールの更新で変わり得ます。実施の際は最新の一次情報をご確認ください。