生成AI実験室(12) 同じプロンプトで、別人が出てくる——静止画は「エンジン選び」が最初の分岐だった

前回(11)に登場した、装備を着せられていた女性——実は彼女、この記事の主役である新しい生成エンジンから生まれています。今回はその経緯の話です。舞台は前回と同じWindowsのデスクトップ機(RTX 5060 Ti 16GB・ComfyUI)。話題は動画ではなく、すべての上流にある静止画の生成エンジン選びです。

目次

発端——プロンプトを何度直しても、人物に満足できない

動画生成のパイプラインは、元をたどれば1枚の静止画から始まります。人物の元画像を作り、キャラクターシートに起こし、動画の参照に渡す。つまり最初の1枚の質が、その後の全部の上限になります。

動画生成パイプラインの最上流に静止画エンジンがある構成図

当方のデスクトップ機でテキストから静止画を作れるモデルは、長らくSDXLのbaseモデル(2023年公開の素の重み)だけでした。そして率直に言って、人物に満足できていませんでした。プロンプトを直しても直しても、どこか惜しい。この「プロンプトをいじり続ける」状態、前回の装備破綻のときと同じ袋小路です(比喩はここで使い切ります——原因は言葉ではなく、土台の方にありました)。

回り道——「動画用の高解像度化モデル」では静止画は作れない

先に、やらかした話をひとつ。手元には動画の高解像度化に使っているモデル(SeedVR2)があり、「これで静止画も綺麗に作れないか」とローダーを差し替えて実行したところ、こういうエラーで止まりました。

SeedVR2 requires conditioning latents from the SeedVR2Conditioning node.

これは接続ミスではありません。SeedVR2は「元になる映像」を入力に取って復元・高解像度化するモデルで、テキストから何かを生み出すモデルではないのです。生成AIのモデルには「ゼロから作る生成モデル」と「入力を磨く復元モデル」があり、名前や見た目のワークフローが似ていても役割がまったく違う——分かってしまえば当たり前ですが、モデルが増えてくると実際に混同します。同じ勘違いをする人は多いはずなので、エラー文ごと残しておきます。

導入——Z-Image Turbo(公式配布の軽量版)

そこで、テキストから静止画を作る専用の新エンジンとしてZ-Image Turboを導入しました。ComfyUI公式配布の構成(int8量子化版)をそのまま使っています。

構成要素ファイルサイズ
生成本体z_image_turbo_int8_convrot6.20 GB
テキスト理解qwen_3_4b_fp8_mixed5.63 GB
VAEae0.34 GB

ポイントは2つ。8ステップ・CFG 1で回す高速設計(ネガティブプロンプトは使わない)であること、そして合計12GB程度なので16GBのVRAMに収まること。ミドル級GPUの静止画エンジンとして現実的なサイズです。

比較——同一プロンプト・各4枚

条件をそろえて比べました。プロンプトは同一(ベージュのビジネススーツの20代日本人女性・正面・全身・カメラ目線)、各モデルの推奨設定で4枚ずつ生成です。

項目SDXL baseZ-Image Turbo
設定25 steps / CFG 78 steps / CFG 1
解像度(3:4・1.0MP)888×1184896×1152
4枚の生成時間47.5秒26.7秒
全身指定の再現4枚中3枚が膝上で切れる4枚とも全身
服装指定の再現指定にないネクタイが出現ジャケット・スカート・パンプスまで指示通り
顔1枚ごとに顔立ち・年齢感がばらつく整っていて安定
SDXL baseとZ-Image Turboの同一プロンプト4枚ずつの比較。SDXLは切れ・別人・指定外、Z-Imageは全身・同一人物で安定
同一プロンプト・各モデル推奨設定・各4枚の実物。上段=SDXL base、下段=Z-Image Turbo。人物はすべてAIによる生成物

結果は見ての通りです。速い方が、きれいで、指示に従う。 運営者の評価をそのまま書けば「Z-Image Turboなら美人が出る。SDXL baseでは出ない」(主観です。ただし全身・服装の再現性は上の表の通り客観でも差が出ています)。

なお、Z-Imageの4枚は構図・ポーズまでほぼ同一ですが、これは「立ち姿の全身・正面・カメラ目線」という指示に4枚とも忠実だからです。ばらつかないことは欠点ではなく、キャラクターシートの元画像づくりのように再現性が要る用途では、そのまま長所になります。構図を変えたいときは乱数任せにせず、プロンプトで指定すればいい——指示が効くエンジンだからこそ成り立つ使い方です。

正直な注意書き——この比較が言えること、言えないこと

この比較から言えるのは「2023年の素のSDXL baseと、公式配布のZ-Image Turboを、それぞれの推奨設定で使うと、人物はZ-Imageが圧倒的」ということまでです。言えないことも書いておきます。第一に、SDXLには実写系にファインチューンされた派生モデルが無数にあり、それらとは比べていません。「SDXL系全般より上」ではない。第二に、step数・CFG・乱数・解像度はモデルごとの推奨に合わせたので、厳密な同条件比較ではありません。第三に、1プロンプト・各4枚の観察です。

それでも当方がZ-Imageを採用した理由は単純で、「プロンプトのせいかもしれない」という疑いを一つ消せたからです。土台を替えただけで結果が別物になった以上、これまでプロンプトに向けていた労力の何割かは、土台に向けるべきだった。前回の「プロンプトを疑う前に、配線を疑え」に続けるなら、今回は「プロンプトを疑う前に、エンジンを疑え」です。

まとめ

要点は3つです。第一に、静止画の品質問題は、プロンプトより先にエンジンを疑う。同一プロンプトでモデルだけ替える比較は30分でできて、数日分のプロンプト調整より多くを教えてくれます。第二に、モデルには「生成」と「復元」の別がある。動画の高解像度化モデルでは静止画は作れない——エラーで学びました。第三に、指示に忠実なエンジンは、ばらつきを乱数に頼らない。4枚が揃うのは指示通りの証であり、構図を変えたければプロンプトで指定すればいい。再現性が要る用途では、この従順さがそのまま資産になります。

パイプラインの上流がこれで固まりました。次はこのエンジンで作った人物を、二台体制(試行はこのデスクトップ、清書はMac)でどう動画まで運ぶか——使い分けの実績が貯まったら、それも書きます。

本記事の内容は2026年10月の当方検証(RTX 5060 Ti 16GB・ComfyUI 0.36.0)に基づきます。登場する人物の画像はすべてAIによる生成物であり、実在の人物とは関係ありません。

よかったらシェアしてね!
  • URLをコピーしました!
  • URLをコピーしました!

この記事を書いた人

コメント

コメントする

目次