検証レポート · 2026-09-24 · RTX 5080

ComfyUIの更新で、
MiniMax H3の動画づくりが約13秒速くなった

約5秒の動画を1本つくる時間が、56.4秒から43.0秒になりました。縮んだのは主に、AIが作った映像データを実際の映像に戻す「仕上げ」の工程です。画質は数値の上でほぼ変わっていません。

約5秒の動画1本
56.4 → 43.0
24%短縮(1.31倍)
そのうち仕上げ(VAE)
16.6 → 6.0
約2.8倍の速さ
画質
ほぼ同じ
平均のずれは明るさ256段階で約1段階

先に、言葉を4つだけ

フレームと秒数
動画は1秒あたり24枚の絵でできています。124フレーム=約5.2秒243フレーム=約10.1秒。このページでは秒数を先に書きます。
サンプリング
AIが映像の中身を「考える」工程です。生成時間のいちばん大きな部分を占めます。
VAE(仕上げ)
AIが考えた結果は、圧縮された数値の束です。それを実際の映像に戻す部品がVAEです。写真でいう「現像」にあたります。
シード
AIの乱数の出発点になる番号です。同じ番号・同じ設定なら同じ動画が出るので、新旧を公平に比べられます。

何と何を比べたか

動画をつくる設定はすべて同じにして、ComfyUIまわりだけを入れ替えました。

  • ComfyUI 0.35.0
  • VAE:従来の重み(FP16)
  • 高速化設定なし
  • ComfyUI 0.36.0
  • VAE:軽量化した重み(INT8)
  • 高速化設定 --fast fp16_accumulation

共通の条件

新旧で3つを同時に変えているので、縮んだ時間のすべてをVAEの効果とは言い切れません。VAEだけの差は下の「長い動画・高画質では」で別に測っています。

どこが速くなったか

3回のうち真ん中の値だった回(両方ともシード5214)の内訳です。考える工程(サンプリング)は36.3秒→33.2秒と少し、仕上げ(VAE)は16.6秒→6.0秒と大きく縮みました。

56.4秒
43.0秒
考える(サンプリング)仕上げ(VAE)保存(MP4)その他

3回とも同じ傾向

同じシードで新旧を1本ずつつくり、3組比べました。どの組でも10秒以上縮んでいます。

シード 5214−13.4秒
56.4秒
43.0秒
シード 5221−14.4秒
58.0秒
43.6秒
シード 5228−10.8秒
53.0秒
42.2秒

できあがった動画

同じシード5228でつくった新旧の動画です。

旧 · 生成にかかった時間 53.0秒
新 · 生成にかかった時間 42.2秒

長い動画・高画質では

約10秒の動画なら、仕上げ(VAE)だけで28.5秒→10.0秒。動画が長く、画質が高いほど、縮む秒数は大きくなります。

ここは生成全体ではなく、すでにできている動画をVAEにだけ通して測りました。各3回の真ん中の値です。旧と新のあいだに「新しいComfyUIで従来の重み」をはさむと、ComfyUIの更新と重みの軽量化が、それぞれどれだけ効いたかが分かれます。

約5.2秒 · 1152×640124フレーム
旧(0.35・従来の重み)
14.2秒
新(0.36・従来の重み)
8.5秒
新(0.36・軽い重み)
5.0秒

ComfyUIの更新で約1.7倍、軽い重みに替えてさらに約1.7倍。合わせて約2.8倍

約10.1秒 · 1152×640243フレーム
旧(0.35・従来の重み)
28.5秒
新(0.36・従来の重み)
17.0秒
新(0.36・軽い重み)
10.0秒

ComfyUIの更新で約1.7倍、軽い重みに替えてさらに約1.7倍。合わせて約2.9倍

約10.1秒 · 1408×800(高画質)243フレーム
旧(0.35・従来の重み)
44.2秒
新(0.36・従来の重み)
26.3秒
新(0.36・軽い重み)
15.5秒

ComfyUIの更新で約1.7倍、軽い重みに替えてさらに約1.7倍。合わせて約2.9倍

エンコード(映像をAI用に縮める工程)も含めた表
動画設定エンコードデコード(仕上げ)合計
約5.2秒 · 1152×640124フレーム旧(0.35・従来の重み)21.6秒14.2秒35.8秒
新(0.36・従来の重み)9.0秒8.5秒17.5秒
新(0.36・軽い重み)9.0秒5.0秒14.1秒
約10.1秒 · 1152×640243フレーム旧(0.35・従来の重み)40.3秒28.5秒68.7秒
新(0.36・従来の重み)16.6秒17.0秒33.6秒
新(0.36・軽い重み)16.7秒10.0秒26.7秒
約10.1秒 · 1408×800(高画質)243フレーム旧(0.35・従来の重み)62.7秒44.2秒106.9秒
新(0.36・従来の重み)25.9秒26.3秒52.2秒
新(0.36・軽い重み)25.9秒15.5秒41.4秒

ふつうの動画生成で使うのはデコードだけです。エンコードは、既存の動画を読み込んで加工するときに使います。

画質は変わったか

同じ動画を、従来の重みと軽い重みのVAEにそれぞれ通して比べました。左右を並べても、目で見て分かる差はほとんどありません。

従来の重み(FP16)
軽い重み(INT8)
動画平均のずれPSNRSSIM元の映像からのずれ
従来 / 軽い
約5.2秒 · 1152×6401.3 / 25542.7 dB0.98835.88 / 35.85 dB
約10.1秒 · 1152×6401.2 / 25543.0 dB0.98736.74 / 36.74 dB
約10.1秒 · 1408×800(高画質)1.3 / 25542.1 dB0.98335.40 / 35.39 dB
平均のずれ
明るさ0〜255の256段階で、1画素あたり平均何段階ずれたか。
PSNR
大きいほど近い。一般に40dBを超えると、並べても差が目立ちにくいとされます。
SSIM
形や模様の似かた。1で完全に同じ。
元の映像からのずれ
通す前の動画とのPSNR。従来も軽いも同じだけずれていて、軽い重みで余計に崩れてはいません。

数値は、保存した動画(WebM)どうしの比較です。保存時の圧縮による差も含みます。

いちばん差が出た1コマを原寸で

全フレームのうち、左右の差が最も大きかったコマを切り出しました。左が従来の重み、右が軽い重みです。

従来の重み(FP16) / 軽い重み(INT8)
約10.1秒 · 1152×640
従来の重み(FP16) / 軽い重み(INT8)
約10.1秒 · 1408×800(高画質)

参考:高速化をひとつも使わないと

以前の探索で、ターボLoRAもスパース化も使わない「素のMiniMax H3(20ステップ)」でもつくっていました。各1回だけの参考値です。このときのスパース化は検証用ノードで一律5%(Jevの配分は使っていません)。

動画素のH3(20ステップ)ターボLoRA+スパース化5%
約5.2秒 · 1152×6405分36秒95.9秒※最初の1本なので、モデルの読み込み時間を含みます
約10.1秒 · 1152×64016分22秒82.7秒
約10.1秒 · 1408×800(高画質)44分01秒2分12秒
素のH3 · 5分36秒
ターボLoRA+スパース化 · 95.9秒

約10秒の動画から、0・2・4・6・8・10秒の6コマ(ターボLoRA+スパース化)

約10.1秒 · 1152×640
約10.1秒 · 1408×800(高画質)

測り方

  1. 時間は、ComfyUIが処理を始めてからMP4の保存が終わるまで。順番待ちの時間は含みません。
  2. 新旧それぞれ、最初の1本はモデルの読み込みを含むので数えていません。そのあと同じシード3つ(5214・5221・5228)で1本ずつつくり、真ん中の値を使いました。
  3. 新旧のComfyUIは同時に動かさず、順番に使いました。
  4. 最初に測ったときは、旧版で558.6秒・245.3秒のような大きな遅れが出ました。原因は特定できていません。再起動して測り直した値を使い、最初の分も含めた全16回をデータに残しています。
  5. 前回のページの最速54.4秒は、スパース化5%・別の日の測定です。今回の最速42.2秒と条件が違うので、並べて比べてはいません。

AIエージェントに頼むときのプロンプト

このページの高速化を自分のPCで試したい方向けです。下の文章をそのまま、Claude Code や Codex などのAIエージェントに貼ってください。ComfyUIの入れ方を調べるところから、測り直して比べるところまで進めます。更新・ダウンロード・設定の変更は、実行前に確認を取るように書いてあります。

確かめたのはRTX 5080(16GB)だけです。ほかの環境で試した結果を教えてもらえると参考になります。

高性能なパソコンがない方へ

GPUを時間単位で借りられるクラウドサービス(いわゆるレンタルGPU)で、ComfyUIを動かす方法もあります。私はまだ試していませんが、ハイスペックなパソコンをお持ちでない方は、選択肢のひとつとして検討してみてもいいかもしれません。

ComfyUI で MiniMax H3 の動画生成を速くしてください。
やることは3つです。どれも ComfyUI 公式の機能と公式配布のモデルで、カスタムノードは要りません。

  1. ComfyUI を 0.36.0 以上に更新する
  2. 動画VAEを軽量版(INT8)に差し替える
  3. 起動オプションに --fast fp16_accumulation を足す

速くなるのは主に、生成の最後に映像へ戻す「仕上げ(動画VAEのデコード)」です。
参考までに、RTX 5080 / 1152×640 / 約5秒(124フレーム)/ ターボLoRA 4ステップ / スパース化10% の環境で、
1本 56.4秒 → 43.0秒(同じシード3本の中央値)、仕上げだけなら 16.6秒 → 6.0秒 でした。
GPU・解像度・尺で結果は変わります。この数字を目標値にせず、必ずこのPCで測り直してください。

公式の解説: https://blog.comfy.org/p/making-the-minimax-h3-video-vae-2x

## 進め方の約束

- 各段階の「確認」を通ってから次へ進んでください。確認できないまま先へ進まないこと。
- ComfyUI の更新、ファイルのダウンロード(約2.8GB)、起動設定の変更は、実行前に内容を私に見せて了承を取ってください。
- 分からないことを推測で埋めないでください。環境が想定と違ったら、止まって私に聞いてください。

## 0. いまの状態を記録する(何も変えない)

次を調べて、表にして見せてください。あとで元に戻すときに使います。

- ComfyUI の入れ方:ポータブル版 / Stability Matrix / ComfyUI Desktop / git clone のどれか
- ComfyUI のバージョン(起動ログの「ComfyUI version:」)と、git なら今のコミット
- GPU の種類と VRAM、PyTorch のバージョン(起動ログの「pytorch version:」)
- いまの起動オプション(どのファイル・どの画面で指定しているか)
- 使っている MiniMax H3 のワークフローで、動画VAEに何を読み込んでいるか
  (VAELoader が2つある。動画用 minimax_h3_video_vae_*.safetensors と、音声用 minimax_h3_audio_vae_*。触るのは動画用だけ)
- 入っているカスタムノードの一覧

★ GPU が NVIDIA か AMD でなければ、4 の --fast fp16_accumulation は効きません。その場合は 2 と 3 だけ行ってください。

## 1. 更新前の速さを測る(基準)

いつものワークフローのまま、次の手順で測ってください。

- 1本目はモデルの読み込みが入るので捨てる
- そのあとシードを変えて3本つくる(同じシードだと ComfyUI のキャッシュが効いて一瞬で終わり、測定にならない)
- 各本の時間はログの「Prompt executed in ○○ seconds」を使う
- 3本の真ん中の値(中央値)を記録する
- 測っている間は、動画編集ソフトやゲームなど GPU を使うアプリを閉じておく
- 比較のたびにモデルを解放しない(20GB 超のモデルの読み直しが計測に混ざる)

使った解像度・フレーム数・ステップ数・シードも一緒に記録してください。2〜4 のあとで同じ条件で測り直します。

## 2. ComfyUI を 0.36.0 以上に更新する

入れ方に合った正規の方法で更新してください(ポータブル版なら update フォルダの更新スクリプト、
Stability Matrix ならアプリの更新ボタン、Desktop ならアプリの更新、git なら pull)。
更新後、ComfyUI の requirements.txt に書かれたパッケージを入れ直してください。
0.36.0 では comfy-kitchen というパッケージが新しく必要になります。

確認(起動ログ):
- 「ComfyUI version: 0.36.0」以上になっている
- 「comfy-kitchen version:」の行が出ている
- 「Found comfy_kitchen backend cuda: {'available': True ...」になっている(NVIDIA の場合)
- カスタムノードの読み込みエラー(IMPORT FAILED)が、更新前より増えていない

増えていたら、どのノードかを報告して止まってください。

## 3. 軽量版の動画VAEを入れて差し替える

ダウンロード元(Comfy-Org 公式):
https://huggingface.co/Comfy-Org/MiniMax-H3/blob/main/vae/minimax_h3_video_vae_int8_convrot.safetensors

- ダウンロード前に、上のページで表示されているファイルサイズ(約2.8GB)と SHA256 を控える
- ダウンロード後に SHA256 を計算して、ページの値と一致することを確かめる
- ComfyUI の models/vae フォルダ(別の場所にモデルを置いている場合はそちら)に置く
- ワークフローの**動画用** VAELoader だけを minimax_h3_video_vae_int8_convrot.safetensors に切り替える
  (音声用 VAELoader は変えない。拡散モデル本体の INT8 とは別物なので、UNETLoader も変えない)
- 元の minimax_h3_video_vae_fp16.safetensors は消さずに残す(戻すときに使う)

## 4. 起動オプションに --fast fp16_accumulation を足す

いまの起動オプションを消さずに、末尾へ --fast fp16_accumulation を追加してください。
(ポータブル版なら run_nvidia_gpu.bat、Stability Matrix ならパッケージの起動オプション設定など。場所は 0 で調べたところ)

確認(起動ログ):
- 「Enabled fp16 accumulation.」の行が出ている

出ていなければ効いていません。GPU が NVIDIA / AMD か、PyTorch が古すぎないかを確認して報告してください。

## 5. 同じ条件で測り直して比べる

1 とまったく同じ手順・同じ解像度・同じフレーム数・同じシードで3本つくり、中央値を比べてください。
結果は次の形で見せてください。

    更新前の中央値 ○○秒 → 更新後の中央値 ○○秒(○○秒短縮)
    3本それぞれの秒数

速くなっていなければ、失敗と決めつけず次を確認してください。
- 空きメモリ(RAM)が少なくないか。少ないとモデルの読み書きで時間が暴れる。使っていないアプリを閉じて測り直す
- 1本目を捨てたか、シードを変えたか
- 4 の「Enabled fp16 accumulation.」が出ているか

## 6. 画質を確かめる

更新前と更新後で、同じシードの動画を1組、左右に並べて見られるようにしてください。
並べて見て、顔・髪・細い線・動きに崩れがないかを私が確認します。
(設定が変わると、同じシードでも細部はわずかに変わります。崩れているかどうかを見てください)

## 7. 戻し方

問題があったら、次の順で戻せるようにしておいてください。
- 動画用 VAELoader を minimax_h3_video_vae_fp16.safetensors に戻す
- 起動オプションから --fast fp16_accumulation を消す
- それでも駄目なら、0 で記録したバージョン(コミット)に ComfyUI を戻す

最後に、変更したファイルと設定の場所を全部フルパスで一覧にしてください。

元データ

関連ページ