検証レポート · 2026-09-24 · RTX 5080
約5秒の動画を1本つくる時間が、56.4秒から43.0秒になりました。縮んだのは主に、AIが作った映像データを実際の映像に戻す「仕上げ」の工程です。画質は数値の上でほぼ変わっていません。
動画をつくる設定はすべて同じにして、ComfyUIまわりだけを入れ替えました。
--fast fp16_accumulation新旧で3つを同時に変えているので、縮んだ時間のすべてをVAEの効果とは言い切れません。VAEだけの差は下の「長い動画・高画質では」で別に測っています。
3回のうち真ん中の値だった回(両方ともシード5214)の内訳です。考える工程(サンプリング)は36.3秒→33.2秒と少し、仕上げ(VAE)は16.6秒→6.0秒と大きく縮みました。
同じシードで新旧を1本ずつつくり、3組比べました。どの組でも10秒以上縮んでいます。
同じシード5228でつくった新旧の動画です。
約10秒の動画なら、仕上げ(VAE)だけで28.5秒→10.0秒。動画が長く、画質が高いほど、縮む秒数は大きくなります。
ここは生成全体ではなく、すでにできている動画をVAEにだけ通して測りました。各3回の真ん中の値です。旧と新のあいだに「新しいComfyUIで従来の重み」をはさむと、ComfyUIの更新と重みの軽量化が、それぞれどれだけ効いたかが分かれます。
ComfyUIの更新で約1.7倍、軽い重みに替えてさらに約1.7倍。合わせて約2.8倍。
ComfyUIの更新で約1.7倍、軽い重みに替えてさらに約1.7倍。合わせて約2.9倍。
ComfyUIの更新で約1.7倍、軽い重みに替えてさらに約1.7倍。合わせて約2.9倍。
| 動画 | 設定 | エンコード | デコード(仕上げ) | 合計 |
|---|---|---|---|---|
| 約5.2秒 · 1152×640124フレーム | 旧(0.35・従来の重み) | 21.6秒 | 14.2秒 | 35.8秒 |
| 新(0.36・従来の重み) | 9.0秒 | 8.5秒 | 17.5秒 | |
| 新(0.36・軽い重み) | 9.0秒 | 5.0秒 | 14.1秒 | |
| 約10.1秒 · 1152×640243フレーム | 旧(0.35・従来の重み) | 40.3秒 | 28.5秒 | 68.7秒 |
| 新(0.36・従来の重み) | 16.6秒 | 17.0秒 | 33.6秒 | |
| 新(0.36・軽い重み) | 16.7秒 | 10.0秒 | 26.7秒 | |
| 約10.1秒 · 1408×800(高画質)243フレーム | 旧(0.35・従来の重み) | 62.7秒 | 44.2秒 | 106.9秒 |
| 新(0.36・従来の重み) | 25.9秒 | 26.3秒 | 52.2秒 | |
| 新(0.36・軽い重み) | 25.9秒 | 15.5秒 | 41.4秒 |
ふつうの動画生成で使うのはデコードだけです。エンコードは、既存の動画を読み込んで加工するときに使います。
同じ動画を、従来の重みと軽い重みのVAEにそれぞれ通して比べました。左右を並べても、目で見て分かる差はほとんどありません。
| 動画 | 平均のずれ | PSNR | SSIM | 元の映像からのずれ 従来 / 軽い |
|---|---|---|---|---|
| 約5.2秒 · 1152×640 | 1.3 / 255 | 42.7 dB | 0.988 | 35.88 / 35.85 dB |
| 約10.1秒 · 1152×640 | 1.2 / 255 | 43.0 dB | 0.987 | 36.74 / 36.74 dB |
| 約10.1秒 · 1408×800(高画質) | 1.3 / 255 | 42.1 dB | 0.983 | 35.40 / 35.39 dB |
数値は、保存した動画(WebM)どうしの比較です。保存時の圧縮による差も含みます。
全フレームのうち、左右の差が最も大きかったコマを切り出しました。左が従来の重み、右が軽い重みです。


以前の探索で、ターボLoRAもスパース化も使わない「素のMiniMax H3(20ステップ)」でもつくっていました。各1回だけの参考値です。このときのスパース化は検証用ノードで一律5%(Jevの配分は使っていません)。
| 動画 | 素のH3(20ステップ) | ターボLoRA+スパース化5% |
|---|---|---|
| 約5.2秒 · 1152×640 | 5分36秒 | 95.9秒※最初の1本なので、モデルの読み込み時間を含みます |
| 約10.1秒 · 1152×640 | 16分22秒 | 82.7秒 |
| 約10.1秒 · 1408×800(高画質) | 44分01秒 | 2分12秒 |


このページの高速化を自分のPCで試したい方向けです。下の文章をそのまま、Claude Code や Codex などのAIエージェントに貼ってください。ComfyUIの入れ方を調べるところから、測り直して比べるところまで進めます。更新・ダウンロード・設定の変更は、実行前に確認を取るように書いてあります。
確かめたのはRTX 5080(16GB)だけです。ほかの環境で試した結果を教えてもらえると参考になります。
GPUを時間単位で借りられるクラウドサービス(いわゆるレンタルGPU)で、ComfyUIを動かす方法もあります。私はまだ試していませんが、ハイスペックなパソコンをお持ちでない方は、選択肢のひとつとして検討してみてもいいかもしれません。
ComfyUI で MiniMax H3 の動画生成を速くしてください。
やることは3つです。どれも ComfyUI 公式の機能と公式配布のモデルで、カスタムノードは要りません。
1. ComfyUI を 0.36.0 以上に更新する
2. 動画VAEを軽量版(INT8)に差し替える
3. 起動オプションに --fast fp16_accumulation を足す
速くなるのは主に、生成の最後に映像へ戻す「仕上げ(動画VAEのデコード)」です。
参考までに、RTX 5080 / 1152×640 / 約5秒(124フレーム)/ ターボLoRA 4ステップ / スパース化10% の環境で、
1本 56.4秒 → 43.0秒(同じシード3本の中央値)、仕上げだけなら 16.6秒 → 6.0秒 でした。
GPU・解像度・尺で結果は変わります。この数字を目標値にせず、必ずこのPCで測り直してください。
公式の解説: https://blog.comfy.org/p/making-the-minimax-h3-video-vae-2x
## 進め方の約束
- 各段階の「確認」を通ってから次へ進んでください。確認できないまま先へ進まないこと。
- ComfyUI の更新、ファイルのダウンロード(約2.8GB)、起動設定の変更は、実行前に内容を私に見せて了承を取ってください。
- 分からないことを推測で埋めないでください。環境が想定と違ったら、止まって私に聞いてください。
## 0. いまの状態を記録する(何も変えない)
次を調べて、表にして見せてください。あとで元に戻すときに使います。
- ComfyUI の入れ方:ポータブル版 / Stability Matrix / ComfyUI Desktop / git clone のどれか
- ComfyUI のバージョン(起動ログの「ComfyUI version:」)と、git なら今のコミット
- GPU の種類と VRAM、PyTorch のバージョン(起動ログの「pytorch version:」)
- いまの起動オプション(どのファイル・どの画面で指定しているか)
- 使っている MiniMax H3 のワークフローで、動画VAEに何を読み込んでいるか
(VAELoader が2つある。動画用 minimax_h3_video_vae_*.safetensors と、音声用 minimax_h3_audio_vae_*。触るのは動画用だけ)
- 入っているカスタムノードの一覧
★ GPU が NVIDIA か AMD でなければ、4 の --fast fp16_accumulation は効きません。その場合は 2 と 3 だけ行ってください。
## 1. 更新前の速さを測る(基準)
いつものワークフローのまま、次の手順で測ってください。
- 1本目はモデルの読み込みが入るので捨てる
- そのあとシードを変えて3本つくる(同じシードだと ComfyUI のキャッシュが効いて一瞬で終わり、測定にならない)
- 各本の時間はログの「Prompt executed in ○○ seconds」を使う
- 3本の真ん中の値(中央値)を記録する
- 測っている間は、動画編集ソフトやゲームなど GPU を使うアプリを閉じておく
- 比較のたびにモデルを解放しない(20GB 超のモデルの読み直しが計測に混ざる)
使った解像度・フレーム数・ステップ数・シードも一緒に記録してください。2〜4 のあとで同じ条件で測り直します。
## 2. ComfyUI を 0.36.0 以上に更新する
入れ方に合った正規の方法で更新してください(ポータブル版なら update フォルダの更新スクリプト、
Stability Matrix ならアプリの更新ボタン、Desktop ならアプリの更新、git なら pull)。
更新後、ComfyUI の requirements.txt に書かれたパッケージを入れ直してください。
0.36.0 では comfy-kitchen というパッケージが新しく必要になります。
確認(起動ログ):
- 「ComfyUI version: 0.36.0」以上になっている
- 「comfy-kitchen version:」の行が出ている
- 「Found comfy_kitchen backend cuda: {'available': True ...」になっている(NVIDIA の場合)
- カスタムノードの読み込みエラー(IMPORT FAILED)が、更新前より増えていない
増えていたら、どのノードかを報告して止まってください。
## 3. 軽量版の動画VAEを入れて差し替える
ダウンロード元(Comfy-Org 公式):
https://huggingface.co/Comfy-Org/MiniMax-H3/blob/main/vae/minimax_h3_video_vae_int8_convrot.safetensors
- ダウンロード前に、上のページで表示されているファイルサイズ(約2.8GB)と SHA256 を控える
- ダウンロード後に SHA256 を計算して、ページの値と一致することを確かめる
- ComfyUI の models/vae フォルダ(別の場所にモデルを置いている場合はそちら)に置く
- ワークフローの**動画用** VAELoader だけを minimax_h3_video_vae_int8_convrot.safetensors に切り替える
(音声用 VAELoader は変えない。拡散モデル本体の INT8 とは別物なので、UNETLoader も変えない)
- 元の minimax_h3_video_vae_fp16.safetensors は消さずに残す(戻すときに使う)
## 4. 起動オプションに --fast fp16_accumulation を足す
いまの起動オプションを消さずに、末尾へ --fast fp16_accumulation を追加してください。
(ポータブル版なら run_nvidia_gpu.bat、Stability Matrix ならパッケージの起動オプション設定など。場所は 0 で調べたところ)
確認(起動ログ):
- 「Enabled fp16 accumulation.」の行が出ている
出ていなければ効いていません。GPU が NVIDIA / AMD か、PyTorch が古すぎないかを確認して報告してください。
## 5. 同じ条件で測り直して比べる
1 とまったく同じ手順・同じ解像度・同じフレーム数・同じシードで3本つくり、中央値を比べてください。
結果は次の形で見せてください。
更新前の中央値 ○○秒 → 更新後の中央値 ○○秒(○○秒短縮)
3本それぞれの秒数
速くなっていなければ、失敗と決めつけず次を確認してください。
- 空きメモリ(RAM)が少なくないか。少ないとモデルの読み書きで時間が暴れる。使っていないアプリを閉じて測り直す
- 1本目を捨てたか、シードを変えたか
- 4 の「Enabled fp16 accumulation.」が出ているか
## 6. 画質を確かめる
更新前と更新後で、同じシードの動画を1組、左右に並べて見られるようにしてください。
並べて見て、顔・髪・細い線・動きに崩れがないかを私が確認します。
(設定が変わると、同じシードでも細部はわずかに変わります。崩れているかどうかを見てください)
## 7. 戻し方
問題があったら、次の順で戻せるようにしておいてください。
- 動画用 VAELoader を minimax_h3_video_vae_fp16.safetensors に戻す
- 起動オプションから --fast fp16_accumulation を消す
- それでも駄目なら、0 で記録したバージョン(コミット)に ComfyUI を戻す
最後に、変更したファイルと設定の場所を全部フルパスで一覧にしてください。