2026-09-21 / MiniMax H3 / text to video

倍速で回した一晩

「AIに計算の削り方を判断させると速くなる」という投稿を見かけて試したら、判断役は要らず、一律に95%削るだけで約2倍速くなりました。絵は荒れません。同じ指示で速い版と遅い版を並べてあるので、見比べてください。

8秒の1本
173 → 78.6 秒
2.2倍。150本の中央値
残した計算
5 %
アテンションの95%を捨てた
一晩の本数
255 本
失敗ゼロ / 6.6時間
参照画像
0 枚
すべて文章だけから
Comparison

速い版と遅い版を見比べる

同じ指示文、同じ乱数、同じ解像度。違うのは計算を削ったかどうかだけです。表示している秒数はこの2本を作ったときの実測です。

8.0秒 — 雨の交差点
削らない158.7秒
95%削る81.0秒
5.2秒 — 同じ指示で尺だけ短く
削らない103.8秒
95%削る56.3秒
同じ指示でも、同じ絵にはなりません

動画生成は、同じ指示文・同じ乱数でも計算の道筋が変われば違う絵が出ます。計算を削るというのはまさに道筋を変えることなので、上の2本も構図が違います。

見ていただきたいのは「同じ絵かどうか」ではなく、絵の質が落ちていないかどうかです。濡れた路面の反射、傘の重なり、ネオンのにじみ、人の歩き方。削った側が劣っているようには見えないはずです。

Speed

どれだけ速くなったか

条件本数1本あたり(中央値)倍率
8.0秒 / 削らない4本173秒—
8.0秒 / 95%削る150本78.6秒2.2倍

削った側の150本は、ほとんどばらつきません。下から10%目が78.0秒、上から10%目が79.8秒。140秒を超えたのは150本中1本だけでした。

削る割合を10%から5%へ下げても、ほとんど変わりませんでした。この辺りで頭打ちで、残りの時間は計算の別の場所が使っています。

当初の見込みは一晩80本でしたが、255本作れました。

再現するには、パソコンのメモリに余裕が要ります

この2.2倍は、他のアプリを閉じた状態で出た数字です。ブラウザやチャットアプリを開いたまま同じ設定で測り直したところ、同じ1本が80秒になったり215秒になったりと暴れました。

動画生成は20GB超のモデルをメモリに置いて動きます。空きメモリが足りないと、計算を削っても意味がなくなります(そこが遅さの原因ではなくなるため)。回す前に、使っていないアプリを閉じてください。

Origin

そもそもの発端 — AIに「どこを削るか」を決めさせる

今回の検証は、Xで見かけたある手法を試すところから始まりました。

動画生成の計算は、層(レイヤー)が何十枚も積み重なった構造をしています。その一枚一枚について「ここは手を抜いていい」「ここは丁寧に計算したい」をAIに判断させるという手法が紹介されていました。判断役に使われていたのが Jev という、文章を書かずに「選択肢とその確率だけ」を返す判断専用のAIです。

紹介されていた数字は 6分07秒 → 3分34秒、41.7%短縮。これを自分の環境で確かめました。

条件残した計算(平均)1本あたり削らない版との比
計算を削らない100%339.0秒—
一律10%だけ残す10%120.7秒2.81倍
一律7.93%だけ残す7.93%133.8秒2.53倍
AIに層ごとに決めさせる6.64%123.9秒2.74倍

1024×1792 / 5.2秒 / 同じ指示文・同じ乱数。この4条件は各1本ずつの計測なので、上の150本の数字ほど当てにはできません。解像度も上の比較表(1152×640)と違うので、倍率をそのまま持ち込まないでください。

AIに決めさせなくても、一律で削れば速くなった

AIを使わず全部の層を一律10%にしただけで2.81倍になりました。紹介されていた41.7%短縮を、判断役なしで上回っています。

ただし数字をそのまま比べてはいけません。紹介されていた環境とはグラフィックボードも解像度も違います。言えるのは「この環境では、AIの判断なしでも同じくらい速くなった」までです。投稿者自身も「一律に削るだけでも結構速くなるので、AIのおかげで速いとは言い切れない」と但し書きを添えていました。

10%より下げても、もう速くならない

10%(120.7秒)→ 7.93%(133.8秒)→ 6.64%(123.9秒)。削る割合を下げても時間が縮みません。この辺りで頭打ちで、残りの時間は計算の別の場所が使っています。

AIの仕事は「1%・3%・5%・10%のどれを各層に割り当てるか」です。その範囲でどう配り直しても、もう削る余地が残っていません。

AIは判断していませんでした

AIが返した配分には、きれいな傾向が出ていました。入口に近い層は3.3%、出口に近い層は10%——「浅い層は大まかでよく、深い層は丁寧に」という、いかにも意味のありそうな配り方です。

そこで質問文の中の「浅い/深い」の説明だけを入れ替えて、選択肢も指示文も一字も変えずに聞き直しました。結果、配分も完全に逆さになりました(入口9.8% / 出口5.5%)。

AIはモデルの中身を知りません。答えを決めていたのは、質問文を書いた人間のほうでした。「AIが賢く配分した」ように見えていたのは、こちらの思い込みが返ってきていただけです。

それでも、無駄ではありませんでした

AIへの問い合わせは4回で2.2秒、費用は0.03円ほど。速度の足を引っ張ってはいません。効かなかったのは、削る余地がもう無かったからです。

そしてこの追試の途中で「一律に削るだけで2倍以上になる」と分かったことが、このページの上半分につながっています。AIに決めさせる話は空振りでしたが、確かめたから本命が見つかりました。

Reel 01

商品CM

銘柄を日本語で指定すると、ラベルにその文字が刷られます。書かないと、それらしい偽物の文字で埋められます。

♪ 音が出ます

映像と音は同時に出ています。後から足したものは一つもありません。再生して音を確かめてください。

Reel 02

映画予告編

冒頭に「これは映画の予告編である」と一行足すと、画が暗く濃くなります。「テレビCMである」と書くと明るく淡くなります。

Reel 03

物語 — 4本で1本

別々に作った4本が、繋ぐと一つの話になります。

Reel 04

アニメ・記録・抽象

How to

同じことを自分でやるには

新しいモデルのダウンロードも、追加のノードも要りません。ComfyUI に最初から入っている機能です。下の文章をそのままAIエージェント(Claude Code など)に貼ってください。

やることは、ノードを1つ挿して配線を2本つなぎ替えるだけ

BlockSparseAttention を LoRA の後ろに挿し、BasicGuider と BasicScheduler の両方をその出力につなぎ替えます。設定は method: sla / keep_percent: 5。

片方だけつなぎ替えてもエラーは出ません。ただ速くならないだけです。ここで半日を無駄にしました。

効いたかは、必ずログで確かめる

ComfyUI のログに sparse producer path という行が出ていれば効いています。出ていなければ、設定は入っているのに密のまま回っています。

再現しないときは、まずメモリを疑う

アプリを閉じた状態では150本が78〜80秒に収まりましたが、ブラウザやチャットアプリを開いたままだと同じ1本が80秒〜215秒に暴れました。空きメモリが足りないと、計算を削っても速くなりません。

本文を見る
Findings

作ってみて分かったこと

このページに並べた動画から言えることだけを書いています。

大きい文字は出る。小さい文字は崩れる

缶の「朝香」、一升瓶の「雪解」、ボトルの「深緑」、題字の「残響」「花霞」「遠雷」。これらは全部、画面の主役になる大きさの文字です。書けば刷られます。

一方で内容量や説明文のような小さい文字は崩れます。同じ缶に4行の表記を入れて3本作ったところ、読めたのは1本だけで、残りは文字が二重になったり同じ行が繰り返されたりしました。このページに並べたのは、すべて大きい文字だけです。

1本の中でカットが割れる

「まず◯◯。次に◯◯。それが終わった瞬間に◯◯」という書き方をすると、1本の中で画が切り替わります。商品CMの3本立て、予告編の「廊下 → 扉 → 靴」、時代劇の「立ち姿 → 目 → 抜刀」はすべてこの形です。

秒数は指定できません。どこで切れるかはモデル任せになります。

同じ人物は、ある程度なら通せる

物語の4本(起・承・転・結)は、参照画像を使わず人物の説明文を一字一句同じにして作りました。髪型・無精ひげ・グレーのパーカー・顔立ちは4本とも通っています。

ただし完全ではありません。目印として入れた「左目の下のほくろ」は、1本目だけ右目の下に出ています。細部は揺れる前提で使ってください。

音は映像と同時に出る

雨音、抜刀の音、蝉、鉋、競りの鐘、ピアノや弦楽。すべて映像と一緒に生成されたもので、後から重ねたものは一つもありません。

ただし音楽・セリフ・効果音を1本に詰め込むと、どれも痩せます。欲張らず、必要なものを選んでください。