「AIに計算の削り方を判断させると速くなる」という投稿を見かけて試したら、判断役は要らず、一律に95%削るだけで約2倍速くなりました。絵は荒れません。同じ指示で速い版と遅い版を並べてあるので、見比べてください。
同じ指示文、同じ乱数、同じ解像度。違うのは計算を削ったかどうかだけです。表示している秒数はこの2本を作ったときの実測です。
動画生成は、同じ指示文・同じ乱数でも計算の道筋が変われば違う絵が出ます。計算を削るというのはまさに道筋を変えることなので、上の2本も構図が違います。
見ていただきたいのは「同じ絵かどうか」ではなく、絵の質が落ちていないかどうかです。濡れた路面の反射、傘の重なり、ネオンのにじみ、人の歩き方。削った側が劣っているようには見えないはずです。
| 条件 | 本数 | 1本あたり(中央値) | 倍率 |
|---|---|---|---|
| 8.0秒 / 削らない | 4本 | 173秒 | — |
| 8.0秒 / 95%削る | 150本 | 78.6秒 | 2.2倍 |
削った側の150本は、ほとんどばらつきません。下から10%目が78.0秒、上から10%目が79.8秒。140秒を超えたのは150本中1本だけでした。
削る割合を10%から5%へ下げても、ほとんど変わりませんでした。この辺りで頭打ちで、残りの時間は計算の別の場所が使っています。
当初の見込みは一晩80本でしたが、255本作れました。
この2.2倍は、他のアプリを閉じた状態で出た数字です。ブラウザやチャットアプリを開いたまま同じ設定で測り直したところ、同じ1本が80秒になったり215秒になったりと暴れました。
動画生成は20GB超のモデルをメモリに置いて動きます。空きメモリが足りないと、計算を削っても意味がなくなります(そこが遅さの原因ではなくなるため)。回す前に、使っていないアプリを閉じてください。
今回の検証は、Xで見かけたある手法を試すところから始まりました。
動画生成の計算は、層(レイヤー)が何十枚も積み重なった構造をしています。その一枚一枚について「ここは手を抜いていい」「ここは丁寧に計算したい」をAIに判断させるという手法が紹介されていました。判断役に使われていたのが Jev という、文章を書かずに「選択肢とその確率だけ」を返す判断専用のAIです。
紹介されていた数字は 6分07秒 → 3分34秒、41.7%短縮。これを自分の環境で確かめました。
| 条件 | 残した計算(平均) | 1本あたり | 削らない版との比 |
|---|---|---|---|
| 計算を削らない | 100% | 339.0秒 | — |
| 一律10%だけ残す | 10% | 120.7秒 | 2.81倍 |
| 一律7.93%だけ残す | 7.93% | 133.8秒 | 2.53倍 |
| AIに層ごとに決めさせる | 6.64% | 123.9秒 | 2.74倍 |
1024×1792 / 5.2秒 / 同じ指示文・同じ乱数。この4条件は各1本ずつの計測なので、上の150本の数字ほど当てにはできません。解像度も上の比較表(1152×640)と違うので、倍率をそのまま持ち込まないでください。
AIを使わず全部の層を一律10%にしただけで2.81倍になりました。紹介されていた41.7%短縮を、判断役なしで上回っています。
ただし数字をそのまま比べてはいけません。紹介されていた環境とはグラフィックボードも解像度も違います。言えるのは「この環境では、AIの判断なしでも同じくらい速くなった」までです。投稿者自身も「一律に削るだけでも結構速くなるので、AIのおかげで速いとは言い切れない」と但し書きを添えていました。
10%(120.7秒)→ 7.93%(133.8秒)→ 6.64%(123.9秒)。削る割合を下げても時間が縮みません。この辺りで頭打ちで、残りの時間は計算の別の場所が使っています。
AIの仕事は「1%・3%・5%・10%のどれを各層に割り当てるか」です。その範囲でどう配り直しても、もう削る余地が残っていません。
AIが返した配分には、きれいな傾向が出ていました。入口に近い層は3.3%、出口に近い層は10%——「浅い層は大まかでよく、深い層は丁寧に」という、いかにも意味のありそうな配り方です。
そこで質問文の中の「浅い/深い」の説明だけを入れ替えて、選択肢も指示文も一字も変えずに聞き直しました。結果、配分も完全に逆さになりました(入口9.8% / 出口5.5%)。
AIはモデルの中身を知りません。答えを決めていたのは、質問文を書いた人間のほうでした。「AIが賢く配分した」ように見えていたのは、こちらの思い込みが返ってきていただけです。
AIへの問い合わせは4回で2.2秒、費用は0.03円ほど。速度の足を引っ張ってはいません。効かなかったのは、削る余地がもう無かったからです。
そしてこの追試の途中で「一律に削るだけで2倍以上になる」と分かったことが、このページの上半分につながっています。AIに決めさせる話は空振りでしたが、確かめたから本命が見つかりました。
銘柄を日本語で指定すると、ラベルにその文字が刷られます。書かないと、それらしい偽物の文字で埋められます。
映像と音は同時に出ています。後から足したものは一つもありません。再生して音を確かめてください。
冒頭に「これは映画の予告編である」と一行足すと、画が暗く濃くなります。「テレビCMである」と書くと明るく淡くなります。
別々に作った4本が、繋ぐと一つの話になります。
新しいモデルのダウンロードも、追加のノードも要りません。ComfyUI に最初から入っている機能です。下の文章をそのままAIエージェント(Claude Code など)に貼ってください。
BlockSparseAttention を LoRA の後ろに挿し、BasicGuider と BasicScheduler の両方をその出力につなぎ替えます。設定は method: sla / keep_percent: 5。
片方だけつなぎ替えてもエラーは出ません。ただ速くならないだけです。ここで半日を無駄にしました。
ComfyUI のログに sparse producer path という行が出ていれば効いています。出ていなければ、設定は入っているのに密のまま回っています。
アプリを閉じた状態では150本が78〜80秒に収まりましたが、ブラウザやチャットアプリを開いたままだと同じ1本が80秒〜215秒に暴れました。空きメモリが足りないと、計算を削っても速くなりません。
このページに並べた動画から言えることだけを書いています。
缶の「朝香」、一升瓶の「雪解」、ボトルの「深緑」、題字の「残響」「花霞」「遠雷」。これらは全部、画面の主役になる大きさの文字です。書けば刷られます。
一方で内容量や説明文のような小さい文字は崩れます。同じ缶に4行の表記を入れて3本作ったところ、読めたのは1本だけで、残りは文字が二重になったり同じ行が繰り返されたりしました。このページに並べたのは、すべて大きい文字だけです。
「まず◯◯。次に◯◯。それが終わった瞬間に◯◯」という書き方をすると、1本の中で画が切り替わります。商品CMの3本立て、予告編の「廊下 → 扉 → 靴」、時代劇の「立ち姿 → 目 → 抜刀」はすべてこの形です。
秒数は指定できません。どこで切れるかはモデル任せになります。
物語の4本(起・承・転・結)は、参照画像を使わず人物の説明文を一字一句同じにして作りました。髪型・無精ひげ・グレーのパーカー・顔立ちは4本とも通っています。
ただし完全ではありません。目印として入れた「左目の下のほくろ」は、1本目だけ右目の下に出ています。細部は揺れる前提で使ってください。
雨音、抜刀の音、蝉、鉋、競りの鐘、ピアノや弦楽。すべて映像と一緒に生成されたもので、後から重ねたものは一つもありません。
ただし音楽・セリフ・効果音を1本に詰め込むと、どれも痩せます。欲張らず、必要なものを選んでください。