生成AIカタログ。いま何があるのか、ひと目で。文章・画像・動画・音声・音楽の5分野について、どこが作っているのか、何が得意なのか、今どれが新しいのかが分かります。
Catalog of Generative AI

生成AIカタログ

いま話題になっている生成AIを、作っている会社ごとにまとめました。文章・画像・動画・音声・音楽の5つの分野を扱っています。それぞれ「どこが作っているのか」「何が得意なのか」「今はどれが新しいのか」が分かるようにしています。

更新 2026-09-24 収録 5分野 / 33サービス
はじめての方へ 2分ほどで読めます
名前がたくさん出てきますので、混乱しないための読み方を先にご案内します。

ニュースを見ていると、いろんな名前が次々に出てきますよね。全部を覚えようとすると、それだけで疲れてしまいます (;´∀`) 最初から全部を分かろうとしなくて大丈夫です。まずは、ここだけ押さえておくと読みやすくなる、というところをお伝えします。

1 / 会社の名前と、AIの名前は別のものです

名前が入り混じって見えるのは、会社の名前・サービスの名前・モデルの名前という3つが、それぞれ別にあるからです。

たとえば「Anthropic という会社が、Claude というサービスを出していて、その中に Opus 5 というモデルがある」という関係になっています。会社が「メーカー」、サービスが「車種」、モデルが「グレード」だと思っていただくと、近いかもしれません。

このページでは会社ごとに1枚のカードにまとめています。ふだんは名前と短い説明だけが見えていて、「ひらく」を押すと、中のモデル一覧が出てきます。気になったところだけ開いてみてください。

2 / どの会社にも「松竹梅」があります

どの会社も、賢いけれど高いものから、そこそこだけど速くて安いものまでを揃えています。このページでは 最上位 中位 軽量 と表示して、上にあるものほど高性能になるよう並べています。

ふだんお使いになるぶんには、中位で足りることが多いようです。最上位は、難しい調べものや、複雑なプログラムを任せるときのものだと思っていただければ大丈夫です。お値段も数倍から十数倍しますので、いきなり最上位を選ばなくても問題ありません。

3 / 日付を見ると、新しいかどうかが分かります

この分野は、数ヶ月で世代が変わります。モデルの名前の横に日付を入れていますので、それが最近のものか、一世代前のものかを見分けていただけます。

半年以上前の型番になると、すでに提供が終わっていることもあります。ネットで調べものをされたときに古い情報に当たることも多いので、日付は気にしていただくといいかもしれません。

4 / よく出てくる言葉

分からない言葉が出てきても、そのつどここに戻ってきていただければ大丈夫です。

  • 用語
    モデル
    AIの本体そのものです。同じサービスでも、中身のモデルを入れ替えると、賢さや料金が変わります。車でいうとエンジンにあたる部分です。
  • 用語
    トークン
    AIが文章の量を数えるときの単位です。日本語ですと、だいたい1文字が1トークン前後になります。料金はこの量で決まりますので、長い文章を読ませたり書かせたりするほど、お金がかかる仕組みです。
  • 用語
    コンテキスト(文脈)
    AIが一度に読み込める量のことです。「100万トークン」とあれば、本を数冊まとめて渡せるくらいの容量になります。長い資料を扱いたい場合は、ここが大きいものを選んでいただくといいと思います。
  • 用語
    API
    チャット画面からではなく、プログラムから直接AIを呼び出す仕組みのことです。自動化したり、大量に処理したりするときに使います。使った分だけお支払いする形になります。
  • 用語
    重み公開(オープンウェイト)
    AIの中身が配布されていて、ご自分のパソコンやサーバーで動かせる状態のことです。外部に文章を送らずに済みますので、社外に出せない情報を扱うお仕事などで選ばれています。
  • 用語
    パラメータ
    モデルの規模を表す数字です。多いほど基本的には賢くなりますが、動かすのに必要な機材も大きくなります。「2.8兆」といった形で出てきます。
  • 用語
    マルチモーダル
    文章だけでなく、画像・音声・動画もまとめて扱えることを指します。最近のモデルは、ほとんどがこの方向に向かっています。

よかったら、まずはここから。ChatGPT、Claude、Gemini のどれかを、無料で使える範囲で触ってみるのが早いと思います。この3つは用途の幅が広くて、日本語も安定しています。そのうえで「画像を作ってみたい」「動画をやってみたい」と、やりたいことが見えてきてから、下の分野を見ていただければじゅうぶん間に合います (*´▽`*)

文章生成

12サービス

おしゃべりしたり、文章を書いてもらったり、翻訳したり、プログラムを作ってもらったり。いわゆる「AIと話す」の中心にある分野です。2026年は米国の会社と中国の会社が値段で競り合う年になっていて、性能の近いものが10分の1のお値段で出てくる、ということも起きています。

まずお試しになるなら、ChatGPT・Claude・Gemini のどれか。4番目から下は、やりたいことが決まってきてからご覧いただいても、じゅうぶん間に合います。

ChatGPT OpenAI / 米国
2022年の終わりに、一般の私たちがAIに触れるきっかけを作ったサービスです。今も利用者数では最大手で、迷ったらここ、という位置にいます。

2022年11月にChatGPTが公開されたことが、いまの生成AIブームの出発点になりました。技術そのものは以前からあったのですが、「チャット画面で話しかければいい」という形にしたことで、一気に広まったと言われています。

いまの主役はGPT-6シリーズです。2026年9月3日にいちばん上の Astra が出て、9月22日に Sol と Luna が続きました。ひとつ前のGPT-5.6シリーズ(7月9日公開)も、終了の予定は出ておらず、そのまま使えます。名前は、太陽(Sol)・地球(Terra)・月(Luna)という具合に、天体の名前で大きさの順番が付いています。覚えやすくて、よくできた名前だなと思います。

いまのモデル(上ほど高性能)
  • 最上位
    GPT-6 Astra2026-09-03
    いちばん上の旗艦モデルです。お値段も高めで、上の段は Claude の Fable 5.1 と同じくらいです。速さを優先する「Fastモード」も選べますが、そちらはさらに倍の料金がかかります。
  • 上位
    GPT-6 Sol2026-09-22最新
    ふだん使いの主力です。ひとつ前の GPT-5.6 Sol と同じくらいの賢さで、お値段は半分になりました。期間限定のお試し価格ではなく、そのままの値段です。ただし、かなり難しいプログラム作りや画面操作の一部では、ひとつ前のSolのほうが最高点は上、という結果も出ています。
  • 軽量
    GPT-6 Luna2026-09-22最新
    いちばん速くて、いちばん安いものです。ひとつ前のLunaから、さらに半額ほどになりました。ChatGPTでは、無料プランやGoプランでもデスクトップアプリから使えます。
  • ひとつ前
    GPT-5.6 Sol / Terra / Luna2026-07-09
    今も使えますが、新しく始めるなら GPT-6 のほうが同じ働きでお安くなります。すでに5.6で動かしているものを、慌てて替える必要はないと思います。
  • 画像
    GPT Image 22026-04-21
    DALL-E 3 の後継です。日本語の文字が崩れにくい、数少ないモデルのひとつです。

動画を作る Sora 2 は終了しました。アプリとWebは2026年4月26日に、開発者向けのAPIも9月24日で終わります。話題になったサービスでしたが、いまOpenAIは動画生成を提供していません。(このページには以前「3月24日に終了」と書いていましたが、それは終了のお知らせが出た日でした。お詫びして訂正します。)

Claude Anthropic / 米国
文章とプログラム作りに定評があります。2026年は「Claude Code」という開発ツールで一気に知られるようになりました。

最初のClaudeが公開されたのは2023年3月14日ですので、実は3年以上の歴史があります。ただ、当初は承認された一部の方だけが使える形でした。どなたでも使えるようになったのは、同じ年の7月に出たClaude 2からです。OpenAIにいたメンバーが立ち上げた会社で、安全性を前に出す姿勢が一貫しています。

流れが変わったのがClaude Code(2025年2月公開)でした。ターミナルという黒い画面から、普通の言葉で開発作業を頼めるツールです。2025年の年末から2026年のはじめにかけて一気に広まって、2026年にはスタートアップの4社に3社が使っている、という調査も出ています。プログラマーではない方が「なんとなく動くものを作ってみる」という使い方をされているのも、よく見かけるようになりました。

いまのモデル(上ほど高性能)
  • 最上位
    Claude Fable 5.12026-09-01最新
    いちばん上のモデルです。お値段自体は前の版から変わっていませんが、同じ資料を何度も読ませるときの料金が4分の1になりました。長い資料を渡して何度も質問する、という使い方をされるなら、実際の請求はかなり下がります。
  • 最上位
    Claude Mythos 5.12026-09-01限定公開
    Fable 5.1 から安全のための制限を外した特別版です。お申し込みをしても使えるものではなく、審査を通った組織だけが対象になっています。サイバー防衛や医学研究など、制限をかけるとお仕事にならない用途に限って開放されているものです。名前をお見かけしても、一般には使えないものとお考えいただければ大丈夫です。
  • 上位
    Claude Opus 5.52026-09-22最新
    実際のお仕事で使う、いちばん上のものです。前のOpus 5より2割お安くなり、しかもプログラム作りの評価では、お値段が2.5倍のFable 5.1を上回ったとAnthropicは説明しています。長い資料を読ませるときの料金も下がりました。次のSonnet 5.5とHaiku 5.5も、数週間のうちに出ると予告されています。
  • ひとつ前
    Claude Opus 52026-07-24
    Opus 5.5 の前の版です。8月12日に処理速度が改善されました。5.5に替えるときは、設定の一部(考える機能をオフにする、など)がそのままでは通らなくなるので、プログラムから使っている方はご注意ください。
  • 中位
    Claude Sonnet 52026-06-30
    ふだん使いの主力です。9月に値上げされる予定だったのですが、8月10日に据え置きが決まりました。
  • 軽量
    Claude Haiku 4.52025-10
    速さを重視したものです。
Gemini Google / 米国
検索やAndroid、Gmailと直接つながっているのが強みです。動画のVeo、画像のNano Bananaも同じGoogle製で、扱う分野の幅がいちばん広い会社です。

出発点は2023年3月のBardでしたが、最初の公開デモで誤った回答を出してしまい、親会社の時価総額が1000億ドル下がるという、なかなか苦い立ち上がりでした (;´・ω・) そこから4月にGoogle BrainとDeepMindを統合し、12月にGemini 1.0を投入。2024年2月にBardという名前をGeminiへ変えて、仕切り直しています。

最初から文章・画像・音声・動画をいっしょに学習させた設計になっていて、いまの「なんでも入力できる」という流れを先取りしていました。検索やAndroid、Gmailに組み込まれていますので、意識せずに使っておられる方も多いと思います。

いまのモデル(上ほど高性能)
  • 最上位
    Gemini 3.1 Pro2026
    じっくり考える用途の旗艦モデルです。後継の3.5 Proは5月に発表されたのですが、3回延期されていて、8月末の時点でもまだ出ていません。
  • 中位
    Gemini 3.8 Flash2026-09-02最新
    ひとつ前の3.7 Flashとまったく同じお値段のまま、公開されたすべての試験で成績が上回りました。据え置きで中身だけ良くなった、という珍しい更新です。2026年の年末までは導入価格で、2027年1月1日に倍になります。
  • 軽量
    Gemini 3.5 Flash-Lite2026-07-21
    たくさんの処理を速くこなしたいとき向けです。
  • 画像
    Nano Banana Pro / 22025-11 / 2026-02-26
    人物の写実性と、文字の乗せ方が上手だと評価されています。日本語も比較的崩れにくいです。2のほうは、品質を保ったまま3分の1のお値段になりました。
  • 動画
    Veo 3.1 / Gemini Omni2026 / 2026-06-30
    Veoは音声つきの動画を早くから実現していました。Omniは文章・画像・動画を1つのモデルで扱う新しい系統ですが、使った分だけ払う場合のお値段が、まだ公表されていません。
Grok xAI(SpaceXAI) / 米国
イーロン・マスクさんのAIです。X(旧Twitter)の投稿をその場で読めるのが他にない特徴で、いま起きていることに強いです。

2023年3月にマスクさんが設立して、同じ年の11月にGrokを公開しました。OpenAI・DeepMind・Google出身の方々が集まった会社で、最初からXと一体で設計されているのが、他社と違うところです。今日の出来事やトレンドを踏まえた回答ができます。

2026年2月にはSpaceXがxAIを買収して、いまはSpaceXの一部門「SpaceXAI」になっています。

いまのモデル(上ほど高性能)
  • 最上位
    Grok 4.72026-09-21最新
    いまの旗艦モデルです。お値段は4.6とまったく同じまま、中身の土台を大きくしました。数時間かかるような長い作業に強くなるよう、訓練を重ねたモデルだと説明されています。倍のお値段で速くした「Fast版」もありますが、これは一部のツール経由でしか使えません。
  • ひとつ前
    Grok 4.62026-08-12
    4.7の前の旗艦です。長く動き続ける自動処理や、プログラム作り、画面を伴う作業に向いています。考える深さを4段階から選べるようになりました。外部の評価指標では、OpenAIのGPT-5.6 Solと並ぶ点数がついています。
  • 上位
    Grok 4.52026-07-09
    長い文章を覚えておく力と、道具を使いこなす力が得意です。大きなプログラムや、大量のPDF・メールを扱う用途を想定して作られています。
  • 中位
    Grok 4.32026-04-30
    長い文章を安く扱いたいとき用です。まとめて処理する場合の割引が使えるのは、こちらだけです。
  • 画像・動画
    Grok Imagine2026
    画像も動画も作れます。動画でまとめ処理の割引がはっきり書かれている数少ない例で、半額になります。

2026年5月に、Grok 4 や Grok 3 系がまとめて終了しました。世代交代がとても早いので、古い型番の情報は当てにならないことが多いです。ネットの記事をご覧になるときは、日付をご確認いただくと安心です。

Muse Meta(Meta Superintelligence Labs) / 米国
FacebookやInstagramの会社です。以前のつまずきから体制を作り直して、2026年に有料のサービスへ本格参入しました。安さが武器です。

Metaは長いあいだLlamaという無料公開のモデルで存在感を保っていました。ただ2025年のLlama 4で、順位を測るテスト用に未公開の特別版を使っていたことが問題になり、信用を落としてしまいます。

それを受けて2025年の夏にMeta Superintelligence Labsを新しく作りました。Scale AI創業者のアレクサンダー・ワンさんを最高AI責任者に迎えて、同社へ143億ドルを投じています。2026年4月8日に最初のモデルMuse Sparkを出して、無料公開の路線から有料へ舵を切りました。

いまのモデル
  • 最上位
    Muse Spark 1.32026-09-02最新
    プログラム作りに特化しています。1.2からさらに大きく値下げしてきました。安さで存在感を出す、という方針がはっきりしています。
  • 上位
    Muse Spark 1.22026-08-05
    ザッカーバーグさんいわく「OpenAIやAnthropicの同等モデルの、およそ25%のお値段」とのことでした。学習に使うことを許可する代わりに、さらに安くなる契約者向けの価格もあります。
  • ツール
    Muse Code2026-08-05
    ターミナルで動く開発の相棒です。Claude Codeを意識したものですね。
  • 公開
    Muse Glimmer 30B2026-08重み公開
    自由に使えるライセンスで公開されています。Muse Spark 1.2 についても、中身の公開が予告されています。
Kimi Moonshot AI / 中国・北京
長い文章の扱いと、プログラム作りで評価が高いです。最新のK3は、中身が公開されたモデルとしては過去最大の規模になりました。

北京の研究所です。もともと長い文章をどれだけ扱えるかという点で名前を上げて、そこからプログラム作りの性能でも評価されるようになりました。中国の独立系AI企業の上位4社「四小龍」のひとつに数えられています。

いまのモデル
  • 最上位
    Kimi K32026-07-16重み公開
    2.8兆パラメータで、中身が公開されたモデルとしては過去最大です。といっても全部を毎回使うわけではなく、質問に応じて必要な部分だけを動かす設計になっていますので、大きさのわりには軽く動きます。100万トークンぶんの文章を読めて、画像や動画もお渡しできます。中身は7月27日に公開されましたが、ライセンスが独自のものですので、お仕事で使われる前に条項のご確認をおすすめします。
  • 旧世代
    Kimi K2.62026-04-20
    K3よりかなりお安く、まとめ処理の割引に対応しているのはこちらだけです。
DeepSeek DeepSeek / 中国・杭州
「安さで勝負する」を体現した会社です。2025年に、低価格のモデルで業界の常識をひっくり返しました。

2025年に、性能の近いモデルを桁違いに安く出したことで、「AIってこんなにお金がかかるものなんだっけ」という前提そのものを問い直させた会社です。投資家やクラウド企業の計算を狂わせた、とまで言われました。効率を追いかける姿勢が一貫しています。

ただ、2026年8月16日に時間帯によってお値段が変わる方式へ移行して、実質的に値上げしています。「恒久的」と説明されていた5月の値下げが、3ヶ月で一部戻された形です。安さが売りの会社でも、こういうことは起こります。

いまのモデル
  • 最上位
    DeepSeek V4 Pro2026-04-24
    最上位でありながら、他社の軽量モデル並みの価格帯です。
  • 特化
    DeepSeek R12025
    じっくり考えることに特化したものです。この系統の火付け役になりました。
  • 軽量
    DeepSeek V4.1-Flash2026-09-10
    いちばん新しいものです。画像も読めるようになり、中身は誰でも使える形で公開されています。いちど「9月14日から上位モデル宛のお願いも引き受けます」と案内が出たのですが、その予定は取りやめになりました。上位モデルはこれまでどおり使えるようです。
  • 軽量
    DeepSeek V4 Flash2026
    ひとつ前の最安クラスです。こちらは役目を終えていて、この名前で頼んでも、実際には新しい V4.1-Flash が答えを返します(お値段も新しいほうのものになります)。8月21日に追加された、画像も読める Flash Vision(お試し扱い)も同じ扱いです。

お値段が高い時間帯と安い時間帯があります。高くなるのは日本時間の10〜13時と、15〜19時です。ちょうどお仕事をされている時間帯ですね。夜にまとめて処理していただくと、半額になります。

GLM Zhipu AI(Z.ai) / 中国・北京
清華大学から生まれた会社です。2026年1月に香港で上場しました。ライセンスがゆるやかで、企業が使いやすいのが特徴です。

清華大学から生まれた会社で、海外向けにはZ.aiという名前で展開しています。2026年1月に香港の証券取引所へ上場し、時価総額はおよそ66億ドル。中国のAI企業としては珍しく、上場企業としての財務基盤を持っています。

特徴はゆるやかなライセンスでの公開と、自動処理やプログラム作りへの集中です。研究の深さと使いやすいライセンスの組み合わせで、企業への導入で選ばれやすいようです。

いまのモデル
  • 最上位
    GLM-5.22026-06-13重み公開
    7,440億パラメータ。100万トークンぶんの文章を扱えます。発表から数日で中身が公開されました。
  • 中位
    GLM-5-Turbo2026-03-15
    速さを重視した別系統です。
Qwen Alibaba / 中国
アリババのAIです。中国で2番目に使われているチャットサービスで、クラウド事業と一体で展開しています。

ネット通販とクラウドの大企業が、AIを自社クラウドへの入口として位置づけているタイプです。月間の利用者は1.66億人で、中国では2位。自社開発のチップまで手掛けていて、上から下まで自前で揃える方向に進んでいます。

動画を作るWanも同じアリババ製です。こちらは2026年8月に、資料から動画を作れるWan 3.0を出して注目されました。

いまのモデル
  • 最上位
    Qwen3.8-Max2026-08-03
    いま実際に使える旗艦モデルです。中身を公開する路線でも、長く存在感があります。
  • 予告
    Qwen 4 Max ほか3種2026-09-22 発表
    9月22日の発表会で、Max・Plus・Flash・27B(手元用)の4種類が予告されました。ただし、お値段も、使えるようになる日も、まだ発表されていません。いまは「予告が出た」という段階です。
  • 動画
    Wan 3.02026-08-24最新
    下の「動画生成」をご覧ください。
MiniMax MiniMax / 中国・上海
文章・音声・動画・音楽・画像を、1つの契約でまとめて使えるのが特徴です。動画のHailuoで知られています。

2021年に設立された会社で、香港に上場しています。「四小龍」のひとつ。文章のM系統と、動画・音声のHailuo系統を両輪で持っているのが他社と違うところで、1つの契約で全部使えます。いろいろ試してみたい方には、まとまっていて分かりやすいかもしれません。

いまのモデル
  • 文章
    MiniMax-M32026
    51万トークンぶんの入力に対応しています。ずっと50%オフが適用された価格で提供されています。
  • 動画
    Hailuo H32026-07-31
    下の「動画生成」をご覧ください。
  • 音声
    MiniMax Speech2026
    下の「音声生成」をご覧ください。
Doubao・Seed ByteDance / 中国
TikTokの会社です。Doubaoは中国でいちばん使われているチャットサービスで、月間3.45億人。動画や画像でも最前線にいます。

一般の方向けのDoubao(豆包)が月間3.45億人で中国最大です。研究部門のByteDance Seedが、動画のSeedance、画像のSeedreamを出しています。

動画については、いまの品質でトップと言われています。Seedance 2.0が、動画の評価でGoogle Veo 3、OpenAI Sora 2、Runway Gen-4.5を抜きました。

いまのモデル
  • 動画
    Seedance 2.5 / 2.02026-07-31 / 2026-02
    下の「動画生成」をご覧ください。
  • 画像
    Seedream 5.0 Pro2026-08-12
    下の「画像生成」をご覧ください。
Fugu Sakana AI / 日本・東京
日本の会社です。自分で全部答えるのではなく、得意な他社のAIに仕事を振り分けるという、少し変わった作り方をしています。

2023年に東京で立ち上がった会社です。GoogleでいまのAIの土台になった論文(Transformer)を書いた研究者が創業に加わったことで知られています。社名のSakanaは、魚の群れのように小さなものが集まって大きな働きをする、という考え方から来ています。

2026年9月11日に出した Fugu は、ひとつの大きなAIではありません。「この仕事はあのAIが得意」と判断して他社のモデルへ振り分け、返ってきた答えをまとめ直すまとめ役(オーケストレーター)という作りになっています。大きなモデルを一から作るのではなく、すでにあるものを上手に使い分けることで安く強くする、という発想です。

いまのモデル
  • 最上位
    Fugu Ultra v2.02026-09-11
    手数のかかる難しい仕事で、とにかく良い答えを出すことを狙ったものです。
  • 中位
    Fugu Max2026-09-11
    かけた金額あたりの結果を狙ったほうです。同じ働きをするモデルより4〜6割安いと説明されています。

日本の会社が、この一覧に載る性能と価格で出してきたのは大きな動きだと思います。ただ、中身は他社のAIを使い分ける仕組みですので、「日本製のAIそのもの」とは少し意味が違う点は知っておいていただくとよいかもしれません。

画像生成

6サービス

絵やイラスト、写真のような画像を作る分野です。日本語で使ううえで効いてくるのが「画像の中の文字が崩れないかどうか」で、ここは各社の差が大きいところです。ポスターや資料をお作りになるなら、絵の綺麗さよりも文字の再現性で選んでいただくことになると思います。

文字を入れるなら GPT Image 2.5 か Nano Banana Pro。絵として綺麗なものがご希望なら Midjourney。この2つの目的は、けっこう別ものだと思っていただくといいかもしれません。

GPT Image 2.5 / 2 OpenAI / 米国
日本語の文字が崩れにくい代表格です。まとめ画像や図解との相性がいいです。

DALL-E 3の後継として、2026年4月21日に登場しました。ChatGPTの画像機能も、これで動いています。日本語の文字の再現度が高いので、文字を入れた画像を作りたい場合の第一候補になると思います。

品質を低・中・高から選べて、お値段はおよそ30倍の開きがあります。試作は低品質、仕上げだけ高品質という使い分けをしていただくと、かなり節約できます。

2026年9月8日に GPT Image 2.5 が出ました。Flare と Sunburst の2種類があって、Flare は速さ重視で数をこなす用、Sunburst は手元の画像を直す精度を重視した用です。お値段は2つとも同じです。ただ、2よりはだいぶ高くつきますので、用途が決まるまでは 2 のままでも困らないと思います。

Nano Banana Pro / 2 Google / 米国
人物の写実性と、文字の乗せ方に定評があります。2は品質を保ったまま3分の1のお値段になりました。

正式にはGemini Image系という名前なのですが、「ナノバナナ」という通称のほうが通っています。Proが2025年11月、より速くて安いNano Banana 2が2026年2月26日に出ました。

Proは人物の写実性と文字の重ね方が上手で、日本語のポスターやSNS画像でも比較的崩れにくいです。2のほうは4Kに対応しながら、出力が3〜5秒と速いので、数をこなしたい場合に向いています。

Midjourney Midjourney / 米国
作品としての美しさで、長く支持されています。資料づくりより、作品づくり向きです。

初期から「とにかく絵として綺麗」という一点で支持を集めてきました。技術的な正確さよりも、作品性を大事にされる方に選ばれています。

2026年3月17日にV8 Alpha、4月にV8.1が続き、6月からV8.1が標準になりました。描画が5倍速くなって、2Kの出力にも対応しています。

Seedream 5.0 ByteDance Seed / 中国
作るだけでなく、直すこともできます。複数の参考画像を混ぜられるのが実務向きです。

2026年8月12日に公開されました。作るだけでなく直せるところと、複数の参考画像を組み合わせられるところが特徴で、お仕事の制作現場を想定した作りになっています。参考画像は1枚目が無料です。

FLUX.2 Black Forest Labs / ドイツ
Stable Diffusionの元開発者の方々が立ち上げた会社です。品質と扱いやすさのバランス型です。

2025年11月25日にFLUX.2系が登場して、FLUX.1から旗艦を引き継ぎました。2026年1月15日には自由に使える軽量版のKlein 4Bも出ています。ご自分の環境で動かしたい方に選ばれています。

Stable Diffusion Stability AI / 英国
画像生成を一般に開放した立役者です。ご自分のパソコンで動かせるのが最大の強みです。

2022年に公開されたとき、誰でも自分のパソコンで画像生成を動かせるようにしたことが、この分野を一気に広げました。派生モデルや追加学習の文化も、ここから生まれています。

2026年4月6日にStable Diffusion 4が登場しました。2022年以来はじめて根本の設計を作り直した世代で、他社の最新モデルと同じ方式へ移っています。

動画生成

7サービス

この1年で、いちばん入れ替わりが激しい分野です。半年前の型番が、もう無いということが普通に起きます。2026年は「音声もいっしょに作る」「長い尺を一発で作る」「資料を読ませて作る」という3つの方向で競争しているところです。

品質重視なら Seedance、安くお試しなら Veo 3.1 Lite、資料から作りたいなら Wan 3.0。この分野はお値段の幅が10倍以上ありますので、まずは安いもので感触をつかんでいただくのがいいと思います。

Seedance ByteDance Seed / 中国
いまの品質でトップです。Veo・Sora・Runwayを評価で抜きました。

2026年2月に2.0が登場して、動画の評価でGoogle Veo 3、OpenAI Sora 2、Runway Gen-4.5を抜いて首位に立ちました。7月31日には2.5が続いています。

2.5では最長30秒を、音声込みで一発で作れるようになりました。参考として画像30枚・動画10本・音声10本まで渡せて、秒単位の編集もできます。ただ、公式の解像度は720pまでです。1080pや4Kを謳っている業者さんは、自前で拡大しているだけということがありますので、そこはご注意ください。

Wan 3.0 Alibaba / 中国
PDFやスライド、表計算を読ませて動画を作れます。この入力のしかたは、他にありません。

2026年8月24日に公開されました。いちばんの特徴は、文章や画像だけでなくドキュメント、表計算、スライド、PDF、Webページをそのまま渡して、そこから動画を組み立てられることです。手元の資料をそのまま渡せるという発想は、いまのところ他社にありません。

2〜30秒で、480p/720p/1080pから選べます。失敗した生成には課金されないのも、実際に使うとありがたいところです。8月6日のお試し公開の時点で、短編ドラマや広告、観光PR、MV制作に使われています。

Veo / Gemini Omni Google / 米国
音声つきの動画を早くから実現しました。安く済ませる選択肢もあって、幅が広いです。

Veoは、セリフや効果音、環境音を映像と同時に作れるようにした、最初の主要モデルです。いまの3.1は品質別に3段階あって、いちばん上といちばん安いもので10倍以上のお値段の差があります。音声が要らないのでしたら、Liteが動画全体でも最安クラスです。

2026年6月30日には、新しい系統のGemini Omni Flashも登場しました。文章・画像・動画を1つのモデルで扱うものですが、使った分だけ払う場合のお値段がまだ公表されていないので、お仕事での見積もりがしづらい状態が続いています。

Hailuo H3 MiniMax / 中国
文章・画像・動画・音声をまとめて理解する統合型です。音声も同時に作ります。

2026年7月31日の公開です。4種類の入力を1つのモデルで理解する設計で、参考として画像9枚・動画3本・音声3本まで渡せます。2K・24fpsで5〜15秒、ステレオ音声も同時に作ります。

解像度は実質2Kのみです。安い768pという区分が価格表にはあるのですが、お申し込み制になっていて、実際にはAPIから指定できず、2Kのお値段で課金されてしまいます。価格表だけを見て安いと判断されないよう、お気をつけください。

Kling Kuaishou(快手) / 中国
4K・60fpsと、多言語の口の動きに対応しています。映像作品寄りの用途で評価が高いです。

2026年2月4日に3.0が登場しました。4K・60fps・15秒を一度に出せて、多言語の口の動きにも合わせられます。6月中旬には高速版のTurboが追加されました。お値段はポイント制で、音声の有無や解像度によって消費が変わります。

Gen-4.5 Runway / 米国
映像制作をされている方向けの老舗です。細かく制御しやすいところで支持されています。

AI動画がまだ数秒しか作れなかった頃から、映像制作の現場に入っていた会社です。品質の競争では中国勢に抜かれつつありますが、作り手が細かく制御できる作りで支持が続いています。

Ray 3 Luma AI / 米国
解像度でお値段が大きく変わります。720pなら安くお試しいただけます。

Dream Machineという名前で知られています。720pと1080pで単価が4倍近く変わりますので、下書きは720p、仕上げだけ1080pという使い方が向いています。

OpenAIのSora 2は終了しました。アプリとWebは2026年4月26日、開発者向けのAPIも9月24日で終わります。(以前は「3月24日に終了」と書いていましたが、それはお知らせが出た日でした。訂正します。)一時期この分野の代名詞のように言われていましたが、いまは使えません。動画生成の勢力図が、ByteDance・Google・Alibabaへ移る転機になりました。

音声生成(読み上げ・声)

4サービス

書いた文章を読み上げさせたり、声そのものを作ったりする分野です。ナレーション、オーディオブック、吹き替え、ゲームのセリフなどに使われています。2026年からは「読み上げる」だけでなく「話し相手になる」ものが増えてきました。

読み上げさせたいなら ElevenLabs、話し相手にしたいなら GPT Live。この2つは目的がまったく別ものですので、やりたいことのほうから選んでいただくのが早いと思います。

GPT Live OpenAI / 米国
ChatGPTの音声会話の中身です。こちらが話している途中でも聞いていて、割り込んでも会話が続きます。

2026年7月8日にChatGPTのアプリで使えるようになり、2026年9月10日から、ご自分のサービスに組み込む形でも使えるようになりました。

いちばんの違いは「聞きながら話せる」ところです。これまでの音声AIは、こちらが話し終わるのを待ってから返してくる作りでしたので、かぶせて話すと止まってしまいました。GPT Live は話している最中でも聞いていますので、「あ、そうじゃなくて」と割り込んでも会話が続きます。返事までの間も、1.41秒から0.798秒へ短くなりました。

ChatGPTの無料プランでも軽い版(mini)が使えて、Go・Plus・Proでは通常版になります。

ご自分のサービスに組み込む場合は、料金の読み方に注意が要ります。表に出ている1分5セントは「聞いて話す部分」だけのお値段で、実際に考える部分は別のAIが担当し、そちらのぶんが別料金になります。10分お話しすると、軽いAIと組み合わせて80円ほど、賢いAIと組み合わせて140円ほど、というのが目安です。加えて、黙っている時間も同じように課金されます。

もうひとつ。公開されている12種類の声は、英語圏とポルトガル語・フィリピン系のもので、日本語の声は一覧に載っていません。日本語でお使いになる前提でしたら、ここは実際に試してご確認いただいたほうが安全だと思います。

ElevenLabs ElevenLabs / 米国・ポーランド発
この分野の代表格です。自然さと、声を似せる精度で抜けています。

ポーランド出身の幼なじみ2人が2022年に始めて、4年で評価額110億ドルまで来た会社です。2026年2月には5億ドルを調達しています。

読み上げと声を似せる機能が特に評価されていて、オーディオブック、吹き替え、ゲーム、動画制作の現場で広く使われています。速さ重視のものと品質重視のものがあって、単価は倍ほど違います。

MiniMax Speech MiniMax / 中国
文章・動画・音楽と同じ契約で使えます。まとめて揃えたいときに。

速さ重視のTurboと、品質重視のHDの2段構えです。単体で見ればElevenLabsと同じくらいの価格帯ですが、MiniMaxは1つの契約で文章・画像・動画・音声がまとめて使えますので、いろいろ試したい場合には選ぶ理由が出てきます。

音楽だけは事情が変わりました。2026年8月20日から、音楽生成と歌詞生成のAPIは新規のお申し込みを受け付けていません。それ以前から使っている方は続けられますが、これから始める場合は MiniMax Audio というアプリを使うか、公開されているモデルをご自分の環境で動かす形になります。

OpenAI TTS / Google TTS OpenAI・Google / 米国
大手が本体のサービスに含めている読み上げ機能です。すでにご契約があるなら手軽です。

どちらも本体のサービスに含まれる形で提供されています。専門のElevenLabsと比べると、声の表現力では一歩譲る場面もありますが、すでに文章生成でご契約があれば、追加の契約なしにお使いいただけます。

Googleは2026年8月26日に、文字起こしに特化したGemini 3.5 Transcribeも出していて、音声まわりの整備が進んでいます。

さらに9月15日には、話し相手になる音声モデル「Gemini 3.8 Live」が出ました。GPT Live と同じように、声で話しかけて声で返してもらう使い方ができます。日本語を含む97言語に対応していると紹介されていて、お値段も、聞く分と話す分を合わせて1分あたり3〜4円ほどと、かなり安く出ています。ただ、日本語対応の情報は紹介記事からのもので、Googleの公式な資料では確認できていません。実際にお試しになってから決められるのが安心です。

Googleの読み上げは声の質によって4段階のお値段があって、いちばん上といちばん下で40倍ほど違います。下の段には月400万文字までの無料枠がありますので、量が多くなければ費用をかけずに始められます。

音楽生成

4サービス

歌や伴奏を、まるごと作ってしまう分野です。他の分野と少し違うのは、学習に使ったデータの権利をめぐる裁判が続いているところで、お仕事で使われる場合には条件のご確認が必要になります。

質を取るなら Suno、お仕事で安心して使いたいなら ElevenMusic。後者は学習データを正規にライセンスしていると明記しています。

Suno Suno / 米国
出来上がりの質では、いちばん評価が高いです。ただ権利まわりの議論が続いています。

2026年2月の時点で有料の利用者がおよそ200万人。ポップ、ロック、電子音楽、アンビエントと、幅広いジャンルで出来上がりの評価が高いです。

この分野は提供のしかた自体が動いています。MiniMaxは2026年8月20日に音楽APIの新規受付をやめ、アプリか公開モデルへ切り替えました。お仕事で使う前提なら、料金だけでなくこれから先も申し込めるかどうかもご確認ください。

一方で学習データをめぐる裁判が続いていて、お仕事で使うときの条件が固まっていません。ここは、ご自身で確認したうえでご判断いただくところかなと思います。公式のAPIは提供されておらず、外部の業者さん経由での利用になります。

ElevenMusic ElevenLabs / 米国
学習データを正規にライセンスしているのが、いちばんの違いです。お仕事で使いやすいです。

音声で地位を築いたElevenLabsが2025年8月に音楽へ参入して、2026年4月1日に単体のアプリを出しました。

違いは品質よりも権利のはっきりしていることで、音楽のライセンス管理会社から100%ライセンスを受けたデータで学習していると明記しています。SunoやUdioが抱えている権利の問題を避けていますので、お仕事で使う前提でしたら有力な選択肢になると思います。

Udio Udio / 米国
Sunoと並ぶ品質です。こちらも権利まわりの議論の渦中にあります。

Sunoと並んで、出来上がりの評価が高いサービスです。ただ同じように学習データの裁判を抱えていて、お仕事で使うときの条件は流動的です。使った分だけ払うAPIはなく、月額のご契約のみになります。

Lyria Google / 米国
リアルタイムに音を出し続けられる版があるのが、少し変わっています。

Google製の音楽モデルです。1曲ずつ作る通常版に加えて、演奏を途切れずに流し続けるリアルタイム版があります。配信の裏でBGMを鳴らし続ける、といった使い方ができます。