いま話題になっている生成AIを、作っている会社ごとにまとめました。文章・画像・動画・音声・音楽の5つの分野を扱っています。それぞれ「どこが作っているのか」「何が得意なのか」「今はどれが新しいのか」が分かるようにしています。
ニュースを見ていると、いろんな名前が次々に出てきますよね。全部を覚えようとすると、それだけで疲れてしまいます (;´∀`) 最初から全部を分かろうとしなくて大丈夫です。まずは、ここだけ押さえておくと読みやすくなる、というところをお伝えします。
名前が入り混じって見えるのは、会社の名前・サービスの名前・モデルの名前という3つが、それぞれ別にあるからです。
たとえば「Anthropic という会社が、Claude というサービスを出していて、その中に Opus 5 というモデルがある」という関係になっています。会社が「メーカー」、サービスが「車種」、モデルが「グレード」だと思っていただくと、近いかもしれません。
このページでは会社ごとに1枚のカードにまとめています。ふだんは名前と短い説明だけが見えていて、「ひらく」を押すと、中のモデル一覧が出てきます。気になったところだけ開いてみてください。
どの会社も、賢いけれど高いものから、そこそこだけど速くて安いものまでを揃えています。このページでは 最上位 中位 軽量 と表示して、上にあるものほど高性能になるよう並べています。
ふだんお使いになるぶんには、中位で足りることが多いようです。最上位は、難しい調べものや、複雑なプログラムを任せるときのものだと思っていただければ大丈夫です。お値段も数倍から十数倍しますので、いきなり最上位を選ばなくても問題ありません。
この分野は、数ヶ月で世代が変わります。モデルの名前の横に日付を入れていますので、それが最近のものか、一世代前のものかを見分けていただけます。
半年以上前の型番になると、すでに提供が終わっていることもあります。ネットで調べものをされたときに古い情報に当たることも多いので、日付は気にしていただくといいかもしれません。
分からない言葉が出てきても、そのつどここに戻ってきていただければ大丈夫です。
よかったら、まずはここから。ChatGPT、Claude、Gemini のどれかを、無料で使える範囲で触ってみるのが早いと思います。この3つは用途の幅が広くて、日本語も安定しています。そのうえで「画像を作ってみたい」「動画をやってみたい」と、やりたいことが見えてきてから、下の分野を見ていただければじゅうぶん間に合います (*´▽`*)
おしゃべりしたり、文章を書いてもらったり、翻訳したり、プログラムを作ってもらったり。いわゆる「AIと話す」の中心にある分野です。2026年は米国の会社と中国の会社が値段で競り合う年になっていて、性能の近いものが10分の1のお値段で出てくる、ということも起きています。
まずお試しになるなら、ChatGPT・Claude・Gemini のどれか。4番目から下は、やりたいことが決まってきてからご覧いただいても、じゅうぶん間に合います。
2022年11月にChatGPTが公開されたことが、いまの生成AIブームの出発点になりました。技術そのものは以前からあったのですが、「チャット画面で話しかければいい」という形にしたことで、一気に広まったと言われています。
いまの主役はGPT-6シリーズです。2026年9月3日にいちばん上の Astra が出て、9月22日に Sol と Luna が続きました。ひとつ前のGPT-5.6シリーズ(7月9日公開)も、終了の予定は出ておらず、そのまま使えます。名前は、太陽(Sol)・地球(Terra)・月(Luna)という具合に、天体の名前で大きさの順番が付いています。覚えやすくて、よくできた名前だなと思います。
動画を作る Sora 2 は終了しました。アプリとWebは2026年4月26日に、開発者向けのAPIも9月24日で終わります。話題になったサービスでしたが、いまOpenAIは動画生成を提供していません。(このページには以前「3月24日に終了」と書いていましたが、それは終了のお知らせが出た日でした。お詫びして訂正します。)
最初のClaudeが公開されたのは2023年3月14日ですので、実は3年以上の歴史があります。ただ、当初は承認された一部の方だけが使える形でした。どなたでも使えるようになったのは、同じ年の7月に出たClaude 2からです。OpenAIにいたメンバーが立ち上げた会社で、安全性を前に出す姿勢が一貫しています。
流れが変わったのがClaude Code(2025年2月公開)でした。ターミナルという黒い画面から、普通の言葉で開発作業を頼めるツールです。2025年の年末から2026年のはじめにかけて一気に広まって、2026年にはスタートアップの4社に3社が使っている、という調査も出ています。プログラマーではない方が「なんとなく動くものを作ってみる」という使い方をされているのも、よく見かけるようになりました。
出発点は2023年3月のBardでしたが、最初の公開デモで誤った回答を出してしまい、親会社の時価総額が1000億ドル下がるという、なかなか苦い立ち上がりでした (;´・ω・) そこから4月にGoogle BrainとDeepMindを統合し、12月にGemini 1.0を投入。2024年2月にBardという名前をGeminiへ変えて、仕切り直しています。
最初から文章・画像・音声・動画をいっしょに学習させた設計になっていて、いまの「なんでも入力できる」という流れを先取りしていました。検索やAndroid、Gmailに組み込まれていますので、意識せずに使っておられる方も多いと思います。
2023年3月にマスクさんが設立して、同じ年の11月にGrokを公開しました。OpenAI・DeepMind・Google出身の方々が集まった会社で、最初からXと一体で設計されているのが、他社と違うところです。今日の出来事やトレンドを踏まえた回答ができます。
2026年2月にはSpaceXがxAIを買収して、いまはSpaceXの一部門「SpaceXAI」になっています。
2026年5月に、Grok 4 や Grok 3 系がまとめて終了しました。世代交代がとても早いので、古い型番の情報は当てにならないことが多いです。ネットの記事をご覧になるときは、日付をご確認いただくと安心です。
Metaは長いあいだLlamaという無料公開のモデルで存在感を保っていました。ただ2025年のLlama 4で、順位を測るテスト用に未公開の特別版を使っていたことが問題になり、信用を落としてしまいます。
それを受けて2025年の夏にMeta Superintelligence Labsを新しく作りました。Scale AI創業者のアレクサンダー・ワンさんを最高AI責任者に迎えて、同社へ143億ドルを投じています。2026年4月8日に最初のモデルMuse Sparkを出して、無料公開の路線から有料へ舵を切りました。
北京の研究所です。もともと長い文章をどれだけ扱えるかという点で名前を上げて、そこからプログラム作りの性能でも評価されるようになりました。中国の独立系AI企業の上位4社「四小龍」のひとつに数えられています。
2025年に、性能の近いモデルを桁違いに安く出したことで、「AIってこんなにお金がかかるものなんだっけ」という前提そのものを問い直させた会社です。投資家やクラウド企業の計算を狂わせた、とまで言われました。効率を追いかける姿勢が一貫しています。
ただ、2026年8月16日に時間帯によってお値段が変わる方式へ移行して、実質的に値上げしています。「恒久的」と説明されていた5月の値下げが、3ヶ月で一部戻された形です。安さが売りの会社でも、こういうことは起こります。
お値段が高い時間帯と安い時間帯があります。高くなるのは日本時間の10〜13時と、15〜19時です。ちょうどお仕事をされている時間帯ですね。夜にまとめて処理していただくと、半額になります。
清華大学から生まれた会社で、海外向けにはZ.aiという名前で展開しています。2026年1月に香港の証券取引所へ上場し、時価総額はおよそ66億ドル。中国のAI企業としては珍しく、上場企業としての財務基盤を持っています。
特徴はゆるやかなライセンスでの公開と、自動処理やプログラム作りへの集中です。研究の深さと使いやすいライセンスの組み合わせで、企業への導入で選ばれやすいようです。
ネット通販とクラウドの大企業が、AIを自社クラウドへの入口として位置づけているタイプです。月間の利用者は1.66億人で、中国では2位。自社開発のチップまで手掛けていて、上から下まで自前で揃える方向に進んでいます。
動画を作るWanも同じアリババ製です。こちらは2026年8月に、資料から動画を作れるWan 3.0を出して注目されました。
2021年に設立された会社で、香港に上場しています。「四小龍」のひとつ。文章のM系統と、動画・音声のHailuo系統を両輪で持っているのが他社と違うところで、1つの契約で全部使えます。いろいろ試してみたい方には、まとまっていて分かりやすいかもしれません。
一般の方向けのDoubao(豆包)が月間3.45億人で中国最大です。研究部門のByteDance Seedが、動画のSeedance、画像のSeedreamを出しています。
動画については、いまの品質でトップと言われています。Seedance 2.0が、動画の評価でGoogle Veo 3、OpenAI Sora 2、Runway Gen-4.5を抜きました。
2023年に東京で立ち上がった会社です。GoogleでいまのAIの土台になった論文(Transformer)を書いた研究者が創業に加わったことで知られています。社名のSakanaは、魚の群れのように小さなものが集まって大きな働きをする、という考え方から来ています。
2026年9月11日に出した Fugu は、ひとつの大きなAIではありません。「この仕事はあのAIが得意」と判断して他社のモデルへ振り分け、返ってきた答えをまとめ直すまとめ役(オーケストレーター)という作りになっています。大きなモデルを一から作るのではなく、すでにあるものを上手に使い分けることで安く強くする、という発想です。
日本の会社が、この一覧に載る性能と価格で出してきたのは大きな動きだと思います。ただ、中身は他社のAIを使い分ける仕組みですので、「日本製のAIそのもの」とは少し意味が違う点は知っておいていただくとよいかもしれません。
絵やイラスト、写真のような画像を作る分野です。日本語で使ううえで効いてくるのが「画像の中の文字が崩れないかどうか」で、ここは各社の差が大きいところです。ポスターや資料をお作りになるなら、絵の綺麗さよりも文字の再現性で選んでいただくことになると思います。
文字を入れるなら GPT Image 2.5 か Nano Banana Pro。絵として綺麗なものがご希望なら Midjourney。この2つの目的は、けっこう別ものだと思っていただくといいかもしれません。
DALL-E 3の後継として、2026年4月21日に登場しました。ChatGPTの画像機能も、これで動いています。日本語の文字の再現度が高いので、文字を入れた画像を作りたい場合の第一候補になると思います。
品質を低・中・高から選べて、お値段はおよそ30倍の開きがあります。試作は低品質、仕上げだけ高品質という使い分けをしていただくと、かなり節約できます。
2026年9月8日に GPT Image 2.5 が出ました。Flare と Sunburst の2種類があって、Flare は速さ重視で数をこなす用、Sunburst は手元の画像を直す精度を重視した用です。お値段は2つとも同じです。ただ、2よりはだいぶ高くつきますので、用途が決まるまでは 2 のままでも困らないと思います。
正式にはGemini Image系という名前なのですが、「ナノバナナ」という通称のほうが通っています。Proが2025年11月、より速くて安いNano Banana 2が2026年2月26日に出ました。
Proは人物の写実性と文字の重ね方が上手で、日本語のポスターやSNS画像でも比較的崩れにくいです。2のほうは4Kに対応しながら、出力が3〜5秒と速いので、数をこなしたい場合に向いています。
初期から「とにかく絵として綺麗」という一点で支持を集めてきました。技術的な正確さよりも、作品性を大事にされる方に選ばれています。
2026年3月17日にV8 Alpha、4月にV8.1が続き、6月からV8.1が標準になりました。描画が5倍速くなって、2Kの出力にも対応しています。
2026年8月12日に公開されました。作るだけでなく直せるところと、複数の参考画像を組み合わせられるところが特徴で、お仕事の制作現場を想定した作りになっています。参考画像は1枚目が無料です。
2025年11月25日にFLUX.2系が登場して、FLUX.1から旗艦を引き継ぎました。2026年1月15日には自由に使える軽量版のKlein 4Bも出ています。ご自分の環境で動かしたい方に選ばれています。
2022年に公開されたとき、誰でも自分のパソコンで画像生成を動かせるようにしたことが、この分野を一気に広げました。派生モデルや追加学習の文化も、ここから生まれています。
2026年4月6日にStable Diffusion 4が登場しました。2022年以来はじめて根本の設計を作り直した世代で、他社の最新モデルと同じ方式へ移っています。
この1年で、いちばん入れ替わりが激しい分野です。半年前の型番が、もう無いということが普通に起きます。2026年は「音声もいっしょに作る」「長い尺を一発で作る」「資料を読ませて作る」という3つの方向で競争しているところです。
品質重視なら Seedance、安くお試しなら Veo 3.1 Lite、資料から作りたいなら Wan 3.0。この分野はお値段の幅が10倍以上ありますので、まずは安いもので感触をつかんでいただくのがいいと思います。
2026年2月に2.0が登場して、動画の評価でGoogle Veo 3、OpenAI Sora 2、Runway Gen-4.5を抜いて首位に立ちました。7月31日には2.5が続いています。
2.5では最長30秒を、音声込みで一発で作れるようになりました。参考として画像30枚・動画10本・音声10本まで渡せて、秒単位の編集もできます。ただ、公式の解像度は720pまでです。1080pや4Kを謳っている業者さんは、自前で拡大しているだけということがありますので、そこはご注意ください。
2026年8月24日に公開されました。いちばんの特徴は、文章や画像だけでなくドキュメント、表計算、スライド、PDF、Webページをそのまま渡して、そこから動画を組み立てられることです。手元の資料をそのまま渡せるという発想は、いまのところ他社にありません。
2〜30秒で、480p/720p/1080pから選べます。失敗した生成には課金されないのも、実際に使うとありがたいところです。8月6日のお試し公開の時点で、短編ドラマや広告、観光PR、MV制作に使われています。
Veoは、セリフや効果音、環境音を映像と同時に作れるようにした、最初の主要モデルです。いまの3.1は品質別に3段階あって、いちばん上といちばん安いもので10倍以上のお値段の差があります。音声が要らないのでしたら、Liteが動画全体でも最安クラスです。
2026年6月30日には、新しい系統のGemini Omni Flashも登場しました。文章・画像・動画を1つのモデルで扱うものですが、使った分だけ払う場合のお値段がまだ公表されていないので、お仕事での見積もりがしづらい状態が続いています。
2026年7月31日の公開です。4種類の入力を1つのモデルで理解する設計で、参考として画像9枚・動画3本・音声3本まで渡せます。2K・24fpsで5〜15秒、ステレオ音声も同時に作ります。
解像度は実質2Kのみです。安い768pという区分が価格表にはあるのですが、お申し込み制になっていて、実際にはAPIから指定できず、2Kのお値段で課金されてしまいます。価格表だけを見て安いと判断されないよう、お気をつけください。
2026年2月4日に3.0が登場しました。4K・60fps・15秒を一度に出せて、多言語の口の動きにも合わせられます。6月中旬には高速版のTurboが追加されました。お値段はポイント制で、音声の有無や解像度によって消費が変わります。
AI動画がまだ数秒しか作れなかった頃から、映像制作の現場に入っていた会社です。品質の競争では中国勢に抜かれつつありますが、作り手が細かく制御できる作りで支持が続いています。
Dream Machineという名前で知られています。720pと1080pで単価が4倍近く変わりますので、下書きは720p、仕上げだけ1080pという使い方が向いています。
OpenAIのSora 2は終了しました。アプリとWebは2026年4月26日、開発者向けのAPIも9月24日で終わります。(以前は「3月24日に終了」と書いていましたが、それはお知らせが出た日でした。訂正します。)一時期この分野の代名詞のように言われていましたが、いまは使えません。動画生成の勢力図が、ByteDance・Google・Alibabaへ移る転機になりました。
書いた文章を読み上げさせたり、声そのものを作ったりする分野です。ナレーション、オーディオブック、吹き替え、ゲームのセリフなどに使われています。2026年からは「読み上げる」だけでなく「話し相手になる」ものが増えてきました。
読み上げさせたいなら ElevenLabs、話し相手にしたいなら GPT Live。この2つは目的がまったく別ものですので、やりたいことのほうから選んでいただくのが早いと思います。
2026年7月8日にChatGPTのアプリで使えるようになり、2026年9月10日から、ご自分のサービスに組み込む形でも使えるようになりました。
いちばんの違いは「聞きながら話せる」ところです。これまでの音声AIは、こちらが話し終わるのを待ってから返してくる作りでしたので、かぶせて話すと止まってしまいました。GPT Live は話している最中でも聞いていますので、「あ、そうじゃなくて」と割り込んでも会話が続きます。返事までの間も、1.41秒から0.798秒へ短くなりました。
ChatGPTの無料プランでも軽い版(mini)が使えて、Go・Plus・Proでは通常版になります。
ご自分のサービスに組み込む場合は、料金の読み方に注意が要ります。表に出ている1分5セントは「聞いて話す部分」だけのお値段で、実際に考える部分は別のAIが担当し、そちらのぶんが別料金になります。10分お話しすると、軽いAIと組み合わせて80円ほど、賢いAIと組み合わせて140円ほど、というのが目安です。加えて、黙っている時間も同じように課金されます。
もうひとつ。公開されている12種類の声は、英語圏とポルトガル語・フィリピン系のもので、日本語の声は一覧に載っていません。日本語でお使いになる前提でしたら、ここは実際に試してご確認いただいたほうが安全だと思います。
ポーランド出身の幼なじみ2人が2022年に始めて、4年で評価額110億ドルまで来た会社です。2026年2月には5億ドルを調達しています。
読み上げと声を似せる機能が特に評価されていて、オーディオブック、吹き替え、ゲーム、動画制作の現場で広く使われています。速さ重視のものと品質重視のものがあって、単価は倍ほど違います。
速さ重視のTurboと、品質重視のHDの2段構えです。単体で見ればElevenLabsと同じくらいの価格帯ですが、MiniMaxは1つの契約で文章・画像・動画・音声がまとめて使えますので、いろいろ試したい場合には選ぶ理由が出てきます。
音楽だけは事情が変わりました。2026年8月20日から、音楽生成と歌詞生成のAPIは新規のお申し込みを受け付けていません。それ以前から使っている方は続けられますが、これから始める場合は MiniMax Audio というアプリを使うか、公開されているモデルをご自分の環境で動かす形になります。
どちらも本体のサービスに含まれる形で提供されています。専門のElevenLabsと比べると、声の表現力では一歩譲る場面もありますが、すでに文章生成でご契約があれば、追加の契約なしにお使いいただけます。
Googleは2026年8月26日に、文字起こしに特化したGemini 3.5 Transcribeも出していて、音声まわりの整備が進んでいます。
さらに9月15日には、話し相手になる音声モデル「Gemini 3.8 Live」が出ました。GPT Live と同じように、声で話しかけて声で返してもらう使い方ができます。日本語を含む97言語に対応していると紹介されていて、お値段も、聞く分と話す分を合わせて1分あたり3〜4円ほどと、かなり安く出ています。ただ、日本語対応の情報は紹介記事からのもので、Googleの公式な資料では確認できていません。実際にお試しになってから決められるのが安心です。
Googleの読み上げは声の質によって4段階のお値段があって、いちばん上といちばん下で40倍ほど違います。下の段には月400万文字までの無料枠がありますので、量が多くなければ費用をかけずに始められます。
歌や伴奏を、まるごと作ってしまう分野です。他の分野と少し違うのは、学習に使ったデータの権利をめぐる裁判が続いているところで、お仕事で使われる場合には条件のご確認が必要になります。
質を取るなら Suno、お仕事で安心して使いたいなら ElevenMusic。後者は学習データを正規にライセンスしていると明記しています。
2026年2月の時点で有料の利用者がおよそ200万人。ポップ、ロック、電子音楽、アンビエントと、幅広いジャンルで出来上がりの評価が高いです。
この分野は提供のしかた自体が動いています。MiniMaxは2026年8月20日に音楽APIの新規受付をやめ、アプリか公開モデルへ切り替えました。お仕事で使う前提なら、料金だけでなくこれから先も申し込めるかどうかもご確認ください。
一方で学習データをめぐる裁判が続いていて、お仕事で使うときの条件が固まっていません。ここは、ご自身で確認したうえでご判断いただくところかなと思います。公式のAPIは提供されておらず、外部の業者さん経由での利用になります。
音声で地位を築いたElevenLabsが2025年8月に音楽へ参入して、2026年4月1日に単体のアプリを出しました。
違いは品質よりも権利のはっきりしていることで、音楽のライセンス管理会社から100%ライセンスを受けたデータで学習していると明記しています。SunoやUdioが抱えている権利の問題を避けていますので、お仕事で使う前提でしたら有力な選択肢になると思います。
Sunoと並んで、出来上がりの評価が高いサービスです。ただ同じように学習データの裁判を抱えていて、お仕事で使うときの条件は流動的です。使った分だけ払うAPIはなく、月額のご契約のみになります。
Google製の音楽モデルです。1曲ずつ作る通常版に加えて、演奏を途切れずに流し続けるリアルタイム版があります。配信の裏でBGMを鳴らし続ける、といった使い方ができます。