第II部 · 大規模モデルの時代

世界モデル(World Models)とマルチモーダル

第5章読了目安 14分更新:2026年9月

5.1テキストの予測だけでは足りない:世界を理解する

そこから、2025年以降の研究界を揺さぶっている1つの考えが生まれた。より汎用的な知能に到達するには、真の世界モデル、すなわち現実がどのように機能し変化していくかについての内部表現を備えたシステムが必要だ、という考えである。この見方に立てば、テキストは現実の貧弱で不完全な影にすぎない。研究者のヤン・ルカンはこれを持論として掲げてきた。彼によれば、テキストをひたすら大量に飲み込んでも知能には到達できず、動画や世界との相互作用といった、より豊かな信号から学ぶことが必要なのである。

5.2マルチモーダル:テキスト、画像、音声、動画

5.3世界モデル:定義と意義

単なる動画生成器と混同しないよう注意が必要である。その違いは微妙だが、決定的に重要である。

図5.1. 動画生成器と世界モデルの対比。前者は固定されたクリップを生成する。後者はインタラクティブであり、その中で行動することができ、フレームごとに一貫した応答が返ってくる。行動とその結果というこのループこそが、世界モデルをエージェントやロボットの訓練の場にしている。

5.4競合するアプローチ(2026年半ばの概観)

表 5.1. 2026年における「世界モデル」の4つの陣営。

2025年から2026年にかけての具体的な節目をいくつか挙げる。

  • 「世界のシミュレーション」としての動画生成。 OpenAIは2024年の時点で、Soraを掲げて、十分な量の動画で学習したモデルはやがて物理を暗黙のうちに学び、残りは規模が埋めてくれるという主張を打ち出した。OpenAIはその後、この製品を市場から引き上げた。終了は2026年3月に発表され、2段階で進められる。2026年4月にアプリが閉鎖され、APIの停止は2026年9月に予定されている。Google(Veo)、中国のKuaishou(Kling)とByteDance(Seedance、2025年に複数の動画生成ランキングで首位)、そしてRunwayも、近い路線を進んでいる。議論に決着はついていない。Soraは一部の相互作用(割れるコップ、かじられる食べ物)をうまくモデル化できず、複数の研究は、Soraは「世界モデルの萌芽」を示してはいたが、完全な世界モデルではなかったと結論づけた。
  • 空間知能。 フェイフェイ・リー(ImageNetの生みの親であり、AIの「ゴッドマザー」と呼ばれる)が創業したWorld Labsは、2025年末に製品Marbleをリリースした。テキストまたは画像から、永続的で編集可能かつエクスポート可能な3D世界を生成できる。2026年9月1日、World LabsはAtlasを発表した。3Dシーンを生成、再構成、シミュレーションするマルチモーダルな世界モデルであり(1枚の画像から最長1分の動画を生成し、点群やガウシアン「スプラット」の形式でも出力する)、とりわけロボティクスに向けた現実からシミュレーションへの移行を狙っている。2026年9月末時点で、Atlasはパートナー向けに早期アクセスとして提供されており、一般提供はされていない。リーにとって、「空間知能はAIの次のフロンティア」である。
  • インタラクティブな生成モデル。 Google DeepMindはGenie 3(2025年8月)を公開した。探索可能な3D世界を毎秒24フレームでリアルタイムに生成できるモデルであり、2026年からは「Project Genie」を通じて一部の加入者に開放されている。NVIDIAは、プラットフォームCosmos(2026年初頭で200万回超のダウンロード)により、ロボットや自動運転車をシミュレーション上で学習させるための「物理を考慮した」世界を提供している。
  • 潜在アプローチ(JEPA)。 これはヤン・ルカンの賭けである。ピクセルを予測するのではなく、次に何が起こるかを抽象空間の中で予測する。そのほうがはるかに効率的で、認知にも近いというのである。LLMは「頭打ちになる」と確信するルカンは、2025年末にMetaを去り、パリでAMI Labs(Advanced Machine Intelligence)を創業し、この構想のもとに10億ドル超を調達した。AMI Labsは自らの信念を次のように要約する。真の知能は言語の中ではなく、世界の中で始まる。同社の世界モデルは、センサーデータから抽象的な表現を学習し、その空間の中で予測を行う。行動で条件付けることで、エージェントは自らの行動の結果を予測し、ガードレールのもとで計画を立てられるようになる。掲げる目標は、永続的な記憶を備え、推論でき、制御可能で安全なシステムを、信頼性が最優先される分野(産業制御、ロボティクス、コネクテッドデバイス、医療)に向けて実現することである。同社は設立当初から、パリ、ニューヨーク、モントリオール、シンガポールに拠点を分散させたフロンティア研究所である。一方、Metaは独自にV-JEPAモデルの開発を続けている。

その意義は次節で述べるものと重なるが、舞台はソフトウェアに移っている。実環境は遅く、希少で、コストがかかり、リスクも伴ううえ、エージェントが対処できなければならないエッジケースを思いのままに注入することもできない。これに対し、忠実で制御可能かつ再実行可能なシミュレーターがあれば、学習用の軌跡を無制限に生成でき(合成データの一種、第4章)、強化学習を低コストかつ安全に適用でき、エージェントを実際のシステムに投入する前にテストできる。Qwenは、このようにシミュレーションで学習したエージェントが実環境で学習したエージェントを上回りうること、そして環境に関するこの知識が、特別な再学習なしにエージェントのタスクへ転移することさえ報告している。

ただし、2つの留保が必要である。これらの結果を測定したベンチマーク(AgentWorldBench)は、開発チーム自身が設計し公開したものであり、そこで示された優位の幅は慎重に受け止めるべきである。そしてこれは、後述するシミュレーションと現実の隔たりと同じ落とし穴でもある。シミュレーターの中では優秀なエージェントも、現実世界の乱雑さを前にすると失敗しうる。世界モデルの価値は、それを育てたデータの質を決して超えないからである。

5.5なぜ2026年の大きな賭けの1つなのか

背景知識:仮想から現実へ(sim-to-real)。 世界モデルの主要な実用例はすでに存在する。エージェントやロボットをシミュレーション上で学習させることである。その利点は明らかである。仮想世界では、ロボットはリスクも摩耗も危険もなく、数百万回の試行を早送りで行える。現実世界での学習であれば、遅くコストもかかるところである。残るのは中心的な課題、すなわちシミュレーションと現実の隔たり(reality gap)である。完璧すぎるシミュレーターで学習した振る舞いは、現実世界の乱雑さ(摩擦、変化する照明、不完全なセンサー)を前にすると、しばしば失敗する。主な対策はドメインランダム化と呼ばれる。シミュレーションの無数のパラメーター(テクスチャ、照明、質量、摩擦)を意図的に変動させ、学習される方策を頑健にせざるをえないようにする。そうすれば、その方策にとって現実世界は、すでに出会ってきた数々の変種にもう1つ加わるものにすぎなくなる。これに加えて、合成データ(収集するのではなく生成した事例)の作成があり、実データが不足する場合のモデル学習にますます利用されている。これは、本章とロボティクス(第13章)とを結ぶ最も具体的な橋である。


要点(第5章)

  • 最先端のモデルはマルチモーダルである。テキスト、画像、音声、動画を共通の表現空間で処理する(すべてがトークンになる)。
  • 世界モデルとは、行動から次の状態を予測する内部シミュレーターである。固定されたクリップを生成する動画生成器とは異なり、インタラクティブである。
  • 2026年には4つの陣営が競い合っている。動画生成(Veo、Kling、Seedance)、空間/3D(World Labs、Marble)、インタラクティブ生成(Genie 3、Cosmos)、潜在/JEPA(V-JEPA、ルカンのAMI Labs)である。
  • 2026年に登場した変種である言語的世界モデル(例:Qwen-AgentWorld)は、物理世界ではなくエージェントのデジタル環境(ターミナル、ウェブ、OSなど)をシミュレートし、エージェントをリスクなしに学習させテストできるようにする(第6章)。
  • 多くの人がそこに、身体性AIへの橋(ロボティクス)と、汎用知能へのありうる一段階を見ている。
  • 根本的な論点:規模だけで十分なのか、それとも物理に根ざした新しいアーキテクチャが必要なのか。

次章では、知覚とシミュレーションから行動へと進む。取り上げるのはAIエージェント、すなわち答えるだけにとどまらず、自ら行動するシステムである。