仕組みを知る

ワールドモデルとは?AIが世界の変化を予測する仕組み

ワールドモデルは、現在の観測と行動から次に起こり得る状態を内部で予測し、計画やシミュレーションに使うモデルです。動画生成との違い、学習の流れ、限界を整理します。

ワールドモデルとは?AIが世界の変化を予測する仕組み

30秒でわかる答え

ワールドモデルとは?

現在の観測と行動を受け取り、次に起こり得る状態を内部表現の上で予測するモデルの総称。 ワールドモデルは、現在の観測と行動から次に起こり得る状態を内部で予測し、計画やシミュレーションに使うモデルです。

一文定義
現在の観測と行動を受け取り、次に起こり得る状態を内部表現の上で予測するモデルの総称

TERM PRIMER

先に知っておく言葉

ワールドモデル
現在の観測や行動から、次に起こり得る状態を内部表現の上で予測するモデルです。
潜在表現
入力の特徴や関係を、モデル内部で扱いやすい数値の並びへ圧縮した表現です。
予測
現在までの情報や学習した関係を使い、まだ確定していない結果や状態の見込みを出すことです。
シミュレーション
現実の対象や変化を模型や計算で再現し、条件を変えたときの結果を試す方法です。

イト

ワールドモデルなら、まだ歩いていない角の先まで本当に知っているの?

ユイ

きれいな未来映像を作れることと、変化を正しく予測することは同じかな

マコト

行動を変えた時の結果まで比べられるかが計画には重要だね

ピコ

未来観測所の予測工房で、入力から候補を選ぶ流れを見よう

ワールドモデルとは、現在の観測と行動を受け取り、次に起こり得る状態を内部表現の上で予測するモデルの総称です。ロボット、ゲームAI、動画生成、計画システムなどで使われる言葉ですが、研究ごとに対象と構成は異なります。

知りたい疑問は「未来の絵を作れるか」だけではありません。「右へ動く」「箱を押す」といった行動を変えた時、次の状態がどう変わると予測するか、その予測を選択に使えるかが中心です。もっともらしい映像と、現実で役立つ予測を分けながら、仕組みを整理します。モデルを作る学習と、現在の入力から未来候補を出す推論の違いは、先にAIの学習と推論は何が違う?で確認できます。

予測された街と現実の街のずれは、物語第107話「歩くたびに作られる街」で具体的に追えます。

ワールドモデルの仕組みを一文で

現在の世界をそのまま記憶するのではなく、観測から必要な特徴を内部状態へ写し、行動を加えた次の内部状態や観測を予測します。内部状態は画像の全画素とは限らず、物体の位置、動き、関係などを圧縮した表現になる場合があります。

予測工房のたとえでは、現在の街を小さなジオラマへ写し、「右へ曲がる」「扉を開く」という行動札を入れると、次のジオラマ候補が組み上がります。実際にはニューラルネットなどがデータから規則性を学び、確率的な複数の未来を扱うこともあります。

観測から次状態までの流れ

移動ロボットが廊下を進む場面なら、次の循環になります。

  1. カメラや距離センサーから現在の観測を得る
  2. 観測をモデルが扱う内部表現に変換する
  3. 進む、止まる、曲がるなどの行動候補を用意する
  4. 各行動を選んだ後の内部状態を予測する
  5. 衝突、目的地への距離、時間などを評価する
  6. 条件に合う行動を選ぶ
  7. 現実で一部または全部を実行する
  8. 新しい観測を得て予測との差を確認する
  9. 内部状態と次の計画を更新する

一度に長い未来を予測すると、小さなずれが積み重なります。そのため短い予測と現実の再観測を交互に行う設計があります。フィジカルAIとは?の知覚・計画・制御の輪では、ワールドモデルが行動前の試走を担当できるイメージです。

内部状態は何の役割を持つ?

センサーから届くデータには、計画に不要な細部も含まれます。たとえば廊下を曲がれるか判断する時、壁紙の細かな模様より、通路の幅、人の位置、扉の向きが重要です。モデルは観測から、次の予測に役立つ特徴を取り出します。

内部状態に求められる性質は用途で変わります。

  • 物体や人の位置関係を保てる
  • 時間とともに動く対象を追える
  • 行動によって変わる部分を表せる
  • 観測できない部分の不確かさを持てる
  • 長い計画に必要な情報を失いにくい
  • 新しい観測で誤りを修正できる

圧縮すれば計算を軽くできますが、重要な特徴まで落とすと予測が崩れます。反対に細部をすべて保つと計算量が増えます。何を覚え、何を捨てるかがモデル設計の要点です。

さらに、内部状態が人に読みやすいとは限りません。物体名や座標が明示されず、多数の数値の関係として保持される場合があります。その表現が計画に役立つことと、人が理由を追跡できることも別の評価軸です。安全に関わる用途では、最終行動だけでなく、どの観測に反応し、どの制約で候補を除いたかを別のログに残します。

行動候補を比べる計画の役割

予測は、選択へつないで初めて計画に役立ちます。ロボットが箱へ近づく時、正面から進む、横へ回る、いったん止まるという候補ごとに、衝突の可能性や到達時間を予測します。ゲームAIなら、移動後の得点、危険、残り資源を比べます。

ここでは二つの評価を分けます。

  1. 予測の整合性: 次の状態が観測データとどれほど合うか
  2. 目的への適合: 予測された状態が安全性や目標をどれほど満たすか

予測が正しくても、目的関数が間違っていれば望まない行動を選びます。最短時間だけを得点にすると、人の近くを速く通る危険な経路が高評価になるかもしれません。モデル、目的、制約、現実の監視を別々に検証します。

動画生成との違いと共通点

世界モデルと動画生成モデルは、過去の画像から続きの画像を作る点で重なる場合があります。生成された環境を人が操作できる研究もあり、境界は一枚の線では引けません。それでも用途を考える時は次の違いが役立ちます。

観点映像生成を主目的にする場合計画用の世界モデル
主な評価見た目、動き、指示との一致行動後の状態、計画への有用性
行動入力文章やカメラ移動の場合もあるエージェントが選べる操作
重要な性質視覚的一貫性因果に沿った変化と不確かさ
失敗の影響不自然な映像誤った行動選択につながる

高精細で自然な映像は重要な成果でも、物体の重さ、保存則、見えない場所の状態を正確に扱えている証明にはなりません。見た目の評価と、制御課題での予測精度を分けます。

誤解しやすい限界と確認点

ワールドモデルは「世界そのものを理解した完全な小宇宙」ではありません。観測データと学習条件の範囲で作られた近似です。

確認したい限界には次があります。

  • 学習例に少ない状況で予測が崩れる
  • 長い時間を生成すると誤差が積み重なる
  • 見えない原因を見た目だけから誤って推定する
  • 複数の未来があるのに一つへ決め打ちする
  • 行動と偶然の相関を因果関係と取り違える
  • 現実の安全条件を映像上の成功だけで判定する
  • 予測の不確かさを利用者へ示せない

ラボでは、同じ開始場面に複数の行動札を入れ、予測がどこで分岐するかを記録します。予測と現実がずれた時に止まり、再観測できる設計が欠かせません。

科学と行動へ広げるルート

ワールドモデルはロボットの行動だけでなく、複雑な系の候補を計算上で試す発想とも接点があります。ただし科学的な主張には実験、測定、再現、反証が要ります。この境界はAIによる科学発見とは?へ進むと整理できます。

そもそも学習時にモデルを作る工程と、作ったモデルで次状態を出す推論の工程はAIの学習と推論は何が違う?で読み直せます。この記事はワールドモデルの基本原理を担い、どの製品がどこまで実現したかは未来観測所で継続更新します。

予測工房の確認クイズとワーク

ワーク: 「廊下の角を右へ曲がる」場面を、現在の観測、内部状態、行動候補、予測する次状態、評価条件、現実での再観測に分けます。不確かな情報には「複数候補」と書いてください。

Q1. 自然な未来映像なら物理法則も理解している?

見た目だけでは判断できません。行動を変えた時の予測、長期の整合性、現実データとの比較など、用途に合う試験が必要です。

Q2. 世界全体を一つのモデルに入れる?

対象と目的を限定する場合が多くあります。運転、ゲーム、ロボット操作などで必要な状態と行動は異なります。

Q3. 予測があれば現実で試さなくてよい?

いいえ。予測は候補の絞り込みや危険の低減に使えますが、現実の測定と安全確認に置き換わるものではありません。

LAB WHITEBOARD

自分の言葉で説明してみよう

「観測、内部状態、行動、次状態予測、計画の流れを説明し、生成映像を現実理解の証明と取り違えないようになる。」を、いまの自分の言葉で一文にしてみてください。途中の説明でも大丈夫です。