TERM PRIMER
先に知っておく言葉
イト
ワールドモデルなら、まだ歩いていない角の先まで本当に知っているの?
ユイ
きれいな未来映像を作れることと、変化を正しく予測することは同じかな
マコト
行動を変えた時の結果まで比べられるかが計画には重要だね
ピコ
未来観測所の予測工房で、入力から候補を選ぶ流れを見よう
ワールドモデルとは、現在の観測と行動を受け取り、次に起こり得る状態を内部表現の上で予測するモデルの総称です。ロボット、ゲームAI、動画生成、計画システムなどで使われる言葉ですが、研究ごとに対象と構成は異なります。
知りたい疑問は「未来の絵を作れるか」だけではありません。「右へ動く」「箱を押す」といった行動を変えた時、次の状態がどう変わると予測するか、その予測を選択に使えるかが中心です。もっともらしい映像と、現実で役立つ予測を分けながら、仕組みを整理します。モデルを作る学習と、現在の入力から未来候補を出す推論の違いは、先にAIの学習と推論は何が違う?で確認できます。
予測された街と現実の街のずれは、物語第107話「歩くたびに作られる街」で具体的に追えます。
ワールドモデルの仕組みを一文で
現在の世界をそのまま記憶するのではなく、観測から必要な特徴を内部状態へ写し、行動を加えた次の内部状態や観測を予測します。内部状態は画像の全画素とは限らず、物体の位置、動き、関係などを圧縮した表現になる場合があります。
予測工房のたとえでは、現在の街を小さなジオラマへ写し、「右へ曲がる」「扉を開く」という行動札を入れると、次のジオラマ候補が組み上がります。実際にはニューラルネットなどがデータから規則性を学び、確率的な複数の未来を扱うこともあります。
観測から次状態までの流れ
移動ロボットが廊下を進む場面なら、次の循環になります。
- カメラや距離センサーから現在の観測を得る
- 観測をモデルが扱う内部表現に変換する
- 進む、止まる、曲がるなどの行動候補を用意する
- 各行動を選んだ後の内部状態を予測する
- 衝突、目的地への距離、時間などを評価する
- 条件に合う行動を選ぶ
- 現実で一部または全部を実行する
- 新しい観測を得て予測との差を確認する
- 内部状態と次の計画を更新する
一度に長い未来を予測すると、小さなずれが積み重なります。そのため短い予測と現実の再観測を交互に行う設計があります。フィジカルAIとは?の知覚・計画・制御の輪では、ワールドモデルが行動前の試走を担当できるイメージです。
内部状態は何の役割を持つ?
センサーから届くデータには、計画に不要な細部も含まれます。たとえば廊下を曲がれるか判断する時、壁紙の細かな模様より、通路の幅、人の位置、扉の向きが重要です。モデルは観測から、次の予測に役立つ特徴を取り出します。
内部状態に求められる性質は用途で変わります。
- 物体や人の位置関係を保てる
- 時間とともに動く対象を追える
- 行動によって変わる部分を表せる
- 観測できない部分の不確かさを持てる
- 長い計画に必要な情報を失いにくい
- 新しい観測で誤りを修正できる
圧縮すれば計算を軽くできますが、重要な特徴まで落とすと予測が崩れます。反対に細部をすべて保つと計算量が増えます。何を覚え、何を捨てるかがモデル設計の要点です。
さらに、内部状態が人に読みやすいとは限りません。物体名や座標が明示されず、多数の数値の関係として保持される場合があります。その表現が計画に役立つことと、人が理由を追跡できることも別の評価軸です。安全に関わる用途では、最終行動だけでなく、どの観測に反応し、どの制約で候補を除いたかを別のログに残します。
行動候補を比べる計画の役割
予測は、選択へつないで初めて計画に役立ちます。ロボットが箱へ近づく時、正面から進む、横へ回る、いったん止まるという候補ごとに、衝突の可能性や到達時間を予測します。ゲームAIなら、移動後の得点、危険、残り資源を比べます。
ここでは二つの評価を分けます。
- 予測の整合性: 次の状態が観測データとどれほど合うか
- 目的への適合: 予測された状態が安全性や目標をどれほど満たすか
予測が正しくても、目的関数が間違っていれば望まない行動を選びます。最短時間だけを得点にすると、人の近くを速く通る危険な経路が高評価になるかもしれません。モデル、目的、制約、現実の監視を別々に検証します。
動画生成との違いと共通点
世界モデルと動画生成モデルは、過去の画像から続きの画像を作る点で重なる場合があります。生成された環境を人が操作できる研究もあり、境界は一枚の線では引けません。それでも用途を考える時は次の違いが役立ちます。
| 観点 | 映像生成を主目的にする場合 | 計画用の世界モデル |
|---|---|---|
| 主な評価 | 見た目、動き、指示との一致 | 行動後の状態、計画への有用性 |
| 行動入力 | 文章やカメラ移動の場合もある | エージェントが選べる操作 |
| 重要な性質 | 視覚的一貫性 | 因果に沿った変化と不確かさ |
| 失敗の影響 | 不自然な映像 | 誤った行動選択につながる |
高精細で自然な映像は重要な成果でも、物体の重さ、保存則、見えない場所の状態を正確に扱えている証明にはなりません。見た目の評価と、制御課題での予測精度を分けます。
誤解しやすい限界と確認点
ワールドモデルは「世界そのものを理解した完全な小宇宙」ではありません。観測データと学習条件の範囲で作られた近似です。
確認したい限界には次があります。
- 学習例に少ない状況で予測が崩れる
- 長い時間を生成すると誤差が積み重なる
- 見えない原因を見た目だけから誤って推定する
- 複数の未来があるのに一つへ決め打ちする
- 行動と偶然の相関を因果関係と取り違える
- 現実の安全条件を映像上の成功だけで判定する
- 予測の不確かさを利用者へ示せない
ラボでは、同じ開始場面に複数の行動札を入れ、予測がどこで分岐するかを記録します。予測と現実がずれた時に止まり、再観測できる設計が欠かせません。
科学と行動へ広げるルート
ワールドモデルはロボットの行動だけでなく、複雑な系の候補を計算上で試す発想とも接点があります。ただし科学的な主張には実験、測定、再現、反証が要ります。この境界はAIによる科学発見とは?へ進むと整理できます。
そもそも学習時にモデルを作る工程と、作ったモデルで次状態を出す推論の工程はAIの学習と推論は何が違う?で読み直せます。この記事はワールドモデルの基本原理を担い、どの製品がどこまで実現したかは未来観測所で継続更新します。
予測工房の確認クイズとワーク
ワーク: 「廊下の角を右へ曲がる」場面を、現在の観測、内部状態、行動候補、予測する次状態、評価条件、現実での再観測に分けます。不確かな情報には「複数候補」と書いてください。
Q1. 自然な未来映像なら物理法則も理解している?
見た目だけでは判断できません。行動を変えた時の予測、長期の整合性、現実データとの比較など、用途に合う試験が必要です。
Q2. 世界全体を一つのモデルに入れる?
対象と目的を限定する場合が多くあります。運転、ゲーム、ロボット操作などで必要な状態と行動は異なります。
Q3. 予測があれば現実で試さなくてよい?
いいえ。予測は候補の絞り込みや危険の低減に使えますが、現実の測定と安全確認に置き換わるものではありません。
LAB WHITEBOARD
自分の言葉で説明してみよう
「観測、内部状態、行動、次状態予測、計画の流れを説明し、生成映像を現実理解の証明と取り違えないようになる。」を、いまの自分の言葉で一文にしてみてください。途中の説明でも大丈夫です。




