TERM PRIMER
先に知っておく言葉
イト
フィジカルAIって、会話AIをロボットの体に入れたもの?
ユイ
言葉で頼めても、箱を置き終えたかどうかは何で確かめるんだろう
マコト
現実では重さも摩擦も、人が通る可能性も計画に入るね
ピコ
AI運行局から作業床まで、判断と観測の輪を追おう
フィジカルAIとは、カメラや力センサーなどで現実世界を観測し、目的に合わせて行動を選び、ロボットや機械を通じて物理世界へ働きかけるAIシステムです。画面の中で文章や画像を返すだけでなく、移動する、つかむ、置く、停止するといった行動が環境を変えます。
調べている人が最初に分けたいのは、自然な指示を理解する能力と、現実の作業を安全に完了する能力です。前者が高くても、対象の位置、力加減、衝突、完了条件を扱えなければ後者は成立しません。ラボの作業床を歩きながら、体のあるAIに必要な部品を見ていきます。
「机を片付ける」という指示だけでは完了も副作用も決められないことを、物語第106話「終わったことが分からないロボット」で確かめられます。
フィジカルAIとは一言で
「見て、考えて、動き、動いた後をもう一度見るAI」です。AIモデル単体ではなく、センサー、計算機、行動計画、制御装置、アクチュエーター、安全機構をつないだシステム全体を指します。
AI運行局の判断を、目と手足を持つ作業機へつなぐたとえを置くと分かりやすくなります。運行局が「青い箱を棚へ」と決め、カメラが場所を測り、腕が動き、置いた後に再び棚を見ます。ただし実際のロボットは、言葉の意味だけでなく、座標、速度、力、関節角、時間といった数値を連続的に扱います。
AIエージェントとは?で見た目標・行動・観測の循環が土台ですが、フィジカルAIでは一回の誤操作が物、人、設備へ直接影響する点が大きく違います。
知覚から行動確認までの役割
ロボットが机の上のコップを別の台へ移す場面を、七つの役割に分けます。
- 知覚: カメラ、距離、力などのセンサー値を受け取る
- 状態推定: コップ、机、人、ロボット自身の位置や状態を推定する
- 目標解釈: どのコップをどこへ移せば完了か定める
- 行動計画: 近づき方、つかみ方、運び方、置き方を組み立てる
- 制御: 関節や車輪へ短い間隔で指令を送り、ずれを修正する
- 安全監視: 人の接近、過大な力、立入禁止範囲などを検出する
- 完了確認: 手を離した後のコップの位置と安定を観測する
最初の計画通りに一気に動くのではありません。コップが想定より重い、進路へ人が入る、置いた後に傾くといった変化に応じ、速度を落とす、持ち直す、停止する、人へ知らせるなどの分岐を選びます。
生成AIや普通のロボットとの違い
生成AIは文章や画像などの内容を作る能力を指します。フィジカルAIは、その能力を利用することがあっても、現実の状態変化と制御を主題にします。
| 観点 | 生成AI中心 | 従来型の固定ロボット | フィジカルAI中心 |
|---|---|---|---|
| 主な入力 | 文章・画像 | 決められた信号 | 言葉・映像・力・位置など |
| 主な出力 | 内容 | 固定された動作 | 状況に応じた行動 |
| 環境 | 画面・データ | 整備された作業領域 | 変化のある現実環境も対象 |
| 再計画 | 生成し直す | 条件分岐が中心 | 観測から経路や動作を更新 |
| 失敗の影響 | 誤情報など | 停止・不良品など | 人身・物損を含む可能性 |
固定ロボットが古い、フィジカルAIが新しくて常に上、という関係ではありません。同じ場所で同じ部品を扱う工場では、動作範囲を厳密に固定した制御の方が予測しやすい場合があります。変化に対応する範囲と、安全に検証できる範囲を合わせます。
現実で使われる場面
研究や実装の対象には、次のような場面があります。
- 倉庫で異なる形の荷物を仕分ける
- 家庭で散らかった物の位置を認識する
- 工場で部品の状態を見て作業手順を変える
- 移動ロボットが人や障害物を避ける
- ドローンが地形や設備を点検する
- 車両が周辺状況を認識して運転を支援する
- 手術やリハビリを補助する装置を制御する
- 仮想環境で動作を練習し、実機へ移す
場面ごとに許される失敗や応答時間が違います。映像の中で経路を提案することと、重い機械を人の近くで動かすことを同じ評価表に入れません。
端末近くで低遅延の推論を行う構成はオンデバイスAIとは?とつながります。ただし端末内で動くことは安全性の十分条件ではなく、停止回路や監視などAIモデルと独立した仕組みも要ります。
完了判定と安全の注意点
「箱を棚に置く」という指示は、人には簡単に見えても終了条件が曖昧です。棚のどの範囲か、向きは問うか、倒れていないか、手を離した後も安定しているかを観測可能な条件にします。
安全設計では、少なくとも次を分けます。
- モデルが提案する行動
- 実行してよい範囲を制限する規則
- 速度・力・距離を監視する制御
- 異常時に止める独立した仕組み
- 人が承認する作業と自動でよい作業
- 実行ログと再現可能な試験
- 失敗した時に安全側へ戻る動作
映像上では成功しても、対象をつかめていない、別の物を動かした、置いた後に倒れた可能性があります。行動開始の検出と作業完了の検証を別に置くことが大切です。「動いた」ことを「終わった」ことと取り違えません。
学習とシミュレーションの仕組み
実機だけで大量の失敗を経験させると、時間、費用、機器の損傷、安全面の負担が大きくなります。そこで、人の操作記録、実機データ、シミュレーション、生成した場面などを組み合わせて学習・評価します。
仮想工房では、物体の配置や照明を変えながら多数の試行を作れます。しかし仮想環境と現実には差があります。摩擦、素材のたわみ、センサーのノイズ、予期しない人の行動まで正確には再現できません。シミュレーションで高得点でも、実機で段階的に確認する工程が残ります。
行動した後の世界を予測し、危険な候補を実行前に比べる考え方はワールドモデルとも結び付きます。それでも予測は近似なので、現実のセンサーから返った情報で更新し続けます。
世界を予測する次のルート
「右へ曲がったら何が見えるか」「押したら物体がどう動くか」を内部で予測する仕組みはワールドモデルとは?で詳しく扱います。見栄えのよい映像生成と、行動の結果を計画に使える予測を分けるのがポイントです。
現実設備とコンピューター上の対応物を更新し続ける考え方とも接点があります。一方、目標、権限、ツール、停止条件という上位の設計を読み直すならAIエージェントとは?へ戻ります。フィジカルAIの記事は「動くAIの基本構成」を所有し、普及速度や将来の分岐は未来観測所で更新します。
作業完了の確認クイズとワーク
ワーク: 「机の赤い箱を棚に置く」を、観測できる開始条件、許される動作、停止条件、完了条件、失敗時の戻り方に分けてください。特に「腕が動いた」と「箱が安定して置かれた」を別欄にします。
Q1. 会話AIへロボットの操作機能を付ければフィジカルAIは完成?
いいえ。知覚、座標と力の制御、安全監視、実行後の観測など、物理世界に固有の仕組みが必要です。
Q2. シミュレーションで成功すれば実機でも同じ?
環境差があります。実機では小さな範囲、低い速度、監視付きの条件から段階的に検証します。
Q3. 高い自律性ほど良い?
作業と危険度によります。固定手順の方が検証しやすい領域もあり、人の確認や独立した停止装置を含めて設計します。
LAB WHITEBOARD
自分の言葉で説明してみよう
「知覚、状態推定、計画、制御、実行後の観測、安全確認の循環としてフィジカルAIを説明できるようになる。」を、いまの自分の言葉で一文にしてみてください。途中の説明でも大丈夫です。




