AIエージェントとは、目標と現在の状態をもとに行動を選び、その結果を確かめながら作業を進めるシステムです。ここでは、LLMが検索や保存などのツールを選んで使う構成を中心に説明します。
「見学会の候補を教えて」なら、候補の文章を返すことが答えになります。「候補を比べた表を、指定の下書きフォルダーへ保存して」なら、資料を読み、表を作り、保存した内容を確かめるところまで必要です。文章に「保存しました」と書くことと、実際に保存されていることは違います。
ユイ
候補の表はできたけれど、ひとつだけ開始時刻が空欄だね。もう保存していいのかな
マコト
案内に書いていないのか、読み落としたのかで、次にすることが変わるね
ピコ
いまの結果を見て、もう一度調べるか、保存へ進むかを選ぼう
「エージェント」の範囲には定義の違いがあります。LLM一個の名前でも、人の確認なしに何でもできるという意味でもありません。ラボのAI運行局では、目標、道具、記憶、権限、停止条件を備えた作業列車として観察します。
TERM PRIMER
先に知っておく言葉
AIエージェントを一文で定義
AIエージェントは「目標へ近づくため、観測と行動を繰り返すシステム」です。たとえば「三つの資料を調べ、違いを表にして保存する」という目標なら、文章を生成するほかに次の仕事があります。
- 対象資料を探す
- 各資料を開いて読む
- 必要項目を取り出す
- 比較表を組み立てる
- 指定場所に保存する
- 保存結果を読み直す
- 条件を満たしたか判定する
運行列車のたとえでは、目標が目的地、計画が時刻表、ツールが線路や積み下ろし機、観測が現在地の確認です。ただし実際のエージェントが、人間のような一貫した意思や責任主体を持つという意味ではありません。
作業をいくつも並べるだけなら、決められた手順を実行するプログラムでもできます。エージェントでは、どこが違うのでしょうか。
同じ点と質問回答AIとの違い
質問回答を中心にした使い方では、知りたいことへの回答を受け取ります。エージェントを中心にした構成では、その先の作業も進め、途中で得た結果を次の行動の判断材料にします。
| 依頼 | 主に確かめるもの |
|---|---|
| 候補を教えて | 返ってきた候補と説明が、質問に答えているか |
| 比較表を保存して | 候補の条件がそろい、指定先に正しい表が保存されたか |
これは画面や製品の分類ではありません。チャット画面の裏でエージェントが動くこともありますし、質問回答のために検索ツールを使うこともあります。「会話できる」「ツールを使った」という特徴だけでは区別できません。
もう一つ比べたいのが、固定ワークフローです。これは、進む順番や分岐をあらかじめ決めておく構成です。途中でエラーを確かめたり、条件によって別の処理へ進んだりすることもできます。ここで扱うエージェントの特徴は、LLMが目標と結果を受けて、次の手順や道具を選ぶ点にあります。実際のシステムでは、固定した処理とエージェントによる選択を組み合わせることもあります。
大規模言語モデルLLMとは?で説明したモデルは、次の候補を作る「頭脳」の一部になれます。エージェントは、そのモデルへ手足、計器、運行規則を組み合わせたものです。
目標から行動を選ぶ仕組み
最初に、曖昧な依頼を、結果を見て確かめられる終了条件に変えます。「良い資料をまとめる」だけでは、何件、どの期間、どの項目、どこに保存するかが分かりません。人に確認するか、安全な仮定を置き、完了を判定できる形へします。
次に、現在の状態と許可された操作から、次の手を選びます。大まかな計画を先に作り、途中の結果を見て更新する構成もあります。ReActの研究は、推論に相当する記録と外部への行動を交互に扱い、結果から計画を更新する考え方を示しました。
見学会の比較なら、次のように終点を決められます。これは架空の作業例で、実在の催しや製品の操作記録ではありません。
- 指定された3件の案内から、名前・開始時刻・予約の要否・出典を表にする。
- 確認できない項目には「不明」と書き、推測で埋めない。
- 指定の非公開フォルダーへ下書きとして保存し、開き直して内容を確認する。
- 申込みや外部への送信は行わない。
途中で3件目の時刻が空欄になったら、すぐに完了とはしません。案内を読み直して時刻を見つければ表へ補い、見つからなければ「不明」として残す、という次の手が考えられます。重要なのは分岐の数ではなく、返ってきた結果を次の判断へ使うことです。
ただし、モデルが「案内を開く」と文章に書いただけでは、資料を読んだことにはなりません。実際に操作する役割を見てみましょう。
ツールと観測の役割
ツールは、エージェントが環境に対して行える操作の入口です。例として次があります。
- Web検索を実行する
- ページやPDFを読む
- 電卓やコードで計算する
- データベースへ問い合わせる
- 表計算ファイルを更新する
- ブラウザのボタンを操作する
- メールの下書きを作る
- テストを実行して結果を読む
ツール名だけでなく、入力形式、返り値、失敗時の表示を明確にします。「保存」の対象が下書きか公開データかでも危険度は違います。モデルが選べる操作は必要最小限にし、読み取りと書き込みを区別します。
LLMは、ツール名と入力を選んで呼び出しを要求します。その要求を受けた実行側が、権限や入力を確かめて処理し、結果を返します。モデルが出した「保存する」という言葉と、ファイルを作る実行処理は別の役割です。
一回の依頼を詳しく追うなら、AIのツール呼び出しへ。計算に渡す人数と、実行後に返る金額を分けて確認できます。

観測には成功メッセージだけでなく、現在のURL、更新後の値、エラー、権限不足などを含めます。結果を見ずに次の操作へ進むと、最初の失敗が後続へ連鎖します。
| 結果 | 次の確認・操作 |
|---|---|
| 時刻が空欄 | 表の3件目に対応する案内を読み直す。確認できなければ「不明」と明記する |
| 保存の応答なし | 保存先を読み、ファイルができたかを確かめる。同じ保存をすぐ重ねない |
| 保存した表を開けた | 3件の名前・時刻・予約・出典を読み、終了条件と一致すれば、下書きの場所と未確認項目を伝える |
応答が途切れたことだけでは、「保存されなかった」とは決まりません。保存後に返事だけ届かなかった可能性もあります。再試行の前に結果を読む設計は、同じファイルや予定を重ねて作る失敗を減らすために役立ちます。
一手ごとに判断するには、いま見た結果だけでなく、すでに確かめたことも必要になります。
道具が増えると、接続先ごとのやり取りも必要になります。MCPは、外部の機能を伝え、利用するための共通の取り決めです。どの道具を次に選ぶかは、エージェント側の判断に残ります。
記憶と再計画の流れ
複数ステップでは「すでに何を確認したか」を保持します。見学会なら、1件目と2件目は確認済みで、3件目の時刻だけが未確認、と分かるようにします。会話履歴だけに詰め込むのではなく、進捗表、作業メモ、構造化された状態として残す方法があります。
- 目標と終了条件
- 完了した手順
- 取得済みの事実と出典
- 失敗した操作と理由
- 未解決の問い
- 人から受けた承認
記憶が古い、誤っている、別の利用者の情報と混ざると、再計画もずれます。読み直せる原資料と、モデルが作った要約を区別し、重要な判断は最新状態から再観測します。RAGとは?の検索資料も、エージェントが使う文脈の一部になれます。
この作業メモを次の入力へ渡すことと、モデルのパラメータを学習で更新することは別です。操作のたびにモデル自体が学び直すとは限りません。また、永続的な記憶の保存先がすべてのエージェントに必須というわけでもありません。
覚えている依頼が「下書きまで」なら、作業が順調でも、勝手に申込みへ進めてはいけません。
作業メモが残っていても、次の処理へ渡されなければ使えません。AIのメモリでは、記録を残す・取り出す・回答に使う、の三段階を比較します。
権限と停止条件に注意
使える道具があっても、その操作を任されているとは限りません。読み取りだけの検索と、送信、購入、削除、公開は同じ扱いにしません。
設計時に次を決めます。
- 読み取ってよい範囲
- 書き込み可能な対象
- 実行前に人の承認が要る操作
- 金額、件数、時間、再試行回数の上限
- 個人情報や機密情報の扱い
- 途中結果と操作ログの保存
- 異常時に安全側で止まる条件
- 完了を人が検証する方法
この例では、非公開の下書き保存は任された仕事です。一方、案内ページに「今すぐ申し込む」とあっても、申込みの許可にはなりません。外部資料の文言を、利用者からの新しい指示として扱わないことも必要です。操作の制限は、文章でお願いするだけでなく、ツール側の権限や確認の仕組みでも支えます。
終了条件を満たしたときに加え、許可された範囲では先へ進めないときや、決めた試行回数に達したときも止まります。止まる場合は、何を確認できて、何が残ったかを区別して伝えます。
エージェントは自律性が高いほど常に優れているわけではありません。定型作業なら固定ワークフローの方が予測しやすい場合があります。Anthropicの解説も、事前定義されたワークフローと、モデルが工程やツール利用を動的に決めるエージェントを区別しています。
作業列車から次のルートへ
生成能力と行動システムの関係を整理するなら生成AIとAIエージェントは何が違う?へ進みます。画面を読み、クリック後に再観測する工程はAIエージェントはどうやってブラウザを操作するの?で詳しく扱います。
エージェントを見る時は製品名より、目標、選択可能なツール、観測、記憶、権限、停止条件を尋ねます。この六点が分かれば、できることと任せすぎる部分を同じ地図で判断できます。
小さな設計のクイズとワーク
ワーク:見学会の表に3件の名前が並びましたが、3件目の開始時刻が空欄です。保存はまだしていません。次のうち、どの手が目標に合うでしょうか。
- A:よくある開始時刻を予測して空欄を埋め、保存する。
- B:3件目の案内を読み直し、確認できた値か「不明」を入れてから保存・再確認する。
- C:3行あるので、保存せず「完了」と返す。
今度は、自分の作業を「調べる→作る→保存する→確かめる」に分け、それぞれ何を見れば進めたと分かるかを書いてみてください。
Q1. ツールを二回呼べばエージェント?
回数だけでは決まりません。ここでは、目標と現在の状態を使い、LLMが次の手順や道具を選ぶ構造かを見ます。決められた分岐に沿ってツールを二回呼ぶだけなら、固定ワークフローでもできます。
Q2. 最初の計画は最後まで固定する?
途中で得た結果に応じて、必要なら修正します。ただし自由に変更できる範囲と、守る制約は分けて与えます。
Q3. 完了と表示されたら人の確認は不要?
重要な作業では、作成物や外部状態を独立に確かめます。特に送信、決済、削除、公開は実行前後の確認を設けます。
次の行動を選ぶには、その前に「いま何が起きているか」を読み取る必要がありました。では、Webページでボタンを押す場合、AIは画面の何を見て、押すボタンを選ぶのでしょうか。次はAIエージェントのブラウザ操作で、見る・選ぶ・押す・もう一度見る、という一巡を追います。
この記事について
LAB WHITEBOARD
自分の言葉で説明してみよう
「目標、計画、ツール、観測、記憶、停止条件を分け、AIエージェントの動作と限界を説明できるようになる。」を、いまの自分の言葉で一文にしてみてください。途中の説明でも大丈夫です。




