TERM PRIMER
先に知っておく言葉
AIの学習と推論の違いは、学習がデータからモデルの内部パラメータを調整する工程、推論が調整済みモデルを使って新しい入力への出力を計算する工程であることです。
チャットAIが前の発言を覚えているように見えると、「会話のたびにモデルが学び直している」と感じるかもしれません。疑問を整理する鍵は、処理の前後でモデルのパラメータが変わるかどうかです。ラボの夜に開く訓練工房と、昼に開く案内窓口を見比べましょう。
学習そのものの流れは機械学習とは?で、データ、予測、誤差、更新の順に確認できます。ここでは、完成したモデルが利用者の入力を受け取る段階との違いに焦点を当てます。
学習と推論の違いを先に比較
二つの工程を表にする代わりに、変化するものを順に並べます。
- 学習の入力: 多数の訓練例、ラベルや評価信号
- 学習の処理: 予測の誤差を計算し、内部パラメータを更新する
- 学習の出力: 調整されたモデル
- 推論の入力: 利用時に届いた新しい文章、画像、音声など
- 推論の処理: 現在のパラメータを使い、出力を計算する
- 推論の出力: 分類、予測値、生成された文章や画像
大切なのは、推論でも大量の計算は行われる一方、通常はその一回の処理だけで基盤となるモデル全体のパラメータを更新しない点です。同じモデルを多くの利用者が繰り返し使えるのは、この分離があるからです。
ユイ
AIに間違いを教えたら、その会話のたびに学習してモデル全体が直るの?
マコト
返事を作る推論と、内部を変える学習は、同じ計算に見えるね
ピコ
訓練工房と案内窓口を分けて見ると、更新されるものの違いがはっきりするよ
共通する一つのモデルと二つの時間
たとえでは、AI知能区の地図を閉館後に作り直す時間が学習、できあがった地図で来訪者を案内する時間が推論です。どちらも同じ街と地図に関係しますが、目的が異なります。
共通するのは、入力を数値表現に変換し、モデル内部で計算する点です。違いは計算の向きにあります。推論では入力から出力へ進みます。学習では出力の誤差を手掛かりに、どのパラメータをどちらへ動かすかも計算します。そのため、大規模モデルの学習は推論より多くの時間、データ、メモリ、計算装置を必要とする場合があります。
ただし、小さなモデルの学習と巨大モデルの推論を比べれば、後者のほうが重いこともあります。「学習は常に何倍重い」という固定比率ではなく、モデル規模、入力長、回数、利用する装置で変わります。
学習では内部パラメータを変える
学習の典型的な流れは次のようになります。
- 訓練データをモデルに入力する
- モデルが予測を返す
- 期待する出力との差を損失として測る
- 損失を小さくする更新方向を計算する
- 重みなどのパラメータを少し変える
- 多数の例で反復し、別データでも評価する
ニューラルネットワークでは、誤差逆伝播と最適化手法を使ってパラメータを調整することが一般的です。大規模言語モデルなら、大量のテキストを使う事前学習の後に、指示へ応答しやすくする追加の調整が行われる場合もあります。
学習データへ情報を追加したからといって、その内容が一文ずつ取り出せる形でモデル内に保存されるわけではありません。多数の例から得た規則性が、分散したパラメータに反映されます。何を学習させ、どう評価するかはモデル提供側の工程です。
推論では新しい出力を計算する
推論では、調整済みモデルを固定した状態で新しい入力を処理します。画像分類なら写真からラベルを予測し、文章生成なら文脈から次に続くトークンの候補を計算します。
- 入力をモデルが扱える数値に変換する
- 調整済みパラメータを通して計算する
- 分類確率や次のトークンなどを得る
- 必要なら生成を反復し、利用者向けの出力に戻す

スマホ内で推論するか、遠いデータセンターで推論するかでも、通信、遅延、消費電力、プライバシーの条件が変わります。処理場所の比較はクラウドAIとオンデバイスAIの違いで整理しています。
会話の記憶は再学習と同じ?
チャットで「さっき言った名前」を次の返答に使えたとしても、それだけではモデル全体を再学習した証拠になりません。サービスには、モデルのパラメータとは別に情報を渡す仕組みがあります。
- 会話履歴: 直前までの文章を次の推論の入力に含める
- 保存メモリ: 利用者が許可した情報を別の保存領域から読み出す
- 外部検索やRAG: 文書を探し、関連部分を入力に加えてから推論する
- キャッシュ: 以前の計算結果を再利用する
- 追加学習: 別の工程でデータを集め、モデルのパラメータを調整する
地図のたとえなら、会話履歴は窓口へ一緒に渡す付箋、検索結果は外の図書館から借りた資料です。地図そのものを書き換えなくても、案内に使う情報を増やせます。実際のサービスが入力を学習に利用するか、どの期間保存するかは、設定と利用規約で異なるため個別の確認が必要です。
使う場面で計算資源はどう変わる?
学習と推論は、運用上の課題も異なります。
- 学習では、大量データの準備、長時間の計算、途中状態の保存、評価の再実行が中心になる
- 推論では、利用者が待てる時間、同時アクセス数、一回当たりの費用、端末の電池が中心になる
- 学習済みモデルを小さくしたり、数値精度を調整したりして、推論を軽くする場合がある
- 新しいデータに対応するため、一定期間ごとに学習工程へ戻る場合がある
夜の工房と昼の窓口は独立した建物ではなく、運用の循環としてつながっています。推論中に見つかった失敗例を確認し、品質と権利に配慮して次の学習データを設計することもあります。しかし、利用者が一度訂正した瞬間に全利用者向けモデルが変化する、という話ではありません。
誤解を分ける確認クイズとワーク
ワーク: 「写真アプリが猫を判定する」「開発チームが誤判定画像を集めてモデルを調整する」「チャットへ前の発言も一緒に渡す」を、学習、推論、入力の補助に分類してください。モデルのパラメータが変わる場面には印を付けます。
Q1. チャットAIへ間違いを伝えると、その場でモデル全体が再学習する?
通常の一回の推論では、そう考えません。訂正内容を会話履歴として次の入力に含めることはできますが、パラメータ更新とは別です。
Q2. 推論は答えをデータベースから取り出すだけ?
モデルによる推論では、新しい入力をパラメータへ通して出力を計算します。検索システムと組み合わせる場合でも、検索とモデル計算は分けて捉えます。
Q3. 学習済みなら評価は終わり?
終わりではありません。実際の入力分布や利用環境が変わることがあるため、運用中の品質確認と必要に応じた更新が続きます。
学習と推論から次へ進むルート
二つの時間を分けられたら、文章生成のモデルへ進めます。大規模言語モデルLLMとは?では、事前学習したモデルが次のトークンを生成する流れを扱います。内部構造を先に見たい場合はTransformerとは?へ進みましょう。
学習工程を復習するなら機械学習とは?、計算場所の違いはクラウドAIとオンデバイスAIの違いへ戻れます。
学習では調整し、推論では答えを出す
学習はデータを使ってモデル内部のパラメータを調整する工程、推論は調整済みモデルへ新しい入力を渡して答えを計算する工程です。会話履歴を参照したり検索結果を読んだりしても、それだけでモデルが再学習したとは限らない。この線を引ければ、二つを混同しません。
調整する重みやバイアスが出力へどう関わるかは、ニューラルネットワークの仕組みにある小さな計算図で追えます。
LAB WHITEBOARD
自分の言葉で説明してみよう
「パラメータ更新の有無、入力、出力、計算資源の観点からAIの学習と推論を分け、会話履歴や検索を再学習と混同しないようになる。」を、いまの自分の言葉で一文にしてみてください。途中の説明でも大丈夫です。




