この観測ファイルの役割
このページは、用語の定義そのものを扱う記事ではありません。基礎ガイドで仕組みを確認したあと、現在確認できること、まだ条件つきの推論、将来の分岐、予測を弱める反証条件を同じ場所で追います。新しい発表ごとにURLを増やさず、基準日と差分を残します。
一文回答
オンデバイスAIとローカルAIの次に起こりやすいのは、すべてを端末内で処理することではなく、個人データや即応処理は端末内、重い推論や最新情報はクラウドというように、処理ごとに実行場所を自動選択するハイブリッドAIです。
3つの要点
- 端末内でできる仕事が増える
- 要約、分類、書き換え、音声認識、画像理解、限定的なツール利用。
- 小型モデルと大型モデルが分業する
- 常時動く軽い処理は端末、大きな推論や広い知識はクラウド。
- 新しい競争軸はルーティング
- どのモデルを使うかだけでなく、データをどこへ送り、どのチップで処理するかが重要になる。
現在確認できること
- AppleのFoundation Models frameworkは端末内モデルへのアプリ向けアクセスを提供し、2026年にはローカル・サーバー型を含む他モデルプロバイダーを扱う方向へ拡張。
- Gemini Nanoは対応Android端末上でネット接続やクラウド送信なしに生成AI機能を実行可能。
- Google AI Edgeは端末内モデルの実行・最適化と、オンデバイスLLMからの関数呼び出しを提供。
- ChromeではGemini Nanoを使う組み込みAI APIが展開中。
- WindowsではNPUを持つCopilot+ PCと、GPUでも動くローカルAI基盤が併存。
- llama.cpp、MLX、MLX-LM、Ollamaにより個人PCでの推論が容易になっている。
よくある誤解
- ローカルAIなら入力情報が絶対に外へ出ないとは限らない。
- NPUのTOPSが高ければすべてのLLMが高速になるわけではない。
- GPUよりNPUが常に速いわけではない。
- 量子化は量子コンピューターを使う技術ではない。
- 端末内モデルは自動的に最新情報を知るわけではない。
- ローカルモデルでもハルシネーションは起こる。
未来シナリオと観測条件
0〜12か月
L1 OS・ブラウザがモデル管理を担う
- 確信度: 高
- 起こり得ること:
- 必要時のモデルダウンロード
- ハードウェア適合性の自動確認
- 更新・削除・容量管理
- アプリから共通API利用
- 強くなるサイン:
- OS・ブラウザ標準API
- モデル名に依存しない能力API
- 複数ベンダー対応
L2 端末内関数呼び出しが増える
- 確信度: 高
- 用途:
- カレンダー候補作成
- ローカルファイル検索
- アプリ内操作
- センサー・機器制御
- リスク:
- 小型モデルの誤った引数
- ローカルだから広い権限を与える
- 操作ログ不足
L3 ローカル前処理+クラウド推論が一般化する
- 確信度: 高
- 流れ:
- 個人情報を端末で検出
- 必要部分を要約・匿名化
- クラウドへ最小限送信
- 結果を端末内データと再統合
L4 NPU・GPUの自動振り分けが進む
- 確信度: 中〜高
- NPU: 低電力・常時処理
- GPU: 大きいモデル・画像生成
- CPU: 制御・小規模推論・前後処理
1〜3年
L5 ローカルファーストの個人AIが増える
- 確信度: 中〜高
- 扱うもの:
- メール、ノート、写真、音声、コード、閲覧履歴
- 条件:
- インデックスと埋め込みも端末内
- 明確な権限
- 暗号化
- バックアップ
L6 小型モデルがエージェントの入口になる
- 確信度: 中
- 役割:
- 意図分類
- 権限確認
- タスク分解
- 簡単な実行
- クラウドへ上げる判断
L7 ブラウザ内AIがWebアプリの標準部品になる
- 確信度: 中〜高
- 用途:
- 要約、書き換え、翻訳、分類、構造化出力
- 分岐:
- 複数ブラウザで標準化
- ブラウザごとに断片化
- 非対応端末はクラウドへフォールバック
L8 個人端末同士の分散推論が増える
- 確信度: 中
- 例:
- PCとスマートフォン
- 複数GPU
- 家庭内サーバー
- 社内エッジ
- 課題:
- 通信、セキュリティ、故障、モデル分割、キャッシュ同期
3〜7年
L9 AI機能がOSの標準サービスになる
- 確信度: 中〜高
- 形:
- 文章・画像・音声の共通モデルサービス
- アプリ間で権限付き利用
- モデルプロバイダー交換
L10 ローカルとクラウドの境界がユーザー設定になる
- 確信度: 中
- 設定例:
- 機密データは端末のみ
- 品質優先時だけクラウド
- 電池残量で切り替え
- 月間費用上限
- 会社ポリシー
L11 ローカルモデルのパーソナライズが進む
- 確信度: 中
- 方法:
- 検索・メモリ
- 軽量アダプター
- ユーザー辞書
- オンデバイス学習
- 課題:
- 誤学習、端末移行、削除権、複数端末同期
L12 端末AIの環境負荷が評価される
- 確信度: 中
- 観測:
- 一回当たり電力
- バッテリー劣化
- モデル配布量
- 端末買い替え
- クラウドとの総比較
現時点の編集部仮説
- 軽い・機密・低遅延処理は端末へ移る。
- 大型推論・最新情報・長時間処理はクラウドが残る。
- OS・ブラウザがモデル配布とハードウェア最適化を管理する。
- アプリはモデル名ではなく能力とプライバシー条件を指定する。
- ローカルエージェントの権限・ログ・誤操作が新しい課題になる。
ニュースを読むための指標・用語
オンデバイスAI
AIモデルの推論などを、スマートフォン、PC、ロボットなど利用者側の端末で実行する構成。
ローカルAI
利用者または組織が管理する端末・サーバー内で実行するAI。家庭内サーバーや社内サーバーを含み得る。
エッジAI
中央クラウドではなく、データが発生する場所に近い機器で処理するAI。
ハイブリッドAI
端末内、ローカルサーバー、クラウドをタスクや条件ごとに組み合わせる構成。
NPU
ニューラルネットワーク処理向けの専用演算器。対応する演算・ランタイム・精度形式に依存する。
TOPS
一秒当たり何兆回の演算を行えるかを示す指標。演算精度やタスクが違えば単純比較できない。
TTFT
Time to First Token。入力後、最初の出力トークンが返るまでの時間。
Tokens per Second
生成速度。プロンプト処理速度、モデル、量子化、メモリ帯域などに影響される。
モデル量子化
モデルの重みや計算を少ないビット数で表し、容量・計算負荷を減らす技術。量子コンピューターとは異なる。
ユニファイドメモリ
CPU・GPUなどが一つのメモリ空間を共有する構成。帯域・容量・実装が性能を左右する。
ローカルRAG
文書検索と回答生成を、利用者管理の環境内で行う構成。
クラウドフォールバック
端末内で処理できない場合に、クラウドモデルへ切り替えること。
能力ルーティング
要約、画像理解、ツール利用など必要能力に応じてモデルを選ぶ仕組み。
プライバシールーティング
データの機密度や送信許可に応じて実行場所を選ぶ仕組み。
モデル管理
モデルのダウンロード、更新、削除、容量、バージョン、対応端末を管理すること。
初回ダウンロード
組み込みAI APIの初回利用時などに端末へモデルを取得すること。
コンテキストウィンドウ
モデルが一度に扱える入力・会話履歴の範囲。
KVキャッシュ
生成時に過去トークンの計算結果を保持し、繰り返し計算を減らす仕組み。メモリを消費する。
ローカルファースト
可能な処理とデータ保存を利用者側で行い、必要な場合だけ外部サービスを利用する設計思想。
最小送信
クラウドへ送るデータを目的達成に必要な範囲へ絞ること。
基礎・体験・物語を行き来する
- 基礎ガイド: what-is-on-device-ai
- 基礎ガイド: cloud-ai-vs-on-device-ai
- 基礎ガイド: cpu-gpu-npu-differences
- 操作して確かめる: AI処理ルート管制室
- 物語で考える: 雲へ送らない相談
参考資料
- Foundation Models(Apple)
- Bring an LLM provider to the Foundation Models framework(Apple)
- Gemini Nano(Google)
- Google AI Edge(Google)
- AI Edge Function Calling SDK(Google)
- Built-in AI(Chrome)
- Prompt API(Chrome)
- Develop AI applications for Copilot+ PCs(Microsoft)
- Phi Silica(Microsoft)
- llama.cpp(ggml-org)
- MLX(Apple ML Research)
- MLX-LM(Apple ML Research)
- Ollama powered by MLX on Apple Silicon(Ollama)
- Ollama Blog(Ollama)
内容の最終確認日: 2026-08-01
LAB WHITEBOARD
自分の言葉で説明してみよう
強くなった未来分岐と、まだ足りない証拠を一つずつ書いてみてください。予想が外れた理由も残して大丈夫です。
