仕組みを知る

AI検索はWebサイトをどう読んでいるの?

AI検索がWebページを扱う流れを、発見、クロール、索引、取得、生成、引用に分けて解説します。特別な一設定で引用が決まるという誤解をほどき、サイト側で確認できる点も順に見ていきます。

AI検索はWebサイトをどう読んでいるの?

30秒でわかる答え

AI検索はWebサイトをどう読んでいるの?

Webページを発見し、内容を処理して索引に入れ、質問に合う資料を取得し、回答とリンクを組み立てる複数段階の仕組み。 AI検索がWebページを扱う流れを、発見、クロール、索引、取得、生成、引用に分けて解説します。

一文定義
Webページを発見し、内容を処理して索引に入れ、質問に合う資料を取得し、回答とリンクを組み立てる複数段階の仕組み

TERM PRIMER

先に知っておく言葉

クロール
リンクなどをたどってWebページを発見し、内容を取得していく処理です。
インデックス
検索時に情報を見つけやすくするため、取得した文書の内容や場所を整理した索引です。
検索
条件や問いに合う情報を、文書、Webページ、データベースなどから探して取り出す処理です。
引用
回答や記述の根拠として、参照した資料の箇所や出典を示すことです。

AI検索は、Webページを発見し、内容を処理して索引に入れ、質問に合う資料を取得し、回答とリンクを組み立てる複数段階の仕組みです。一体のロボットが人間のようにページを読み、その場で要約しているとは限りません。

サービスによって、使うクローラー、索引、検索方法、生成モデル、引用の選び方は異なります。ラボの「AI検索案内所」で工程を分けると、特別なファイルを一つ置けば引用される、といった近道の誤解を避けられます。Webページ自体の構造はWebサイトの仕組みとは?も先に確認してください。

仕組みの各段階は何をする?

AI検索という名前は、会話形式で答える検索、検索結果を要約する機能、外部検索を呼ぶチャットなどを広く指します。共通して見える回答画面の裏で、次の部品が別々に動く場合があります。

  • URLを見つける発見機構
  • ページを取得するクローラー
  • HTMLや画像などを解釈する処理
  • 内容を後から探すための索引
  • 質問から候補を探す検索
  • 候補を並べ直すランキング
  • 取得資料から文章を作る生成モデル
  • 主張と参照先を結ぶ引用表示

巡回員が街を訪れ、台帳を作り、質問時に資料を集めて案内文を書くたとえです。ただし実際には、一社のサービス内でも問い合わせによって使う検索回数や候補が変わり、別サービスなら経路も違います。

ユイ

公開した記事は普通の検索に出るのに、AIの回答では引用されないの。読まれていないのかな?

マコト

発見されたか、索引に入ったか、質問時に選ばれたかを分けないと原因は見えないね

ピコ

巡回路から回答窓口まで、AI検索の道を一駅ずつ確かめよう

Webページを発見する段階

最初はURLの発見です。クローラーは、すでに知っているページのリンク、サイトマップ、過去の巡回記録などから新しいURLや更新URLを見つけます。URLが存在するだけでは、外部からたどれるとは限りません。

発見と取得を助ける基本は次のとおりです。

  1. 重要ページへ通常のリンクを張る
  2. リンク先を正しいURLにする
  3. サイトマップへ公開URLを含める
  4. サーバーが正常なHTTP応答を返す
  5. robots.txtなどで意図せず取得を止めない
  6. ログイン後だけ見える本文と公開本文を区別する

Google Searchの公式説明でも、検索はクロール、インデックス登録、検索結果の配信という段階に分けられています。これはGoogleの説明であり、すべてのAI検索が同じ構成だという意味ではありません。

内容を索引化する段階

取得されたページは、HTMLの見出し、本文、リンク、画像の代替テキスト、構造化データなどを手掛かりに処理されます。JavaScriptで後から描画する内容は、クローラーの実行方法や時間制限によって見え方が変わることもあります。

索引は、ページのコピーを棚へそのまま置くだけではありません。代表URLの判断、重複の整理、言語や主題の推定、検索用の表現作成などが含まれ得ます。ページが取得されたことと、索引に残ることは別です。

読み取りやすさを考えるなら、次を優先します。

  • 見出しと本文の関係をHTMLで表す
  • 重要な説明を画像内の文字だけに閉じ込めない
  • 画像には内容に合う代替テキストを付ける
  • 構造化データと画面上の本文を一致させる
  • 更新日、著者、参照元を読者にも見える形で示す
  • 同じ内容の複数URLは代表関係を整理する

構造化データは理解の手掛かりですが、入力すれば掲載や引用が決まる券ではありません。

質問に合う資料を取得する段階

利用者が質問すると、検索側は単語どおりの検索だけでなく、質問を書き換えたり、複数の小さな問いに分けたりして候補を集める場合があります。GoogleはAI機能について、関連する複数検索を行う「query fan-out」を使うことがあると説明しています。

この段階では、ページ全体が有用でも、質問に答える箇所が見つからなければ候補になりにくいことがあります。反対に、通常検索の順位が同じでも、AI回答の小問に合う段落が選ばれる場合があります。

RAGとは?で見たように、資料が棚にあることと、必要な部分を取得できることは別です。見出しだけを増やすより、問いへの短い結論、理由、条件、例外を同じ節で明確にする方が、人にも検索処理にも内容を追いやすくします。

回答を生成し引用する段階

取得された候補は、質問や指示と一緒に生成モデルに渡されます。モデルは複数資料をまとめ、比較し、回答文を作ります。引用リンクは、その回答を支える候補として表示されますが、表示位置と主張の対応が常に正しいとは限りません。

ユイ、マコト、ピコが、Webの街を巡回する工程、索引台帳、質問に合う資料の取得、根拠リンク付き回答窓口へ進む流れを確認している
発見、取得、索引、検索、生成、引用は別工程です。どこを通らなかったかで確認方法も変わります。

GoogleのAI検索機能では、通常の検索における基本方針が引き続き重要で、AI機能だけの特別なマークアップは不要と案内されています。また、条件を満たしてもクロール、索引、表示は保証されません。この二点からも「設定一つで引用を約束する」という説明には慎重になる必要があります。

読みやすいページの条件

AIだけを相手にした秘密の文章より、読者が根拠を検証できるページを整える方が土台になります。

  • 冒頭で問いへの答えを明示する
  • 用語の意味と対象範囲をそろえる
  • 手順は順序付きで書く
  • 比較は同じ軸で並べる
  • 例外や適用条件を省かない
  • 一次資料へ直接リンクする
  • 古くなりやすい情報には確認日を付ける
  • 図の内容を本文と代替テキストでも説明する

llms.txtのような新しい提案や独自ファイルは、対応するサービスでは手掛かりになり得ます。しかし、すべてのAI検索で採用される共通の掲載保証ではありません。まず公開HTML、内部リンク、取得可否、本文品質という観測できる層を整えます。

引用されない時の確認

引用が見つからない時は、順番に四つの問いを立てます。

  1. 発見: 対象URLへリンクやサイトマップから到達できるか
  2. 理解: 取得したHTMLに重要本文、見出し、日付が現れるか
  3. 取得: 想定質問へ直接答える節と根拠があるか
  4. 引用: 回答に使われてもリンク表示が省かれる可能性を分けたか

検索コンソール、サーバーログ、URL検査などで確認できる範囲と、外部サービスが公開していない範囲を区別します。通常検索で上位ならAI回答でも同じ順になる、という前提は置けません。AIのハルシネーションとは?と同様、もっともらしい回答と根拠の対応を人が確かめます。

四段階を監査するクイズとワーク

ワーク: 自分の公開記事を一つ選び、「発見・理解・取得・引用」の四欄を作ります。リンク到達性、取得HTML、質問へ答える段落、一次資料へのリンクを各欄に記録し、未確認事項は推測で埋めず「未確認」とします。

Q1. AI用の特別なファイルを置けば引用される?

共通の掲載保証にはなりません。対象サービスの公式対応を確認し、まず通常のクロール、索引、読者向け本文を整えます。

Q2. クロール済みなら質問時にも取得される?

別の段階です。索引に残るか、質問に関連すると判断されるか、候補から回答に使われるかが続きます。

Q3. 引用リンクが表示されたら回答全体の根拠になる?

リンク先の該当箇所と回答中の主張を対応させて確認します。一つのリンクが周囲の全主張を支えるとは限りません。

多段階の地図から次へ進む

AI検索の工程を分けられたら、次は検索や表計算などを自ら選ぶAIエージェントとは?へ進みます。外部資料の取り込みと検索を詳しく見るならRAGとは?へ戻ってください。

サイト改善では「どのAIにも好かれる魔法」を探すのではなく、読者への答え、技術的な到達性、更新、根拠を一つずつ検証します。AI検索の方式が変わっても、この切り分けは原因を考える土台になります。

公開して終わりではなく、四段階で届く

AI検索に内容が使われるまでには、ページの発見、内容の処理、質問に合う資料の取得、回答と引用の生成があります。自分の記事を一つ選び、「検索で見つかるか」「本文を取得できるか」「引用されたか」を分けて確認すれば、見えない段階を一つの成否にまとめずに済みます。

LAB WHITEBOARD

自分の言葉で説明してみよう

「AI検索がWeb情報を扱う工程を分け、発見、理解、取得、引用のどこに問題があるか切り分けられるようになる。」を、いまの自分の言葉で一文にしてみてください。途中の説明でも大丈夫です。