クローラーとは?
クローラー(Crawler)は、Web 上のページを巡回して URL とコンテンツを取得するプログラムの総称です。スパイダー、ロボット、bot とも呼ばれます。Google 検索セントラルのGoogle クローラーの概要では、Googlebot を含む各種クローラーの一覧と User-Agent が公開されています。
AI 検索の登場以降、検索エンジンのクローラーだけでなく、AI 各社のクローラー(GPTBot、ClaudeBot、PerplexityBot など)が個別の User-Agent で巡回するようになりました。Google-Extended は HTTP 上の独立した User-Agent ではなく、Google の既存クロール結果を Gemini や Vertex AI for Gemini が学習・grounding に使うかを制御する robots.txt 用のトークンです。SEO 担当者は、これらをまとめて把握し、許可・拒否の方針を決める必要があります。
robots.txt はクロール可否のヒントを伝える仕組みであり、検索結果からの削除を保証するものではありません。検索クローラーは原則許可しつつ、AI クローラーは事業方針に合わせて User-Agent ごとに判断します。
01.クローラーとは
クローラーは、サイト内のリンクやサイトマップをたどって URL を発見し、HTTP リクエストでページを取得します。取得した情報は、検索エンジンのインデックス、AI モデルの学習、AI 検索の回答生成などに使われます。
サイト運営者から見ると、クローラーは Web サーバーへのアクセスログに User-Agent として記録されます。Google 検索セントラルでは、本物の Googlebot かどうかを逆引き DNS で検証する手順が公開されています。User-Agent の偽装に対しては、IP の検証も合わせて行うのが安全です。
逆引き DNS はコマンドラインが手元になくても、当サイトの無料ツールでアクセスログのIPを入力すればブラウザから確認できます。
ドメイン名やIPアドレスを入力すると、DNSレコードを確認できます(ブラウザから Cloudflare の公開DNSへ直接問い合わせ、サーバー送信なし)。
02.代表的なクローラー一覧(検索エンジン・AI)
- 目的:検索結果作成のためのインデックス
- 代表:Googlebot / Bingbot
- 制御:robots.txt(標準仕様)
- 目的:AI 学習 / AI 検索 / 回答生成
- 代表:GPTBot / ClaudeBot / PerplexityBot / Google-Extended
- 制御:robots.txt + 各社個別ルール
| クローラー | 提供元 | 主な目的 | User-Agent / トークン |
|---|---|---|---|
| Googlebot | 通常検索のクロール・インデックス | Googlebot / Googlebot-Image / Googlebot-Video | |
| Bingbot | Microsoft | Bing 検索のクロール | bingbot |
| GPTBot | OpenAI | OpenAI モデル学習用のクローラー | GPTBot |
| OAI-SearchBot | OpenAI | ChatGPT search の検索用クローラー | OAI-SearchBot |
| ChatGPT-User | OpenAI | ChatGPT がリンクを開いた際のユーザー起点 fetch(robots.txt 適用外と明記) | ChatGPT-User |
| ClaudeBot | Anthropic | Claude モデル開発・学習候補のクローラー | ClaudeBot |
| Claude-SearchBot | Anthropic | Claude の検索結果品質向上クローラー | Claude-SearchBot |
| Claude-User | Anthropic | Claude のユーザー起点リクエスト fetch | Claude-User |
| PerplexityBot | Perplexity | Perplexity の検索インデックス用クローラー | PerplexityBot |
| Perplexity-User | Perplexity | Perplexity のユーザー起点 fetch(robots.txt を一般に無視と公式明記) | Perplexity-User |
| CCBot | Common Crawl | 公開クロールデータセット(多くの AI が参照) | CCBot |
Google-Extended は上の表に含めていません。これは独立した HTTP User-Agent ではなく、Google の既存クロール結果を Gemini / Vertex AI for Gemini の学習・grounding に使うかを制御する robots.txt 用トークンです。
User-Agent と方針は変更されることがあります。各社公式ドキュメント(OpenAI bots、Anthropic クローラー、Perplexity bots、Google クローラー、Google-Extended)で最新仕様を確認してください。
ChatGPT-User、Claude-User、Perplexity-User のように「ユーザーが AI 上でリンクを開いた瞬間のリクエスト」は、OpenAI / Perplexity の公式ドキュメントで robots.txt ルールが適用されない/一般に無視される旨が明記されています。これらの User-Agent を Disallow しても、ユーザー操作起点の fetch までは止まらない前提で扱うのが安全です。
03.robots.txt でできること・できないこと
robots.txt は、サイトのルート(/robots.txt)に置き、クローラーに対して「クロールしてほしくない領域」などを伝えるテキストファイルです。Google 検索セントラルのrobots.txt の概要で標準仕様が公開されています。
| robots.txt の役割 | できる | できない・注意点 |
|---|---|---|
| クロール可否のヒント | User-Agent 別に Disallow / Allow を伝える | クローラーが従う保証はない(悪意のある bot は無視) |
| サイトマップの場所通知 | Sitemap ディレクティブで sitemap.xml の URL を伝える | 通知だけで内容は別途整える必要がある |
| 検索結果からの削除 | (できない) | 削除には noindex / 削除リクエスト / 適切なステータスコードを使う |
04.robots.txt の書き方サンプル
まずは検索クローラーを許可しつつ、管理画面や検索結果ページ、重いパラメータ URL を Disallow するのが基本です。
User-agent: *
Disallow: /admin/
Disallow: /search
Disallow: /*?session_id=
# Search engines
User-agent: Googlebot
Allow: /
User-agent: bingbot
Allow: /
# AI 学習用クローラー(学習目的の利用を抑えたい場合は Disallow)
User-agent: GPTBot
Disallow: /
User-agent: ClaudeBot
Disallow: /
# Google が既存クロール結果を Gemini / Vertex AI で使うかの制御トークン
User-agent: Google-Extended
Disallow: /
# AI 検索クローラー(AI 検索からの引用は欲しい場合は Allow)
User-agent: OAI-SearchBot
Allow: /
User-agent: Claude-SearchBot
Allow: /
User-agent: PerplexityBot
Allow: /
# ユーザー起点 fetcher(robots.txt が適用されない場合があると公式明記)
User-agent: ChatGPT-User
Allow: /
User-agent: Claude-User
Allow: /
User-agent: Perplexity-User
Allow: /
Sitemap: https://example.com/sitemap.xml検索エンジン用の Googlebot や Bingbot を拒否すると、通常検索からの流入が止まります。一方で、GPTBot / ClaudeBot などの「学習用」クローラーや Google-Extended トークンは、AI 検索からの引用・回答生成にどう影響するかを切り分けて判断するのがおすすめです。
上のようなクローラー別の許可・拒否設定は、当サイトの無料ツールでクローラーごとにチェックボックスを選ぶだけでも作成できます。
クローラーごとに許可/拒否を選ぶと、そのまま使える robots.txt をその場で生成します(ブラウザ内で処理、サーバー送信なし)。
AI学習用クローラー
生成AIモデルの学習データ収集。拒否しても検索順位やAI検索からの引用には影響しません。
AI検索用クローラー
AI検索の索引・引用元の収集。拒否するとAI検索の回答に自サイトが引用されなくなります(LLMOに影響)。
ユーザー操作による取得(AI)
ユーザーの質問に応じてリアルタイムにページを取得するエージェント。robots.txt に従わない場合があります。
検索エンジン
検索結果の索引作成。拒否すると検索結果に表示されなくなるため、通常は許可のままにします。
SEO分析ツール
被リンク・競合分析ツールの収集。拒否しても検索順位には影響しません(競合からの分析を防ぎたい場合に拒否)。
# クローラーはすべて許可(既定で許可のため個別指定は不要) User-agent: * Allow: /
生成した内容をサイトのルート(https://あなたのドメイン/robots.txt)に設置してください。
既存の robots.txt がある場合は、既存のルールを消さないように追記します。
05.AIクローラーの許可・拒否方針
AI クローラーをどう扱うかは、事業方針・コンテンツの性質・法務観点から決めるべきテーマです。代表的な選択肢を整理します。
| 方針 | 想定する状況 | 具体的な設定例 |
|---|---|---|
| 全 AI クローラーを許可 | AI 検索での引用・露出を最大化したい / 公開情報中心のサイト | robots.txt で AI 系 User-Agent を Disallow しない |
| 学習用は拒否、検索・参照は許可 | 学習データへの利用は避けたいが、AI 検索からの流入は欲しい | GPTBot / ClaudeBot / Google-Extended は Disallow、OAI-SearchBot / Claude-SearchBot / PerplexityBot は Allow |
| 全 AI クローラーを拒否 | コンテンツが有料 / 機密 / 厳格なライセンス管理がある | GPTBot / ClaudeBot / Claude-SearchBot / Google-Extended / PerplexityBot などすべて Disallow(ユーザー起点 fetcher は止まらない前提で別途検討) |
どの方針を選んでも、AI クローラーがすべて従う保証はない点に注意が必要です。学習用途を確実に止めたい場合は、ログイン制限や個別契約など robots.txt 以外の手段も検討します。
06.llms.txt との役割の違い
llms.txt は、AI 向けにサイトの重要ページを Markdown で案内する補助ファイルです。robots.txt がクロール可否の指示なのに対し、llms.txt は「AI に読んでほしい代表的なページの一覧」を伝える発見補助の位置づけです。詳細はllms.txt の解説記事にまとめています。
| ファイル | 役割 | AI 検索での効果 |
|---|---|---|
| robots.txt | クロール可否のヒント | クロール許可した範囲が AI に届く可能性が上がる |
| sitemap.xml | クロールしてほしい URL の一覧 | 検索エンジン・AI に発見されやすくなる |
| llms.txt | AI に読んでほしい代表ページの案内 | AI が短時間でサイト概要を把握しやすくなる |
07.よくある失敗
- robots.txt を設定すれば検索結果からも消えると考える(クロール可否と検索表示は別レイヤー)。
- 管理画面用の Disallow を本番公開時に外し忘れ、本番ページがクロールできない状態になる。
- 全 AI クローラーを拒否したまま、AI 検索での引用が出ないと悩む。
- 重要ページを JavaScript 内のリンクだけで結び、HTML レベルでクロール経路がない。
08.よくある質問(FAQ)
Googlebot と AI クローラーは同じものですか?
別物です。Googlebot は通常検索のクロール用、Google-Extended は Gemini など Google 生成 AI 用と用途が分かれています。OpenAI も学習用 GPTBot、検索用 OAI-SearchBot、ユーザー操作用 ChatGPT-User と分かれており、目的別に許可・拒否を決められます。
robots.txt で全 AI クローラーを拒否しても問題ないですか?
学習データに使われるリスクは下げられますが、AI 検索(ChatGPT search、Perplexity、AI Overview など)から引用・参照される機会も減る可能性があります。事業方針として AI 検索からの流入を期待するかどうかで判断するのがおすすめです。
アクセスログにある User-Agent が本物かどう確認しますか?
Googlebot は逆引き DNS で google.com / googlebot.com に解決できるかを確認します。OpenAI など他社も公式ドキュメントで IP レンジを公開しています。User-Agent 文字列は簡単に偽装できるため、IP でも検証するのが安全です。
llms.txt があれば robots.txt は不要ですか?
別の役割なので両方必要です。robots.txt はクロール可否、llms.txt は AI に読んでほしい代表ページの案内です。AI クローラーの動きを制御したい場合は robots.txt と各社個別仕様で対応し、AI に把握してもらいたい情報は llms.txt で案内するのがおすすめです。
09.まとめ
クローラーは検索エンジンと AI サービスで目的が異なります。検索クローラー(Googlebot / Bingbot)は許可しつつ、AI クローラーは User-Agent ごとに方針を決め、robots.txt で表現します。robots.txt はクロール可否のヒントであり、検索結果からの削除には別の仕組みが必要だという点も押さえましょう。
robots.txt と llms.txt を整え、AI 検索時代の流入基盤を作りませんか?
TANTOU では、テクニカル SEO、AI クローラー方針設計、構造化データ、AI 検索対策まで一貫して支援します。
SEO・AI検索 基礎知識集
一覧に戻る →基本概念
- ›SEOとは?
- ›SEO必読ドキュメント一覧
- ›コアアップデートの歴史
- ›ページエクスペリエンスとは?
- ›インデックスとは?
- ›クローラーとは?(この記事)
- ›canonical・正規化とは?
- ›ドメイン・TLDの選び方

