SEO・AI検索 基礎知識集基礎知識集 / SEO

クローラーとは?Googlebot・AIクローラー・robots.txtの関係を解説


クローラーは、Web 上のページを巡回して URL とコンテンツを取得するプログラムです。検索エンジンの Googlebot や Bingbot に加えて、AI サービスの GPTBot、ClaudeBot、PerplexityBot、Google-Extended などが個別の User-Agent で動いています。本記事では、検索クローラーと AI クローラーの違い、robots.txt との関係、llms.txt との役割の違い、AI 検索時代の許可・拒否の考え方を整理します。

公開2026.05.10
最終更新2026.05.10
読了 14 分 / 約6,000
この記事をシェアポスト
SEO・AI検索 基礎知識集Crawlers

クローラーとは?

Googlebot検索
AIクローラー
robots制御

クローラー(Crawler)は、Web 上のページを巡回して URL とコンテンツを取得するプログラムの総称です。スパイダー、ロボット、bot とも呼ばれます。Google 検索セントラルのGoogle クローラーの概要では、Googlebot を含む各種クローラーの一覧と User-Agent が公開されています。

AI 検索の登場以降、検索エンジンのクローラーだけでなく、AI 各社のクローラー(GPTBot、ClaudeBot、PerplexityBot など)が個別の User-Agent で巡回するようになりました。Google-Extended は HTTP 上の独立した User-Agent ではなく、Google の既存クロール結果を Gemini や Vertex AI for Gemini が学習・grounding に使うかを制御する robots.txt 用のトークンです。SEO 担当者は、これらをまとめて把握し、許可・拒否の方針を決める必要があります。

C
結論
クローラーの理解は「検索結果用」と「AI用」を分けて考える

robots.txt はクロール可否のヒントを伝える仕組みであり、検索結果からの削除を保証するものではありません。検索クローラーは原則許可しつつ、AI クローラーは事業方針に合わせて User-Agent ごとに判断します。

01.クローラーとは

クローラーは、サイト内のリンクやサイトマップをたどって URL を発見し、HTTP リクエストでページを取得します。取得した情報は、検索エンジンのインデックス、AI モデルの学習、AI 検索の回答生成などに使われます。

サイト運営者から見ると、クローラーは Web サーバーへのアクセスログに User-Agent として記録されます。Google 検索セントラルでは、本物の Googlebot かどうかを逆引き DNS で検証する手順が公開されています。User-Agent の偽装に対しては、IP の検証も合わせて行うのが安全です。

逆引き DNS はコマンドラインが手元になくても、当サイトの無料ツールでアクセスログのIPを入力すればブラウザから確認できます。

nslookup(DNSレコード確認)
ツール単体ページで開く

ドメイン名やIPアドレスを入力すると、DNSレコードを確認できます(ブラウザから Cloudflare の公開DNSへ直接問い合わせ、サーバー送信なし)。

02.代表的なクローラー一覧(検索エンジン・AI)

図:検索クローラーと AI クローラーの役割
どちらも HTTP でページを取得する点は同じだが、目的・User-Agent・制御方針が異なる
検索クローラー
  • 目的:検索結果作成のためのインデックス
  • 代表:Googlebot / Bingbot
  • 制御:robots.txt(標準仕様)
AIクローラー
  • 目的:AI 学習 / AI 検索 / 回答生成
  • 代表:GPTBot / ClaudeBot / PerplexityBot / Google-Extended
  • 制御:robots.txt + 各社個別ルール
クローラー提供元主な目的User-Agent / トークン
GooglebotGoogle通常検索のクロール・インデックスGooglebot / Googlebot-Image / Googlebot-Video
BingbotMicrosoftBing 検索のクロールbingbot
GPTBotOpenAIOpenAI モデル学習用のクローラーGPTBot
OAI-SearchBotOpenAIChatGPT search の検索用クローラーOAI-SearchBot
ChatGPT-UserOpenAIChatGPT がリンクを開いた際のユーザー起点 fetch(robots.txt 適用外と明記)ChatGPT-User
ClaudeBotAnthropicClaude モデル開発・学習候補のクローラーClaudeBot
Claude-SearchBotAnthropicClaude の検索結果品質向上クローラーClaude-SearchBot
Claude-UserAnthropicClaude のユーザー起点リクエスト fetchClaude-User
PerplexityBotPerplexityPerplexity の検索インデックス用クローラーPerplexityBot
Perplexity-UserPerplexityPerplexity のユーザー起点 fetch(robots.txt を一般に無視と公式明記)Perplexity-User
CCBotCommon Crawl公開クロールデータセット(多くの AI が参照)CCBot

Google-Extended は上の表に含めていません。これは独立した HTTP User-Agent ではなく、Google の既存クロール結果を Gemini / Vertex AI for Gemini の学習・grounding に使うかを制御する robots.txt 用トークンです。

User-Agent と方針は変更されることがあります。各社公式ドキュメント(OpenAI botsAnthropic クローラーPerplexity botsGoogle クローラーGoogle-Extended)で最新仕様を確認してください。

i
注意
ユーザー起点 fetcher は robots.txt の対象外になることがある

ChatGPT-User、Claude-User、Perplexity-User のように「ユーザーが AI 上でリンクを開いた瞬間のリクエスト」は、OpenAI / Perplexity の公式ドキュメントで robots.txt ルールが適用されない/一般に無視される旨が明記されています。これらの User-Agent を Disallow しても、ユーザー操作起点の fetch までは止まらない前提で扱うのが安全です。

03.robots.txt でできること・できないこと

robots.txt は、サイトのルート(/robots.txt)に置き、クローラーに対して「クロールしてほしくない領域」などを伝えるテキストファイルです。Google 検索セントラルのrobots.txt の概要で標準仕様が公開されています。

robots.txt の役割できるできない・注意点
クロール可否のヒントUser-Agent 別に Disallow / Allow を伝えるクローラーが従う保証はない(悪意のある bot は無視)
サイトマップの場所通知Sitemap ディレクティブで sitemap.xml の URL を伝える通知だけで内容は別途整える必要がある
検索結果からの削除(できない)削除には noindex / 削除リクエスト / 適切なステータスコードを使う

04.robots.txt の書き方サンプル

まずは検索クローラーを許可しつつ、管理画面や検索結果ページ、重いパラメータ URL を Disallow するのが基本です。

User-agent: *
Disallow: /admin/
Disallow: /search
Disallow: /*?session_id=

# Search engines
User-agent: Googlebot
Allow: /

User-agent: bingbot
Allow: /

# AI 学習用クローラー(学習目的の利用を抑えたい場合は Disallow)
User-agent: GPTBot
Disallow: /

User-agent: ClaudeBot
Disallow: /

# Google が既存クロール結果を Gemini / Vertex AI で使うかの制御トークン
User-agent: Google-Extended
Disallow: /

# AI 検索クローラー(AI 検索からの引用は欲しい場合は Allow)
User-agent: OAI-SearchBot
Allow: /

User-agent: Claude-SearchBot
Allow: /

User-agent: PerplexityBot
Allow: /

# ユーザー起点 fetcher(robots.txt が適用されない場合があると公式明記)
User-agent: ChatGPT-User
Allow: /

User-agent: Claude-User
Allow: /

User-agent: Perplexity-User
Allow: /

Sitemap: https://example.com/sitemap.xml
i
ポイント
検索エンジンと AI 学習・AI 検索を分けて判断する

検索エンジン用の Googlebot や Bingbot を拒否すると、通常検索からの流入が止まります。一方で、GPTBot / ClaudeBot などの「学習用」クローラーや Google-Extended トークンは、AI 検索からの引用・回答生成にどう影響するかを切り分けて判断するのがおすすめです。

上のようなクローラー別の許可・拒否設定は、当サイトの無料ツールでクローラーごとにチェックボックスを選ぶだけでも作成できます。

robots.txt メーカー(AIクローラー対応)
ツール単体ページで開く

クローラーごとに許可/拒否を選ぶと、そのまま使える robots.txt をその場で生成します(ブラウザ内で処理、サーバー送信なし)。

AI学習用クローラー

生成AIモデルの学習データ収集。拒否しても検索順位やAI検索からの引用には影響しません。

AI検索用クローラー

AI検索の索引・引用元の収集。拒否するとAI検索の回答に自サイトが引用されなくなります(LLMOに影響)。

ユーザー操作による取得(AI)

ユーザーの質問に応じてリアルタイムにページを取得するエージェント。robots.txt に従わない場合があります。

検索エンジン

検索結果の索引作成。拒否すると検索結果に表示されなくなるため、通常は許可のままにします。

SEO分析ツール

被リンク・競合分析ツールの収集。拒否しても検索順位には影響しません(競合からの分析を防ぎたい場合に拒否)。

# クローラーはすべて許可(既定で許可のため個別指定は不要)
User-agent: *
Allow: /

生成した内容をサイトのルート(https://あなたのドメイン/robots.txt)に設置してください。既存の robots.txt がある場合は、既存のルールを消さないように追記します。

05.AIクローラーの許可・拒否方針

AI クローラーをどう扱うかは、事業方針・コンテンツの性質・法務観点から決めるべきテーマです。代表的な選択肢を整理します。

方針想定する状況具体的な設定例
全 AI クローラーを許可AI 検索での引用・露出を最大化したい / 公開情報中心のサイトrobots.txt で AI 系 User-Agent を Disallow しない
学習用は拒否、検索・参照は許可学習データへの利用は避けたいが、AI 検索からの流入は欲しいGPTBot / ClaudeBot / Google-Extended は Disallow、OAI-SearchBot / Claude-SearchBot / PerplexityBot は Allow
全 AI クローラーを拒否コンテンツが有料 / 機密 / 厳格なライセンス管理があるGPTBot / ClaudeBot / Claude-SearchBot / Google-Extended / PerplexityBot などすべて Disallow(ユーザー起点 fetcher は止まらない前提で別途検討)

どの方針を選んでも、AI クローラーがすべて従う保証はない点に注意が必要です。学習用途を確実に止めたい場合は、ログイン制限や個別契約など robots.txt 以外の手段も検討します。

06.llms.txt との役割の違い

llms.txt は、AI 向けにサイトの重要ページを Markdown で案内する補助ファイルです。robots.txt がクロール可否の指示なのに対し、llms.txt は「AI に読んでほしい代表的なページの一覧」を伝える発見補助の位置づけです。詳細はllms.txt の解説記事にまとめています。

ファイル役割AI 検索での効果
robots.txtクロール可否のヒントクロール許可した範囲が AI に届く可能性が上がる
sitemap.xmlクロールしてほしい URL の一覧検索エンジン・AI に発見されやすくなる
llms.txtAI に読んでほしい代表ページの案内AI が短時間でサイト概要を把握しやすくなる

07.よくある失敗

  • robots.txt を設定すれば検索結果からも消えると考える(クロール可否と検索表示は別レイヤー)。
  • 管理画面用の Disallow を本番公開時に外し忘れ、本番ページがクロールできない状態になる。
  • 全 AI クローラーを拒否したまま、AI 検索での引用が出ないと悩む。
  • 重要ページを JavaScript 内のリンクだけで結び、HTML レベルでクロール経路がない。

08.よくある質問(FAQ)

Googlebot と AI クローラーは同じものですか?

別物です。Googlebot は通常検索のクロール用、Google-Extended は Gemini など Google 生成 AI 用と用途が分かれています。OpenAI も学習用 GPTBot、検索用 OAI-SearchBot、ユーザー操作用 ChatGPT-User と分かれており、目的別に許可・拒否を決められます。

robots.txt で全 AI クローラーを拒否しても問題ないですか?

学習データに使われるリスクは下げられますが、AI 検索(ChatGPT search、Perplexity、AI Overview など)から引用・参照される機会も減る可能性があります。事業方針として AI 検索からの流入を期待するかどうかで判断するのがおすすめです。

アクセスログにある User-Agent が本物かどう確認しますか?

Googlebot は逆引き DNS で google.com / googlebot.com に解決できるかを確認します。OpenAI など他社も公式ドキュメントで IP レンジを公開しています。User-Agent 文字列は簡単に偽装できるため、IP でも検証するのが安全です。

llms.txt があれば robots.txt は不要ですか?

別の役割なので両方必要です。robots.txt はクロール可否、llms.txt は AI に読んでほしい代表ページの案内です。AI クローラーの動きを制御したい場合は robots.txt と各社個別仕様で対応し、AI に把握してもらいたい情報は llms.txt で案内するのがおすすめです。

09.まとめ

クローラーは検索エンジンと AI サービスで目的が異なります。検索クローラー(Googlebot / Bingbot)は許可しつつ、AI クローラーは User-Agent ごとに方針を決め、robots.txt で表現します。robots.txt はクロール可否のヒントであり、検索結果からの削除には別の仕組みが必要だという点も押さえましょう。

クローラー設計から AI 検索対策まで

robots.txt と llms.txt を整え、AI 検索時代の流入基盤を作りませんか?

TANTOU では、テクニカル SEO、AI クローラー方針設計、構造化データ、AI 検索対策まで一貫して支援します。

TANTOUの詳細を見る

SEO・AI検索 基礎知識集

一覧に戻る →
この記事をシェア
澤田 翔太(Shota Sawada)
この記事を書いた人

澤田 翔太

株式会社クリプタル 代表取締役

1988年生まれ、慶應義塾大学卒。創業メンバーとして関わった株式会社セールスサポートを株式会社ネオマーケティング(東証STD 4196)に売却。株式会社クリプタルでも複数の事業立ち上げと売却を経験し、2022年9月には婚活・恋愛メディア「シッテク」「婚活会議」を株式会社ベビーカレンダー(東証GRT 7363)へ売却。現在はAI業務支援事業、TANTOU事業、グロースハック支援事業、メディア事業、SEOコンサルティング事業を手がける。