robots.txtとは?
robots.txt は、サイトのルート(https://example.com/robots.txt)に置くテキストファイルで、クローラーに「クロールしてほしくない領域」を伝える仕組みです。Google 検索セントラルのrobots.txt の概要とrobots.txt ファイルの作成に標準仕様がまとまっています。
AI クローラー(GPTBot、ClaudeBot、Claude-SearchBot、PerplexityBot など)にも User-Agent 別のディレクティブで指定できます。Google-Extended は HTTP 上の独立した User-Agent ではなく、Google の既存クロール結果を Gemini / Vertex AI for Gemini が学習・grounding に使うかを制御する robots.txt 用トークンとして指定します。
検索結果から確実に消したいページは noindex を使い、クロール可能な状態で運用します。robots.txt と noindex の役割を取り違えると、古いインデックスが残ったまま消えなくなる事故が起こります。
01.robots.txt とは
robots.txt は Robots Exclusion Protocol(REP)に基づく標準仕様です。サイトのルートに UTF-8 のテキストファイルとして配置すると、クローラーがアクセス時に最初に読み込みます。Google・Bing・主要 AI クローラーなど、ほとんどの「行儀のよい」クローラーは指示に従いますが、悪意のある bot は無視するため、機密情報の保護目的では使えません。
02.ディレクティブ一覧(User-agent / Disallow / Allow / Sitemap)
| ディレクティブ | 意味 | 備考 |
|---|---|---|
| User-agent | 対象クローラーを指定(* は全クローラー) | User-agent ブロックごとにルールをまとめる |
| Disallow | 指定パス以下のクロールを拒否 | 「/」だけだとサイト全体を拒否 |
| Allow | Disallow の例外として個別パスを許可 | Disallow と組み合わせて使う |
| Sitemap | sitemap.xml の URL をクローラーに通知 | User-agent ブロックの外に書ける |
03.書き方サンプル
管理画面・検索結果ページ・パラメータ URL など、検索結果に出す必要がない領域を Disallow するのが基本パターンです。検索クローラーは原則許可します。
# 全クローラー共通の Disallow
User-agent: *
Disallow: /admin/
Disallow: /search
Disallow: /*?session_id=
# Search engines
User-agent: Googlebot
Allow: /
User-agent: bingbot
Allow: /
# AI 学習用クローラー
User-agent: GPTBot
Disallow: /
User-agent: ClaudeBot
Disallow: /
# Google が既存クロール結果を Gemini / Vertex AI で使うかの制御トークン
User-agent: Google-Extended
Disallow: /
# AI 検索クローラー
User-agent: OAI-SearchBot
Allow: /
User-agent: Claude-SearchBot
Allow: /
User-agent: PerplexityBot
Allow: /
# ユーザー起点 fetcher(robots.txt が適用されない場合があると公式明記)
User-agent: ChatGPT-User
Allow: /
User-agent: Claude-User
Allow: /
User-agent: Perplexity-User
Allow: /
# サイトマップの場所を通知
Sitemap: https://example.com/sitemap.xml04.AI クローラーへの指定
AI クローラーは目的別に分かれており、User-Agent ごとに方針を決められます。学習用と検索・回答生成用を分けることで、AI 検索からの引用を残しつつ、学習データへの利用を抑える運用も可能です。詳しくはクローラーの解説記事にもまとめています。
| User-Agent / トークン | 提供元 | 主な目的 |
|---|---|---|
| GPTBot | OpenAI | OpenAI モデル学習用クローラー |
| OAI-SearchBot | OpenAI | ChatGPT search の検索用 |
| ChatGPT-User | OpenAI | ユーザー起点 fetch(robots.txt 適用外と公式明記) |
| ClaudeBot | Anthropic | Claude モデル開発・学習候補 |
| Claude-SearchBot | Anthropic | Claude の検索結果品質向上 |
| Claude-User | Anthropic | Claude のユーザー起点 fetch |
| PerplexityBot | Perplexity | Perplexity の検索インデックス用 |
| Perplexity-User | Perplexity | ユーザー起点 fetch(robots.txt を一般に無視と公式明記) |
| Google-Extended(robots.txt トークン) | Google 既存クロール結果を Gemini / Vertex AI for Gemini で使うか制御 |
ChatGPT-User、Claude-User、Perplexity-User は、AI 上でユーザーが操作してリンクを開いた瞬間のリクエストです。OpenAI / Perplexity の公式ドキュメントでは robots.txt ルールが適用されない/一般に無視される旨が明記されています。Disallow しても、ユーザー操作起点の fetch は止まらない前提で扱うのが安全です。
上のような AI クローラー別の許可・拒否設定は、当サイトの無料ツールでクローラーごとにチェックボックスを選ぶだけでも作成できます。
クローラーごとに許可/拒否を選ぶと、そのまま使える robots.txt をその場で生成します(ブラウザ内で処理、サーバー送信なし)。
AI学習用クローラー
生成AIモデルの学習データ収集。拒否しても検索順位やAI検索からの引用には影響しません。
AI検索用クローラー
AI検索の索引・引用元の収集。拒否するとAI検索の回答に自サイトが引用されなくなります(LLMOに影響)。
ユーザー操作による取得(AI)
ユーザーの質問に応じてリアルタイムにページを取得するエージェント。robots.txt に従わない場合があります。
検索エンジン
検索結果の索引作成。拒否すると検索結果に表示されなくなるため、通常は許可のままにします。
SEO分析ツール
被リンク・競合分析ツールの収集。拒否しても検索順位には影響しません(競合からの分析を防ぎたい場合に拒否)。
# クローラーはすべて許可(既定で許可のため個別指定は不要) User-agent: * Allow: /
生成した内容をサイトのルート(https://あなたのドメイン/robots.txt)に設置してください。
既存の robots.txt がある場合は、既存のルールを消さないように追記します。
05.noindex との使い分け
| やりたいこと | 選ぶべき手段 |
|---|---|
| クロール自体を止めて、サーバー負荷を抑えたい | robots.txt の Disallow |
| クロールはさせるが、検索結果には出したくない | meta robots noindex(または X-Robots-Tag) |
| 重複 URL の代表 URL を伝えたい | rel="canonical" |
| 古い URL を別 URL に集約したい | 301 リダイレクト |
robots.txt で Disallow したページに noindex を入れても、Google はページにアクセスできず noindex タグを読めません。古いインデックスが残ったまま消えない事故につながります。検索結果から外したいページは、クロール可能な状態で noindex を返す運用が原則です。
noindex の指定方法と使うべきページは別記事で詳しく整理しています。あわせてご覧ください。
noindexとは?SEOで検索結果に出さない設定と使い方を解説
meta robots / X-Robots-Tag の書き方、robots.txt / canonical / nofollow との違い、AI Overview への影響をまとめています。
06.Search Console での検証
書いた robots.txt が想定通りに動くかは、Search Console のrobots.txt レポートで確認します。記述ミス(タイポ、改行コード、エンコーディング)があると、想定と違う領域がブロックされる、もしくは想定通りにブロックされない、といった事故が起きます。
Search Console の確認前に手早く目視したいときは、当サイトの無料ツールで、クローラーごとの許可・拒否をその場で確認できます。
サイトのURLを入力するか robots.txt の内容を直接貼り付けると、AIクローラー・検索エンジンごとのアクセス可否をその場で判定します。
- 本番反映前に robots.txt レポートでテストする。
- 重要ページの URL 検査で「robots.txt によりブロックされています」が出ていないかを確認する。
- 新しいディレクトリを Disallow する場合は、本番反映後にも数日見ておく。
07.よくある失敗
- noindex したいページを robots.txt でブロックする(クロール不可なため反映されない)。
- 開発環境用の
Disallow: /を本番リリース時に外し忘れ、サイト全体が検索結果から消える。 - 管理画面ディレクトリへの Disallow を忘れ、検索結果に意図しないページが出る。
- AI クローラー全部を拒否したまま、AI 検索からの引用を期待してしまう。
08.よくある質問(FAQ)
robots.txt でページを検索結果から削除できますか?
削除を保証するものではありません。クロールは止められますが、すでにインデックスされたページが残るケースがあります。検索結果から確実に外したい場合は noindex、緊急で消したい場合は Search Console の削除ツールを使います。
robots.txt にサイトマップを書いてもよいですか?
はい。Sitemap ディレクティブで sitemap.xml の URL を通知できます。User-agent ブロックの外に書きます。複数のサイトマップがある場合は、複数行書くか、サイトマップインデックスファイルを使います。
AI クローラーも robots.txt に従いますか?
GPTBot、ClaudeBot、Google-Extended、PerplexityBot などの主要 AI クローラーは、それぞれ公式に robots.txt 対応を表明しています。一方で、すべてのクローラーが従う保証はありません。学習用途を確実に止めたい場合は、ログイン制限や個別契約など別の手段も検討します。
robots.txt と robots meta タグはどう違いますか?
robots.txt はサイトレベルでのクロール可否、robots meta タグはページレベルでのインデックス可否やスニペット制御を担当します。両者は同時に使えますが、目的が違うので適切に組み合わせます。
09.まとめ
robots.txt は、クロール可否のヒントを伝える標準仕様です。検索クローラーは原則許可し、不要な領域を Disallow するのが基本。AI クローラーは User-Agent ごとに方針を決められます。noindex とは目的が違うため、検索結果から削除したいページは noindex を別途使いましょう。Search Console の robots.txt レポートと URL 検査で、想定通りに動いているかを定期的に確認するのがおすすめです。
robots.txt と AI クローラー方針の設計をセットで支援します
TANTOU では、テクニカル SEO、AI クローラー方針設計、構造化データ、AI 検索対策まで一貫して支援します。
SEO・AI検索 基礎知識集
一覧に戻る →基本概念
コンテンツ設計・品質
サイト構造・リンク設計
エンティティ・構造化データ
クロール・インデックス制御
- ›クロールバジェットとは?
- ›robots.txtとは?(この記事)
- ›sitemap.xmlとは?
- ›noindexとは?
- ›noindexを使うべきページ
- ›nofollowとは?
- ›クロール済みインデックス未登録の直し方
- ›リダイレクトとは?

