AIクローラーは、運営会社名だけで一律に許可・拒否を決めるものではありません。「検索・回答での参照」と「AIモデルの学習」を分けて判断することが重要です。同じ事業者でも、用途ごとに別のユーザーエージェントを用意している場合があります。
たとえばOpenAIでは、ChatGPT検索での発見や要約表示に関係するOAI-SearchBotと、将来のモデル改善に使われ得るGPTBotが区別されています。Anthropicも、学習、検索、ユーザー要求による取得を別のボットとして案内しています。
この記事では、公式情報で役割またはrobots.txt上の指定方法を確認できる主要なAIクローラーを整理します。検索露出、AI回答での参照、学習利用、サーバー負荷という目的別に、robots.txtをどう運用するかも解説します。
AIクローラーは用途別に許可・拒否を判断する
AIクローラーへの対応では、サービス名ではなく、対象ユーザーエージェントの取得目的を確認してください。検索結果やAI回答で自社ページを発見・参照してほしい場合と、将来のAIモデル学習への利用を抑えたい場合では、設定対象が異なります。
たとえば、学習用クローラーだけを拒否し、検索・回答用クローラーは許可する方針は可能です。反対に、AI関連のクローラーをまとめて拒否すると、意図せずAI検索や回答型サービスでの発見性を下げるおそれがあります。
| 確認する観点 | 主な判断内容 |
|---|---|
| 検索・回答での露出 | AI検索や回答サービスから、ページの発見・リンク・要約参照を期待するか |
| モデル学習 | 公開コンテンツが将来のモデル改善・学習候補として収集されることを許容するか |
| ユーザー起点の取得 | 利用者がAIにページ閲覧や操作を依頼した際のアクセスを許可するか |
| 技術的な負荷 | WAF、CDN、サーバー容量、クロール頻度に問題がないか |
| 公開範囲 | 個人情報、契約情報、会員限定情報などが公開領域に混在していないか |
robots.txtでクロールを許可しても、検索結果への掲載、AI回答での引用、検索順位は保証されません。クロール可能であることは、候補ページとして発見・評価され得る条件の一つです。
主要AIクローラー一覧|ユーザーエージェントと役割
以下は、各社の公式情報で役割またはrobots.txtの指定方法を確認できる主な対象です。仕様は変更され得るため、設定直前に公式ドキュメントを再確認することを前提にしてください。
| 運営元 | クローラー名・指定 | 主な役割 | 学習用途との関係 |
|---|---|---|---|
| OpenAI | GPTBot | 将来のモデル改善に使われ得る公開Webコンテンツの取得 | 関係あり |
| OpenAI | OAI-SearchBot | ChatGPT検索での発見、要約、スニペット、リンク表示に関係 | 公式FAQでは学習用として案内されていない |
| OpenAI | ChatGPT-User | ユーザーの操作・要求に伴うWebアクセス | 用途は検索インデックス用クロールと異なる |
| Googlebot | Google検索向けのクロール・インデックス | Google-Extendedとは別管理 | |
| Google-Extended | Gemini関連の学習・一部グラウンディング利用を制御するrobots.txtトークン | 関係あり | |
| Anthropic | ClaudeBot | モデル開発・学習候補となり得る公開コンテンツの取得 | 関係あり |
| Anthropic | Claude-SearchBot | Claude検索の品質・関連性向上のためのWeb巡回 | 公式案内では検索用途 |
| Anthropic | Claude-User | Claude利用者の要求に応じたWebコンテンツ取得 | 公式案内では学習用途ではない |
| Microsoft / Bing | bingbot | Bing検索のクロール・インデックス | 専用の学習用UAとしては扱わない |
| Perplexity | PerplexityBot | Perplexity検索結果でのWebサイト表示・リンク | 公式案内では基盤モデル学習に使わない |
| Perplexity | Perplexity-User | ユーザー要求に応じたページ取得 | 公式案内では学習用途ではない |
表の「検索・回答への関係」は、AI回答への掲載を保証する意味ではありません。サービス側の選定基準、ページの品質、質問との関連性、鮮度などにより、実際の表示は変わります。
OpenAI:GPTBot・OAI-SearchBot・ChatGPT-User
OpenAIでは、GPTBotとOAI-SearchBotを同じ目的のクローラーとして扱わないことが重要です。GPTBotは学習利用、OAI-SearchBotはChatGPT検索を検討する対象です。
OpenAIの公式FAQでは、ChatGPTの要約やスニペットにコンテンツを含めたい場合はOAI-SearchBotをブロックしないよう案内しています。一方、将来の学習対象から外したいサイトやページについては、GPTBotを拒否する方法が案内されています。
出典:OpenAI Help Center「Publishers and Developers – FAQ」
ChatGPT-Userは、ユーザーが明示的に閲覧や操作を求めた際のアクセスに関係する識別子です。定期的な検索インデックス用クロールとは性質が異なるため、ChatGPT-Userだけを前提に固定的な運用を作るのではなく、実装時点のOpenAI公式仕様を確認してください。
Google:GooglebotとGoogle-Extended
GooglebotはGoogle検索のための通常のWebクローラーです。Google検索、Discover、画像・動画・ニュースなどの検索機能への掲載を維持したい場合、Googlebotを不用意に拒否しないことが基本です。
Google-Extendedは、通常のHTTPリクエストで送られる独立したクローラー名ではなく、Googleが既存のクローラーで取得したコンテンツについて、Gemini関連の将来モデル学習や一部グラウンディング用途への利用可否を制御するrobots.txtトークンです。
Googleは、Google-Extendedの指定がGoogle検索への登録やGoogle検索のランキングに影響しないと案内しています。Google検索を止めずにGoogle-Extendedの対象用途だけを制限したい場合は、GooglebotではなくGoogle-Extendedを個別に指定します。
出典:Google for Developers「Google’s common crawlers」
Anthropic:ClaudeBot・Claude-SearchBot・Claude-User
AnthropicはClaudeBot、Claude-SearchBot、Claude-Userを別用途のボットとして説明しています。ClaudeBotの拒否だけでは検索やユーザー取得は止まりません。
- ClaudeBot:将来のAIモデル学習データに寄与し得るWebコンテンツの取得
- Claude-SearchBot:検索結果の品質・関連性・精度向上を目的としたWeb巡回
- Claude-User:Claude利用者の要求に応じたWebコンテンツ取得
Anthropicは、各ボットがrobots.txtの標準的なクロール拒否指示に従うと案内しています。またClaude-SearchBotやClaude-Userを停止すると、Claudeの検索やユーザー要求による参照の可視性・精度に影響する可能性があると説明しています。
Microsoft/Bing・Perplexity:bingbot・PerplexityBot
bingbotはBing検索のインデックスを作成・更新するクローラーです。Microsoftの検索体験やCopilot関連のWeb参照を意識する場合も、まずはBing検索のクロールを不要に止めていないか確認するとよいでしょう。
Bingは、bingbotがrobots.txtを参照してクロール対象を判断すると案内しています。また、ユーザーエージェント文字列は偽装できるため、アクセス制御や障害対応ではBing Webmaster Toolsなどで正規のbingbotか確認する必要があります。
出典:Bing Webmaster Tools「How to Report an Issue with Bingbot」
PerplexityBotは、Perplexity上の検索結果でWebサイトを表示・リンクするためのクローラーです。Perplexityは同ボットをAI基盤モデルの学習用には使用しないと説明しています。Perplexity-Userはユーザー要求に応じた取得用であり、公式文書では、この種のユーザー要求によるフェッチでは通常robots.txtルールを無視すると案内されています。
出典:Perplexity Documentation「Perplexity Crawlers」
robots.txtでAIクローラーを許可・拒否する書き方
robots.txtは、サイトのドメイン直下に置くテキストファイルです。クローラーごとにクロールを避けてほしいURLパスを伝えます。基本はUser-agentとDisallowの組み合わせです。
User-agent: クローラー名
Disallow: /拒否したいパス/
サイト全体へのクロールを拒否する場合は、Disallowの値を「/」にします。特定ディレクトリだけを拒否する場合は対象パスを指定します。Allowは、広い範囲を拒否したうえで特定パスだけを許可したい場合に使います。
User-agent: ExampleBot
Disallow: /members/
Allow: /members/public-guide/
robots.txtは、ホスト、プロトコル、ポートごとに適用範囲が分かれます。wwwあり・なし、サブドメイン、HTTP・HTTPSで配信先が異なる場合は、意図した公開URLのドメイン直下にあるrobots.txtを確認してください。
出典:Google for Developers「How Google interprets the robots.txt specification」
特定の学習用クローラーだけを拒否する例
検索・回答での参照余地を残しながら、公式に学習用途として区別されているクローラーを制限したい場合は、個別に記述します。以下は構文例です。既存のrobots.txtルールとの競合確認が必要です。
User-agent: GPTBot
Disallow: /
User-agent: ClaudeBot
Disallow: /
この例で拒否するのはGPTBotとClaudeBotだけです。OAI-SearchBot、Claude-SearchBot、Googlebot、bingbotを一緒に拒否する設定ではありません。目的が明確でない限り、「AIボットを全部拒否」といった包括的な設定は避けたほうが管理しやすくなります。
検索・回答用クローラーを許可する際の確認点
robots.txtに拒否ルールがない場合でも、WAFやCDNなど別の層でアクセスが遮断されていればクロールできません。robots.txtとWAFの双方を確認することが大切です。
- robots.txtに対象クローラーのDisallowがないか
- CDNやWAFが正規クローラーを403エラーで拒否していないか
- ログイン必須や地域制限により重要ページへ到達できない状態ではないか
- noindex、X-Robots-Tag、canonicalなどの検索制御が意図どおりか
- サイトマップと内部リンクから重要ページを発見できるか
許可設定をしても、検索順位、AI回答での引用、リンク掲載、要約表示は保証されません。ページの品質、質問との関連性、更新性、サービス側の選定基準など、複数の要素で結果が変わります。
Google-Extendedを指定する場合の注意点
Google検索のクロールを継続しながら、Google-Extendedの対象となるGemini関連の利用を制限したい場合は、Google-Extendedを個別に指定します。
User-agent: Google-Extended
Disallow: /
この記述はGooglebotを拒否するものではありません。反対に、Googlebotを拒否するとGoogle検索、Discover、画像・動画・ニュースなどのGoogle検索機能に影響します。GooglebotとGoogle-Extendedは代替関係ではありません。
出典:Google Search Central「What Is Googlebot」
目的別|AIクローラーを許可・拒否する判断の目安
設定の正解は、サイトの収益構造、コンテンツの性質、権利方針、インフラ構成によって異なります。以下は一律の推奨ではなく、自社方針を決めるための検討材料です。
| 優先したい目的 | 検討しやすい方向性 | 注意点 |
|---|---|---|
| 検索流入やAI検索での発見性 | Googlebot、bingbot、OAI-SearchBot、Claude-SearchBot、PerplexityBotを一律拒否しない | 許可しても引用・掲載・順位は保証されない |
| AIモデル学習を抑えたい | GPTBot、ClaudeBot、Google-Extendedなど、用途が確認できる対象を個別に制限する | 対応事業者がrobots.txtを遵守することを前提とした意思表示である |
| サーバー負荷を抑えたい | ログ分析、WAF、CDN、キャッシュ、レート制限、公式管理ツールを併用する | 正規クローラーの誤遮断は検索露出に影響し得る |
| 非公開情報を守りたい | 認証、認可、URL設計、アクセス制御を実装する | robots.txtだけでは保護にならない |
検索流入やAI検索での発見性を優先したい場合
検索流入やAI回答からの参照を期待する場合、学習用と検索用をまとめて拒否しないことを検討します。特にGooglebotやbingbotを拒否すると、従来の検索エンジンにおける発見性にも影響し得ます。
ChatGPT検索での表示を検討する場合、OpenAIはOAI-SearchBotをブロックしないよう案内しています。Anthropicも、Claude-SearchBotを停止するとClaude検索での可視性や正確性に影響する可能性があると説明しています。
AIモデルの学習利用を抑えたい場合
学習利用を抑えたい場合は、GPTBotやClaudeBotのように、公式に学習・モデル開発用途として説明されている対象を個別に拒否する考え方が分かりやすいでしょう。GoogleではGoogle-ExtendedがGoogle検索とは別にGemini関連の用途を管理するトークンとして提供されています。
ただし、robots.txtを設定しても、設定前に取得された情報、第三者サイトへ転載された情報、別の検索インデックスやキャッシュにある情報まで一律に削除されるわけではありません。robots.txtは将来のクロール方針を伝える仕組みとして理解してください。
サーバー負荷やコンテンツ保護を重視する場合
クロール負荷が問題になっている場合は、robots.txtだけで解決しようとせず、アクセスログでユーザーエージェント、送信元IP、アクセス頻度、HTTPステータス、取得URLを確認してください。正規クローラーであれば、公式管理ツール、WAFルール、CDNキャッシュ、レート制限などを組み合わせる余地があります。
会員限定コンテンツ、個人情報、管理画面、見積書、顧客データ、限定配布資料などをrobots.txtで隠してはいけません。拒否したURLパスはrobots.txtから推測できる場合もあります。非公開情報は認証・認可で保護することが必須です。
AIクローラーを拒否した場合の影響とrobots.txtの限界
AIクローラーを拒否する際は、「拒否すればAI回答から完全に消える」「許可すれば必ず引用される」と考えないことが大切です。robots.txtの設定と実際の表示結果は同義ではありません。
たとえばページのクロールを拒否していても、他サイトのリンク、ページタイトル、既存の検索インデックス、過去のキャッシュなどを根拠に、サービス側が限定的な情報を表示する可能性があります。OpenAIも、クロール禁止ページについて、第三者の検索プロバイダーなどからURLを取得した場合に、リンクとページタイトルだけを表示する場合があると案内しています。
出典:OpenAI Help Center「Publishers and Developers – FAQ」
robots.txtはアクセスを技術的に遮断する仕組みではない
robots.txtは、Robots Exclusion Protocolに対応するクローラーへクロール方針を伝えるファイルです。すべてのアクセスを止めるファイアウォールではありません。
robots.txtを無視するボット、偽装されたユーザーエージェント、利用者自身のブラウザアクセスをrobots.txtだけで防ぐことはできません。取得自体を制限したい場合は、ログイン認証、IP制限、署名付きURL、WAF、レート制限、CAPTCHA、アプリケーション側の認可を利用してください。
ユーザーエージェント名だけで正規クローラーと判断しない
アクセスログにGooglebotやbingbotと表示されていても、本物とは限りません。ユーザーエージェント文字列は偽装できるため、UA文字列だけでアクセス許可しないことが重要です。
Googleは逆引きDNSと正引きDNS、または公開IPレンジによる検証を案内しています。BingもBing Webmaster Toolsの検証機能を案内しています。PerplexityはWAF設定時にユーザーエージェントと公式IPレンジを組み合わせる方法を示しています。
出典:Google Search Central「What Is Googlebot」
WordPressでrobots.txtを確認・編集する手順
WordPressでは、robots.txtがサーバー上の物理ファイルとして存在する場合と、WordPressやSEOプラグインが仮想的に出力する場合があります。編集前後に公開URLで実際の内容を確認することが重要です。
まず公開URLのrobots.txtを確認する
ブラウザで次のURLを開き、現在配信されているrobots.txtを確認します。
https://example.com/robots.txt
管理画面の設定内容ではなく、外部へ実際に返されている内容を基準にしてください。wwwあり・なし、サブドメイン、ステージング環境でURLが異なる場合、それぞれ別のrobots.txtとして扱われることがあります。
編集場所を特定する際は、テーマやプラグインの設定、サーバーのファイルマネージャー、FTP/SFTP上のrobots.txt、CDNやホスティング側のルールを確認します。複数の場所で設定すると有効な設定が分かりにくくなるため、管理場所はできるだけ一本化しましょう。
編集後はキャッシュ・CDNを含めて反映を確認する
robots.txtを更新したら、公開URLで意図したUser-agent、Disallow、Allowが配信されているか確認します。管理画面の保存だけで完了にしないことが大切です。
- 公開中のrobots.txtを保存し、変更前の状態を控える
- 対象クローラーだけを追加または変更する
- 必要に応じてキャッシュやCDNをパージする
- 公開URLで最終的なrobots.txtを確認する
- Google Search Console、Bing Webmaster Tools、アクセスログで継続確認する
Bing Webmaster Toolsにはrobots.txtのテスト機能があります。Google検索向けの変更では、Google Search ConsoleのURL検査も併用すると、意図しないクロール停止を発見しやすくなります。
出典:Bing Webmaster Tools「How to Create a robots.txt File」
AIクローラー運用でよくある質問
設定変更は検索流入やコンテンツ活用方針に影響し得ます。変更後すぐに結論を出すのではなく、robots.txt・ログ・検索パフォーマンスを継続確認する運用が適しています。
AIクローラーを拒否するとGoogle検索順位は下がりますか?
学習用のGPTBotやClaudeBotだけを拒否したことが、Google検索順位を直接下げるとは一概にいえません。一方、Googlebotを拒否すればGoogle検索のクロールやインデックスに影響します。Google検索を維持したい場合は、GooglebotとGoogle-Extendedを混同せず、目的別に設定してください。
robots.txtでAI学習を完全に止められますか?
完全には止められません。robots.txtは対応するクローラーに方針を示す仕組みであり、取得済みデータ、第三者サイト上の転載、robots.txtを無視する取得者までは制御しません。公開してはいけない情報は、認証・権限管理・アクセス制御で保護してください。
GooglebotとGoogle-Extendedはどちらを指定すべきですか?
Google検索のクロールやインデックスを制御したいならGooglebot、Gemini関連の将来モデル学習やGoogleが示す一部グラウンディング用途を制御したいならGoogle-Extendedを検討します。Google検索への露出を維持したい場合は、Google-Extendedの代わりにGooglebotを拒否しないことが重要です。
まとめ|AIクローラーは役割と公式仕様を確認して個別に管理する
AIクローラー対策で最も重要なのは、AIだからという理由でまとめて拒否しないことです。GPTBotとOAI-SearchBot、ClaudeBotとClaude-SearchBot、GooglebotとGoogle-Extendedのように、同じ事業者内でも目的が異なります。
検索・AI回答での発見性を優先するのか、モデル学習への利用を抑えたいのか、サーバー負荷を抑えたいのかを整理し、ユーザーエージェント単位でrobots.txtを設計してください。設定後は公開中のrobots.txt、WAF、CDN、アクセスログを確認し、各社の公式仕様が更新されていないか定期的に見直しましょう。
また、robots.txtは非公開情報を守るための仕組みではありません。会員限定情報、個人情報、機密資料などは、robots.txtではなく認証とアクセス権限の設計で保護してください。