Google検索からの流入を維持したい場合、Googlebotをrobots.txtで拒否しないことが基本です。一方、Googleの生成AI機能でのコンテンツ利用について方針を示したい場合は、Googlebotではなく「Google-Extended」を個別に設定します。
Google-Extendedだけを拒否しても、Google検索のクロール、インデックス登録、検索順位を直接止める設定にはなりません。検索掲載を維持しながら、Googleが案内する生成AI向けの学習・グラウンディング利用について意思を示すことは可能です。
ただし、robots.txtは公開済み情報を非公開にする仕組みではありません。検索結果から消したいのか、AI利用方針を示したいのか、機密情報を守りたいのかで必要な対策は異なります。
Google検索を維持しながらAI利用を制御する結論
Google検索への掲載を続けたいサイトはGooglebotを許可し、Googleが案内する生成AI用途だけを制限したい場合にGoogle-Extendedを拒否します。検索用と生成AI用の設定を混同しないことが、意図しない検索流入の減少を防ぐポイントです。
| 自社の方針 | Googlebot | Google-Extended | 主な対応 |
|---|---|---|---|
| Google検索を維持し、AI利用だけ制限したい | 拒否しない | 拒否する | 検索クロールは維持し、生成AI向け利用の方針を示す |
| Google検索と生成AIでの利用を許容する | 拒否しない | 拒否しない | Google-Extendedを明示的にブロックしない |
| 検索結果に出したくない公開ページがある | 目的に応じて許可 | 別途判断 | noindex、削除、認証などを検討する |
| 機密情報・会員限定情報を守りたい | 必要に応じて制御 | 必要に応じて制御 | 認証・権限管理・サーバー側のアクセス制限を優先する |
Googleの公式情報では、Googlebot向けのクロール設定はGoogle検索、Discover、Google画像、GoogleニュースなどのGoogle検索機能に関係します。一方、Google-Extendedは、Google検索への掲載やGoogle検索のランキングシグナルに影響しない、生成AI向けのプロダクトトークンと説明されています。
出典:Google for Developers「Google’s common crawlers」
検索掲載を維持してGoogle-Extendedだけを拒否するrobots.txtの設定例
Google検索の掲載を維持したままGoogle-Extendedを拒否したい場合は、既存のrobots.txtにGoogle-Extended専用のグループを追加します。Googlebotへの拒否設定を追加しないことが重要です。
robots.txtは、クローラーなどに対してサイト内のURLへのアクセス可否を伝えるファイルです。Google-Extendedは通常の検索クローラー名とは異なり、HTTPリクエストで独自のユーザーエージェントを名乗るものではありません。robots.txt上でGoogleの生成AI利用に関する意思を示すためのトークンとして扱われます。
出典:Google for Developers「Google’s common crawlers」
サイト全体でGoogle-Extendedを拒否する記述例
サイト全体についてGoogle-Extendedを拒否する最小構成は、次のとおりです。Disallow: / はサイト全体を対象にします。
User-agent: Google-Extended
Disallow: /
この記述はGooglebotを対象にしていないため、それ自体でGoogle検索のクロールを止めるものではありません。ただし、同じrobots.txt内にGooglebotを拒否する記述がないか、編集前後に必ず確認してください。
一部のディレクトリだけ利用を制限する記述例
制限対象を特定の配下に絞る場合は、Disallowに対象パスを指定します。たとえば、/members-only/配下を対象とする記述例は次のとおりです。
User-agent: Google-Extended
Disallow: /members-only/
この例は、/members-only/配下についてGoogle-Extendedの対象外とする意思を示します。実装前には、対象URL、末尾スラッシュの有無、画像やPDFなどの関連ファイルの配置先を確認してください。WordPressでは、投稿、固定ページ、添付ファイル、カテゴリーのURLが想定と異なる場合があります。
既存のGooglebot設定がある場合の書き方
既存のrobots.txtにGooglebotのグループがある場合でも、Google-Extendedは別グループで追加します。対象ごとにグループを分けて管理すると、意図を確認しやすくなります。
User-agent: Googlebot
Disallow: /wp-admin/
Allow: /wp-admin/admin-ajax.php
User-agent: Google-Extended
Disallow: /
Google検索を維持したいサイトで、Googlebotに対して次のような記述を加えることは慎重に判断してください。
User-agent: Googlebot
Disallow: /
Googlebotをサイト全体でブロックすると、Googleがページを取得しにくくなり、Google検索や関連する検索機能への表示・更新に影響する可能性があります。検証環境を除き、サイト全体の指定を安易に行わないほうが安全です。
出典:Google Search Central「Googlebot」
GooglebotとGoogle-Extendedの違い
GooglebotとGoogle-Extendedは、どちらもrobots.txtで指定できますが、役割は異なります。Googlebotは検索クローラー、Google-ExtendedはAI利用の制御トークンと捉えると設定を判断しやすくなります。
| 項目 | Googlebot | Google-Extended |
|---|---|---|
| 主な役割 | Google検索向けにWebページをクロールする | Googleの生成AIにおける学習・グラウンディング利用の意思を管理する |
| robots.txtでの指定 | User-agent: Googlebot |
User-agent: Google-Extended |
| Google検索への影響 | クロール制御が検索機能に影響し得る | 検索掲載・ランキングシグナルには影響しないとGoogleが説明 |
| 独自のHTTPユーザーエージェント | Googlebot Smartphone、Googlebot Desktopなどがある | 独自のHTTPユーザーエージェントではない |
Googleの公式ドキュメントでは、Google-Extendedは、将来世代のGeminiモデルのトレーニングと、Gemini AppsおよびVertex AIのGrounding with Google Searchにおけるグラウンディングのために、Googleがクロールしたコンテンツを利用できるか管理するトークンとされています。対象機能や名称は変更される可能性があるため、重要な方針決定の前には公式情報を再確認してください。
出典:Google for Developers「Google’s common crawlers」
Googlebotを拒否するとGoogle検索にどう影響するか
Googlebotをrobots.txtで拒否すると、Googleは対象ページを取得しにくくなります。その結果、検索結果での表示、ページ内容の更新、Google検索の各機能への参加に影響する可能性があります。検索流入を重視するサイトでは全体拒否を避けるのが基本です。
ただし、robots.txtでクロールを拒否したことと、URLが検索結果から完全に消えることは同義ではありません。外部サイトからリンクされているURLなどは、Googleが本文を取得できない状態でも、URLのみが検索結果に表示される場合があります。検索結果から外したい場合は、目的に応じてnoindex、ページ削除、認証を検討してください。
出典:Google Search Central「Robots.txt Introduction and Guide」
Google-Extendedを拒否すると何が変わるか
Google-Extendedを拒否すると、Googleに対して、サイトからクロールしたコンテンツを指定された生成AI用途に利用させない意思を示します。Google検索の掲載を止める指定ではありません。
Googleは、Google-ExtendedがGoogle検索への掲載に影響せず、Google検索のランキングシグナルとしても使用しないと説明しています。そのため、Google-Extendedの拒否そのものを理由に、SEO順位が下がる、またはインデックスが消えるとはいえません。一方で検索順位は多数の要因で変動するため、個別サイトの順位変動をこの設定だけで説明することもできません。
出典:Google for Developers「Google’s common crawlers」
自社方針別:GooglebotとGoogle-Extendedの選び方
設定は「AIに使われたくないか」だけで決めず、検索流入、コンテンツの権利、公開情報の性質、社内規程を合わせて判断します。公開範囲の管理とAI利用方針は別問題です。
検索流入を優先し、AI利用だけを制限したい場合
オウンドメディア、企業サイト、ECサイトなどでGoogle検索からの流入を維持したい場合は、Googlebotを拒否せず、Google-Extendedだけを拒否する方法を検討できます。自社独自のノウハウ、編集コンテンツ、商品説明を検索には公開しつつ、Googleの生成AI用途には利用させない方針を示したい場面に適しています。
ただし、この設定だけで転載、引用、画面保存、第三者による手動取得、他社ボットによる取得まで防げるわけではありません。コンテンツの利用範囲を広く管理したい場合は、他社のクローラー方針、利用規約、ライセンス表記も別途検討する必要があります。
Google検索と生成AIでの利用を許容する場合
Google検索とGoogleの生成AI関連機能の双方でコンテンツ利用を許容する方針なら、Google-Extendedを明示的に拒否しない運用になります。robots.txtでは、特定のユーザーエージェントをブロックする記述がなければ、クロールは原則として許可される扱いです。
許可する前には、画像、寄稿原稿、商品データ、引用文、ライセンス素材について、自社に必要な権利や利用許諾があるかを確認してください。公開済みでも無条件に利用許容できるとは限りません。
出典:Google for Developers「Create and Submit a robots.txt File」
公開・クロールそのものを制限すべき情報がある場合
会員限定コンテンツ、個人情報、契約情報、未公開資料、管理画面は、Google-Extendedの拒否だけで守る対象ではありません。robots.txtはアクセス制御ではないため、機密性のある情報には認証、権限管理、サーバー側のアクセス制限を優先してください。
Googleも、robots.txtはページをGoogleから確実に非表示にする仕組みではないと案内しています。非公開情報はURLを公開しない設計を優先することが大切です。
出典:Google Search Central「Robots.txt Introduction and Guide」
設定前後に確認したいrobots.txtの実務チェック
robots.txtは少ない記述でも対象範囲を大きく変え得ます。変更前のバックアップと公開後の確認をセットにすることで、設定ミスの早期発見につながります。
対象ホストのrobots.txtを確認する
robots.txtは通常、https://example.com/robots.txtのように、対象ホストのルートに配置します。サブドメインを利用している場合、メインドメインとサブドメインは別のrobots.txtとして扱われるため、設定対象のホストを確認してください。
編集前には現在のrobots.txtを保存し、WordPressのSEOプラグイン、キャッシュ機能、サーバー設定など、どの仕組みがrobots.txtを出力しているかも確認します。複数の管理箇所があると、編集内容が上書きされるおそれがあります。
公開URLとSearch Consoleで変更を確認する
公開後は、ブラウザで実際の/robots.txtへアクセスし、Google-ExtendedとGooglebotの記述が意図どおりに表示されるか確認します。管理画面の設定値ではなく公開URLを確認することが重要です。
Googlebotのクロールやインデックス登録の状態は、Google Search ConsoleのURL検査ツールやインデックス登録に関するレポートで確認できます。反映時期はGooglebotがrobots.txtやページを再取得する状況に左右されるため、変更後すぐに結果が出るとは限りません。
出典:Google for Developers「Create and Submit a robots.txt File」
robots.txtで制御できない範囲を理解する
robots.txtは主にクローラーへアクセス方針を伝える仕組みです。過去に取得されたデータ、すでに検索結果に残ったURL、第三者サイトに転載された内容、ユーザーが保存した内容を取り消す機能ではありません。
また、robots.txtを遵守するかどうかはクローラー側の実装にも依存します。Googleは自動クロールでrobots.txtのルールに従うと説明していますが、すべての第三者クローラーに同じ対応を期待することはできません。robots.txtを機密情報の防御策にしないことが必要です。
出典:Google Search Central「Robots.txt Introduction and Guide」
Google-Extended以外のAIクローラーも同じように扱うべきか
他社のAIクローラーも制限したい場合、Google-Extendedの記述をそのままコピーし、名称だけ変える運用は適切ではありません。事業者ごとにトークンと対象用途が異なります。
AI事業者ごとに、robots.txtで使うユーザーエージェント名、学習と検索回答での参照の扱い、適用範囲、方針変更の状況は異なります。制限を検討する場合は、対象事業者の公式ドキュメントを確認し、自社のコンテンツ利用方針に沿って個別に設定してください。
全体方針を作る際は、robots.txtだけで完結させず、公開範囲、コンテンツ利用規約、ライセンス表記、認証設計も見直すことが重要です。特に権利関係が複雑なコンテンツは、必要に応じて社内の法務・権利担当者へ確認してください。
GooglebotとGoogle-Extendedに関するよくある質問
設定時に判断を誤りやすい点を、検索掲載とコンテンツ管理の観点から補足します。
Google-Extendedを拒否するとSEO順位やインデックスは下がりますか
Googleは、Google-ExtendedがGoogle検索への掲載に影響せず、Google検索のランキングシグナルとして使われないと説明しています。Google-Extendedの拒否自体はSEO停止の設定ではありません。
ただし、順位はコンテンツ品質、競合、検索意図、サイトの技術的な問題など多くの要因で変化します。設定後に順位が動いた場合も、Google-Extendedだけを原因と断定せず、Search Consoleのデータやサイト変更履歴とあわせて確認してください。
出典:Google for Developers「Google’s common crawlers」
誤ってGooglebotを拒否した場合はどうすればよいですか
まず、robots.txt内のUser-agent: Googlebotに対する不要なDisallow: /を修正または削除し、正しい内容を公開します。その後、公開URLでrobots.txtを確認し、Search Consoleでクロールやインデックス登録の状況を確認してください。
復旧時期は、Googlebotがrobots.txtと対象URLを再確認するタイミング、サイト規模、内部リンク構造などによって異なります。修正後も継続して状況を観察することが必要です。
robots.txtだけでGoogle検索結果からページを消せますか
robots.txtはクロール制御用であり、検索結果からの確実な削除を目的とする方法ではありません。検索結果に出したくない公開ページには、Googlebotがページを取得できる状態でnoindexを設定する方法が基本です。
Googleは、robots.txtでページをブロックするとGooglebotがnoindexを読み取れず、URLが検索結果に残る場合があると説明しています。緊急の削除、恒久的な非公開化、会員限定化などでは、目的に応じて削除ツール、ページ削除、認証も検討してください。
出典:Google Search Central「Block Search Indexing with noindex」
まとめ:Googlebotは検索、Google-Extendedは生成AI利用の方針で分ける
Google検索を維持したいなら、Googlebotを不用意に拒否してはいけません。Googleの生成AIにおけるコンテンツ利用を制限する意思を示したい場合は、Google-Extendedをrobots.txtで個別に指定します。検索掲載とAI利用を別の設定として扱うことが最も重要です。
サイト全体を制限する場合は、User-agent: Google-ExtendedとDisallow: /を追加し、Googlebot用のグループとは分けて管理してください。公開後は/robots.txtの実際の内容を確認し、Google検索への影響はSearch Consoleで継続的に確認します。
なお、robots.txtは公開情報の完全な削除や機密情報の保護を担うものではありません。検索結果から消したい情報にはnoindexや削除を、非公開にすべき情報には認証・アクセス制御を使うなど、目的に合った方法を選んでください。