robots.txtでAIの学習だけを断る書き方。Google-Extended・Applebot-Extended・GPTBot・ClaudeBotの指定と、検索順位・AI Overviewsへの影響

左に「robots.txtで」「AI学習だけ断る」の見出しと「検索に載せたまま断る書き方」の帯、右にチェック印の付いた虫眼鏡が文書とWebページの前を通り、本を読むロボットが手のひらとバツ印で止められているイラスト。画像内の文字:robots.txtで AI学習だけ断る 検索に載せたまま断る書き方

PR|この記事にはアフィリエイト広告(A8.net)が含まれます。

WordPressで書いたブログの文章を、AIの学習には使わせたくない。けれど、Google検索からの訪問は今までどおり受けたい。そう考えてrobots.txtを開いても、どのクローラーの名前を書けば学習だけを断れるのかは分かりにくいところです。

robots.txtに、各社が学習用に用意している名前(Google-Extended、Applebot-Extended、GPTBot、ClaudeBot)を書いて「Disallow: /」を指定し、検索用のGooglebotやApplebotは許可したままにする、というのが基本の書き方です。Googleは、Google-Extendedの指定がGoogle検索への登録や順位に影響しないと説明しています。ただし、GoogleはAI OverviewsとAI ModeをGoogle検索に組み込まれた機能として説明しており、Google-Extendedは検索とは別のシステムでの学習とグラウンディングを管理する指定です。そのため、Google-Extendedを断ってもAI Overviewsの表示対象から外れるとは考えないほうがよい、というのが筆者の読みです。また、robots.txtはクローラーに希望を伝える仕組みで、守らないクローラーを止める力はありません。

先に押さえる条件
  • この記事で扱うのは、公式資料で名前と扱いを確認できたGoogle・Apple・OpenAI・Anthropicの4社です。ほかの会社のクローラーは、それぞれの公式ページで名前を確かめて追加します。
  • 学習を断る指定は、各社のクローラーがrobots.txtを読んで守ることで成り立ちます。指定を無視するクローラーを止めたい場合は、Cloudflareのようなサーバーの手前でブロックする仕組みが別に必要です。
  • Googleの公式資料はGoogle-Extendedを「今後のGeminiモデル」の学習についての指定として、Anthropicの公式資料はClaudeBotを断ることを「サイトの今後の内容」を学習データから除外する合図として書いています。すでに集められたデータがどう扱われるかは、今回読んだ資料からは確認できませんでした。

情報確認日:2026年10月2日。Google・Apple・OpenAI・Anthropicのクローラーの公式ドキュメントと、WordPressの開発者向け資料をまとめた解説です。

DMM 生成AI CAMP 学び放題の広告バナー

PR 生成AIを仕事で使う力をまとめて学ぶなら、DMM 生成AI CAMP 学び放題(職種別11コースが月額14,800円(税込16,280円)で学び放題)。先に仕組み・料金・解約条件の解説を読むこともできます。

目次

学習を断るにはどの名前を書けばいい?

Webページの形をした家の門を、虫眼鏡のキャラクターが開けて小道を進み、その横では本を抱えたロボットが禁止マークの標識の前で止まっているイラスト。検索用のクローラーは許可したまま、AIの学習用クローラーだけを断るイメージを表している。

4社とも、検索のために使う名前と、AIの学習を断るために使う名前を分けています。学習用の名前だけを「Disallow」にすれば、検索用のクローラーはそのまま通せます。各社の公式資料をもとに整理すると次のとおりです。

スクロールできます
会社学習を断る名前検索・回答に使う名前学習を断ったときの検索への影響
GoogleGoogle-ExtendedGooglebot(AI OverviewsとAI Modeを含むGoogle検索)Google検索への登録にも順位にも影響しない
AppleApplebot-ExtendedApplebot(Spotlight・Siri・Safariなどの検索)引き続き検索結果に含められる。検索のランキングでは考慮されない
OpenAIGPTBotOAI-SearchBot(ChatGPTの検索機能)、ChatGPT-User(利用者の操作で訪問)各設定は独立している。OAI-SearchBotを許可すればChatGPTの検索結果に出られる
AnthropicClaudeBotClaude-SearchBot(検索結果の質の向上)、Claude-User(利用者の質問で訪問)検索用は別の名前で管理されている
各社の公式ドキュメント(2026年10月2日に確認)をもとに作成。

GoogleとAppleの名前は、ほかの2社と仕組みが少し違います。Googleの説明では、Google-Extendedは専用のクローラーではありません。クロールは通常のGoogleのクローラーが行い、Google-Extendedは集めた内容の使い道を指定するための名前です。指定の対象は、次世代のGeminiモデルの学習と、GeminiアプリやVertex AIでのグラウンディングです。グラウンディングは、AIが回答を作るときに、検索インデックスの内容をモデルに渡して事実の確かさを高める処理を指します。

Appleも同様で、Applebot-ExtendedはWebページをクロールしないと明記しています。Applebotが集めたデータを、Appleの生成AIの基盤モデルの学習に使ってよいかを決めるためだけの名前です。

OpenAIとAnthropicは、学習用のクローラーそのものを分けています。OpenAIは、GPTBotを断ると、そのサイトの内容を生成AIの基盤モデルの学習に使わないという意思表示になると説明しています。Anthropicの説明でも、ClaudeBotを断ることは、そのサイトの今後の内容を学習データから除外する合図という位置づけです。

robots.txtにはどう書く?

4社の学習用の名前をサイト全体で断り、検索エンジン向けの指定はWordPressの初期状態のまま残す場合の例です。最後の2つのまとまりは、WordPressが自動で出力する内容に合わせています。「example.com」は自分のドメインに置き換えてください。

User-agent: Google-Extended
Disallow: /

User-agent: Applebot-Extended
Disallow: /

User-agent: GPTBot
Disallow: /

User-agent: ClaudeBot
Disallow: /

User-agent: *
Disallow: /wp-admin/
Allow: /wp-admin/admin-ajax.php

Sitemap: https://example.com/wp-sitemap.xml

robots.txtは、「User-agent:」の行から始まるまとまりごとに、どのクローラーに何を指定するかを書くファイルです。Googleの仕様では、1つのクローラーに適用されるまとまりは1つだけで、自分の名前にいちばん具体的に一致するまとまりが選ばれます。そのため、Googlebotは「User-agent: *」のまとまりに従い、Google-Extendedの「Disallow: /」の影響を受けません。名前の大文字と小文字は区別されないとGoogleは説明しています。

書くときに気をつけたい点は次の3つです。

  • 「User-agent: *」のまとまりに「Disallow: /」を書くと、名前を個別に書いていないクローラーはすべて対象になります。Googlebotもここに含まれるので、検索にも影響します。
  • 一部のページだけ断りたい場合は、「Disallow: /private/」のようにパスを書きます。Appleの公式ページの例もこの形です。
  • robots.txtの指定は、置いたホスト・プロトコル・ポートの組み合わせにだけ効くとGoogleは説明しています。サブドメインで別のブログを運営している場合は、そちらにも置く必要があります。

Appleの公式ページには、もう一つ押さえておきたい記述があります。robots.txtにApplebot向けの指定がなく、Googlebot向けの指定がある場合、ApplebotはGooglebot向けの指定に従います。Googlebotだけに特別な指定を書いているサイトでは、Applebotにも同じ指定が届く点に注意が必要です。

WordPressではどこに書けばいい?

WordPressは、サーバーにrobots.txtというファイルがなくても、「/robots.txt」へのアクセスに対して自動でrobots.txtの内容を返します。中身を作るのはWordPress本体の関数「do_robots」で、初期状態では管理画面の「/wp-admin/」を断り、「admin-ajax.php」だけを許可する内容です。WordPress 5.5からは、サイトを検索エンジンに公開している場合にサイトマップの行も追加されます。この仮想のrobots.txtは、サイトのアドレスがドメインの直下(https://example.com/ のような形)にある場合だけ使われます。

学習を断る指定を足す方法は、主に次の3つです。

スクロールできます
方法やること注意点
サーバーにrobots.txtファイルを置くサーバーのファイルマネージャーやFTPで、WordPressと同じ階層にrobots.txtを作るWordPressが自動で出力していたサイトマップの行も自分で書く
SEOプラグインの編集機能を使う使っているSEOプラグインにrobots.txtの編集画面があれば、そこで追記する機能の有無と場所はプラグインごとに違う
テーマに処理を追加するWordPressの「robots_txt」フィルターで、出力の先頭に指定を足すPHPの編集が必要。テーマを更新すると消えないよう子テーマなどに書く
3つ目の「robots_txt」フィルターはWordPress 3.0から用意されている仕組みです。

サーバーにファイルを置く方法がいちばん分かりやすく、プラグインやテーマに左右されません。WordPress公式の.htaccessの記述例には、要求されたパスに実在するファイルがない場合だけWordPressに回す条件(Apacheの「!-f」)が入っています。そのため、この記述例のとおりに設定されたApacheサーバーでは、置いたrobots.txtファイルがそのまま返され、WordPressの仮想のrobots.txtより優先されます。Nginxなど別のWebサーバーや、独自の設定をしているサーバーでの扱いは、サーバーの設定しだいです。

手順は次のとおりです。

  1. ブラウザで「https://自分のドメイン/robots.txt」を開き、今の内容をすべてコピーして控える
  2. テキストエディタで、控えた内容の前に、学習用の4つの名前と「Disallow: /」のまとまりを書き足す
  3. 「robots.txt」という名前で保存し、サーバーのファイルマネージャーやFTPで、WordPressをインストールした階層(通常はwp-config.phpやwp-adminフォルダがある場所)にアップロードする
  4. もう一度ブラウザで/robots.txtを開き、書き足した内容と、もとのサイトマップの行が表示されるかを確かめる

SEOプラグインなどがサイトマップの行や独自の指定を追加している場合もあるので、1で控えた内容は消さずに残します。ファイルを置いた後は、プラグインの画面でrobots.txtを編集しても反映されなくなる可能性があります。

テーマに処理を追加する場合は、子テーマのfunctions.phpなどに次のように書きます。WordPressが作る内容の前に、学習用の指定を足す例です。

add_filter( 'robots_txt', function ( $output, $public ) {
	$ai_bots = array( 'Google-Extended', 'Applebot-Extended', 'GPTBot', 'ClaudeBot' );
	$rules   = '';
	foreach ( $ai_bots as $bot ) {
		$rules .= "User-agent: {$bot}\nDisallow: /\n\n";
	}
	return $rules . $output;
}, 10, 2 );

この方法は、WordPressが/robots.txtの応答を作っている場合、つまりサーバーにrobots.txtファイルが置かれていない場合だけ働きます。ファイルを置く方法と同時には使わず、どちらか一方にしてください。

検索順位やAI Overviewsへの影響は?

ここは「検索順位」「Google検索のAI機能」「各社のAIサービスでの表示」を分けて考えます。

検索順位は変わらないと各社が説明している

Googleは、Google-Extendedの指定がGoogle検索への登録に影響せず、ランキングの要素としても使われないと明記しています。Appleの公式ページにも、Applebot-Extendedを断ったページは引き続き検索結果に含められ、Applebot-Extendedの指定は検索のランキングで考慮されないとの記載があります。

AI OverviewsとAI Modeの管理はGoogle-Extendedとは別

GoogleのAI機能についてのページでは、AIは検索に組み込まれた機能なので、検索のためのクロールを管理する手段はGooglebot向けのrobots.txtの指定だと説明しています。Google-Extendedは、「Googleのほかのシステム」での学習とグラウンディングを制限するものとして別に案内されています。Google-Extendedを断ったページがAI Overviewsに出なくなるかどうかについて、この2つのページに直接の記述はありません。ただ、AI機能の管理手段としてGooglebot向けの指定と表示の制御だけが案内されている構成から、Google-Extendedを断ってもAI OverviewsやAI Modeに自分のページが使われなくなるわけではない、と筆者は読んでいます。

検索結果に表示する情報を制限したい場合、Googleはnosnippet、data-nosnippet、max-snippet、noindexの指定を案内しています。一方で、AI OverviewsやAI Modeで参照リンクとして表示されるには、インデックスに登録され、スニペット付きで表示できる状態であることが条件です。Googleのrobots metaタグの説明では、nosnippetを付けるとそのページの検索結果にテキストのスニペット(説明文)が表示されなくなり、max-snippetではスニペットの文字数に上限が付きます。AI機能だけでなく通常の検索結果の見え方も変わるため、学習を断る指定とは別に、慎重に判断したほうがよい設定です。

ChatGPTやClaude、Appleの回答での表示

OpenAIは、OAI-SearchBotとGPTBotの設定はそれぞれ独立していると説明しています。GPTBotを断っても、OAI-SearchBotを許可していればChatGPTの検索結果に出られます。逆にOAI-SearchBotを断ったサイトは、ChatGPTの検索の回答に表示されません。ただし、ナビゲーション用のリンクとしては表示される場合があるとされています。robots.txtを変えてからOpenAIのシステムに反映されるまで、24時間ほどかかるとOpenAIは説明しています。

Anthropicは、Claude-SearchBotやClaude-Userを断ると、検索のためのインデックス作成や、利用者の質問に応じた取得ができなくなり、表示の機会が減る可能性があると説明しています。Claudeの回答で記事が紹介される機会を残したいなら、断るのはClaudeBotだけにします。

Appleの説明では、Siriや検索が幅広い一般知識に関する質問に答えるときに、Applebotが集めたWebの内容を追加の文脈として使う場合があります。この回答に使われないようにする手段として案内されているのは、ページに付けるnosnippetのメタタグです。学習を断るApplebot-Extendedとは別の手段として分けて案内されています。なお、nosnippetを付けたページは、Appleの検索でもページの説明文が作られず、候補に出るときはタイトルだけという扱いです。

robots.txtでどこまで防げる?

Googleは、robots.txtの指定はすべてのクローラーが守るとは限らず、強制する仕組みではないと説明しています。学習を断る指定が効くのは、指定を守ると表明している会社のクローラーに対してだけです。今回の4社以外の学習用クローラーには、名前を書かなければ何も伝わりません。

robots.txtで断れる範囲には、ほかにも次のような限界があります。

  • OpenAIのChatGPT-Userは、利用者の操作で動くため、robots.txtの指定が適用されない場合があるとOpenAIは説明しています。
  • Googleの説明では、robots.txtは一般に最大24時間キャッシュされ、取得し直せない状況ではさらに長くなることもあります。書き換えてもすぐには反映されません。
  • Anthropicは、IPアドレスでClaudeBotをブロックすると、robots.txtを読めなくなるため、学習を断る意思が正しく伝わらない可能性があると注意しています。
  • 各社の名前は増えたり変わったりします。今回の表は2026年10月2日時点の公式資料に基づくもので、Microsoft(Bing)など扱っていない会社もあります。

指定を無視するクローラーまで止めるには、サーバーの手前で通信を見分けてブロックする仕組みが要ります。ドメインをCloudflareに登録しているなら、検索を残したまま学習用クローラーを断る設定がCloudflare側にも用意されています。設定の選択肢と検索への影響は、Cloudflareで検索は残してAI学習だけ断る設定を解説した記事を読んでいただくと、robots.txtとの違いも含めて確かめられます。

まとめ:学習用の4つの名前を断り、検索用は許可したままにする

Google-Extended、Applebot-Extended、GPTBot、ClaudeBotの4つを「Disallow: /」にすれば、Google検索の順位に影響させずに、4社に対してAIの学習に使わないよう伝えられます。WordPressでは、今の/robots.txtの内容を控えてから、ファイルを置くか、SEOプラグインや「robots_txt」フィルターで追記します。AI Overviewsでの扱いはGoogle-Extendedとは別の話なので、nosnippetなどを使うかどうかは検索結果の見え方と合わせて判断してください。

出典:Google「Google’s common crawlers」、Google「AI features and your website」、Google「Introduction to robots.txt」、Google「How Google interprets the robots.txt specification」、Google「Robots meta tag, data-nosnippet, and X-Robots-Tag specifications」、Apple「Applebotについて」、OpenAI「Overview of OpenAI Crawlers」、Anthropic「Does Anthropic crawl data from the web, and how can site owners block the crawler?」、WordPress「do_robots()」、WordPress「WP_Sitemaps::add_robots()」、WordPress「Apache HTTPD / .htaccess」、Apache「mod_rewrite」

robots.txtを置くサーバーをこれから選ぶ人へ

robots.txtを自分で置くには、サーバーのファイルマネージャーやFTPでWordPressのファイルを扱える環境が必要です。これからWordPressブログを始める人や、サーバーの乗り換えを考えている人は、エックスサーバーとConoHa WINGの料金や機能を比べた記事を読んでいただくと、自分に合うサーバーを選びやすくなります。

WordPress本体のセキュリティ更新が気になる場合は、WordPress 7.1.1の修正内容と自動更新の対象範囲をまとめた記事を読んでいただくと、自分のブログをすぐ更新すべきか判断できます。

よかったらシェアしてね!
  • URLをコピーしました!
  • URLをコピーしました!
目次