「AIクローラーは、とりあえず全部拒否しておけば安全ですよね」。社内でそう言われて、robots.txtを開いたまま手が止まっている方は多いと思います。閉めるのは一瞬で終わります。ただ、閉めた相手が何を運んでいた相手なのかを確かめないまま閉めると、あとから元に戻すのが難しくなります。
ここで効いてくるのが、クローラーの「名前」です。GoogleもOpenAIもAnthropicも、検索インデックス登録に使うクローラーと、AIの学習や回答生成に使うクローラーを、別々のUser-agentトークンとして公開しています。名前が別ということは、robots.txtでの扱いも別に決められるということです。逆に言えば、名前を見ずにまとめて閉じると、閉じたくなかった相手まで一緒に閉じてしまいます。
この記事では、3社の公式ドキュメントに書いてあることだけを土台にして、AIクローラーのrobots.txt設定をどう決めるかを整理します。「拒否すべき」という一律の答えは示しません。示すのは、自社の事業モデルに当てて考えるための軸と、本誌自身がどう書いているかという実物です。
こんなふうに調べていませんか
- 「AIクローラー robots.txt 設定」で検索して、許可と拒否のどちらが正解か探している
- 社内で「AI学習に使われたくない」と言われたが、どの行を書けばいいのか分からない
この記事を読み終えたときに手に入るもの
- 検索インデックス登録用のクローラーと学習用のクローラーを、名前で見分けられるようになります
- 許可と拒否の判断を、事業モデルの言葉で社内に説明できるようになります
- robots.txtに書いた指示が、どこまで届いてどこから届かないかを区別できるようになります
結論30秒でわかる、この記事の結論
- AIクローラーには、検索インデックス登録用と、AI学習・回答生成用という目的の異なる複数のUser-agentトークンがあります。
- 許可か拒否かは技術の正解ではなく、自社コンテンツが収益源かどうかと、AI検索経由の言及や流入をどう評価するかという事業モデルの判断です。
- 拒否する相手を取り違えると、通常の検索評価まで失いかねません。閉じる範囲は学習用に限定します。
検証環境:Google・OpenAI・Anthropic 各社公式クローラードキュメント/2026-08-07確認
この記事では、社内でよく出る質問を3人に代弁してもらいます。用語からつまずく若葉さん、運用の手間を気にする高梨課長、投資の判断を求める大森部長。答える側は鈴木さんです。
01AIクローラーのrobots.txt設定は、SEOと何が違うんですか?
若葉さんrobots.txtって、これまでもSEOで触っていましたよね。AIクローラー向けに、何か新しく増えるんでしょうか。
鈴木さん書き方そのものは同じです。増えるのは「誰宛てに書くか」の選択肢と、その判断を誰が下すかという部分ですね。
従来のSEOでrobots.txtを検討するとき、相手はほとんどの場合Googlebotでした。どのディレクトリを見せて、どこを見せないか。目的は検索結果への出方をそろえることだけで、判断は担当者の裁量に収まっていました。
AIクローラーが加わると、この構図が変わります。同じrobots.txtというファイルの中に、目的の違う相手が並ぶからです。検索インデックス登録のために来る相手と、AIの学習データを集めるために来る相手と、利用者の操作を受けてページを取りに来る相手が、それぞれ別のUser-agentトークンを持っています。
だから最初の問いは「拒否すべきか」ではありません。「いま自分が閉じようとしている相手は、何を運んでいる相手か」です。ここを飛ばして一律に閉じると、AI検索に出たいという当初の目的と逆のことをしてしまいます。
そして許可・拒否の最終判断は、技術の正解では決まりません。自社コンテンツそのものが収益源かどうか、AI検索経由の言及や流入をどう評価するか。この事業モデルの軸で分かれます。本記事は一律の結論を示さず、判断に使える基準と、本誌自身の実装例を示します。
この章のまとめ
AIクローラーのrobots.txt設定は、書式の話ではなく宛先の話。相手の役割を確かめてから閉じる。
02そもそもAIクローラーは、SEOのGooglebotと何が別ものなんですか?
Google公式は、検索の仕組みを「クロール」「インデックス登録」「検索結果への表示」という3段階で説明しています(出典: Google Search Central)。この3段階を担っているのが、通常のGooglebotです。
一方のGoogle-Extendedは、この検索用クローラーとは別のUser-agentトークンです。Gemini関連モデルの将来的な学習にコンテンツを使用するかどうかを、サイト側が個別に管理できます(出典: Google Search Central)。
大事なのは、片方の設定がもう片方に自動的に及ぶことはないという点です。Googlebotを許可したままGoogle-Extendedだけを閉じることもできますし、その逆もできます。robots.txtの中では、両者はまったく別の宛先として扱われます。
ここで、よく聞かれるけれど答えを持っていない論点をひとつ先に置いておきます。Google-Extendedを許可・拒否した場合に、検索順位や検索結果への表示そのものへ影響するかどうかは、公式ドキュメントから直接確認できていません。本記事ではこの因果関係を断定しません。 断定している解説を見かけたら、その根拠がどこに書かれているかを確かめてください。
この章のまとめ
Googlebotは検索の3段階を担う相手、Google-Extendedは学習の可否を預かる相手。設定は連動しない。
03Googleのクローラー一覧で、AI検索に関わるAIクローラーはどれですか?
Google公式の一覧ページ(2026年7月14日更新版)によると、クローラー名は11件掲載されています(出典: Google Search Central)。Googlebot本体もこの一覧に含まれます。
- Googlebot(デスクトップ・スマートフォン、検索インデックス登録用)
- Googlebot Image
- Googlebot Video
- Googlebot News
- Google StoreBot
- Google-InspectionTool
- GoogleOther
- GoogleOther-Image
- GoogleOther-Video
- Google-CloudVertexBot
- Google-Extended(AI学習用データ提供の管理トークン)
名前が並ぶと身構えてしまいますが、読み方は単純です。検索インデックス登録を担うのはGooglebotで、AI学習用データの提供可否を管理するのはGoogle-Extendedです。両者は別のUser-agentトークンで、それ以外は付随的な役割を持つ相手だと考えて差し支えありません。
高梨課長この一覧を毎回追いかけるとなると、それだけで手間がかかりますね。
鈴木さん全部を追う必要はありません。役割の層で見て、自社が触るのは学習の層だけと決めてしまえば、見る対象はぐっと減ります。
この章のまとめ
Googleの一覧は役割の層で読む。自社が判断するのは、学習の可否を預かるトークンの扱いだけ。
04OpenAIのAIクローラーは、AI検索用と学習用でどう分かれますか?
OpenAIは、GPTBotのほかに3種類の公式ボットを公開しています(出典: OpenAI)。
- GPTBot:生成AI基盤モデルの訓練データ収集用
- OAI-SearchBot:ChatGPT検索機能の結果表示用
- OAI-AdsBot:ChatGPT広告の安全性検証用
- ChatGPT-User:ユーザーがChatGPTに操作を指示した際のページ取得(自動クロールではない)
ここを読み飛ばすと事故が起きます。GPTBotとOAI-SearchBotは、名前も役割も別です。 前者を閉じても検索機能の表示用は閉じませんし、両方まとめて閉じれば、ChatGPTの検索機能から見える場所を自分で減らすことになります。
なお、GPTBotの正式なUser-agent文字列には、バージョン番号GPTBot/1.4が含まれています(出典: OpenAI)。サーバーログで巡回状況を確かめるときは、この文字列で絞り込むと見つけやすくなります。
OpenAI公式は、GPTBotを拒否することの意味を次のように説明しています。
"Disallowing GPTBot indicates a site's content should not be
used in training generative AI foundation models."
出典: OpenAI「Overview of OpenAI Crawlers」読んでのとおり、拒否が意味しているのは「学習に使わないでほしい」という意思表示です。ChatGPTの画面から自社の情報が消える、という意味ではありません。
この章のまとめ
OpenAIは学習用・検索表示用・広告検証用・利用者操作用を名前で分けている。閉じるなら学習用だけ。
05AnthropicのAIクローラーは、AI検索の応答にどう使われるんですか?
Anthropicは、ClaudeBot・Claude-User・Claude-SearchBotという3種類のボットでクロール体制を構成しています(出典: Anthropic)。
- ClaudeBot:AIモデル開発用のWebコンテンツ収集
- Claude-User:ユーザーの質問応答時のWebアクセス
- Claude-SearchBot:検索結果品質向上のためのWebナビゲーション
構図はOpenAIと同じです。開発のために集めに来る相手と、利用者の求めに応じて取りに来る相手と、検索の品質を確かめに来る相手が、別の名前を持っています。ClaudeBotをDisallowにしても、Claude-UserとClaude-SearchBotは止まりません。
若葉さん「学習に使われたくない」という気持ちと、「AIの回答に載りたい」という気持ちは、両立するんですか。
鈴木さん両立します。名前が分かれているのは、そのためだと考えていいと思います。気持ちの単位ではなく、相手の単位で書くのがコツです。
この章のまとめ
Anthropicも役割ごとに名前を分けている。開発用を閉じても、利用者起点のアクセスは別枠で動く。
06robots.txtの書き方は、AI検索対策として何を書けばいいですか?
書式そのものは、これまでのrobots.txtと変わりません。宛先を書いて、範囲を書くだけです。
Google-Extendedの記述例は、公式ドキュメントに次のように示されています(出典: Google Search Central)。
user-agent: Google-Extended
allow: /archive/1Q84
disallow: /archive/ClaudeBotについては、全面拒否とクロール頻度の抑制、両方の記述例が公式ドキュメントに示されています(出典: Anthropic)。
User-agent: ClaudeBot
Disallow: /User-agent: ClaudeBot
Crawl-delay: 1ここで注意したいのがCrawl-delayです。これはAnthropicが独自にサポートする非標準の拡張です(出典: Anthropic)。他社のクローラーが同じ記法を読み取るとは限らないため、全社共通の設定だと思い込まないでください。
この章のまとめ
書式は従来どおり。宛先の一覧を先に決め、非標準の拡張を全社共通と思い込まない。
07AIクローラーを許可・拒否すると、AI検索での見え方はどう変わりますか?
「許可」と「拒否」が何を意味するかは、クローラーごとに異なります。表で整理します。
| クローラー | 許可した場合 | 拒否した場合 |
|---|---|---|
| Google-Extended | Gemini関連モデルの学習にコンテンツが使われうる | 学習データ収集の対象から外れる(検索インデックス登録には別トークンのGooglebotが使われる) |
| GPTBot | OpenAIの基盤モデル学習にコンテンツが使われうる | 学習データの対象から外れる(ChatGPT-User経由のアクセスは別枠) |
| ClaudeBot | Anthropicのモデル開発にコンテンツが使われうる | 収集対象から外れる(Claude-User・Claude-SearchBotは別枠) |
表の右列に共通しているのは、拒否の対象が「学習データとして使われるかどうか」に限られているという点です。検索結果やAI回答に自社サイトの情報が一切出なくなる、という意味ではありません。
この章のまとめ
拒否が届くのは学習データの範囲まで。検索結果やAI回答から情報が消えるという意味ではない。
08AIクローラーを閉じても届くアクセスは、AI検索で何を意味しますか?
拒否を書いた翌週に「閉じたはずなのにアクセスが来ている」と相談されることがあります。ほとんどの場合、これは設定の不具合ではありません。相手が違うだけです。
ユーザーがAIサービスへ直接URLを渡したときのアクセス(ChatGPT-UserやClaude-User)は、学習用クローラーの設定とは別枠で動きます。ここを混同したまま設定そのものを疑うと、余計な手戻りが生まれます。
見分け方は単純で、サーバーログのUser-agent名を見るだけです。閉じた名前が来ているなら設定の問題、閉じていない名前が来ているなら仕様どおりの動きです。
大森部長つまり、閉めても閉めなくても、AIの回答に出るかどうかは別の話だということかね。
鈴木さん学習の可否についてはそのとおりです。表示に関わる相手まで閉めた場合は、話が変わります。そこだけは分けて決めてください。
この章のまとめ
閉じた範囲の外から来る訪問は別枠。相手の名前で切り分ければ、設定を疑わずに済む。
09robots.txtの指示は、AI検索を運営する各社に本当に守られるんですか?
Anthropicは、自社のボットがrobots.txtの「do not crawl」シグナルを尊重すると公式に明記しています(出典: Anthropic)。あわせて、IPアドレスによるブロックは正しく機能しない場合があるとも述べられており、確実な制御にはrobots.txtの修正が推奨されています。
OpenAIも、GPTBotを拒否することの意味を公式ページで明記しています(出典: OpenAI)。
ただし、ここで押さえておきたい線引きがあります。これは各社が自社の方針として遵守を表明しているという事実であって、第三者が独立に遵守率を検証した公開情報を、本誌はまだ確認できていません。
robots.txtはクローラーへの要請であり、法的な強制力を持つ仕組みではありません。遵守の実態を独立に調べたと称する調査は、方法論の開示が限定的なものが多いため、本記事では各社が公式に明言している遵守方針までを事実として扱います。遵守の実態そのものは断定しません。
この章のまとめ
各社は遵守方針を公式に表明している。第三者による独立検証の公開情報は、本誌では確認できていない。
10AIクローラーのrobots.txt設定で、拒否を選ぶのはどんなSEO判断ですか?
学習用クローラー(Google-Extended・GPTBot・ClaudeBot)の拒否を検討する材料は、次のようなケースです。
- 独自に収集した調査データ・統計データそのものが商品であり、要約されて無償で読まれると収益が目減りする
- 会員限定・有料コンテンツの本文が、robots.txtの対象範囲に含まれてしまっている
- 取材記事など、一次情報としての価値が「そのままの文章」に強く依存している
- 競合との差別化要因が独自の分析手法や表現そのものにあり、要約でも代替されやすい
共通しているのは、文章そのものが値打ちを持っているという点です。要約されて広まることが、そのまま機会損失につながる事業では、拒否を検討する理由があります。
ただし、これらに当てはまる事業でも、拒否する対象は学習用クローラーに限定してください。検索インデックス登録用のGooglebotまで誤って拒否すると、通常のSEO評価そのものを失います。ここは取り返しがつきにくい失敗です。
大森部長うちの調査レポートは有料で出している。あれが要約されて無料で読めるようになるのは困るな。
鈴木さんその心配は、閉じる相手を学習用に限定することで扱えます。検索の並びに出る力は残したまま、学習の素材にしないでほしい、という指定ができます。
この章のまとめ
拒否を選ぶ理由は「文章そのものが商品かどうか」。閉じる範囲は学習用に限定し、Googlebotに触らない。
11AIクローラーのrobots.txt設定で、許可を選ぶのはどんなAI活用ですか?
逆に、学習用クローラーの許可を検討する材料は、次のようなケースです。
- 自社のサービス名・商品名がAIの回答内で正確に言及されることが、認知や指名検索につながる事業である
- 記事・ノウハウの公開自体が営業導線であり、要約されて広く知られる方が広告効果に近い
- AI検索経由の流入や言及を、既存のマーケティング指標に組み込みたい方針がある
こちらに共通しているのは、名前を呼ばれることに値打ちがあるという点です。文章を守るより、名前が広まるほうが事業に効くのであれば、開けておく理由があります。
ひとつだけ補っておきます。AI検索経由の流入をどう計測するかは、既存のアクセス解析の分類にまだ揺れがある領域です。許可する場合でも、流入の可視化は別途整える必要があります。「許可したから測れる」ではありません。
この章のまとめ
許可を選ぶ理由は「名前を呼ばれることの価値」。ただし計測は別問題として整える。
12本誌はなぜ、AI検索のクローラーを積極的に許可しているんですか?
AI MARKETING JOURNAL自身は、AI検索クローラーの巡回を積極的に許可する方針で運用しています。理由は単純で、自誌がAIOを教えながら自ら実践できていなければ説得力を持たない、と考えているためです。
本誌の値打ちは、記事の文章そのものを囲い込むことではなく、記事の中身が引かれて名前が広まることにあります。前章の軸に当てはめれば、迷わず許可の側です。方針が先に決まっているから、行の書き方が短時間で決まります。
裏を返せば、この方針は本誌の事業モデルに固有のものです。読者の会社にそのまま当てはめるものではありません。同じ表を見ても、独自データを売っている会社なら別の結論になります。
この章のまとめ
本誌が許可を選ぶのは、名前が広まることに値打ちがあるから。方針が先、記述は後。
13本誌のrobots.txtは、AI検索向けにどう設定しているんですか?
本誌のrobots.txtは、次のような構成です。
User-agent: *
Allow: /
User-agent: GPTBot
Allow: /
User-agent: OAI-SearchBot
Allow: /
User-agent: ChatGPT-User
Allow: /
User-agent: ClaudeBot
Allow: /
User-agent: Claude-User
Allow: /
User-agent: anthropic-ai
Allow: /
User-agent: PerplexityBot
Allow: /
User-agent: Perplexity-User
Allow: /
User-agent: Google-Extended
Allow: /
Sitemap: https://ai-marketing.webmarks.co.jp/sitemap.xml既定の全許可(User-agent: *)に加えて、AIクローラー向けの個別Allow指定が9件あります(自社実測、2026-08-07確認)。
この章のまとめ
本誌は全許可に加え、AIクローラー向けの個別行を並べている。実物を見せられる形で運用する。
14AIクローラーごとに行を分けるのは、SEO運用でどう効くんですか?
「全許可があるなら個別行は要らないのでは」と思われるかもしれません。個別に行を分けているのは、各社の仕様変更を追いやすくするためです。将来、特定のクローラーだけ挙動を変えたくなった場合に、該当行だけを書き換えられます。
高梨課長行が増えると管理が大変になりませんか。
鈴木さん逆でした。まとめて書くほど、変えたいときに全体を読み直すことになります。相手ごとに分けておくと、直す場所が1か所で済みます。
この章のまとめ
本誌は積極許可の方針。相手ごとに行を分けておくと、仕様変更に追随しやすくなる。
15AIクローラーのrobots.txt設定で、SEO担当がつまずくのはどこですか?
いちばん多いのは、User-agent名を書き間違えてGooglebotまで拒否してしまう失敗です。名前が似ているうえ、書き間違えても構文としては通ってしまうため、公開されるまで気づきません。ここでは、それとは別の2つの誤解を扱います。
1つめは、学習用クローラーを拒否すれば自社の情報がAIから一切見えなくなる、という誤解です。 GPTBotを拒否しても、ユーザーがChatGPTに自社サイトのURLを直接渡した場合のアクセス(ChatGPT-User)は止まりません(出典: OpenAI)。Anthropicも同様に、ClaudeBotとは別にClaude-Userという枠を持っています(出典: Anthropic)。学習データからの除外と、ユーザー操作起点のアクセスは別問題です。
2つめは、Crawl-delayを書けば全社のクロール頻度を抑えられる、という誤解です。 Crawl-delayは非標準の拡張であり、Anthropicがサポートを明記しているのはClaudeBot向けの記法です(出典: Anthropic)。他社のクローラーにも同じ効果があるとは、公式ドキュメントからは確認できていません。
この章のまとめ
つまずきの正体は射程の取り違え。学習からの除外と、利用者起点のアクセスを同じ話にしない。
16AIクローラーのrobots.txt設定は、公開前に何をSEOの目で見直しますか?
書き上げたrobots.txtは、公開する前に一度だけ声に出して読んでみてください。宛先の綴り、範囲の指定、書き忘れた相手。目で追うだけだと、見ているつもりで飛ばしてしまいます。
公開前に、次の8項目を上から確認してください。
- Google-ExtendedとGooglebotを、別のUser-agentトークンとして区別して記述した
- GPTBotを拒否しても、ChatGPT-User経由のアクセスは別枠だと理解した
- ClaudeBotとClaude-User・Claude-SearchBotの違いを確認した
- 独自データ・有料コンテンツの比重から、拒否を検討すべきかを判断した
- AI検索経由の言及・流入をどう評価するかの方針を、許可・拒否の判断に反映した
- robots.txtの記述をrobots.txtテスター等で公開前に確認した
- User-agent名を1行ずつ見直し、誤字がないか確認した
- 設定変更後、Search Consoleのクロールの統計情報レポートで変化を確認する予定を立てた
この章のまとめ
つまずきの正体は、名前の取り違えと射程の取り違え。公開前にUser-agent名を1行ずつ読み直す。
17よくある質問
AIクローラーはすべて拒否すれば安全ですか
判断は事業モデル次第です。独自データや有料コンテンツが収益源なら拒否を検討する材料になりますが、認知や指名検索を重視する事業では許可の方が合う場合もあります。安全側に倒したいのであれば、まず学習用クローラーだけを対象にして、検索インデックス登録用と表示用には触らない、という切り分けから始めてください。
Googleのクローラーのうち、AIクローラーに当たるのはどれですか
Googlebotは検索インデックス登録用、Google-Extendedは学習用データの管理用で、両者は別のトークンです(出典: Google Search Central)。AI学習用の設定を変えたい場合はGoogle-Extended側を編集します。
GPTBotというAIクローラーを拒否すれば、ChatGPTに一切表示されなくなりますか
いいえ。GPTBotの拒否は学習データ収集からの除外を意味しますが、ユーザーがURLを直接渡した際のアクセス(ChatGPT-User)は別枠のため止まりません(出典: OpenAI)。
robots.txtの指示はどこまで信頼できますか
各社は公式に、robots.txtの記述を尊重する方針を明記しています。ただし、この遵守状況を第三者が独立に検証した公開情報を、本誌はまだ確認できていません。社内には、この2段のまま伝えるのが安全です。
自社サイトはAIクローラーをどう設定すべきですか
本誌は認知や言及を重視する立場から、AIクローラーを積極的に許可する方針を取っています。事業モデルが異なれば、拒否を検討すべき場面もあります。先に決めるのは行の中身ではなく、自社の値打ちがどこにあるかです。
robots.txtを変更したら何を確認すればよいですか
Search Consoleのクロールの統計情報レポートで、クロールリクエスト数の変化を確認してください(出典: Google(Search Console ヘルプ))。このレポートは、通常1,000ページ未満の小規模サイトには不要な上級者向け機能と位置づけられています。
18まとめ|今日やる3つのこと
今日この順でやります
宛先の一覧を紙に書く
Google-Extended・GPTBot・OAI-SearchBot・ChatGPT-User・ClaudeBot・Claude-User・Claude-SearchBotを並べ、それぞれの役割を1行で書き添えます
自社の値打ちがどこにあるかを1つに決める
文章そのものが商品なのか、名前が広まることが力になるのか。ここが決まると許可・拒否が決まります
robots.txtを開いて、相手ごとに行を分ける
まとめて閉じる書き方をやめ、変えたいときに1か所だけ直せる形にします
AI検索では、こう聞かれています
AIクローラーはrobots.txtで全部拒否しておけばいいですか?
「AIクローラーを許可・拒否すると、AI検索での見え方はどう変わりますか?」の章で、閉じたときに何が起きるかを整理しています
GPTBotを拒否すると、ChatGPTに自社サイトが出なくなりますか?
「OpenAIのAIクローラーは、AI検索用と学習用でどう分かれますか?」の章で、名前ごとの役割を説明しています
Google-ExtendedとGooglebotは何が違うんですか?
「そもそもAIクローラーは、SEOのGooglebotと何が別ものなんですか?」の章で、道が分かれる仕組みを図にしています
次に読むなら、この記事です