ツール
結果
結果はここに表示されます。どの AI ボットを受け入れるかは、今や本当のトレードオフです。学習用クローラーはリンクを返さずにコンテンツを持っていきますが、OAI-SearchBot、PerplexityBot、Claude-SearchBot のような AI 検索クローラーは、ChatGPT search、Perplexity、Claude が引用するページを見つける手段です。このジェネレーターは ai-robots-txt/ai.robots.txt が管理するリスト(同梱のスナップショットでは 175 の User-agent)をもとに、3 つのポリシーのルールを書き出します。学習用だけをブロックして検索とユーザー要求による取得は明示的に許可する、すべての AI ボットをブロックする、指定した名前だけをブロックする、の 3 つです。
動作のしくみ
- スナップショット内の各クローラーは、上流のリストに記録された用途に基づき、学習、検索、ユーザー要求型アシスタント、エージェント、リンクプレビューのいずれかに分類されます。
- ブロック対象のクローラーは、User-agent 行をまとめた 1 つのグループと 1 つの Disallow ルールを共有します。これは RFC 9309 で認められた書き方で、ファイルを短く保てます。
- facebookexternalhit は、用意されたポリシーではブロックしません。ブロックすると、ページが共有されたときのリンクプレビューが表示されなくなるからです。
データの行き先
どこにも行きません。このツールは完全にブラウザ内で動作します。貼り付けたテキストはページが処理し、サーバーに送信されることも、ログに記録されることもありません。
このツールは無料で登録不要です。結果は開いているページの中にだけあり、どこにも保存されません。
必要なポイント
このツールは無料です。ログインもポイントも必要ありません。
よくある質問
- Google-Extended をブロックすると Google 検索から消えますか?
- いいえ。Google-Extended はクローラーではなく制御用のトークンで、Gemini と Vertex AI の学習にコンテンツを使わないよう Google に伝えるものです。ページが検索に表示されるかどうかには影響しません。クロール自体は Googlebot が行っており、このリストには含まれていません。Google から離れるつもりがない限り、Googlebot はブロックしないでください。
- すべてのボットがこのルールに従いますか?
- robots.txt はあくまでお願いです。大手の運営者は User-agent を公開し、robots.txt を尊重すると表明していますが、上流のリストでは多くのエントリーの遵守状況が「不明」と記録されており、スクレイパーは User-agent を偽ることもできます。ファイルを無視するボットに対しては、CDN やファイアウォールで User-agent や IP によってブロックするしか強制する方法はありません。
- 既存のファイルと統合せず、出力を貼り付けるのはなぜですか?
- 既存の robots.txt を置き換えるのではなく、末尾に追加してください。これらのグループは特定のボットを名指ししているため、User-agent: * のルールが他のクローラーに指示している内容は変わりません。ファイルにはスナップショットの日付が書き込まれます。新しい AI クローラーは次々に登場するので、数か月ごとに生成し直してください。
背後にあるオープンソース
このツールは ai-robots-txt/ai.robots.txt(MIT)の上で動作しています。同じ処理を自分のプログラムに組み込みたい場合は、そのライブラリを使ってください。
ai-robots-txt/ai.robots.txt別の呼び方
- robots.txt AI クローラー ブロック
- GPTBot ブロック
- robots.txt 生成 AI
- ClaudeBot disallow
- Google-Extended robots.txt
- AI 学習 拒否 robots.txt