实用工具

AI 爬虫 robots.txt 生成器

屏蔽 AI 训练爬虫或全部 AI 机器人,并自己决定是否仍让 AI 搜索引擎引用你的页面。

浏览器本地运行站长与 GEO4118
免费

结果

结果会显示在这里。

放不放 AI 机器人进来,现在是一个真实的取舍:训练爬虫拿走内容却不带回任何链接,而 OAI-SearchBot、PerplexityBot、Claude-SearchBot 这类 AI 搜索爬虫,正是 ChatGPT 搜索、Perplexity 和 Claude 找到可引用页面的途径。这个生成器以 ai-robots-txt/ai.robots.txt 维护的名单为基础——随工具打包的快照里有 175 个 User-agent——按三种策略写规则:只屏蔽训练并显式放行搜索和用户触发的抓取、屏蔽全部 AI 机器人,或只屏蔽你列出的名字。

它是怎么工作的

  • 快照里的每个爬虫都按上游名单记录的用途,被归入训练、搜索、用户请求的助手、代理或链接预览中的一类。
  • 被屏蔽的爬虫共用一组 User-agent 行和一条 Disallow 规则,RFC 9309 允许这种写法,文件也更短。
  • 预设策略永远不会屏蔽 facebookexternalhit,因为屏蔽它会让你的页面被分享时没有链接预览卡片。

你的数据去了哪里

哪也没去。本工具完全在你的浏览器里运行:你粘贴的文本由页面处理,不会传输到任何服务器,也不会写进任何日志。

本工具免费且无需登录,运行结果只存在于你当前的页面里,不会被保存到任何地方。

它要花多少

本工具完全免费,不需要登录,也不消耗积分。

常见问题

屏蔽 Google-Extended 会让我从谷歌搜索里消失吗?
不会。Google-Extended 是一个控制标记而不是爬虫:它告诉谷歌不要用你的内容训练 Gemini 和 Vertex AI,不影响页面能否出现在搜索结果里。实际抓取仍由 Googlebot 完成,这份名单里没有它,除非你打算放弃谷歌流量,否则不要屏蔽它。
所有爬虫都会遵守这些规则吗?
robots.txt 只是请求。大公司会公开自己的 User-agent 并声明遵守,但上游名单里很多条目的遵守情况记录为不明,爬虫也完全可以伪造 User-agent。对不守规矩的爬虫,只能在 CDN 或防火墙上按 User-agent 或 IP 拦截,这才是真正的强制手段。
生成结果要替换我现有的 robots.txt 吗?
不要替换,追加到现有文件末尾即可:这些规则组点名的是特定机器人,不会改变你的 User-agent: * 对其他爬虫的规定。文件里写有名单快照的日期,建议每隔几个月重新生成一次,因为新的 AI 爬虫一直在出现。

背后的开源项目

本工具运行在 ai-robots-txt/ai.robots.txt 之上,以 MIT 许可发布。如果你需要在自己的程序里实现同样的能力,直接用这个库。

ai-robots-txt/ai.robots.txt

也常被称作

  • robots.txt屏蔽ai爬虫
  • 禁止gptbot抓取
  • 屏蔽ai爬虫
  • robots.txt生成器
  • 禁止ai训练抓取网站