實用工具

AI 爬蟲 robots.txt 產生器

封鎖 AI 訓練爬蟲或所有 AI 機器人,並自行決定是否仍讓 AI 搜尋引擎引用你的頁面。

瀏覽器本機執行站長與 GEO4118
免費

結果

結果會顯示在這裡。

要不要讓 AI 機器人進來,如今是個實際的取捨:訓練爬蟲拿走內容卻不帶回任何連結,而 OAI-SearchBot、PerplexityBot、Claude-SearchBot 這類 AI 搜尋爬蟲,正是 ChatGPT 搜尋、Perplexity 和 Claude 找到可引用頁面的管道。這個產生器以 ai-robots-txt/ai.robots.txt 維護的清單為基礎——隨工具打包的快照裡有 175 個 User-agent——依三種策略寫出規則:只封鎖訓練並明確允許搜尋與使用者觸發的抓取、封鎖所有 AI 機器人,或只封鎖你列出的名稱。

它是怎麼運作的

  • 快照裡的每個爬蟲都依上游清單記載的用途,歸入訓練、搜尋、使用者請求的助理、代理或連結預覽其中一類。
  • 被封鎖的爬蟲共用一組 User-agent 行和一條 Disallow 規則,RFC 9309 允許這種寫法,檔案也更精簡。
  • 預設策略永遠不會封鎖 facebookexternalhit,因為封鎖它會讓你的頁面被分享時沒有連結預覽卡片。

你的資料去了哪裡

哪也沒去。本工具完全在你的瀏覽器裡執行:你貼上的文字由頁面處理,不會傳輸到任何伺服器,也不會寫進任何紀錄。

本工具免費且免登入,執行結果只存在於你目前的頁面裡,不會被儲存到任何地方。

它要花多少

本工具完全免費,不需要登入,也不消耗點數。

常見問題

封鎖 Google-Extended 會讓我從 Google 搜尋消失嗎?
不會。Google-Extended 是一個控制標記而不是爬蟲:它告訴 Google 不要拿你的內容訓練 Gemini 和 Vertex AI,不影響頁面能否出現在搜尋結果中。實際抓取仍由 Googlebot 負責,這份清單裡沒有它;除非你打算放棄 Google 流量,否則不要封鎖它。
所有爬蟲都會遵守這些規則嗎?
robots.txt 只是一種請求。大公司會公開自己的 User-agent 並聲明會遵守,但上游清單中許多項目的遵守情況記載為不明,爬蟲也完全可以偽造 User-agent。對付不守規矩的爬蟲,只能在 CDN 或防火牆上依 User-agent 或 IP 阻擋,這才是真正的強制手段。
產生的結果要取代我現有的 robots.txt 嗎?
不要取代,附加到現有檔案的末尾即可:這些規則群組指名的是特定機器人,不會改變你的 User-agent: * 對其他爬蟲的規定。檔案裡寫有清單快照的日期,建議每隔幾個月重新產生一次,因為新的 AI 爬蟲不斷出現。

背後的開源專案

本工具執行在 ai-robots-txt/ai.robots.txt 之上,以 MIT 授權發布。如果你需要在自己的程式裡實作同樣的能力,直接用這個函式庫。

ai-robots-txt/ai.robots.txt

也常被稱作

  • robots.txt 封鎖 ai 爬蟲
  • 禁止 gptbot 抓取
  • 封鎖 ai 爬蟲
  • robots.txt 產生器
  • 禁止 ai 訓練抓取網站
  • google-extended robots.txt