實用工具
結果
結果會顯示在這裡。要不要讓 AI 機器人進來,如今是個實際的取捨:訓練爬蟲拿走內容卻不帶回任何連結,而 OAI-SearchBot、PerplexityBot、Claude-SearchBot 這類 AI 搜尋爬蟲,正是 ChatGPT 搜尋、Perplexity 和 Claude 找到可引用頁面的管道。這個產生器以 ai-robots-txt/ai.robots.txt 維護的清單為基礎——隨工具打包的快照裡有 175 個 User-agent——依三種策略寫出規則:只封鎖訓練並明確允許搜尋與使用者觸發的抓取、封鎖所有 AI 機器人,或只封鎖你列出的名稱。
它是怎麼運作的
- 快照裡的每個爬蟲都依上游清單記載的用途,歸入訓練、搜尋、使用者請求的助理、代理或連結預覽其中一類。
- 被封鎖的爬蟲共用一組 User-agent 行和一條 Disallow 規則,RFC 9309 允許這種寫法,檔案也更精簡。
- 預設策略永遠不會封鎖 facebookexternalhit,因為封鎖它會讓你的頁面被分享時沒有連結預覽卡片。
你的資料去了哪裡
哪也沒去。本工具完全在你的瀏覽器裡執行:你貼上的文字由頁面處理,不會傳輸到任何伺服器,也不會寫進任何紀錄。
本工具免費且免登入,執行結果只存在於你目前的頁面裡,不會被儲存到任何地方。
它要花多少
本工具完全免費,不需要登入,也不消耗點數。
常見問題
- 封鎖 Google-Extended 會讓我從 Google 搜尋消失嗎?
- 不會。Google-Extended 是一個控制標記而不是爬蟲:它告訴 Google 不要拿你的內容訓練 Gemini 和 Vertex AI,不影響頁面能否出現在搜尋結果中。實際抓取仍由 Googlebot 負責,這份清單裡沒有它;除非你打算放棄 Google 流量,否則不要封鎖它。
- 所有爬蟲都會遵守這些規則嗎?
- robots.txt 只是一種請求。大公司會公開自己的 User-agent 並聲明會遵守,但上游清單中許多項目的遵守情況記載為不明,爬蟲也完全可以偽造 User-agent。對付不守規矩的爬蟲,只能在 CDN 或防火牆上依 User-agent 或 IP 阻擋,這才是真正的強制手段。
- 產生的結果要取代我現有的 robots.txt 嗎?
- 不要取代,附加到現有檔案的末尾即可:這些規則群組指名的是特定機器人,不會改變你的 User-agent: * 對其他爬蟲的規定。檔案裡寫有清單快照的日期,建議每隔幾個月重新產生一次,因為新的 AI 爬蟲不斷出現。
背後的開源專案
本工具執行在 ai-robots-txt/ai.robots.txt 之上,以 MIT 授權發布。如果你需要在自己的程式裡實作同樣的能力,直接用這個函式庫。
ai-robots-txt/ai.robots.txt也常被稱作
- robots.txt 封鎖 ai 爬蟲
- 禁止 gptbot 抓取
- 封鎖 ai 爬蟲
- robots.txt 產生器
- 禁止 ai 訓練抓取網站
- google-extended robots.txt