Outils

Générateur robots.txt contre les robots IA

Bloquez les robots d’entraînement IA, ou tous les bots IA, tout en choisissant si les moteurs de recherche IA peuvent encore vous citer.

S’exécute dans le navigateurSEO et GEO4,1 k
Gratuit

Résultat

Le résultat apparaîtra ici.

Décider quels bots IA laisser entrer est désormais un vrai arbitrage : les robots d’entraînement prennent le contenu sans lien en retour, tandis que les robots de recherche IA comme OAI-SearchBot, PerplexityBot et Claude-SearchBot sont la manière dont ChatGPT search, Perplexity et Claude trouvent les pages à citer. Ce générateur part de la liste maintenue par ai-robots-txt/ai.robots.txt — 175 user agents dans l’instantané qu’il embarque — et écrit les règles pour trois politiques : bloquer uniquement l’entraînement en autorisant explicitement la recherche et les récupérations demandées par l’utilisateur, bloquer tous les bots IA, ou bloquer seulement les noms que vous indiquez.

Comment ça marche

  • Chaque robot de l’instantané est classé en entraînement, recherche, assistant à la demande de l’utilisateur, agent ou aperçu de lien, d’après la finalité consignée dans la liste en amont.
  • Les robots bloqués partagent un seul groupe de lignes User-agent avec une unique règle Disallow, ce que permet la RFC 9309 et qui garde le fichier court.
  • facebookexternalhit n’est jamais bloqué par les politiques prédéfinies, car le bloquer casse les aperçus de lien quand vos pages sont partagées.

Où vont vos données

Nulle part. Cet outil s’exécute entièrement dans votre navigateur : le texte collé est traité par la page, jamais transmis à un serveur ni consigné dans un journal.

Cet outil est gratuit et ne demande aucun compte. Ses résultats n’existent que dans la page ouverte et ne sont enregistrés nulle part.

Ce que ça coûte

Cet outil est gratuit, sans connexion ni points.

Questions fréquentes

Bloquer Google-Extended me retire-t-il de la recherche Google ?
Non. Google-Extended est un jeton de contrôle, pas un robot : il demande à Google de ne pas utiliser votre contenu pour entraîner Gemini et Vertex AI, et n’influe pas sur l’apparition de vos pages dans la recherche. L’exploration reste assurée par Googlebot, que cette liste n’inclut pas et que vous ne devez pas bloquer, sauf si vous comptez quitter Google.
Tous les bots respecteront-ils ces règles ?
robots.txt est une demande. Les grands opérateurs documentent leurs user agents et affirment le respecter, mais la liste en amont indique un respect incertain pour de nombreuses entrées, et un scraper peut tout simplement mentir sur son user agent. Pour les bots qui ignorent le fichier, bloquer par user agent ou par IP au niveau de votre CDN ou de votre pare-feu est le seul moyen de l’imposer.
Faut-il remplacer mon robots.txt existant par le résultat ?
Ajoutez-le à la fin de votre robots.txt existant plutôt que de le remplacer : ces groupes nomment des bots précis, ils ne modifient donc pas ce que vos règles User-agent: * disent aux autres robots. La date de l’instantané figure dans le fichier ; régénérez-le tous les quelques mois, car de nouveaux robots IA apparaissent régulièrement.

L’open source derrière

Cet outil fonctionne grâce à ai-robots-txt/ai.robots.txt, publié sous licence MIT. Si vous avez besoin du même comportement dans votre propre programme, c’est cette bibliothèque qu’il faut utiliser.

ai-robots-txt/ai.robots.txt

Aussi appelé

  • bloquer robots ia robots.txt
  • bloquer gptbot
  • robots.txt ia
  • bloquer claudebot
  • google-extended robots.txt
  • empêcher ia d’aspirer mon site