Tous les robots IA ne font pas la même chose. Ceux qui servent à la recherche (OAI-SearchBot, PerplexityBot, Claude-SearchBot, Googlebot) conditionnent votre présence dans les réponses : les bloquer vous en retire. Ceux qui servent à l'entraînement des modèles (GPTBot, ClaudeBot, Google-Extended) relèvent d'un choix, et les refuser n'empêche pas d'apparaître dans la recherche.
Trois familles de robots
La confusion vient souvent d'un raccourci : « bloquer les robots IA ». Or les éditeurs d'assistants documentent des robots aux rôles bien séparés :
- les robots de recherche parcourent le web pour faire apparaître des sites dans les réponses de l'assistant ;
- les robots d'entraînement collectent des contenus susceptibles de servir à l'entraînement des modèles ;
- les robots déclenchés par un utilisateur visitent une page précise parce qu'une personne a posé une question qui la concerne.
Bloquer un robot d'entraînement est un choix éditorial légitime. Bloquer un robot de recherche revient à demander de ne pas être montré. Voici ce que chaque éditeur indique dans sa documentation officielle.
OpenAI (ChatGPT)
- OAI-SearchBot : sert à faire apparaître des sites dans les résultats des fonctions de recherche de ChatGPT. Les sites qui le refusent ne sont pas affichés dans les réponses de recherche, même s'ils peuvent encore apparaître sous forme de liens de navigation.
- GPTBot : explore des contenus qui peuvent servir à l'entraînement des modèles d'OpenAI.
- ChatGPT-User : visite une page lors de certaines actions d'un utilisateur dans ChatGPT ou dans un GPT personnalisé. Il n'explore pas le web de façon automatique.
OpenAI précise que chaque réglage est indépendant des autres : on peut autoriser OAI-SearchBot et refuser GPTBot. Il faut compter environ 24 heures après une modification du robots.txt pour que ses systèmes s'ajustent.
Perplexity
- PerplexityBot : conçu pour faire apparaître des sites et leur donner un lien dans les résultats de Perplexity. Il respecte le robots.txt. Perplexity indique qu'il ne sert pas à entraîner des modèles de fondation.
- Perplexity-User : accompagne les actions des utilisateurs. Quand une personne pose une question, il peut visiter une page pour construire la réponse. Comme la visite est demandée par l'utilisateur, ce robot ignore en général les règles du robots.txt.
Perplexity indique qu'une modification du robots.txt peut demander jusqu'à 24 heures pour être prise en compte.
Anthropic (Claude)
- ClaudeBot : collecte des contenus web susceptibles de contribuer à l'entraînement des modèles. Le restreindre signale que les futurs contenus du site doivent être exclus des données d'entraînement.
- Claude-SearchBot : parcourt le web pour améliorer la qualité des résultats de recherche. Le bloquer empêche l'indexation de vos contenus pour la recherche, ce qui peut réduire votre visibilité dans les réponses.
- Claude-User : accède à une page quand un utilisateur de Claude pose une question. Le bloquer empêche de récupérer votre contenu en réponse à une demande, ce qui peut réduire votre visibilité.
Anthropic accepte aussi la directive Crawl-delay pour ralentir ClaudeBot, et rappelle qu'un blocage par adresse IP ne garantit pas un retrait durable : le robots.txt reste la méthode prévue.
Google (Recherche, AI Overviews, Gemini)
- Googlebot : construit l'index de la recherche Google. Ses réglages s'appliquent à la recherche et à toutes ses fonctionnalités, y compris les fonctions IA comme AI Overviews et le mode IA.
- Google-Extended : permet de décider si les contenus explorés par Google peuvent servir à entraîner les futurs modèles Gemini et à ancrer leurs réponses (grounding) dans les applications Gemini et l'API Vertex AI. Google précise qu'il n'a aucun effet sur l'inclusion dans la recherche Google et n'est pas un critère de classement.
Google-Extended n'a pas de signature propre dans les requêtes : l'exploration se fait avec les robots habituels de Google, et le nom sert uniquement de consigne dans le robots.txt. Google conserve en général le contenu du robots.txt en cache jusqu'à 24 heures.
Quel réglage choisir ?
Pour une entreprise qui veut être trouvée, la logique est simple : ouvrir les robots de recherche, puis trancher sur l'entraînement selon sa propre position. Un robots.txt qui autorise la recherche et refuse l'entraînement pourrait contenir ces groupes :
- User-agent: OAI-SearchBot, User-agent: PerplexityBot, User-agent: Claude-SearchBot, User-agent: Googlebot suivis de Allow: / ;
- User-agent: GPTBot, User-agent: ClaudeBot, User-agent: Google-Extended suivis de Disallow: /.
Si vous acceptez aussi l'entraînement, il suffit de ne rien écrire pour ces robots, ou de les autoriser. Aucune des deux positions n'est « la bonne » : c'est une décision qui vous appartient. Ce qui est certain, en revanche, c'est qu'un Disallow: / sous User-agent: * ferme la porte à tous les robots qui n'ont pas leur propre groupe, y compris les robots de recherche.
Les pièges fréquents
- Le mauvais emplacement. Le fichier doit se trouver à la racine du site. Chez Google, les règles ne valent que pour l'hôte, le protocole et le port où il est publié : un robots.txt sur exemple.fr ne s'applique pas à www.exemple.fr.
- Les groupes qui se chevauchent. Google applique le groupe le plus spécifique : si Googlebot a son propre groupe, le groupe * ne le concerne plus. Un robot nommé explicitement échappe donc aux règles générales.
- Le robots.txt n'est pas une protection. Google rappelle que ses règles ne sont pas forcément suivies par tous les robots, et qu'une page bloquée peut encore apparaître dans les résultats si d'autres sites y renvoient. Pour cacher un contenu, il faut une protection par mot de passe ou une balise noindex.
- Le blocage par l'hébergeur. Un pare-feu ou un réseau de diffusion peut refuser les robots IA quel que soit le contenu du robots.txt. Le guide Comment savoir si ChatGPT cite mon entreprise ? explique comment le repérer.
Après le robots.txt
Autoriser les bons robots ouvre la porte. Il reste à leur présenter votre entreprise clairement, avec un texte lisible sans JavaScript et une fiche décrite en données structurées : c'est l'objet du guide Données structurées LocalBusiness.
Lisible, un service Velyria, lit votre robots.txt et vérifie, robot par robot, qui peut entrer : OAI-SearchBot, PerplexityBot, Claude-SearchBot, Googlebot et bingbot pour la recherche, GPTBot, ClaudeBot et Google-Extended pour l'entraînement. Il teste aussi votre page d'accueil avec la signature de plusieurs robots pour détecter un blocage caché. Vérifiez votre robots.txt gratuitement avec Lisible.
Lisible vérifie en quelques secondes si les assistants de recherche (ChatGPT, Perplexity, Gemini, Claude) peuvent lire votre site et comprendre ce que fait votre entreprise.
Tester mon site gratuitementSources officielles
- OpenAI : Overview of OpenAI Crawlers
- Perplexity : Perplexity Crawlers
- Anthropic : Does Anthropic crawl data from the web, and how can site owners block the crawler?
- Google Search Central : Google's common crawlers
- Google Search Central : Introduction to robots.txt
- Google Search Central : How Google interprets the robots.txt specification
- Google Search Central : AI features and your website
À lire aussi
- Comment savoir si ChatGPT cite mon entreprise ?Poser les bonnes questions, vérifier que le robot de recherche d'OpenAI peut lire votre site, repérer les blocages : méthode pour savoir si ChatGPT vous cite.
- Données structurées LocalBusiness : aider Google et les assistants IA à comprendre votre entrepriseNom, adresse, téléphone, horaires : comment décrire votre entreprise en JSON-LD LocalBusiness, quelles propriétés remplir et quelles règles de Google respecter.