Technique GEO

Robots IA : qui vient lire votre site, et sous quel nom

MREL — Ma Réputation En Lignemis à jour le

Les robots IA sont les programmes qui parcourent le web pour le compte des fournisseurs de modèles : GPTBot et OAI-SearchBot pour OpenAI, ClaudeBot pour Anthropic, PerplexityBot pour Perplexity, Google-Extended pour Google. Ils ne servent pas tous à la même chose — certains alimentent l'entraînement, d'autres la recherche en direct pendant une réponse. Les bloquer indistinctement revient souvent à se rendre invisible sans le vouloir.

Aussi appelé : GPTBot, ClaudeBot, PerplexityBot, crawlers IA.

Ce que chaque robot vient faire

Les fournisseurs distinguent en général deux usages, et publient des noms différents pour chacun :

  • L'entraînement. Le robot collecte du contenu qui pourra servir à entraîner de futurs modèles. Le refuser n'empêche pas d'être cité par un moteur qui va chercher en direct.
  • La recherche au moment de la réponse. Le robot charge une page parce qu'un utilisateur vient de poser une question. Le refuser, c'est refuser la citation.

Un robots.txt écrit sans cette distinction produit régulièrement l'effet inverse de celui recherché : on croit protéger son contenu de l'entraînement, on se coupe de la recherche.

Vérifier, et pas seulement déclarer

Trois contrôles, dans cet ordre, et aucun ne remplace les autres :

  1. Lire le robots.txt et y chercher explicitement chaque nom de robot, plutôt que de conclure d'un Allow: / global. Beaucoup de thèmes et d'extensions en bloquent par défaut.
  2. Demander les pages sous ces noms et comparer non seulement le code de réponse, mais aussi la taille : un pare-feu peut répondre 200 avec un écran de blocage.
  3. Lire les journaux du serveur ou la console du pare-feu. C'est la seule preuve qu'un robot est réellement passé, et le seul endroit où se voient les blocages par adresse IP.

Le cas des hébergements mutualisés

Sur certains hébergements, une règle de sécurité générique refuse les robots IA au niveau du pare-feu applicatif, sans que rien n'apparaisse dans le robots.txt ni dans l'administration du site. Le symptôme est caractéristique : le site s'affiche parfaitement dans un navigateur, et reste introuvable pour les moteurs génératifs.

FAQ Questions fréquentes

Faut-il autoriser tous les robots IA ?
C'est un arbitrage, pas une évidence. Autoriser les robots de recherche en direct est nécessaire pour être cité ; le choix d'autoriser ceux qui servent à l'entraînement relève d'une décision d'entreprise. La seule erreur franche est de bloquer sans savoir lequel fait quoi.
Un test avec un autre agent utilisateur prouve-t-il qu'un robot passe ?
Non. Les blocages sérieux s'appliquent par plage d'adresses IP, pas au nom déclaré. Un robot peut recevoir une erreur là où votre test reçoit une page. Seuls les journaux du serveur ou la console du pare-feu tranchent.

Pour aller plus loin

Savez-vous ce que les IA disent de votre marque ?

Recevez un audit de votre visibilité dans ChatGPT, Perplexity, Gemini et Claude.