Ce que chaque robot vient faire
Les fournisseurs distinguent en général deux usages, et publient des noms différents pour chacun :
- L'entraînement. Le robot collecte du contenu qui pourra servir à entraîner de futurs modèles. Le refuser n'empêche pas d'être cité par un moteur qui va chercher en direct.
- La recherche au moment de la réponse. Le robot charge une page parce qu'un utilisateur vient de poser une question. Le refuser, c'est refuser la citation.
Un robots.txt écrit sans cette distinction produit régulièrement l'effet
inverse de celui recherché : on croit protéger son contenu de l'entraînement, on
se coupe de la recherche.
Vérifier, et pas seulement déclarer
Trois contrôles, dans cet ordre, et aucun ne remplace les autres :
- Lire le
robots.txtet y chercher explicitement chaque nom de robot, plutôt que de conclure d'unAllow: /global. Beaucoup de thèmes et d'extensions en bloquent par défaut. - Demander les pages sous ces noms et comparer non seulement le code de réponse, mais aussi la taille : un pare-feu peut répondre 200 avec un écran de blocage.
- Lire les journaux du serveur ou la console du pare-feu. C'est la seule preuve qu'un robot est réellement passé, et le seul endroit où se voient les blocages par adresse IP.
Le cas des hébergements mutualisés
Sur certains hébergements, une règle de sécurité générique refuse les robots IA
au niveau du pare-feu applicatif, sans que rien n'apparaisse dans le robots.txt
ni dans l'administration du site. Le symptôme est caractéristique : le site
s'affiche parfaitement dans un navigateur, et reste introuvable pour les moteurs
génératifs.
FAQ Questions fréquentes
Faut-il autoriser tous les robots IA ?
Un test avec un autre agent utilisateur prouve-t-il qu'un robot passe ?
Pour aller plus loin
- Comment apparaître dans les réponses de ChatGPT, Perplexity, Gemini et Claude
- Votre site est-il lisible par les IA ? Le test en 6 points
Savez-vous ce que les IA disent de votre marque ?
Recevez un audit de votre visibilité dans ChatGPT, Perplexity, Gemini et Claude.