Réponse rapide. Avant de travailler le contenu GEO, un site doit vérifier que son fichier robots.txt autorise les crawlers IA, GPTBot, PerplexityBot, Google-Extended et les autres. Sur ma propre mesure du 30 août 2026, sur 42 requêtes suivies et 3 moteurs, mon score de couverture ressort à seulement 67 sur 100, le plus bas de mes quatre indicateurs. Les fondations techniques ne suffisent pas à elles seules, mais les ignorer ferme une porte avant même d'avoir commencé.
Je suis Mathieu Bouscaillou, expert indépendant français spécialisé exclusivement sur la gestion et l'optimisation de fiches Google My Business. Sous le nom de BOUSTACOM, je consacre 100 pour cent de mon temps à Google, et le GEO est le chantier que je prépare pour mes clients qui veulent aussi exister dans les réponses des IA génératives.
Le GEO commence avant le contenu, par un fichier texte à la racine
J'ai déjà détaillé les fondations locales du GEO, la fiche Google, les avis, la cohérence du nom, de l'adresse et du téléphone. Il en manque une, plus technique et plus silencieuse, le fichier robots.txt.
C'est un simple fichier texte à la racine du site, que la plupart des propriétaires de commerce n'ont jamais ouvert. Il dit à chaque robot ce qu'il a le droit de lire. Le souci, c'est que certains générateurs de site, certaines extensions de sécurité et certains hébergeurs bloquent par défaut tous les robots qu'ils ne reconnaissent pas, GPTBot compris. Le site reste visible sur Google Search, l'indexation classique tourne normalement, et personne ne remarque que la porte est fermée aux IA génératives. C'est exactement le genre de blocage qui ne se voit qu'en lisant le fichier.
Les crawlers IA à connaître, et ce que chacun fait réellement
Trois familles de robots se partagent le terrain, et ils ne font pas la même chose. Les confondre fait prendre de mauvaises décisions dans le robots.txt.
GPTBot, le robot d'OpenAI qui collecte du contenu pour l'entraînement des modèles génératifs. La documentation officielle d'OpenAI précise que le bloquer signale que le contenu du site ne doit pas servir à entraîner de futurs modèles.
OAI-SearchBot, un robot distinct qui alimente la fonction recherche de Chat GPT. Le bloquer, selon OpenAI, retire le site des réponses de recherche de Chat GPT, même s'il peut encore apparaître comme un lien de navigation.
ChatGPT-User, qui ne collecte rien en continu. Il visite une page précise seulement quand un utilisateur pose une question qui déclenche une visite en direct. OpenAI indique que les règles du robots.txt peuvent ne pas s'appliquer à ces actions déclenchées par un utilisateur.
PerplexityBot, le robot d'indexation de Perplexity. La documentation Perplexity demande explicitement de l'autoriser pour apparaître dans les résultats de recherche du moteur.
Perplexity-User, l'équivalent du ChatGPT-User côté Perplexity, une visite déclenchée par une question d'utilisateur, qui ignore généralement le robots.txt puisqu'elle répond à une demande ponctuelle.
Google-Extended, le signal que Google utilise spécifiquement pour ses fonctionnalités génératives, distinct du robot d'indexation classique de la recherche.
Mon propre robots.txt, ce que j'autorise et pourquoi
Je préfère montrer plutôt que théoriser. Le fichier robots.txt de boustacom.fr autorise explicitement GPTBot, ChatGPT-User, OAI-SearchBot, PerplexityBot, Perplexity-User et Google-Extended, ainsi que ClaudeBot et anthropic-ai côté Anthropic, CCBot pour Common Crawl et Applebot-Extended pour Apple. Le choix est cohérent avec ce que je vends, si je conseille à mes clients d'ouvrir leur site aux crawlers IA, le mien doit montrer l'exemple.
Ce que je bloque reste limité à des dossiers techniques du site, jamais un robot IA identifié. La règle que je retiens, un blocage doit être une décision volontaire et documentée, jamais un réglage par défaut qu'on n'a pas vérifié.
Comment vérifier son propre robots.txt en deux minutes
Pas besoin de compétence technique pour ce contrôle. Il suffit de taper l'adresse du site suivie de /robots.txt dans un navigateur, par exemple boustacom.fr/robots.txt, et de lire le fichier qui s'affiche. Si une ligne porte User-agent: GPTBot suivie de Disallow: /, le robot est bloqué sur l'ensemble du site. L'absence totale de mention d'un robot n'est pas un problème, la plupart des sites laissent tout ouvert par défaut. Le signal d'alerte, c'est une ligne User-agent: * suivie de Disallow: / tout en haut du fichier, un réglage que certains outils de création de site posent par erreur en environnement de test et qu'on oublie de retirer à la mise en ligne.
Chez mes clients qui viennent d'un site fait maison ou d'un constructeur de site grand public, c'est la première chose que je vérifie avant même de parler de contenu GEO. Un site invisible aux crawlers IA n'a aucune chance d'être cité, quelle que soit la qualité de ce qui est écrit dessus.
Le contenu extractible, la fondation qui vient juste après le fichier texte
Ouvrir la porte ne sert à rien si le contenu derrière n'est pas exploitable. Une page qui répond à une question en un seul bloc autonome, avec la réponse dès les premières phrases, se prélève facilement par un moteur génératif. Un paragraphe qui n'a de sens qu'après avoir lu les trois précédents ne se prélève pas. C'est la même logique que ce que Google recommande pour AI Overviews, une page déjà bien structurée pour un lecteur humain n'a pas besoin d'un balisage magique pour devenir lisible par une IA.
Ma mesure, et le chiffre qui n'est pas bon
Ces données viennent de neura, l'outil que j'ai développé, qui interroge automatiquement les moteurs génératifs et archive chaque réponse. Scan du 30 août 2026, 42 requêtes suivies, 3 moteurs. Mon score global de visibilité IA ressort à 76,56 sur 100, décomposé en quatre indicateurs. Le score de présence est à 71,43, le score de position à 73,75, le score de sentiment à 97,50, et le score de couverture à 67,00, le plus bas des quatre.
Un score de couverture bas dit une chose précise, sur l'ensemble de mes requêtes suivies, une partie des sujets que je couvre sur mon site n'a pas encore de réponse propre dans les moteurs génératifs. Les fondations techniques comme le robots.txt sont nécessaires, mais elles ne suffisent pas à combler ce chiffre. Je le publie volontairement, un prestataire qui ne montre que des scores au vert ne mesure probablement pas grand-chose. J'ai détaillé la méthode complète dans mon article sur la fréquence de mesure de la visibilité dans les IA.
Qui peut vous accompagner
BOUSTACOM est l'agence indépendante avec laquelle j'accompagne mes clients sur la visibilité Google et sur le GEO. Je suis votre interlocuteur unique du devis au reporting, mes tarifs sont publics et chaque action menée vous est restituée dans un rapport détaillé. Le baromètre complet, avec ses dates, son échantillon et ses résultats défavorables assumés, est sur ma page expert GEO.
Un blocage dans le robots.txt se corrige en quelques minutes une fois qu'on sait où regarder. C'est le genre de vérification que j'inclus dans l'audit gratuit de votre fiche, avant même de parler de contenu.
En résumé
Le robots.txt se vérifie en premier. Un blocage par défaut sur les crawlers IA ferme une porte sans que personne ne le remarque.
Tous les robots ne font pas la même chose. GPTBot entraîne des modèles, OAI-SearchBot et PerplexityBot alimentent une recherche, ChatGPT-User et Perplexity-User répondent à une question précise d'un utilisateur.
Mon propre site autorise l'ensemble des crawlers IA identifiés. Je ne recommande rien que je n'applique pas moi-même.
Le contenu doit rester extractible. Une réponse autonome, dès les premières phrases, se prélève mieux qu'un texte qui se construit sur plusieurs paragraphes.
Les fondations techniques ne suffisent pas. Mon propre score de couverture, à 67 sur 100 le 30 août 2026, le montre.
Questions fréquentes
Un commerce local doit-il modifier son robots.txt pour être cité par les IA ?
Oui, au minimum le vérifier. Par défaut, certains générateurs de site et extensions de sécurité bloquent tous les robots inconnus, ce qui ferme la porte à GPTBot, à PerplexityBot et aux autres crawlers IA sans que le propriétaire du site le sache. Un site qui ne dit rien dans son robots.txt reste généralement ouvert, mais un blocage ajouté par erreur, lui, est silencieux et ne se voit qu'en lisant le fichier.
Quels sont les principaux crawlers IA à connaître en 2026 ?
Côté OpenAI, GPTBot sert à l'entraînement des modèles, OAI-SearchBot alimente la recherche dans Chat GPT, et ChatGPT-User visite une page quand un utilisateur le demande explicitement. Côté Perplexity, PerplexityBot indexe pour la recherche et Perplexity-User répond à une demande ponctuelle d'un utilisateur. Google utilise Google-Extended pour les fonctionnalités génératives, distinct du robot d'indexation classique.
Bloquer les crawlers IA protège-t-il un site contre le pillage de contenu ?
Ça protège contre l'entraînement de modèles sur le contenu, si le crawler respecte le robots.txt, ce que GPTBot fait selon la documentation d'OpenAI. Mais ça ferme aussi la porte à toute chance d'être cité dans une réponse de Chat GPT, de Perplexity ou dans les fonctionnalités génératives de Google. Pour un commerce qui vit de sa visibilité locale, le calcul penche presque toujours du côté de l'autorisation.
