Aller au contenu principal
Bêta privéeL'app Shopify qui rend vos produits lisibles et vérifiables par l'IA.App Shopify : soyez lisible par l’IAJe veux un accès
Tutoriel

Robots IA bloqués : la procédure de vérification

11 min de lecture Mis à jour le Mis à jour récemment
#robots-txt #crawlers #cloudflare #gptbot #oai-searchbot #perplexitybot #claudebot #shopify #cdn
Share

Le problème en 60 mots

Le blocage des robots IA est beaucoup plus rare qu’on ne le lit. Nous avons mesuré 432 boutiques Shopify françaises : une seule bloque un robot de recherche IA ou un agent d’achat. Shopify livre un robots.txt permissif par défaut, et il faut une intervention manuelle pour le casser. Cette procédure sert donc à une chose : vérifier en 15 minutes que vous n’êtes pas l’exception, et couvrir les sites hors Shopify placés derrière un CDN.

Ce que nous avons mesuré

Le 24 juillet 2026, lecture du robots.txt de 432 boutiques Shopify françaises (clientes d’agences référencées dans le répertoire partenaires Shopify).

MesureRésultat
Citent au moins un robot IA dans leur robots.txt9 / 432 (2,1 %)
Bloquent un robot d’entraînement (GPTBot, ClaudeBot)4 / 432 (0,9 %)
Bloquent un robot de recherche IA ou un agent d’achat1 / 432 (0,2 %)
Blocage global Disallow: /0 / 432

Méthode : lecture du robots.txt servi en HTTP 200, parsing des groupes User-agent, blocage retenu si Disallow: / s’applique au robot (groupe dédié, ou * à défaut). Limites : échantillon français, boutiques accompagnées par une agence (donc probablement mieux entretenues que la moyenne), et couche fichier uniquement — un blocage au niveau CDN ou WAF n’est pas visible depuis l’extérieur, c’est précisément l’objet de l’étape 3.

Procédure de vérification des robots IA bloqués en 4 étapes : lire le robots.txt, corriger robots.txt.liquid sur Shopify, vérifier la couche CDN dans Cloudflare AI Crawl Control, tester via les metrics et un agent réel
Figure 1 : la procédure en 4 étapes. La couche CDN (étapes 3-4) est invisible dans le robots.txt : c'est là que se cachent les blocages que personne n'a décidés.

Étape 0 : comprendre les trois familles de robots

« Les robots IA », ça n’existe pas. Il y a trois familles, avec trois impacts business différents. Tout le reste de la procédure en découle. C’est aussi la première brique de toute stratégie GEO (Generative Engine Optimization) : avant d’optimiser vos contenus pour la visibilité IA, vérifiez que les moteurs peuvent simplement vous lire.

FamilleUser-agentsCe qu’ils fontSi vous les bloquez
Robots d’entraînementGPTBot, ClaudeBot, Google-ExtendedCollectent du contenu pour entraîner des modèlesChoix défendable : vous donnez sans rien recevoir
Robots de recherche IAOAI-SearchBot, Claude-SearchBot, PerplexityBotIndexent votre boutique pour les réponses de ChatGPT, Claude, PerplexityVous disparaissez de ces réponses
Agents d’achatChatGPT-User, Claude-User, Perplexity-UserVisitent une page quand un utilisateur réel pose une questionVous fermez la porte à un client en train d’acheter

Chaque opérateur documente cette séparation : OpenAI, Anthropic et Perplexity précisent que chaque robot se règle indépendamment : bloquer GPTBot n’affecte pas OAI-SearchBot, et inversement. Perplexity indique explicitement que PerplexityBot ne sert pas à entraîner des modèles.

Trois familles de robots IA : robots d'entraînement (GPTBot, ClaudeBot, Google-Extended), blocage défendable ; robots de recherche IA (OAI-SearchBot, Claude-SearchBot, PerplexityBot), blocage = disparaître des réponses ; agents d'achat (ChatGPT-User, Claude-User, Perplexity-User), blocage = perdre un client réel
Figure 2 : les trois familles de robots IA et le coût de leur blocage. Chaque famille se règle séparément.

Étape 1 : lire votre robots.txt (2 minutes)

Chemin exact : ouvrez https://votre-boutique.com/robots.txt dans un navigateur.

Cherchez ces trois motifs, du plus grave au plus sournois :

1. Le blocage global :

User-agent: *
Disallow: /

Tout le site est bloqué pour tous les crawlers. C’est rare mais fatal.

2. Les blocages ciblés anti-IA :

User-agent: GPTBot
Disallow: /

User-agent: PerplexityBot
Disallow: /

Souvent ajoutés en 2023-2024 par des guides « protégez votre contenu de l’IA », puis oubliés. Vérifiez chaque User-agent cité : s’il appartient à la famille recherche ou agent d’achat (tableau ci-dessus), le blocage vous coûte de la visibilité et des ventes.

3. Les blocages partiels : Disallow: /products/ ou Disallow: /collections/ sous un user-agent IA. Plus discret, même effet sur les fiches produit.

Cas particulier : un bloc encadré par # BEGIN Cloudflare Managed content et # END Cloudflare Managed Content. Ces lignes ne viennent pas de votre site : c’est le robots.txt géré de Cloudflare, préfixé au vôtre directement à la périphérie. Modifier le fichier de votre origine (Shopify ou autre) ne les retirera pas : la configuration se fait dans le tableau de bord Cloudflare (voir l’étape 3).

Résultat attendu : sur une boutique Shopify sans personnalisation, vous devez voir uniquement des règles Disallow sur /admin, /cart, /orders, /checkouts/, /account et similaires. Aucun bloc User-agent nommant un robot IA. Si c’est votre cas, passez directement à l’étape 3 : votre robots.txt est sain.

Étape 2 : corriger sur Shopify (5 minutes)

Shopify ne bloque aucun robot IA par défaut. Si votre robots.txt contient des blocages IA, ils viennent d’un fichier robots.txt.liquid personnalisé dans votre thème.

Chemin exact : Boutique en ligneThèmes → bouton sur le thème actif → Modifier le code → dossier Templatesrobots.txt.liquid.

  • Si le fichier n’existe pas : Shopify sert son robots.txt par défaut, qui est sain. Rien à faire.
  • Si le fichier existe : cherchez les blocs User-agent visant des robots IA et supprimez-les. Conservez la boucle Liquid robots.default_groups qui génère les règles par défaut : Shopify recommande de garder ces objets Liquid, car les règles par défaut sont mises à jour automatiquement.

Limite à connaître : Shopify classe la modification de robots.txt.liquid comme une personnalisation non supportée. Le support Shopify n’aide pas à éditer ce fichier, et une règle mal écrite peut couper tout votre trafic. Si vous n’êtes pas à l’aise, supprimez le template entier (votre thème reviendra au défaut Shopify, sain) plutôt que d’éditer règle par règle.

Chronologie après la correction

MomentCe qui se passeCe que vous voyez
T+0Le nouveau robots.txt est servi immédiatementvotre-boutique.com/robots.txt reflète le changement au rechargement
T+0 à 24hChaque crawler relit le fichier à son prochain passage (la plupart cachent robots.txt jusqu’à 24h)Rien de visible : période de propagation normale
T+24h à quelques joursLes robots de recherche IA recommencent à explorer les pages débloquéesRéapparition progressive dans les réponses IA, sans garantie de citation

Vérification pendant l’attente : rechargez votre-boutique.com/robots.txt en navigation privée pour confirmer que la version servie est bien la nouvelle (pas un cache).

Étape 3 : vérifier la couche CDN (5 minutes)

C’est l’étape que presque tout le monde saute, et c’est pourtant là que se cachent les blocages que personne n’a décidés. Un CDN peut refuser un crawler avant même qu’il atteigne votre robots.txt : ce blocage est invisible dans le fichier.

Cas 1 : boutique Shopify standard. Votre CDN est géré par Shopify, qui ne bloque pas les robots IA par défaut. Si vos étapes 1 et 2 sont propres, vous avez terminé. Attention en revanche aux apps de « protection de contenu » ou anti-bot installées sur la boutique : vérifiez leur configuration une par une.

Cas 2 : site derrière Cloudflare (site custom, WooCommerce, headless, ou domaine proxifié par Cloudflare). Depuis le 1er juillet 2025, Cloudflare bloque les crawlers IA connus par défaut sur les nouveaux domaines. Si votre domaine a été ajouté après cette date, vous êtes probablement bloquant sans l’avoir choisi.

Et à partir du 15 septembre 2026, ça s’étend. Cloudflare a annoncé le 1er juillet 2026 de nouveaux défauts : sur les nouveaux domaines, les catégories Training ET Agent seront bloquées par défaut sur les pages qui affichent de la publicité (la catégorie Agent inclut explicitement ChatGPT-User et les agents de navigation, donc les agents d’achat). Search reste autorisé. Les clients existants doivent poser leurs préférences dans les réglages Security avant le 15 septembre.

Le piège à connaître absolument : les nouveaux défauts appliquent la règle la plus restrictive. Cloudflare l’écrit noir sur blanc : les crawlers multi-usages comme Googlebot, Applebot et BingBot seront bloqués chez les clients qui choisissent de bloquer Training. Autrement dit, cocher « bloquer l’entraînement IA » au niveau Cloudflare peut vous retirer de la recherche Google classique. Si vous bloquez l’entraînement, faites-le dans le robots.txt (Google-Extended, GPTBot), pas via la catégorie Cloudflare, tant que ce comportement est en vigueur.

Chemin exact : tableau de bord Cloudflare → votre domaine → AI Crawl Control → onglet Crawlers.

  • Chaque crawler IA apparaît avec une colonne Action : sélectionnez Allow ou Block robot par robot.
  • Disponible sur le plan gratuit (détection par user-agent ; les plans payants ajoutent la détection avancée du Bot Management).
  • Depuis le 1er juillet 2026, Cloudflare classe aussi les bots vérifiés par intention (Search, Agent, Training, Transact…), ce qui correspond exactement aux trois familles de l’étape 0.

Le robots.txt géré par Cloudflare. Si votre robots.txt affiche un bloc # BEGIN Cloudflare Managed content, la fonction « managed robots.txt » est active. Ce qu’elle fait, précisément : elle préfixe à votre fichier un Content-signal: search=yes, ai-train=no et des règles Disallow: / visant huit robots d’entraînement (GPTBot, ClaudeBot, Google-Extended, CCBot, Bytespider, Amazonbot, Applebot-Extended, meta-externalagent). Elle ne touche ni les robots de recherche IA ni les agents d’achat : c’est cohérent avec la logique des trois familles, et c’est un réglage défendable si vous refusez l’entraînement.

Chemin exact pour l’activer ou le désactiver : SecurityBotsConfigure Bot Fight Mode → interrupteur Instruct bot traffic with robots.txt (également accessible via SecuritySettings, filtre Bot traffic). Disponible sur tous les plans. Si le bloc persiste après désactivation, purgez le cache Cloudflare de /robots.txt : la version gérée peut rester servie quelques minutes.

Réglage cohérent avec les trois familles : autorisez les robots de recherche IA et les agents d’achat ; décidez librement pour les robots d’entraînement.

Chronologie après un changement Cloudflare

MomentCe qui se passeCe que vous voyez
T+0 à 1 minLa règle se propage sur le réseau CloudflareL’onglet Crawlers affiche la nouvelle action
T+quelques heuresLes crawlers autorisés recommencent à passerL’onglet Metrics d’AI Crawl Control montre les requêtes autorisées par crawler

Vérification pendant l’attente : l’onglet Metrics d’AI Crawl Control liste les requêtes récentes par crawler, avec leur statut. C’est la preuve directe : si PerplexityBot apparaît en Blocked après votre changement, la règle n’est pas la bonne.

Étape 4 : le test final

  1. votre-boutique.com/robots.txt : plus aucun bloc visant un robot de recherche IA ou un agent d’achat.
  2. Si Cloudflare : onglet Metrics d’AI Crawl Control avec des requêtes Allowed pour les crawlers des familles 2 et 3.
  3. Test réel côté agent : demandez à ChatGPT (avec recherche activée) ou Perplexity une question sur un de vos produits en citant votre marque. Si votre fiche est accessible, l’outil peut la consulter en direct. Un échec ponctuel ne prouve rien (la citation dépend de bien d’autres facteurs), mais un refus systématique de lire une URL que vous collez est un signal de blocage restant.

Si ça ne marche pas

  • Le robots.txt ne change pas après modification du template → vous avez édité un thème non publié. Vérifiez que vous étiez sur le thème actif, ou republiez.
  • Le robots.txt est propre mais un crawler n’apparaît jamais dans les logs/metrics → blocage à une autre couche : app anti-bot, WAF, pare-feu serveur. Sur Cloudflare, vérifiez aussi les règles WAF personnalisées et les paramètres Bots au-delà d’AI Crawl Control.
  • Un prestataire vous dit que bloquer toute l’IA « protège le contenu » → vrai pour un média qui vit de son contenu, faux pour une boutique qui vit d’être trouvée et recommandée. Le blocage se décide famille par famille, pas en bloc.

Articles connexes


Vous voulez la vérification complète en 60 secondes ? L’audit gratuit lit votre robots.txt, teste l’accessibilité de vos fiches produit et vérifie les signaux que chaque moteur IA peut réellement extraire. Lancer un audit GEO gratuit →