# Robots IA bloqués : la procédure de vérification
> Mesuré sur 432 boutiques Shopify : 0,2 % bloquent un robot de recherche IA. La procédure pour vérifier que vous n'êtes pas l'exception, du robots.txt au CDN.
- Canonical HTML: https://verityscore.io/fr/blog/verifier-robots-ia-bloques-boutique/
- Markdown alternate: https://verityscore.io/fr/blog/verifier-robots-ia-bloques-boutique.md
- Language: fr
- Content type: blog
- Published: 2026-07-23
- Updated: 2026-07-24
- Tags: robots-txt, crawlers, cloudflare, gptbot, oai-searchbot, perplexitybot, claudebot, shopify, cdn
## Le problème en 60 mots

Le blocage des robots IA est beaucoup plus rare qu'on ne le lit. Nous avons mesuré 432 boutiques Shopify françaises : **une seule bloque un robot de recherche IA ou un agent d'achat**. Shopify livre un `robots.txt` permissif par défaut, et il faut une intervention manuelle pour le casser. Cette procédure sert donc à une chose : vérifier en 15 minutes que vous n'êtes pas l'exception, et couvrir les sites hors Shopify placés derrière un CDN.

### Ce que nous avons mesuré

Le 24 juillet 2026, lecture du `robots.txt` de 432 boutiques Shopify françaises (clientes d'agences référencées dans le répertoire partenaires Shopify).

| Mesure | Résultat |
|---|---|
| Citent au moins un robot IA dans leur `robots.txt` | 9 / 432 (2,1 %) |
| Bloquent un robot d'entraînement (GPTBot, ClaudeBot) | 4 / 432 (0,9 %) |
| Bloquent un robot de recherche IA ou un agent d'achat | **1 / 432 (0,2 %)** |
| Blocage global `Disallow: /` | 0 / 432 |

**Méthode** : lecture du `robots.txt` servi en HTTP 200, parsing des groupes `User-agent`, blocage retenu si `Disallow: /` s'applique au robot (groupe dédié, ou `*` à défaut). **Limites** : échantillon français, boutiques accompagnées par une agence (donc probablement mieux entretenues que la moyenne), et couche fichier uniquement — un blocage au niveau CDN ou WAF n'est pas visible depuis l'extérieur, c'est précisément l'objet de l'étape 3.

<figure>
  <img src="/diagrams/ai-crawler-check-flow-fr.svg" alt="Procédure de vérification des robots IA bloqués en 4 étapes : lire le robots.txt, corriger robots.txt.liquid sur Shopify, vérifier la couche CDN dans Cloudflare AI Crawl Control, tester via les metrics et un agent réel" width="800" height="300" loading="lazy" decoding="async" style="width:100%;height:auto;" />
  <figcaption style="text-align:center;font-size:0.875rem;color:#6B6B76;margin-top:0.5rem;">Figure 1 : la procédure en 4 étapes. La couche CDN (étapes 3-4) est invisible dans le robots.txt : c'est là que se cachent les blocages que personne n'a décidés.</figcaption>
</figure>

## Étape 0 : comprendre les trois familles de robots

« Les robots IA », ça n'existe pas. Il y a trois familles, avec trois impacts business différents. Tout le reste de la procédure en découle. C'est aussi la première brique de toute stratégie GEO (Generative Engine Optimization) : avant d'optimiser vos contenus pour la visibilité IA, vérifiez que les moteurs peuvent simplement vous lire.

| Famille | User-agents | Ce qu'ils font | Si vous les bloquez |
|---|---|---|---|
| Robots d'entraînement | `GPTBot`, `ClaudeBot`, `Google-Extended` | Collectent du contenu pour entraîner des modèles | Choix défendable : vous donnez sans rien recevoir |
| Robots de recherche IA | `OAI-SearchBot`, `Claude-SearchBot`, `PerplexityBot` | Indexent votre boutique pour les réponses de ChatGPT, Claude, Perplexity | Vous disparaissez de ces réponses |
| Agents d'achat | `ChatGPT-User`, `Claude-User`, `Perplexity-User` | Visitent une page quand un utilisateur réel pose une question | Vous fermez la porte à un client en train d'acheter |

Chaque opérateur documente cette séparation : [OpenAI](https://developers.openai.com/api/docs/bots), [Anthropic](https://support.claude.com/en/articles/8896518-does-anthropic-crawl-data-from-the-web-and-how-can-site-owners-block-the-crawler) et [Perplexity](https://docs.perplexity.ai/docs/resources/perplexity-crawlers) précisent que chaque robot se règle indépendamment : bloquer GPTBot n'affecte pas OAI-SearchBot, et inversement. Perplexity indique explicitement que PerplexityBot ne sert pas à entraîner des modèles.

<figure>
  <img src="/diagrams/ai-crawler-families-fr.svg" alt="Trois familles de robots IA : robots d'entraînement (GPTBot, ClaudeBot, Google-Extended), blocage défendable ; robots de recherche IA (OAI-SearchBot, Claude-SearchBot, PerplexityBot), blocage = disparaître des réponses ; agents d'achat (ChatGPT-User, Claude-User, Perplexity-User), blocage = perdre un client réel" width="800" height="430" loading="lazy" decoding="async" style="width:100%;height:auto;" />
  <figcaption style="text-align:center;font-size:0.875rem;color:#6B6B76;margin-top:0.5rem;">Figure 2 : les trois familles de robots IA et le coût de leur blocage. Chaque famille se règle séparément.</figcaption>
</figure>

## Étape 1 : lire votre robots.txt (2 minutes)

**Chemin exact** : ouvrez `https://votre-boutique.com/robots.txt` dans un navigateur.

Cherchez ces trois motifs, du plus grave au plus sournois :

**1. Le blocage global** :

```
User-agent: *
Disallow: /
```

Tout le site est bloqué pour tous les crawlers. C'est rare mais fatal.

**2. Les blocages ciblés anti-IA** :

```
User-agent: GPTBot
Disallow: /

User-agent: PerplexityBot
Disallow: /
```

Souvent ajoutés en 2023-2024 par des guides « protégez votre contenu de l'IA », puis oubliés. Vérifiez chaque `User-agent` cité : s'il appartient à la famille recherche ou agent d'achat (tableau ci-dessus), le blocage vous coûte de la visibilité et des ventes.

**3. Les blocages partiels** : `Disallow: /products/` ou `Disallow: /collections/` sous un user-agent IA. Plus discret, même effet sur les fiches produit.

**Cas particulier : un bloc encadré par `# BEGIN Cloudflare Managed content` et `# END Cloudflare Managed Content`.** Ces lignes ne viennent pas de votre site : c'est le robots.txt géré de Cloudflare, préfixé au vôtre directement à la périphérie. Modifier le fichier de votre origine (Shopify ou autre) ne les retirera pas : la configuration se fait dans le tableau de bord Cloudflare (voir l'étape 3).

**Résultat attendu** : sur une boutique Shopify sans personnalisation, vous devez voir uniquement des règles `Disallow` sur `/admin`, `/cart`, `/orders`, `/checkouts/`, `/account` et similaires. Aucun bloc `User-agent` nommant un robot IA. Si c'est votre cas, passez directement à l'étape 3 : votre robots.txt est sain.

## Étape 2 : corriger sur Shopify (5 minutes)

Shopify ne bloque aucun robot IA par défaut. Si votre robots.txt contient des blocages IA, ils viennent d'un fichier `robots.txt.liquid` personnalisé dans votre thème.

**Chemin exact** : `Boutique en ligne` → `Thèmes` → bouton `…` sur le thème actif → `Modifier le code` → dossier `Templates` → `robots.txt.liquid`.

- **Si le fichier n'existe pas** : Shopify sert son robots.txt par défaut, qui est sain. Rien à faire.
- **Si le fichier existe** : cherchez les blocs `User-agent` visant des robots IA et supprimez-les. Conservez la boucle Liquid `robots.default_groups` qui génère les règles par défaut : Shopify recommande de garder ces objets Liquid, car les règles par défaut sont mises à jour automatiquement.

**Limite à connaître** : Shopify classe la modification de `robots.txt.liquid` comme une personnalisation non supportée. Le support Shopify n'aide pas à éditer ce fichier, et une règle mal écrite peut couper tout votre trafic. Si vous n'êtes pas à l'aise, supprimez le template entier (votre thème reviendra au défaut Shopify, sain) plutôt que d'éditer règle par règle.

#### Chronologie après la correction

| Moment | Ce qui se passe | Ce que vous voyez |
|---|---|---|
| T+0 | Le nouveau robots.txt est servi immédiatement | `votre-boutique.com/robots.txt` reflète le changement au rechargement |
| T+0 à 24h | Chaque crawler relit le fichier à son prochain passage (la plupart cachent robots.txt jusqu'à 24h) | Rien de visible : période de propagation normale |
| T+24h à quelques jours | Les robots de recherche IA recommencent à explorer les pages débloquées | Réapparition progressive dans les réponses IA, sans garantie de citation |

**Vérification pendant l'attente** : rechargez `votre-boutique.com/robots.txt` en navigation privée pour confirmer que la version servie est bien la nouvelle (pas un cache).

## Étape 3 : vérifier la couche CDN (5 minutes)

C'est l'étape que presque tout le monde saute, et c'est pourtant là que se cachent les blocages que personne n'a décidés. Un CDN peut refuser un crawler avant même qu'il atteigne votre robots.txt : ce blocage est invisible dans le fichier.

**Cas 1 : boutique Shopify standard.** Votre CDN est géré par Shopify, qui ne bloque pas les robots IA par défaut. Si vos étapes 1 et 2 sont propres, vous avez terminé. Attention en revanche aux apps de « protection de contenu » ou anti-bot installées sur la boutique : vérifiez leur configuration une par une.

**Cas 2 : site derrière Cloudflare** (site custom, WooCommerce, headless, ou domaine proxifié par Cloudflare). Depuis le 1er juillet 2025, Cloudflare bloque les crawlers IA connus par défaut sur les nouveaux domaines. Si votre domaine a été ajouté après cette date, vous êtes probablement bloquant sans l'avoir choisi.

**Et à partir du 15 septembre 2026, ça s'étend.** Cloudflare a annoncé le 1er juillet 2026 de nouveaux défauts : sur les nouveaux domaines, les catégories `Training` ET `Agent` seront bloquées par défaut sur les pages qui affichent de la publicité (la catégorie `Agent` inclut explicitement ChatGPT-User et les agents de navigation, donc les agents d'achat). `Search` reste autorisé. Les clients existants doivent poser leurs préférences dans les réglages Security avant le 15 septembre.

**Le piège à connaître absolument** : les nouveaux défauts appliquent la règle la plus restrictive. Cloudflare l'écrit noir sur blanc : les crawlers multi-usages comme Googlebot, Applebot et BingBot seront bloqués chez les clients qui choisissent de bloquer `Training`. Autrement dit, cocher « bloquer l'entraînement IA » au niveau Cloudflare peut vous retirer de la recherche Google classique. Si vous bloquez l'entraînement, faites-le dans le robots.txt (Google-Extended, GPTBot), pas via la catégorie Cloudflare, tant que ce comportement est en vigueur.

**Chemin exact** : tableau de bord Cloudflare → votre domaine → `AI Crawl Control` → onglet `Crawlers`.

- Chaque crawler IA apparaît avec une colonne `Action` : sélectionnez `Allow` ou `Block` robot par robot.
- Disponible sur le plan gratuit (détection par user-agent ; les plans payants ajoutent la détection avancée du Bot Management).
- Depuis le 1er juillet 2026, Cloudflare classe aussi les bots vérifiés par intention (`Search`, `Agent`, `Training`, `Transact`…), ce qui correspond exactement aux trois familles de l'étape 0.

**Le robots.txt géré par Cloudflare.** Si votre robots.txt affiche un bloc `# BEGIN Cloudflare Managed content`, la fonction « managed robots.txt » est active. Ce qu'elle fait, précisément : elle préfixe à votre fichier un `Content-signal: search=yes, ai-train=no` et des règles `Disallow: /` visant huit robots d'entraînement (GPTBot, ClaudeBot, Google-Extended, CCBot, Bytespider, Amazonbot, Applebot-Extended, meta-externalagent). Elle ne touche ni les robots de recherche IA ni les agents d'achat : c'est cohérent avec la logique des trois familles, et c'est un réglage défendable si vous refusez l'entraînement.

**Chemin exact pour l'activer ou le désactiver** : `Security` → `Bots` → `Configure Bot Fight Mode` → interrupteur `Instruct bot traffic with robots.txt` (également accessible via `Security` → `Settings`, filtre `Bot traffic`). Disponible sur tous les plans. Si le bloc persiste après désactivation, purgez le cache Cloudflare de `/robots.txt` : la version gérée peut rester servie quelques minutes.

**Réglage cohérent avec les trois familles** : autorisez les robots de recherche IA et les agents d'achat ; décidez librement pour les robots d'entraînement.

#### Chronologie après un changement Cloudflare

| Moment | Ce qui se passe | Ce que vous voyez |
|---|---|---|
| T+0 à 1 min | La règle se propage sur le réseau Cloudflare | L'onglet `Crawlers` affiche la nouvelle action |
| T+quelques heures | Les crawlers autorisés recommencent à passer | L'onglet `Metrics` d'AI Crawl Control montre les requêtes autorisées par crawler |

**Vérification pendant l'attente** : l'onglet `Metrics` d'AI Crawl Control liste les requêtes récentes par crawler, avec leur statut. C'est la preuve directe : si `PerplexityBot` apparaît en `Blocked` après votre changement, la règle n'est pas la bonne.

## Étape 4 : le test final

1. `votre-boutique.com/robots.txt` : plus aucun bloc visant un robot de recherche IA ou un agent d'achat.
2. Si Cloudflare : onglet `Metrics` d'AI Crawl Control avec des requêtes `Allowed` pour les crawlers des familles 2 et 3.
3. Test réel côté agent : demandez à ChatGPT (avec recherche activée) ou Perplexity une question sur un de vos produits en citant votre marque. Si votre fiche est accessible, l'outil peut la consulter en direct. Un échec ponctuel ne prouve rien (la citation dépend de bien d'autres facteurs), mais un refus systématique de lire une URL que vous collez est un signal de blocage restant.

## Si ça ne marche pas

- **Le robots.txt ne change pas après modification du template** → vous avez édité un thème non publié. Vérifiez que vous étiez sur le thème actif, ou republiez.
- **Le robots.txt est propre mais un crawler n'apparaît jamais dans les logs/metrics** → blocage à une autre couche : app anti-bot, WAF, pare-feu serveur. Sur Cloudflare, vérifiez aussi les règles WAF personnalisées et les paramètres Bots au-delà d'AI Crawl Control.
- **Un prestataire vous dit que bloquer toute l'IA « protège le contenu »** → vrai pour un média qui vit de son contenu, faux pour une boutique qui vit d'être trouvée et recommandée. Le blocage se décide famille par famille, pas en bloc.

---

## Articles connexes

- [robots.txt Shopify : accès bots IA utiles](/fr/kb/robots-crawlers/)
- [llms.txt pour Shopify : index de contenu IA utile](/fr/kb/llms-txt/)
- [Score Agent Readiness : les 11 fichiers /.well-known/ à publier en 2026](/fr/blog/well-known-agent-ready/)
- [Le vrai funnel du trafic IA : crawl vs clic](/fr/blog/ai-traffic-funnel-crawl-vs-click/)

---

**Vous voulez la vérification complète en 60 secondes ?** L'audit gratuit lit votre robots.txt, teste l'accessibilité de vos fiches produit et vérifie les signaux que chaque moteur IA peut réellement extraire. [Lancer un audit GEO gratuit →](https://verityscore.io)
## FAQ

### Comment savoir si ma boutique bloque les robots IA ?

Deux vérifications : d'abord lisez votre-boutique.com/robots.txt et cherchez des blocs User-agent visant GPTBot, OAI-SearchBot, ChatGPT-User, ClaudeBot, PerplexityBot ou leurs équivalents. Ensuite vérifiez la couche CDN : sur Cloudflare, le tableau de bord AI Crawl Control liste chaque crawler IA avec son statut autorisé ou bloqué. Le robots.txt seul ne suffit pas, car un blocage CDN est invisible dans ce fichier.

### Shopify bloque-t-il les robots IA par défaut ?

Non. Le robots.txt par défaut de Shopify bloque uniquement les pages d'administration, de panier et de checkout. Si votre boutique Shopify bloque un robot IA, c'est qu'un fichier robots.txt.liquid personnalisé a été ajouté au thème, souvent par une app ou un prestataire SEO. La correction consiste à retirer ces règles du template.

### Faut-il bloquer GPTBot ?

C'est un choix défendable, pas une erreur. GPTBot collecte du contenu pour entraîner les modèles OpenAI : le bloquer n'affecte ni votre présence dans la recherche ChatGPT (OAI-SearchBot) ni les visites déclenchées par un utilisateur (ChatGPT-User). Chaque robot se règle séparément dans robots.txt.

### Pourquoi bloquer ChatGPT-User ou Claude-User est-il grave pour une boutique ?

Parce que derrière chaque visite de ces agents, il y a un humain réel en train de poser une question d'achat. Bloquer ces user-agents revient à refuser l'entrée à un client qui demande votre catalogue. À l'inverse des robots d'entraînement, il n'y a aucun bénéfice de protection de contenu à les bloquer : la page est consultée à la demande, pas collectée en masse.

### Bloquer les robots IA affecte-t-il mon référencement Google classique ?

Non, si vous bloquez les bons robots. Googlebot, le crawler de la recherche Google et des AI Overviews, est distinct de Google-Extended, le jeton qui contrôle l'usage de votre contenu pour Gemini. Bloquer Google-Extended ne change ni votre positionnement dans la recherche Google ni votre présence dans les AI Overviews. En revanche, bloquer Googlebot lui-même vous retire de tout : ne le faites jamais. Attention aussi au niveau Cloudflare : à partir du 15 septembre 2026, les nouveaux défauts appliquent la règle la plus restrictive, et bloquer la catégorie Training y bloque aussi les crawlers multi-usages comme Googlebot. Le blocage de l'entraînement se fait plus sûrement dans le robots.txt.

### Mon robots.txt contient un bloc # BEGIN Cloudflare Managed content : d'où vient-il ?

C'est le robots.txt géré de Cloudflare : quand la fonction est active, Cloudflare préfixe votre fichier avec un Content-signal (search=yes, ai-train=no) et des règles Disallow visant les robots d'entraînement (GPTBot, ClaudeBot, Google-Extended, CCBot, Bytespider, Amazonbot, Applebot-Extended, meta-externalagent). Modifier le fichier de votre site ne le retire pas : désactivez l'interrupteur Instruct bot traffic with robots.txt dans Security, Bots, Configure Bot Fight Mode. Ce bloc ne vise que la famille entraînement, pas les robots de recherche IA ni les agents d'achat.

### Mon site passe par Cloudflare : suis-je concerné par le blocage par défaut ?

Oui si votre domaine a été ajouté à Cloudflare après le 1er juillet 2025 : les crawlers IA connus y sont bloqués par défaut, sauf choix contraire à l'onboarding. Vérifiez dans le tableau de bord Cloudflare, section AI Crawl Control, onglet Crawlers : chaque robot a une action Allow ou Block modifiable individuellement, y compris sur le plan gratuit.

## Sources

- [Cloudflare : Verified bots, classement par comportement (mis à jour 1er juillet 2026)](https://developers.cloudflare.com/bots/concepts/bot/verified-bots/) (official)
- [Cloudflare : Your site, your rules, nouveaux défauts AI traffic au 15 septembre 2026 (1er juillet 2026)](https://blog.cloudflare.com/content-independence-day-ai-options/) (official)
- [Cloudflare : managed robots.txt pour les crawlers IA (mis à jour 1er juillet 2026)](https://developers.cloudflare.com/bots/additional-configurations/managed-robots-txt) (official)
- [Cloudflare : AI Crawl Control, prise en main (mis à jour 23 avril 2026)](https://developers.cloudflare.com/ai-crawl-control/get-started/) (official)
- [Cloudflare bloque les crawlers IA par défaut (communiqué, 1er juillet 2025)](https://www.cloudflare.com/press/press-releases/2025/cloudflare-just-changed-how-ai-crawlers-scrape-the-internet-at-large/) (official)
- [OpenAI : documentation des bots (consultée 23 juillet 2026)](https://developers.openai.com/api/docs/bots) (official)
- [Anthropic : crawlers Claude et contrôle d'accès (consultée 23 juillet 2026)](https://support.claude.com/en/articles/8896518-does-anthropic-crawl-data-from-the-web-and-how-can-site-owners-block-the-crawler) (official)
- [Perplexity : documentation des crawlers (consultée 23 juillet 2026)](https://docs.perplexity.ai/docs/resources/perplexity-crawlers) (official)
- [Shopify : personnaliser robots.txt avec robots.txt.liquid (doc développeur, 2026)](https://shopify.dev/docs/storefronts/themes/seo/robots-txt) (official)
- [Shopify Help Center : Editing robots.txt.liquid (2026)](https://help.shopify.com/en/manual/promoting-marketing/seo/editing-robots-txt) (official)

