Les trois familles de crawlers IA à distinguer
Cloudflare AI Audit, mis à jour le 1er juillet 2026, classe les bots IA dans trois catégories aux intentions très différentes : les crawlers de recherche (GPTBot, PerplexityBot, Amazonbot) alimentent les réponses IA et les moteurs de recherche génératifs ; les crawlers d'entraînement (CCBot, Common Crawl, ClaudeBot en mode scraping) collectent du contenu pour construire ou affiner des modèles ; les agents autonomes pilotent des navigateurs sans session humaine pour effectuer des tâches pour le compte d'un tiers. Traiter ces trois populations de façon identique conduit à des décisions sous-optimales : bloquer les crawlers de recherche supprime la visibilité dans les réponses IA, tandis que bloquer les agents autonomes protège contre l'automatisation non sollicitée.
Pourquoi différencier ces trois familles
- **Visibilité vs exposition** — autoriser les crawlers de recherche augmente les chances d'être cité dans les réponses IA ; bloquer les crawlers d'entraînement protège le contenu à forte valeur ajoutée.
- **Contrôle granulaire** — robots.txt par User-agent permet une politique par famille sans couper l'indexation SEO classique.
- **Surface d'attaque des agents** — un agent autonome peut scraper un formulaire ou déclencher des actions ; leur blocage au niveau WAF est indépendant du reste.
- **Respect de l'intention éditoriale** — certains contenus (guides, tutoriels) sont réservés aux lecteurs humains et ne doivent pas alimenter un corpus d'entraînement sans accord.
- **Charge serveur** — les crawlers d'entraînement sont souvent agressifs et n'honorent pas Crawl-delay ; les identifier permet de les throttler au niveau réseau.
- **Auditabilité** — Cloudflare AI Audit trace le trafic par catégorie, ce qui rend la décision visible et réversible.
robots.txt : la première ligne de défense
Le fichier robots.txt est la déclaration d'intention la plus lisible. Les crawlers bien configurés (GPTBot, PerplexityBot, Amazonbot) l'honorent. Les crawlers d'entraînement moins scrupuleux (CCBot) le respectent de façon variable. Les agents autonomes l'ignorent en général. C'est pourquoi robots.txt doit être complété par des règles actives au niveau réseau pour couvrir les comportements non conformes.
Audit et configuration pas à pas
Auditer le trafic avec Cloudflare AI Audit
Dans le tableau de bord Cloudflare, ouvrez Security > Bots > AI Audit. L'interface affiche le volume par catégorie (recherche, entraînement, agents) et par user-agent. Identifiez les bots présents et leur poids réel avant de configurer quoi que ce soit.
Déclarer la politique par famille dans robots.txt
Ajoutez des blocs ciblés : User-agent: GPTBot / Allow: / pour les crawlers de recherche à conserver ; User-agent: CCBot / Disallow: / pour les crawlers d'entraînement à bloquer ; User-agent: * pour la règle par défaut SEO classique. Chaque user-agent déclaré prend le pas sur *.
Créer une règle WAF Cloudflare pour les agents autonomes
Dans Security > WAF > Custom Rules, créez une règle ciblant cf.bot_management.js_check_failed combiné à un score bot bas pour les agents qui ne respectent pas robots.txt. Choisissez l'action Block ou Challenge selon la tolérance de votre client.
Bloquer les crawlers d'entraînement récalcitrants au WAF
Pour CCBot et les bots sans user-agent fiable, ajoutez une règle WAF sur http.user_agent contains "CCBot" avec action Block. Cloudflare AI Audit fournit la liste exacte des user-agents vus sur la zone.
Vérifier que l'indexation SEO classique est préservée
Après déploiement, vérifiez dans Cloudflare Analytics que Googlebot, Bingbot et les crawlers SEO habituels ne sont pas impactés. Consultez Google Search Console pour détecter toute erreur de crawl introduite par les nouvelles règles.
Ne pas tout bloquer : les crawlers de recherche ont de la valeur
GPTBot (OpenAI), PerplexityBot et Amazonbot alimentent les réponses des moteurs de recherche génératifs. Un site bloqué pour ces crawlers n'apparaît pas dans les résumés IA de ChatGPT ou Perplexity. Pour les sites clients orientés acquisition, c'est une visibilité à ne pas sacrifier. La stratégie recommandée : autoriser les crawlers de recherche, bloquer les crawlers d'entraînement et filtrer les agents autonomes au WAF.
Sites clients sans Cloudflare : que faire
Pour les sites hébergés sans Cloudflare en proxy, robots.txt reste l'unique levier déclaratif. Complétez-le avec des directives User-agent par bot connu. Côté serveur, configurez Nginx ou Apache pour retourner un 403 sur les user-agents les plus agressifs via des règles dans le bloc server. Sur un VPS avec accès root, fail2ban peut lire les logs d'accès et bannir en IP les crawlers qui ignorent robots.txt.