Sommaire de l’article
N’autorisez ou ne bloquez jamais « l’IA » en bloc. Décidez séparément pour la découverte dans la recherche, l’accès déclenché par un utilisateur et l’entraînement, puis vérifiez le comportement du CDN et du WAF.
Matrice des agents documentés
| Opérateur | Agent | Fonction décrite par l’opérateur | robots.txt |
|---|---|---|---|
| OpenAI | OAI-SearchBot | faire apparaître des sites dans ChatGPT Search | pris en compte |
| OpenAI | GPTBot | usage potentiel pour améliorer les modèles | pris en compte |
| OpenAI | ChatGPT-User | visite déclenchée par une action utilisateur | peut ne pas suivre robots.txt |
| Perplexity | PerplexityBot | indexation et liens dans les résultats | pris en compte |
| Perplexity | Perplexity-User | récupération à la demande d’un utilisateur | généralement hors contrôle robots.txt |
| Anthropic | ClaudeBot | crawl général décrit par Anthropic | pris en compte |
| Anthropic | Claude-SearchBot | amélioration des résultats de recherche | pris en compte |
| Anthropic | Claude-User | récupération liée à une demande utilisateur | pris en compte selon la documentation Anthropic |
| Googlebot | crawl pour Google Search, dont ses fonctions IA | pris en compte | |
| Google-Extended | contrôle de certains usages Gemini hors Google Search | jeton de produit, distinct de Googlebot |
Cette matrice décrit les fonctions publiées au 12 août 2026. Les opérateurs peuvent les modifier. La documentation officielle doit rester la source de vérité.
Google-Extended n’est pas Googlebot
Google précise que Googlebot contrôle l’accès pour Search, y compris AI Overviews et AI Mode. Google-Extended est un jeton de produit permettant de gérer certains usages de contenu pour Gemini et le grounding hors Search. Le bloquer ne retire pas automatiquement une page de Google Search.
Cette distinction corrige une erreur fréquente: présenter Google-Extended comme une condition d’éligibilité aux AI Overviews.
Cloudflare sépare Search, Agent et Training
Cloudflare classe désormais les comportements IA en trois finalités: Search pour collecter ou indexer du contenu utilisé dans des réponses ultérieures, Agent pour agir en temps réel au nom d’une personne, et Training pour entraîner ou ajuster un modèle. Cette couche CDN complète la lecture des noms de robots, elle ne la remplace pas.
Cloudflare annonce de nouveaux réglages par défaut pour les domaines ajoutés à partir du 15 septembre 2026: Search restera autorisé, tandis que Training et Agent seront bloqués sur les pages comportant des publicités. Les crawlers à finalité mixte Search et Training seront également concernés par les configurations de blocage de l’entraînement. La date d’entrée en vigueur étant postérieure à la publication prévue de cet article, vérifiez le tableau de bord et la documentation après le 15 septembre avant de conclure sur une configuration réelle.
Conséquence pratique: un fichier robots.txt permissif ne suffit pas si une politique Cloudflare bloque la même requête. Documentez les deux couches et testez le code HTTP effectivement servi.
Configuration orientée visibilité
Un site qui veut être découvert par les fonctions de recherche peut autoriser Googlebot, OAI-SearchBot, PerplexityBot et Claude-SearchBot, sous réserve de sa politique juridique et commerciale. Il peut décider séparément pour GPTBot ou Google-Extended.
Exemple minimal à adapter:
User-agent: OAI-SearchBot
Allow: /
User-agent: PerplexityBot
Allow: /
User-agent: Claude-SearchBot
Allow: /
Une directive Allow ne contourne pas un blocage WAF, une authentification, un noindex ou une erreur serveur.
Contrôles après modification
- Servez
/robots.txten 200 et en texte brut. - Vérifiez les groupes et jokers avec un parseur.
- Testez les pages sans cookie ni session.
- Contrôlez les règles de sécurité et les plages publiées.
- Surveillez les codes HTTP par agent.
- Publiez une note datée pour chaque changement important de politique.
Ce que robots.txt ne garantit pas
Le protocole donne des directives aux robots coopératifs. Il ne constitue pas une protection d’accès. Pour protéger un contenu confidentiel, utilisez une authentification et des contrôles serveur. Autoriser un agent ne garantit ni visite, ni indexation, ni citation.