Insights · Technique

robots.txt et bots IA : configuration vérifiable en 2026

Une politique cohérente distingue recherche, entraînement, actions demandées par un utilisateur et contrôle publicitaire avant de choisir une règle.

Mis à jour 14 septembre 2026 8 min de lecture

Quatre user-agents OpenAI, quatre finalités

Traiter tous les crawlers OpenAI comme un seul bot produit des règles incohérentes. La documentation OpenAI distingue quatre usages publics.

User-agent Finalité documentée Point d’attention
OAI-SearchBot Faire apparaître des pages dans les fonctions de recherche de ChatGPT Le bloquer peut empêcher une page d’être montrée dans les réponses de recherche ChatGPT
GPTBot Collecter du contenu susceptible de servir à l’entraînement des modèles de fondation Le bloquer exprime un refus pour cet usage, sans régler les autres finalités
ChatGPT-User Exécuter certaines actions demandées par un utilisateur dans ChatGPT ou un GPT personnalisé Les règles robots.txt peuvent ne pas s’appliquer comme à un crawl automatique
OAI-AdsBot Vérifier la sécurité et la pertinence de pages soumises comme publicités ChatGPT Il visite les pages soumises comme ads et ses données ne servent pas à entraîner les modèles de fondation

Un exemple minimal à adapter

La configuration suivante correspond à un site qui souhaite rester accessible à la recherche ChatGPT, refuse l’entraînement déclaré par GPTBot et n’utilise pas les publicités ChatGPT.

User-agent: OAI-SearchBot
Allow: /

User-agent: GPTBot
Disallow: /

User-agent: OAI-AdsBot
Disallow: /

Ce n’est pas une recommandation universelle. Un annonceur qui soumet des landing pages doit réexaminer la règle OAI-AdsBot pour les chemins concernés. Une application doit protéger ses actions et ses données privées avec une authentification et des autorisations, pas avec robots.txt seul.

Étendre la politique aux autres catégories

Les mêmes principes s’appliquent aux autres opérateurs. Cloudflare distingue notamment Search, Agent, Training, Transact, Data Collection, SEO et Ads Verification. Une catégorie déclarée aide à structurer la décision, mais ne prouve pas l’usage réel d’une requête.

Utilisez le cadre d’arbitrage des bots IA pour relier chaque intention à sa valeur, son risque et le niveau de contrôle adapté.

Contrôler le résultat après modification

  1. Relire le fichier public avec une requête HTTP directe.
  2. Vérifier que le CDN ou le WAF ne sert pas une autre version.
  3. Tester les chemins sensibles séparément des pages publiques.
  4. Inspecter les logs avec le user-agent, l’adresse source, l’URL, le statut et l’horodatage.
  5. Qualifier le résultat : autorisé par robots.txt, bloqué au réseau, observé dans les logs ou non mesurable.

Un statut 200 établit qu’une requête précise a obtenu une réponse. Il ne prouve ni indexation ni citation. Une absence de logs ne valide pas davantage la règle si la période, l’échantillon ou l’identité technique du bot ne sont pas connus.

Questions fréquentes

Un Disallow sur GPTBot bloque-t-il ChatGPT Search ?

Non. OpenAI documente GPTBot et OAI-SearchBot pour des finalités différentes. Il faut une règle distincte pour chaque usage que vous souhaitez contrôler.

Autoriser OAI-AdsBot améliore-t-il la visibilité organique ?

Aucun avantage organique n’est documenté. OpenAI présente ce bot comme un outil de vérification des pages soumises comme publicités et indique que les publicités restent séparées des réponses.

Un statut HTTP 200 prouve-t-il l’indexation ?

Non. Il prouve seulement qu’une requête précise a reçu une réponse. L’indexation et la citation exigent des preuves distinctes.

Sources primaires

Une modification de robots.txt n'est pas forcément appliquée instantanément par un robot qui a mis le fichier en cache. Conservez l'heure de publication, retestez le fichier servi et observez plusieurs passages avant de conclure. Préparez aussi la règle inverse afin de pouvoir revenir rapidement à la politique précédente.