Quatre user-agents OpenAI, quatre finalités
Traiter tous les crawlers OpenAI comme un seul bot produit des règles incohérentes. La documentation OpenAI distingue quatre usages publics.
| User-agent | Finalité documentée | Point d’attention |
|---|---|---|
| OAI-SearchBot | Faire apparaître des pages dans les fonctions de recherche de ChatGPT | Le bloquer peut empêcher une page d’être montrée dans les réponses de recherche ChatGPT |
| GPTBot | Collecter du contenu susceptible de servir à l’entraînement des modèles de fondation | Le bloquer exprime un refus pour cet usage, sans régler les autres finalités |
| ChatGPT-User | Exécuter certaines actions demandées par un utilisateur dans ChatGPT ou un GPT personnalisé | Les règles robots.txt peuvent ne pas s’appliquer comme à un crawl automatique |
| OAI-AdsBot | Vérifier la sécurité et la pertinence de pages soumises comme publicités ChatGPT | Il visite les pages soumises comme ads et ses données ne servent pas à entraîner les modèles de fondation |
Un exemple minimal à adapter
La configuration suivante correspond à un site qui souhaite rester accessible à la recherche ChatGPT, refuse l’entraînement déclaré par GPTBot et n’utilise pas les publicités ChatGPT.
User-agent: OAI-SearchBot
Allow: /
User-agent: GPTBot
Disallow: /
User-agent: OAI-AdsBot
Disallow: /
Ce n’est pas une recommandation universelle. Un annonceur qui soumet des landing pages doit
réexaminer la règle OAI-AdsBot pour les chemins concernés. Une application doit protéger ses
actions et ses données privées avec une authentification et des autorisations, pas avec
robots.txt seul.
Étendre la politique aux autres catégories
Les mêmes principes s’appliquent aux autres opérateurs. Cloudflare distingue notamment Search, Agent, Training, Transact, Data Collection, SEO et Ads Verification. Une catégorie déclarée aide à structurer la décision, mais ne prouve pas l’usage réel d’une requête.
Utilisez le cadre d’arbitrage des bots IA pour relier chaque intention à sa valeur, son risque et le niveau de contrôle adapté.
Contrôler le résultat après modification
- Relire le fichier public avec une requête HTTP directe.
- Vérifier que le CDN ou le WAF ne sert pas une autre version.
- Tester les chemins sensibles séparément des pages publiques.
- Inspecter les logs avec le user-agent, l’adresse source, l’URL, le statut et l’horodatage.
- Qualifier le résultat : autorisé par robots.txt, bloqué au réseau, observé dans les logs ou non mesurable.
Un statut 200 établit qu’une requête précise a obtenu une réponse. Il ne prouve ni indexation ni citation. Une absence de logs ne valide pas davantage la règle si la période, l’échantillon ou l’identité technique du bot ne sont pas connus.
Questions fréquentes
Un Disallow sur GPTBot bloque-t-il ChatGPT Search ?
Non. OpenAI documente GPTBot et OAI-SearchBot pour des finalités différentes. Il faut une règle distincte pour chaque usage que vous souhaitez contrôler.
Autoriser OAI-AdsBot améliore-t-il la visibilité organique ?
Aucun avantage organique n’est documenté. OpenAI présente ce bot comme un outil de vérification des pages soumises comme publicités et indique que les publicités restent séparées des réponses.
Un statut HTTP 200 prouve-t-il l’indexation ?
Non. Il prouve seulement qu’une requête précise a reçu une réponse. L’indexation et la citation exigent des preuves distinctes.
Sources primaires
- OpenAI, Overview of OpenAI Crawlers
- OpenAI, Advertiser Guidance for Allowing OpenAI Web Crawlers
- OpenAI, Ads in ChatGPT
- Cloudflare, Verified bots
Une modification de robots.txt n'est pas forcément appliquée instantanément par un robot qui a mis le fichier en cache. Conservez l'heure de publication, retestez le fichier servi et observez plusieurs passages avant de conclure. Préparez aussi la règle inverse afin de pouvoir revenir rapidement à la politique précédente.