Référence technique · Recherche vérifiable

Matrice robots IA 2026 : recherche, usage et entraînement

Tableau vérifié des robots OpenAI, Google, Perplexity et Anthropic, avec leur fonction documentée, les contrôles disponibles et les erreurs de configuration.

Publication · 13 septembre 2026 Lecture · 10 min Sources revues · 8 Auteur · Rédaction llmoptimisation.fr
Matrice qui distingue les fonctions des robots IA officiels
Sommaire de l’article
  1. Matrice des agents documentés
  2. Google-Extended n’est pas Googlebot
  3. Cloudflare sépare Search, Agent et Training
  4. Configuration orientée visibilité
  5. Contrôles après modification
  6. Ce que robots.txt ne garantit pas
  7. Sources
Règle de décision

N’autorisez ou ne bloquez jamais « l’IA » en bloc. Décidez séparément pour la découverte dans la recherche, l’accès déclenché par un utilisateur et l’entraînement, puis vérifiez le comportement du CDN et du WAF.

Matrice des agents documentés

Opérateur Agent Fonction décrite par l’opérateur robots.txt
OpenAI OAI-SearchBot faire apparaître des sites dans ChatGPT Search pris en compte
OpenAI GPTBot usage potentiel pour améliorer les modèles pris en compte
OpenAI ChatGPT-User visite déclenchée par une action utilisateur peut ne pas suivre robots.txt
Perplexity PerplexityBot indexation et liens dans les résultats pris en compte
Perplexity Perplexity-User récupération à la demande d’un utilisateur généralement hors contrôle robots.txt
Anthropic ClaudeBot crawl général décrit par Anthropic pris en compte
Anthropic Claude-SearchBot amélioration des résultats de recherche pris en compte
Anthropic Claude-User récupération liée à une demande utilisateur pris en compte selon la documentation Anthropic
Google Googlebot crawl pour Google Search, dont ses fonctions IA pris en compte
Google Google-Extended contrôle de certains usages Gemini hors Google Search jeton de produit, distinct de Googlebot

Cette matrice décrit les fonctions publiées au 12 août 2026. Les opérateurs peuvent les modifier. La documentation officielle doit rester la source de vérité.

Google-Extended n’est pas Googlebot

Google précise que Googlebot contrôle l’accès pour Search, y compris AI Overviews et AI Mode. Google-Extended est un jeton de produit permettant de gérer certains usages de contenu pour Gemini et le grounding hors Search. Le bloquer ne retire pas automatiquement une page de Google Search.

Cette distinction corrige une erreur fréquente: présenter Google-Extended comme une condition d’éligibilité aux AI Overviews.

Cloudflare sépare Search, Agent et Training

Cloudflare classe désormais les comportements IA en trois finalités: Search pour collecter ou indexer du contenu utilisé dans des réponses ultérieures, Agent pour agir en temps réel au nom d’une personne, et Training pour entraîner ou ajuster un modèle. Cette couche CDN complète la lecture des noms de robots, elle ne la remplace pas.

Cloudflare annonce de nouveaux réglages par défaut pour les domaines ajoutés à partir du 15 septembre 2026: Search restera autorisé, tandis que Training et Agent seront bloqués sur les pages comportant des publicités. Les crawlers à finalité mixte Search et Training seront également concernés par les configurations de blocage de l’entraînement. La date d’entrée en vigueur étant postérieure à la publication prévue de cet article, vérifiez le tableau de bord et la documentation après le 15 septembre avant de conclure sur une configuration réelle.

Conséquence pratique: un fichier robots.txt permissif ne suffit pas si une politique Cloudflare bloque la même requête. Documentez les deux couches et testez le code HTTP effectivement servi.

Configuration orientée visibilité

Un site qui veut être découvert par les fonctions de recherche peut autoriser Googlebot, OAI-SearchBot, PerplexityBot et Claude-SearchBot, sous réserve de sa politique juridique et commerciale. Il peut décider séparément pour GPTBot ou Google-Extended.

Exemple minimal à adapter:

User-agent: OAI-SearchBot
Allow: /

User-agent: PerplexityBot
Allow: /

User-agent: Claude-SearchBot
Allow: /

Une directive Allow ne contourne pas un blocage WAF, une authentification, un noindex ou une erreur serveur.

Contrôles après modification

  1. Servez /robots.txt en 200 et en texte brut.
  2. Vérifiez les groupes et jokers avec un parseur.
  3. Testez les pages sans cookie ni session.
  4. Contrôlez les règles de sécurité et les plages publiées.
  5. Surveillez les codes HTTP par agent.
  6. Publiez une note datée pour chaque changement important de politique.

Ce que robots.txt ne garantit pas

Le protocole donne des directives aux robots coopératifs. Il ne constitue pas une protection d’accès. Pour protéger un contenu confidentiel, utilisez une authentification et des contrôles serveur. Autoriser un agent ne garantit ni visite, ni indexation, ni citation.

Sources