La liste complète des User-Agents IA à surveiller (Mise à jour 2026)
Ce que l'IA retient de cet article :
- 1Les bots majeurs : OpenAI, Anthropic, Google, Meta, Apple.
- 2Les bots 'Common Crawl' et d'entraînement à surveiller.
- 3Comment les identifier et les analyser dans vos logs serveurs.
- 4Stratégie de configuration robots.txt par catégorie de bot.
Ne laissez pas des inconnus scraper votre site sans votre accord explicite. En 2026, plus de 50 User-Agents IA différents parcourent activement le web, et la plupart des webmasters n'en connaissent que 3 ou 4. Voici la liste complète et tenue à jour des identifiants des robots d'intelligence artificielle, classés par catégorie et par niveau de risque.
| Facteur | SEO Classique | GEO (IA) | Niveau |
|---|---|---|---|
| GPTBot (OpenAI) | Non applicable | Entraînement modèles | Important |
| ChatGPT-User | Non applicable | Navigation temps réel | Essentiel |
| Google-Extended | Non applicable | Gemini / Bard | Essentiel |
| ClaudeBot | Non applicable | Anthropic Claude | Important |
| CCBot (Common Crawl) | Données publiques | Base pour LLM tiers | Optionnel |
Les 'Big Three' : GPTBot, ClaudeBot et Google-Extended
Ce sont les trois crawlers IA les plus actifs et les plus importants pour votre visibilité. GPTBot est le crawler d'OpenAI utilisé pour entraîner les modèles GPT et alimenter les réponses de ChatGPT. Il respecte le robots.txt et son crawl budget est limité : il priorise les pages avec du contenu structuré et des données JSON-LD. L'autoriser signifie potentiellement être cité dans les réponses de 200 millions d'utilisateurs actifs mensuels de ChatGPT.
ClaudeBot est le crawler d'Anthropic pour le modèle Claude. Il est généralement plus respectueux des ressources serveur que GPTBot mais crawle moins fréquemment. Claude-SearchBot est une variante plus récente dédiée aux recherches en temps réel. Google-Extended alimente les capacités IA de Gemini et Bard. Le bloquer n'affecte pas votre indexation Google classique mais vous rend invisible dans les réponses génératives de Google.
Ces trois bots respectent tous le protocole robots.txt, ce qui signifie que vous pouvez contrôler précisément quelles sections de votre site ils peuvent crawler. La stratégie recommandée est de les autoriser sur vos pages de contenu public tout en protégeant les sections sensibles (espace client, administration, données confidentielles) avec des directives Disallow spécifiques.
Les bots de navigation en temps réel
ChatGPT-User est un User-Agent distinct de GPTBot. Il est utilisé lorsqu'un utilisateur de ChatGPT demande explicitement à l'IA de naviguer sur un site web pour obtenir des informations en temps réel. Bloquer ChatGPT-User est une erreur stratégique majeure : vous vous privez de trafic qualifié et de citations directes avec lien cliquable, sans aucun bénéfice en contrepartie.
PerplexityBot crawle en temps réel pour construire ses réponses sourcées. Chaque citation Perplexity inclut un lien direct vers votre site. OAI-SearchBot est le bot de recherche web d'OpenAI, distinct de GPTBot. Ces bots de navigation représentent votre meilleure opportunité de visibilité IA car ils citent directement vos pages avec des liens cliquables.
Détectez les bots IA sur votre site
Analysez quels crawlers IA visitent réellement votre site et optimisez votre configuration
Les crawlers de données brutes à surveiller
Attention à CCBot (Common Crawl) et Bytespider (ByteDance/TikTok). Ces crawlers sont souvent plus agressifs et alimentent des bases de données utilisées par de nombreuses IA tierces. CCBot crawle massivement le web pour constituer le dataset Common Crawl, utilisé comme base d'entraînement par de nombreux LLM open-source. Bytespider alimente les modèles IA de ByteDance (Doubao, TikTok Search).
D'autres crawlers méritent votre attention : Amazonbot (Amazon Alexa et services IA), FacebookExternalHit et Meta-ExternalAgent (Meta AI et Llama), Applebot-Extended (Apple Intelligence et Siri), Timesbot (utilisé par certains éditeurs de presse pour l'entraînement IA). Chacun a ses propres règles et son propre comportement de crawl.
Bloquer les crawlers d'entraînement comme CCBot ou Bytespider peut réduire significativement votre charge serveur sans affecter votre visibilité dans les réponses IA en temps réel. C'est une optimisation recommandée pour les sites à trafic élevé qui subissent une charge de crawl excessive.
Comment analyser les bots IA dans vos logs serveur
Accédez à vos logs serveur (access.log sur Apache/Nginx) et filtrez par User-Agent pour identifier quels bots IA visitent réellement votre site. La commande grep -i "gptbot\|claudebot\|perplexitybot\|bytespider\|ccbot" access.log | awk '{print $1, $14}' vous donne un premier aperçu des bots présents et de leur fréquence de visite.
Identifiez la fréquence de crawl (quotidienne, hebdomadaire, mensuelle), les pages les plus visitées par chaque bot, les codes HTTP reçus (200 = succès, 403 = bloqué, 503 = erreur serveur) et le volume de requêtes par bot. Ces données vous permettent d'ajuster votre robots.txt et votre infrastructure de manière informée, en vous basant sur des faits réels plutôt que sur des suppositions.
Si vous utilisez un CDN comme Cloudflare, vous pouvez aussi filtrer les bots IA directement dans le dashboard Firewall avec des règles basées sur le User-Agent. Cela vous donne une visibilité en temps réel sur le trafic bot IA sans avoir à analyser manuellement les fichiers log. Crawlers.fr automatise cette analyse et vous envoie des alertes quand de nouveaux bots IA sont détectés sur votre site.
La stratégie optimale consiste à classifier les bots IA en trois catégories distinctes dans votre robots.txt. Premièrement, les bots de navigation temps réel à autoriser systématiquement car ils génèrent des citations avec lien direct. Deuxièmement, les bots d'entraînement à évaluer au cas par cas selon votre stratégie de propriété intellectuelle. Troisièmement, les bots de scraping agressifs à bloquer car ils consomment des ressources serveur sans apporter de visibilité mesurable. Cette approche par tiers vous donne un contrôle granulaire tout en maximisant votre surface de visibilité dans l'écosystème IA.
"En 2026, plus de 50 User-Agents IA différents parcourent activement le web. Seuls 10% des sites web ont une politique robots.txt adaptée à cette nouvelle réalité. Les 90% restants sont soit totalement ouverts, soit totalement fermés — deux extrêmes coûteux."
Sources & Références
Prêt à optimiser votre visibilité IA ?
Découvrez si votre site est bien référencé par ChatGPT, Gemini et Perplexity.
Lancer mon audit expertArticles connexes
Définitions du Lexique SEO/GEO
À propos de l'auteur

Adrien de Volontat
Adrien de Volontat est fondateur de Crawlers.fr, plateforme française d'audit SEO & GEO. Il conçoit les méthodologies d'audit et les algorithmes qui permettent aux sites d'améliorer leur visibilité sur Google et les moteurs génératifs (ChatGPT, Perplexity, Claude, Gemini).