GPTBot (OpenAI)
Crawler d'entraînement de GPT-4 et suivants. User-agent : GPTBot. Bloquable via robots.txt. Bloquer coupe la citation dans ChatGPT sur les requêtes de fond.
Un crawler IA est un robot d'indexation dédié aux modèles génératifs. Contrairement à GoogleBot qui alimente la SERP, un crawler IA alimente les corpus d'entraînement et les réponses en temps réel des LLM. Les principaux crawlers IA à surveiller en 2026 : GPTBot, ChatGPT-User, PerplexityBot, ClaudeBot, Google-Extended, Applebot-Extended.
Chaque LLM opère au moins un crawler. Certains sont dédiés à l'entraînement, d'autres à la recherche en temps réel. Les autoriser ou les bloquer est une décision stratégique.
Crawler d'entraînement de GPT-4 et suivants. User-agent : GPTBot. Bloquable via robots.txt. Bloquer coupe la citation dans ChatGPT sur les requêtes de fond.
Crawler temps réel utilisé quand ChatGPT navigue pour répondre. Bloquer = disparition immédiate des citations live.
Crawler de Perplexity, très actif. Génère parfois plus de trafic bot que GoogleBot sur les sites d'actualité.
Crawler d'Anthropic pour Claude. User-agent : ClaudeBot. Moins agressif que GPTBot mais en forte croissance.
Directive séparée de GoogleBot. Permet d'apparaître dans Google Search mais pas dans Gemini. Décision commerciale importante.
Contrôle l'accès aux fonctions IA d'Apple Intelligence. Émergent en 2026, à surveiller.
La règle Crawlers.fr : autoriser tous les crawlers IA sauf si vous êtes un média premium avec contenu payant. Bloquer, c'est disparaître des réponses IA — et donc du haut de l'entonnoir de découverte 2026.
Site vitrine, SaaS, e-commerce, agence, éditeur avec modèle publicitaire ou lead gen. Le trafic prescrit par les IA vaut plus que le coût d'un crawl.
Média paywall, base de données propriétaire monétisée, marketplace avec catalogue commercial sensible. Bloquer via robots.txt et éventuellement Cloudflare AI Labyrinth.
Crawlers.fr analyse vos logs serveur pour identifier chaque passage d'un crawler IA, sa fréquence, les pages visitées et la corrélation avec les citations effectives dans les LLM. Un bon site GEO reçoit plus de 15 % de trafic bot IA sur son volume total de bots.
Les crawlers majeurs (GPTBot, PerplexityBot, ClaudeBot, Google-Extended) respectent robots.txt. Les crawlers exotiques (ByteSpider, etc.) l'ignorent parfois.
Via l'analyse de logs. Crawlers.fr propose un outil de log analysis gratuit qui identifie les 46 crawlers IA majeurs.
Oui, via des règles robots.txt par répertoire, ou via des headers HTTP X-Robots-Tag conditionnels au user-agent.
Diagnostic SEO et GEO complet sur votre URL, avec plan d'action priorisé.