1. Découverte des URL
Le crawler lit d'abord sitemap.xml (et les sitemaps index imbriqués), puis complète en parcours BFS depuis la page d'accueil. Sur un site sans sitemap, la découverte reste complète jusqu'à 10 000 URL.
Crawlers.fr est un site crawler hébergé : vous entrez un domaine, il parcourt les URL comme le ferait GoogleBot, puis restitue pour chaque page les erreurs techniques, la place dans l’architecture et le niveau de citabilité par les moteurs IA. Aucune installation, aucun plugin, résultats exploitables en quelques minutes.
Un crawl Crawlers.fr couvre jusqu’à 10 000 URL par site, combine découverte sitemap-first et parcours en largeur, et produit trois couches d’analyse : technique, architecture et GEO.
Le crawler lit d'abord sitemap.xml (et les sitemaps index imbriqués), puis complète en parcours BFS depuis la page d'accueil. Sur un site sans sitemap, la découverte reste complète jusqu'à 10 000 URL.
Chaque URL est récupérée avec un rendu JavaScript quand c'est nécessaire. C'est ce qui permet de détecter la « coquille JS » : un site dont le HTML servi aux robots est vide alors que la page s'affiche normalement dans un navigateur.
Statut HTTP, chaînes de redirection, canonical, hreflang, balises title et meta description (longueur et unicité), structure Hn, images sans alt, poids de page, liens internes et externes, directives robots.
Profondeur de clic, pages orphelines, maillage entrant et sortant, détection d'intention (Know / Do / Buy / Navigate) et repérage des pages qui se cannibalisent entre elles.
Chaque constat est classé par impact et par effort, avec la liste exacte des URL concernées. Export CSV et rapport PDF, en marque blanche sur les offres agence.
404, 410, 5xx, chaînes et boucles de redirection, redirections internes évitables.
robots.txt, meta robots, X-Robots-Tag, canonical incohérente, noindex accidentel.
Liens internes et sortants vérifiés avec la règle des deux constats consécutifs, pour éliminer les faux positifs.
Pages trop courtes, quasi-doublons (SimHash), titres et descriptions dupliqués, année périmée.
Temps de réponse serveur, poids des pages, images non optimisées, scripts bloquants.
Passages citables, JSON-LD, blocs Q&A : les signaux qui déclenchent une citation dans ChatGPT ou Perplexity.
WordPress génère mécaniquement des URL à faible valeur : archives d’auteur, pagination profonde, doublons entre étiquettes et catégories, pièces jointes indexables. Le crawl les isole en un passage et indique celles à passer en noindex, celles à fusionner et celles à supprimer. Pour les sites connectés, les correctifs de balises et de maillage peuvent être poussés directement dans le CMS depuis l’injection de code.
Le même mécanisme s’applique aux autres CMS : le crawl lit le HTML servi, pas la base de données, il ne dépend donc d’aucune extension.
Entrez le domaine dans l'outil de crawl, choisissez la profondeur et lancez l'analyse. Crawlers.fr découvre les URL via le sitemap puis par parcours des liens, jusqu'à 10 000 pages, et renvoie un rapport technique par URL avec plan d'action priorisé.
Oui, sans plugin. Le crawl fonctionne sur le HTML servi, donc sur WordPress comme sur Webflow, Shopify, Wix ou un site sur mesure. Pour WordPress, le rapport ajoute les contrôles propres au CMS : pages d'archives indexables, pagination, catégories vides, doublons tag/catégorie.
Un crawler classique s'arrête au constat technique. Crawlers.fr ajoute la couche architecture (profondeur, orphelines, cannibalisation) et la couche GEO (citabilité par les moteurs IA), puis produit un plan d'action priorisé plutôt qu'un tableau brut. Le crawl est hébergé, donc rien à installer.
L'analyse d'une page est gratuite et sans inscription. Le crawl multi-pages est inclus dans les offres avec compte ; les volumes élevés (jusqu'à 10 000 URL) relèvent des offres Premium et agence.
Un crawl complet toutes les deux semaines et un crawl ciblé par répertoire tous les cinq jours suffisent pour la plupart des sites. Crawlers.fr planifie ces passages automatiquement pour les sites suivis.
Intention couverte : crawl website, crawl wordpress, site crawler, outil de crawl
Analyse technique, architecture et visibilité IA dans un seul rapport.