Page produit

    Outil de crawl de site web : analyser jusqu’à 10 000 pages

    Crawlers.fr est un site crawler hébergé : vous entrez un domaine, il parcourt les URL comme le ferait GoogleBot, puis restitue pour chaque page les erreurs techniques, la place dans l’architecture et le niveau de citabilité par les moteurs IA. Aucune installation, aucun plugin, résultats exploitables en quelques minutes.

    Un crawl Crawlers.fr couvre jusqu’à 10 000 URL par site, combine découverte sitemap-first et parcours en largeur, et produit trois couches d’analyse : technique, architecture et GEO.

    Comment fonctionne le crawl, étape par étape

    1. Découverte des URL

    Le crawler lit d'abord sitemap.xml (et les sitemaps index imbriqués), puis complète en parcours BFS depuis la page d'accueil. Sur un site sans sitemap, la découverte reste complète jusqu'à 10 000 URL.

    2. Récupération du HTML réel

    Chaque URL est récupérée avec un rendu JavaScript quand c'est nécessaire. C'est ce qui permet de détecter la « coquille JS » : un site dont le HTML servi aux robots est vide alors que la page s'affiche normalement dans un navigateur.

    3. Analyse technique par page

    Statut HTTP, chaînes de redirection, canonical, hreflang, balises title et meta description (longueur et unicité), structure Hn, images sans alt, poids de page, liens internes et externes, directives robots.

    4. Analyse d’architecture

    Profondeur de clic, pages orphelines, maillage entrant et sortant, détection d'intention (Know / Do / Buy / Navigate) et repérage des pages qui se cannibalisent entre elles.

    5. Plan d’action priorisé

    Chaque constat est classé par impact et par effort, avec la liste exacte des URL concernées. Export CSV et rapport PDF, en marque blanche sur les offres agence.

    Ce que le crawl contrôle sur chaque URL

    • Codes HTTP et redirections

      404, 410, 5xx, chaînes et boucles de redirection, redirections internes évitables.

    • Indexabilité

      robots.txt, meta robots, X-Robots-Tag, canonical incohérente, noindex accidentel.

    • Liens cassés

      Liens internes et sortants vérifiés avec la règle des deux constats consécutifs, pour éliminer les faux positifs.

    • Contenu

      Pages trop courtes, quasi-doublons (SimHash), titres et descriptions dupliqués, année périmée.

    • Performance

      Temps de réponse serveur, poids des pages, images non optimisées, scripts bloquants.

    • Visibilité IA

      Passages citables, JSON-LD, blocs Q&A : les signaux qui déclenchent une citation dans ChatGPT ou Perplexity.

    Crawler un site WordPress

    WordPress génère mécaniquement des URL à faible valeur : archives d’auteur, pagination profonde, doublons entre étiquettes et catégories, pièces jointes indexables. Le crawl les isole en un passage et indique celles à passer en noindex, celles à fusionner et celles à supprimer. Pour les sites connectés, les correctifs de balises et de maillage peuvent être poussés directement dans le CMS depuis l’injection de code.

    Le même mécanisme s’applique aux autres CMS : le crawl lit le HTML servi, pas la base de données, il ne dépend donc d’aucune extension.

    Questions fréquentes

    Comment crawler un site web complet ?+

    Entrez le domaine dans l'outil de crawl, choisissez la profondeur et lancez l'analyse. Crawlers.fr découvre les URL via le sitemap puis par parcours des liens, jusqu'à 10 000 pages, et renvoie un rapport technique par URL avec plan d'action priorisé.

    Peut-on crawler un site WordPress ?+

    Oui, sans plugin. Le crawl fonctionne sur le HTML servi, donc sur WordPress comme sur Webflow, Shopify, Wix ou un site sur mesure. Pour WordPress, le rapport ajoute les contrôles propres au CMS : pages d'archives indexables, pagination, catégories vides, doublons tag/catégorie.

    Quelle est la différence avec un site crawler classique type Screaming Frog ?+

    Un crawler classique s'arrête au constat technique. Crawlers.fr ajoute la couche architecture (profondeur, orphelines, cannibalisation) et la couche GEO (citabilité par les moteurs IA), puis produit un plan d'action priorisé plutôt qu'un tableau brut. Le crawl est hébergé, donc rien à installer.

    Le crawl est-il gratuit ?+

    L'analyse d'une page est gratuite et sans inscription. Le crawl multi-pages est inclus dans les offres avec compte ; les volumes élevés (jusqu'à 10 000 URL) relèvent des offres Premium et agence.

    À quelle fréquence recrawler un site ?+

    Un crawl complet toutes les deux semaines et un crawl ciblé par répertoire tous les cinq jours suffisent pour la plupart des sites. Crawlers.fr planifie ces passages automatiquement pour les sites suivis.

    Dans ce silo

    Intention couverte : crawl website, crawl wordpress, site crawler, outil de crawl

    Crawlez votre site maintenant

    Analyse technique, architecture et visibilité IA dans un seul rapport.