De nouveaux indicateurs dans le crawler et un onglet d'évolution amélioré

Nous avons livré une série d'améliorations sur le crawler redirection.io : contrôles de qualité de contenu, diagnostics de redirection, plus de contrôle sur le déroulement d'un crawl, et une nouvelle façon de suivre l'évolution d'un site dans le temps.

Nouveaux contrôles de contenu et de SEO

Le rapport de crawl comporte plusieurs nouveaux signaux :

  1. Détection de contenu dupliqué : le crawler repère désormais les pages au contenu strictement identique ou quasi identique, via une empreinte simhash. Le contenu dupliqué est un problème SEO classique, jusqu'ici difficile à repérer sur un grand site.
  2. Section de rapport sur la distribution du nombre de motsDistribution du nombre de mots : une nouvelle section du rapport montre la répartition du nombre de mots sur l'ensemble des pages crawlées, utile pour repérer les pages trop pauvres en contenu.
  3. Alerte « redirection vers une page en erreur » dans le rapport de crawlBoucles de redirection et redirections vers une erreur : des métriques et des listes dédiées font ressortir les pages prises dans une boucle de redirection, ou qui redirigent vers une page en erreur. Deux problèmes SEO fréquents, jusqu'ici difficiles à isoler.
  4. Alerte « fichiers well-known manquants » dans le rapport de crawlSitemap et fichiers « well-known » : le rapport alerte maintenant si un sitemap dépasse la taille recommandée, ou si des URLs standard comme /.well-known/security.txt sont absentes.

Plus de contrôle sur un crawl

Vous disposez d'un contrôle plus fin sur le comportement du crawler :

  • Ignorer les directives robots : un crawl peut être configuré pour ignorer volontairement les règles du robots.txt, ainsi que les directives noindex et nofollow dans le HTML. Pratique pour crawler un site de préproduction ou mener un audit SEO complet.
  • En-têtes HTTP personnalisés : un crawl peut envoyer des en-têtes HTTP personnalisés, par exemple pour atteindre un environnement de staging protégé par authentification.
  • Délai entre les requêtes : vous pouvez définir un délai entre chaque requête, y compris sur les crawls programmés récurrents, pour ne pas surcharger un site.
  • Nouvelle tentative automatique en cas d'erreur HTTP : le crawler retente désormais une requête en erreur au lieu d'abandonner immédiatement, pour des rapports plus fiables sur des sites instables.

Avec ces ajouts, le crawler de redirection.io est plus configurable que jamais, et peut explorer de façon fiable même les sites protégés par un pare-feu applicatif (WAF).

Suivre l'évolution d'un site

L'ancien onglet « Tendances » a été remplacé par un onglet Évolution plus riche, qui montre l'évolution du score et de l'état des pages d'un projet crawl après crawl, avec un graphique de performance de crawl. Le score de crawl s'affiche également directement dans la liste des crawls, sans avoir à ouvrir chacun d'eux.

L'onglet Évolution du crawler, suivant le score d'un projet crawl après crawl

L'onglet Évolution compare au moins deux crawls d'un même projet. Programmez des crawls récurrents pour constituer automatiquement un historique et voir les tendances se dessiner dans le temps.

Pour les essayer, ouvrez le crawler depuis votre projet et lancez ou programmez un crawl. Les options de configuration sont décrites dans la documentation du crawler.