Comparaison historique de pages

Les contrôles sont exécutés depuis notre serveur ; nous récupérons l’URL saisie et ne conservons pas les résultats. The exact URL is sent in a POST body to this site, then used for bounded Common Crawl index/WARC lookup and a safe current-page fetch. Results may be cached; raw archived HTML is not returned. Des compteurs anonymes de résultats par exécution peuvent servir à la recherche agrégée ; les URL, domaines, adresses IP et identifiants ne sont jamais inclus, et aucune statistique issue de moins de 100 exécutions n’est publiée.

Commentaires
Signaler un bug

Un élément ne fonctionne pas dans Comparaison historique de pages ? Décrivez ce qui s’est passé : le signalement est envoyé directement dans une file de tri privée, pas dans une liste publique.

Données envoyées
 Les saisies de l’outil, fichiers importés, sources collées, résultats complets, paramètres de requête et fragments d’URL ne sont pas joints automatiquement. Vous pouvez modifier ou supprimer le passage sélectionné ci-dessus. Les métadonnées du navigateur et de protection contre les abus sont traitées pour prévenir le spam. 

À propos de cet outil

Comparez une capture Common Crawl bornée à la page actuelle pour examiner les métadonnées, les canonical, les directives robots, les types de données structurées et les changements de texte extrait.

Fonctionnalités

  • Comparaison des signaux title, H1, description et canonical.
  • Constats séparés pour les statuts HTTP et la couverture d’archive.
  • Extraits de texte bornés avec score de similarité.
  • Traitement local des faits dérivés sans rejouer les scripts archivés.

Fonctionnement

Le service sélectionne un index Common Crawl pertinent, lit une plage WARC bornée et récupère la page publique actuelle via un endpoint protégé. Il extrait des faits HTML comparables et des extraits de texte limités, sans exécuter les sous-ressources archivées.

Limites

  • Common Crawl peut manquer, tronquer ou revisiter des captures sans payload.
  • Une différence est une preuve à examiner, pas automatiquement un défaut SEO.
  • Les droits d’utilisation du contenu archivé restent à vérifier auprès de la source.

Questions fréquentes

Que confronter l’outil ?

Il confronter la archive Common Crawl sélectionnée d’une URL exacte à la page publique actuelle : title, H1, meta description, canonical, consignes robots, nombre de mots, catégories de données structurées, similarité textuelle bornée et extraits ajoutés ou supprimés plafonnés. Les statuts HTTP de la archive et de la page actuelle sont affichés séparément comme constats des sources, et non comme un historique de statut.

Une archive manquante signifie-t-elle que la page n’a jamais existé ?

Non. Common Crawl échantillonne le Web et ne archive pas chaque URL à chaque exploration. Les enregistrements manquants, incomplets, limités à une revisite ou tronqués sont signalés comme des limites de couverture, et non transformés en réussite ou échec.

Puis-je afficher ou télécharger la page archivée complète ?

Non. Le prestataire récupère une seule plage d’octets WARC exacte et renvoie uniquement des faits dérivés et des extraits de texte bornés. Il ne fournit pas de visionneuse d’archive pleine page, n’exécute pas le JavaScript archivé et ne charge pas les sous-ressources archivées.

Puis-je utiliser le résultat commercialement ?

Cet outil présente des constats dérivées et n’accorde aucun droit sur les contenus tiers archivés. Consultez les conditions actuelles de Common Crawl et les droits du site d’origine avant de vous appuyer sur des contenus archivés dans un produit marchand.

Étape suivanteGénérateur de sitemaps XML — generate the corrected version. Des conseils sont disponibles en anglais.