Exploration Web
Comment les moteurs découvrent et téléchargent le Web avec Googlebot et Bingbot, puis rendent, indexent et classent les pages.
Langues
1 indice probant sur cette page
- Données sources liéesplages IP publiées
L’exploration est la première étape de la recherche : les robots découvrent et téléchargent les pages avant leur rendu, leur indexation et leur éventuel classement. Elle est nécessaire sans être un facteur de classement et se distingue de l’indexation. Liens, sitemaps et protocoles push alimentent la découverte ; l’ordonnanceur adapte les passages à la santé du serveur. Les journaux constituent la preuve directe et la plupart des sites n’ont pas à gérer leur budget d’exploration.
En bref — L’exploration permet aux moteurs de recherche de trouver et télécharger vos pages. Googlebot ou Bingbot suit les liens, lit les sitemaps, découvre les URL puis les récupère. Une page doit être explorée avant d’apparaître dans les résultats, mais des passages plus fréquents n’améliorent pas son classement.
Qu’est-ce que l’exploration ?
Les moteurs ne parcourent pas le Web comme un humain. Ils envoient des programmes automatisés, appelés robots d’exploration, bots ou spiders, qui visitent les pages, téléchargent leur contenu et suivent leurs liens. Celui de Google est Googlebot ; celui de Bing, Bingbot.
Imaginez trois étapes successives :
- Explorer — le robot découvre une URL et télécharge la page.
- Indexer — le moteur traite la page et la range dans sa base de contenus susceptibles d’apparaître.
- Servir (classer) — lors d’une recherche, il extrait de l’index les meilleurs résultats et les ordonne.
L’exploration est la première étape. Sans elle, la page ne peut être indexée ni classée. Elle constitue une porte d’entrée, pas un score.
Comment les robots trouvent-ils vos pages ?
Principalement de deux façons :
- En suivant les liens. Le robot ajoute à sa liste les URL trouvées sur chaque page. Un bon maillage interne permet de découvrir les nouveautés.
- Grâce aux sitemaps. Un sitemap XML fournit directement aux moteurs la liste de vos URL.
Des mécanismes « push » permettent aussi de signaler activement un changement, mais liens et sitemaps assurent l’essentiel de la découverte.
Aider les moteurs à explorer votre site
- Reliez vos pages importantes depuis d’autres pages, notamment l’accueil et la navigation principale.
- Envoyez un sitemap XML dans Google Search Console et Bing Webmaster Tools.
- Vérifiez que
robots.txtne bloque pas les pages à découvrir. - Gardez un serveur rapide et stable : lenteurs et erreurs font reculer les robots.
L’erreur la plus répandue
Exploration ne signifie pas classement. Une fréquence supérieure n’améliore pas les positions. Et bloquer une page dans robots.txt ne la retire pas de Google : cela empêche seulement sa lecture. Evidence for this claim robots.txt controls crawler access and is not a reliable way to keep a URL out of Google. Scope: Google Search behavior for URLs blocked by robots.txt; blocked URLs may still be indexed when discovered elsewhere. Confidence: high · Verified: Google Search Central: Introduction to robots.txt Pour la retirer, autorisez l’exploration et ajoutez noindex.
Pour le fonctionnement de l’ordonnanceur, les limites d’octets et les distinctions entre exploration, indexation et classement, consultez l’onglet Advanced.
En bref — L’exploration est la première des trois étapes : explorer → indexer → servir. Les robots découvrent les URL par liens et sitemaps, ou par signalement avec IndexNow et l’API d’indexation, puis les récupèrent selon un calendrier algorithmique adapté à la santé du serveur. Le rendu JavaScript est distinct. L’exploration est nécessaire sans être un signal de classement ; une page bloquée par robots peut encore être indexée. La plupart des sites n’ont pas à gérer leur budget d’exploration, et les journaux constituent la preuve de ce qui s’est réellement passé.
L’exploration est la première des trois étapes
Three stages run left to right. Crawl: a bot discovers a URL and downloads the page. Index: the engine processes the page and stores eligible information. Serve or rank: the best indexed matches are ordered for a query. The Crawl stage is highlighted, and a note says not every page advances through every stage.
© Patrick Stox LLC · CC BY 4.0 ·
Google formule clairement le pipeline : “Google Search works in three stages, and not all pages make it through each stage” (traduction) « la recherche Google fonctionne en trois étapes et toutes les pages ne franchissent pas chacune d’elles » : exploration, indexation et diffusion. Evidence for this claim Google describes Search as three stages: crawling, indexing, and serving results. Scope: Google Search's documented processing model; it does not guarantee that a page reaches every stage. Confidence: high · Verified: Google Search Central: In-depth guide to how Google Search works Une page peut être explorée sans être indexée, ou indexée sans être proposée pour une requête. Garder ces étapes distinctes est fondamental.
Qui effectue l’exploration ?
« Googlebot » ne désigne pas un programme unique. Dans ma présentation Fonctionnement de la recherche, je décris plus de 1 000 systèmes et une famille de robots spécialisés : ordinateur, mobile, images, actualités, vidéos et annonces. Ils puisent dans le même budget d’exploration ; une explosion d’URL d’images ou de paramètres peut donc priver le contenu utile de capacité.
Les moteurs ne sont plus seuls. Dans mon analyse Cloudflare Radar, À la rencontre des nouveaux robots Web, ceux des moteurs restent premiers, mais les robots d’IA occupent nettement la deuxième place et pourraient les dépasser dans les prochaines années. Les journaux hébergent désormais une population différente.
Comment les robots découvrent-ils les URL ?
Two discovery routes feed one crawl queue. Pull discovery includes following links and sitemaps. Push discovery includes IndexNow for Bing, Yandex, and other participating engines but not Google for general pages; the Google Indexing API for JobPosting and BroadcastEvent pages; and change notifications through sitemap lastmod, RSS, and WebSub.
© Patrick Stox LLC · CC BY 4.0 ·
La découverte fonctionne par pull et par push :
- Pull — liens. Google indique : “Other pages are discovered when Google extracts a link from a known page to a new page.” (traduction) « d’autres pages sont découvertes lorsque Google extrait d’une page connue un lien vers une nouvelle page ». Voilà pourquoi les pages orphelines restent difficiles à trouver.
- Pull — sitemaps. “Still other pages are discovered when you submit a list of pages (a sitemap) for Google to crawl.” (traduction) « d’autres pages encore sont découvertes lorsque vous envoyez une liste de pages, un sitemap, à explorer ».
- Push — notifications. IndexNow sert Bing, Yandex et d’autres moteurs, mais pas les pages générales de Google. L’API d’indexation Google est officiellement réservée aux pages
JobPostingetBroadcastEvent.lastmod, RSS et WebSub complètent ces signaux.
Google regroupe ces mécanismes sous le nom “URL discovery.” (traduction) « découverte d’URL ».
Comment les robots récupèrent-ils les pages ?
- Le calendrier est algorithmique. “Googlebot uses an algorithmic process to determine which sites to crawl, how often, and how many pages to fetch from each site.” (traduction) « Googlebot détermine algorithmiquement les sites à explorer, la fréquence et le nombre de pages ». Vous l’influencez sans le fixer.
- L’exploration est polie. Les robots ralentissent pour ne pas surcharger le site : “they try not to crawl the site too fast to avoid overloading it… HTTP 500 errors mean ‘slow down.’” (traduction) « ils évitent d’explorer trop vite ; les erreurs HTTP 500 signifient de ralentir ». Les réponses
503ou429font temporairement reculer Googlebot. - Une limite d’octets existe. Depuis la mise à jour Google de mars 2026, Googlebot récupère environ 2 Mo par URL, et jusqu’à 64 Mo pour les PDF. Au-delà, la récupération est tronquée : seule la partie téléchargée part à l’indexation.
- Le cache réduit le coût. Les requêtes conditionnelles évitent de retélécharger les ressources inchangées. Google ne publie aucune durée fixe pour le cache des ressources de rendu.
Le rendu n’est pas l’exploration
Cette distinction provoque de nombreuses erreurs. “During the crawl, Google renders the page and runs any JavaScript it finds using a recent version of Chrome.” (traduction) « pendant l’exploration, Google rend la page et exécute le JavaScript trouvé avec une version récente de Chrome ». Le service de rendu Web est sans état : stockage et cookies sont effacés, les demandes d’autorisation refusées et les service workers rejetés. Un contenu accessible seulement après un clic ou une navigation JavaScript sans vrai lien <a href> risque de ne pas être découvert ou rendu. Voir SEO JavaScript.
Exploration, indexation et classement
Les distinctions les plus importantes :
- Exploration ≠ classement. Elle est nécessaire pour apparaître, mais n’est pas un signal de classement. Le budget relève de l’efficacité.
- Exploration ≠ indexation. Une page bloquée dans
robots.txtpeut encore être indexée grâce aux liens ; Google ne peut toutefois lire son contenu ni sonnoindex. Comme je l’explique dans Indexée malgré un blocage robots.txt, “crawling and indexing are two different things.” (traduction) « exploration et indexation sont deux choses différentes ». Pour retirer une page, autorisez l’exploration et ajouteznoindex.
Je l’ai testé dans L’histoire de deux pages bien classées bloquées par robots.txt. Après blocage, “We lost a position here or there and all of the featured snippets for the pages… I expected a lot more impact, but the world didn’t end.” (traduction) « nous avons perdu une position ici ou là et tous les extraits optimisés ; je m’attendais à bien pire, mais le monde ne s’est pas arrêté ». Ma conclusion : “Don’t block pages you want indexed. It hurts. Not as bad as you might think it does — but it still hurts.” (traduction) « ne bloquez pas les pages à indexer ; cela nuit, moins qu’on pourrait le penser, mais cela nuit ».
Contrôler l’exploration
robots.txtcontrôle l’exploration, pas l’indexation : il précise quelles URL les robots peuvent consulter. Evidence for this claim robots.txt controls crawler access and is not a reliable way to keep a URL out of Google. Scope: Google Search behavior for URLs blocked by robots.txt; blocked URLs may still be indexed when discovered elsewhere. Confidence: high · Verified: Google Search Central: Introduction to robots.txt Utilisez-le pour les espaces faibles, pas pour désindexer.- Architecture et maillage interne déterminent la profondeur et la découverte.
- Contrôles de cadence. Google a retiré le curseur manuel de Search Console début 2024 et s’appuie sur les réponses serveur ; Bing conserve une grille Crawl Control.
Efficacité et budget d’exploration
Les deux moteurs visent l’efficacité. Gary Illyes décrit Google par limite de cadence + demande d’exploration, selon popularité et ancienneté. Fabrice Canel donne à Bing cet objectif : “crawl efficiency north star … to crawl a URL only when the content has been added … updated.” (traduction) « objectif d’efficacité : explorer une URL seulement lorsque son contenu a été ajouté ou mis à jour ».
Bonne nouvelle : la plupart des sites n’ont pas à s’en préoccuper. Google dit que si le site ne compte pas beaucoup de pages qui changent vite, ou si les pages sont explorées le jour de leur publication, “you don’t need to read this guide.” (traduction) « vous n’avez pas besoin de lire ce guide ». Le sujet devient pertinent autour d’un million de pages modifiées chaque semaine ou de dix mille chaque jour. Evidence for this claim Sites without many rapidly changing pages, or whose new pages are crawled the day they are published, generally do not need crawl-budget management. Scope: large websites Confidence: high · Verified: Optimize your crawl budget
Quand l’exploration échoue : identifier l’étape
Avant de corriger, localisez l’étape réellement défaillante ; symptômes et remèdes diffèrent :
-
Pas découverte ? Aucun lien et aucune présence au sitemap : corrigez maillage et couverture.
-
Découverte mais jamais récupérée ? Erreurs serveur, délais ou blocage
robots.txt: consultez statistiques GSC et journaux. -
Récupérée mais mal rendue ? Un clic ou une navigation uniquement JavaScript bloque le service de rendu : examinez le SEO JavaScript.
-
Récupérée et rendue mais non indexée ? Il s’agit d’une décision de l’index, pas d’un problème d’exploration.
-
L’analyse des journaux fait foi : elle montre les URL réellement demandées, leur fréquence et leurs codes, révèle le gaspillage et les pages jamais atteintes.
-
Les pièges à robots — calendriers, navigation à facettes, identifiants de session ou explosions de liens relatifs — consomment silencieusement le budget sur des URL inutiles.
Pour aller plus loin dans le cluster Exploration
Ce hub sert de carte. Chaque sujet possède son analyse :
Efficacité : volume et fréquence
- Budget d’exploration — capacité, demande, gaspillage et sites concernés.
- Cadence d’exploration — vitesse, retrait du curseur GSC et moyens de ralentir ou accélérer.
- Fréquence d’exploration — popularité, ancienneté et
lastmodprécis. - Profondeur d’exploration — profondeur de clic et proximité de l’accueil.
Identifier les robots
- Crawler — programme Web et boucle récupération → analyse → suivi.
- User-agent — chaîne et jeton robots.txt, faciles à usurper.
- Googlebot — variantes, rendu et vérification.
- Bingbot — différences et surfaces alimentées.
- Robots d’IA — entraînement, recherche IA et récupération déclenchée.
Diagnostiquer
- Analyse des journaux — vérifier les robots et leurs requêtes.
- Pièges à robots — motifs générant une infinité d’URL et correctifs.
Tous ces sujets sont accessibles dans la barre latérale.
Qualifier les liens sortants relève d’un contrôle connexe : nofollow fournit l’indication générale, tandis que rel=sponsored et rel=ugc couvrent liens payants et contenu généré par les utilisateurs. Voir le cluster balises méta on-page.
Être découvert constitue une étape connexe distincte. Liens internes, sitemaps XML, index, images ou vidéos, ainsi qu’IndexNow et l’API d’indexation Google, sont traités dans le hub Découverte. Pour la vue générale, consultez Fonctionnement de la recherche.
Résumé par l’IA
Version condensée de l’onglet Advanced :
- L’exploration ouvre la recherche : explorer → indexer → servir. Elle est nécessaire sans être un signal de classement, et se distingue du rendu.
- La découverte combine pull et push : liens et sitemaps ; IndexNow et API d’indexation.
- La récupération est algorithmique et polie : Google décide du volume et ralentit face aux
5xxet429. La limite avoisine 2 Mo par URL, ou 64 Mo pour un PDF, puis le contenu est tronqué. - Le rendu est séparé dans un Chrome sans état ; la durée du cache n’est pas publiée.
- Explorer ≠ indexer : une page bloquée peut être indexée ; utilisez
noindexavec exploration autorisée pour la retirer. - Budget = capacité + demande ; la plupart des sites n’ont pas à le gérer.
- Les journaux diagnostiquent et les pièges gaspillent la capacité ; les robots d’IA représentent une part croissante.
Documentation officielle
Documentation de première main des moteurs.
- Fonctionnement détaillé de la recherche — pipeline, découverte et ordonnanceur.
- Exploration et indexation — robots, sitemaps, canoniques et contrôles.
- Introduction à robots.txt — rôle et limites.
- Optimiser le budget — capacité, demande et sites concernés.
- Robots et outils de récupération Google — user-agents et plages IP.
- Inside Googlebot, mars 2026 — limites d’octets et architecture.
- Googlebot et les 15 Mo, 2022 — ancienne limite.
- Série Crawling December, 2024 — cache HTTP, facettes et CDN.
Bing / Microsoft
- Série bingbot : maximiser l’efficacité — définition et objectif.
- Bing Webmaster Tools — Crawl Control — vitesse et horaires.
- IndexNow / indexnow.org — protocole push de signalement.
Citations des sources
Déclarations publiques de Google et Bing. Chaque lien mène au passage cité.
Google — fonctionnement de l’exploration
- “Google Search works in three stages, and not all pages make it through each stage.” (traduction) « La recherche Google fonctionne en trois étapes et toutes les pages ne franchissent pas chacune d’elles. » — Documentation Google Search Central. Accéder à la citation
- “Other pages are discovered when Google extracts a link from a known page to a new page… Still other pages are discovered when you submit a list of pages (a sitemap) for Google to crawl. This process is called ‘URL discovery’.” (traduction) « D’autres pages sont découvertes par les liens ou l’envoi d’un sitemap ; ce processus s’appelle la découverte d’URL. » Accéder à la citation
- “Googlebot uses an algorithmic process to determine which sites to crawl, how often, and how many pages to fetch from each site.” (traduction) « Googlebot détermine algorithmiquement les sites, la fréquence et le nombre de pages. » Accéder à la citation
- “They try not to crawl the site too fast to avoid overloading it. This mechanism is based on the responses of the site (for example, HTTP 500 errors mean ‘slow down’).” (traduction) « Ils évitent d’explorer trop vite ; les erreurs HTTP 500 signifient de ralentir. » Accéder à la citation
- “During the crawl, Google renders the page and runs any JavaScript it finds using a recent version of Chrome.” (traduction) « Pendant l’exploration, Google rend la page et exécute le JavaScript trouvé avec une version récente de Chrome. » Accéder à la citation
Google — robots.txt et budget
- “A robots.txt file tells search engine crawlers which URLs the crawler can access on your site.” (traduction) « Un fichier robots.txt indique aux robots quelles URL ils peuvent consulter. » — Documentation Google Search Central. Accéder à la citation
- “Taking crawl capacity and crawl demand together, Google defines a site’s crawl budget as the set of URLs that Google can and wants to crawl.” (traduction) « En combinant capacité et demande, Google définit le budget comme l’ensemble des URL qu’il peut et veut explorer. » Accéder à la citation
- “If your site doesn’t have a large number of pages that change rapidly, or if your pages seem to be crawled the same day that they are published, you don’t need to read this guide.” (traduction) « Si votre site n’a pas beaucoup de pages changeant rapidement ou si elles sont explorées le jour de leur publication, vous n’avez pas besoin de lire ce guide. » Accéder à la citation
Gary Illyes, Google (d’après la reproduction littérale par Search Engine Land du billet Google de 2017)
- La limite de cadence est “the number of simultaneous parallel connections Googlebot may use to crawl the site, as well as the time it has to wait between the fetches.” (traduction) « le nombre de connexions parallèles simultanées utilisables par Googlebot et le délai entre les récupérations ». La demande dépend de la popularité et de l’ancienneté. Lire la couverture
Fabrice Canel, Microsoft Bing
- “Crawling is the process by which bingbot discovers new and updated documents or content to be added to Bing’s searchable index.” (traduction) « L’exploration permet à bingbot de découvrir les documents ou contenus nouveaux et mis à jour à ajouter à l’index Bing. » Accéder à la citation
- “Our crawl efficiency north star is to crawl a URL only when the content has been added (URL not crawled before), updated (fresh on-page context or useful outbound links).” (traduction) « Notre objectif est d’explorer une URL seulement quand son contenu a été ajouté ou mis à jour. » Accéder à la citation
Liste de contrôle de santé de l’exploration
Vérification rapide pour s’assurer que les moteurs trouvent et récupèrent l’essentiel :
- Les pages importantes reçoivent des liens explorables ; aucune orpheline.
-
robots.txtne bloque aucun contenu à indexer et exclut les espaces faibles. - Le sitemap XML est envoyé à Google et Bing, ne liste que des URL canoniques et indexables, avec un
lastmodexact. - Le serveur répond vite et sans
5xxni délais fréquents. -
robots.txtne sert pas à désindexer ; utiliseznoindex. - Aucun piège ne génère une infinité d’URL.
- Les statistiques GSC sont vérifiées pour les pics d’erreurs et les temps de réponse.
- Les journaux révèlent gaspillage et pages importantes non explorées.
- Le contenu JavaScript est accessible par de vrais liens
<a href>.
Modèles mentaux
1. Pipeline — explorer → rendre → indexer → servir. Chaque étape filtre des pages. En cas de contre-performance, identifiez l’étape en échec avant toute modification.
2. Trois distinctions.
- Exploration ≠ indexation : une page bloquée peut être indexée via des liens.
- Exploration ≠ classement : la cadence n’est pas un signal.
- Exploration ≠ rendu : JavaScript s’exécute dans une étape séparée et mise en cache.
3. Découverte = pull + push. Pull : liens et sitemaps. Push : IndexNow, API d’indexation et lastmod. Pour une page introuvable, déterminez le canal attendu et vérifiez les liens.
4. Budget = capacité + demande. La capacité dépend du serveur ; la demande, de la popularité et de l’ancienneté. Supprimer pièges, doublons et paramètres inutiles augmente davantage le budget utile que réclamer plus de passages.
5. Retirer une page. Pour la faire disparaître : exploration autorisée + noindex. Pour empêcher toute visite d’un espace sans enjeu d’indexation : interdiction dans robots.txt.
Contrôler l’exploration — aide-mémoire
Rôle réel de chaque contrôle
| Contrôle | Arrête l’exploration ? | Arrête l’indexation ? | Usage |
|---|---|---|---|
Interdiction robots.txt | Oui | Non | Écarter les robots des espaces faibles |
noindex méta ou en-tête | Non, la page doit être explorée | Oui | Retirer une page de l’index |
rel=canonical | Non | Consolide sans forcer | Désigner le doublon préféré |
nofollow | Décourage le suivi | Non | Ne pas cautionner ou suivre un lien |
rel="sponsored" / rel="ugc" | Indication | Non | Marquer publicité et contenu utilisateur |
5xx / 503 / 429 | Ralentit temporairement | Non | Signal temporaire de ralentissement |
Codes importants
200— récupération réussie.301/308— redirection permanente et consolidation.404/410— ressource disparue, retirée progressivement.429/500/503— ralentir et réessayer ; une persistance réduit l’exploration.
Repères
- Limite Googlebot : environ 2 Mo par URL, 64 Mo pour les PDF, puis troncature.
- Curseur manuel GSC : retiré en janvier 2024.
- Équivalent Bing : grille Crawl Control.
- IndexNow : Bing, Yandex et autres, pas Google ; API Google réservée aux pages JobPosting et BroadcastEvent.
Vérifier qu’un robot est bien Googlebot
De nombreux clients prétendent être Googlebot. Confirmez-les par DNS inverse puis direct ; les faux user-agents sont courants.
Ou effectuez manuellement le même contrôle :
macOS / Linux
# 1) Reverse DNS the IP from your logs — it should end in googlebot.com or google.com
host 66.249.66.1
# → 1.66.249.66.in-addr.arpa domain name pointer crawl-66-249-66-1.googlebot.com
# 2) Forward DNS that hostname back — it must resolve to the same IP
host crawl-66-249-66-1.googlebot.com
# → crawl-66-249-66-1.googlebot.com has address 66.249.66.1Windows
nslookup 66.249.66.1
nslookup crawl-66-249-66-1.googlebot.comSi la résolution inverse ne finit pas sur un domaine Google, ou si la résolution directe ne correspond pas à l’IP initiale, ce n’est pas Googlebot. Comparez aussi les plages IP publiées.
Base sûre pour robots.txt
User-agent: *
Disallow: /search # internal search result pages
Disallow: /*?*sort= # sort-order parameter spaces
Allow: /
Sitemap: https://example.com/sitemap.xmlRappel : Disallow bloque l’exploration, pas l’indexation. Ne l’utilisez pas pour retirer une page des résultats.
Outils de suivi et de gestion
- Google Search Console — statistiques d’exploration — requêtes dans le temps, codes, temps moyen, types de fichiers et variantes Googlebot.
- Bing Webmaster Tools — informations, Crawl Control et Site Scan.
- Analyse des journaux serveur — preuve directe, via Screaming Frog ou une plateforme de logs.
- Robots et audits de site — Ahrefs Site Audit et Screaming Frog simulent l’exploration et révèlent profondeur, chaînes, blocages et pièges.
- Ahrefs Webmaster Tools — exploration et audit gratuits des sites vérifiés.
- Inspection de l’URL — vérifie exploration, rendu et indexation d’une URL.
Ressources utiles
Mes articles connexes
- Guide du débutant en SEO technique — place de l’exploration.
- Deux pages bien classées bloquées par robots.txt — expérience directe.
- Indexée malgré robots.txt — pourquoi une page bloquée reste indexable.
- Robots.txt et SEO.
- Problèmes et pratiques SEO JavaScript — rendu.
- Nouveaux robots Web et progression de l’IA.
Mes conférences
- Fonctionnement de la recherche — exploration, rendu, indexation et classement. Avertissement : “This is my understanding of systems… not going to be 100% complete or accurate.” (traduction) « Il s’agit de ma compréhension des systèmes ; elle ne sera pas complète ni exacte à 100 %. »
Autres ressources
- r/TechSEO — communauté exploration/indexation.
- Série Crawling December de Google — ensemble officiel.
- Google explique le budget d’exploration — reproduction du billet de Gary Illyes.
- Budget Googlebot expliqué — capacité et demande.
- Limites d’octets et architecture Googlebot — mise à jour de mars 2026.
- Fonctionnement de Bingbot — pipeline Bing.
- Limite de taille Googlebot — troncature au-delà.
Podcasts
- Podcast Google Search Relations — épisode consacré à la manière dont Googlebot explore le Web. Gary Illyes et Martin Splitt abordent infrastructure unifiée, HTTP/1.1 et HTTP/2, requêtes conditionnelles et limites d’octets. Écouter
Vidéos
- Google Search Central sur YouTube — série consacrée au fonctionnement de la recherche et explications de Martin Splitt sur exploration, rendu et SEO JavaScript. Chaîne
Statistiques à citer
- Les robots d’IA se rapprochent de ceux des moteurs. Mon analyse Cloudflare Radar place encore les moteurs en tête, avec l’IA clairement deuxième et susceptible de les dépasser dans les prochaines années. Source
- Des dizaines de milliards de nouvelles URL normalisées sont découvertes chaque jour par Bing (Fabrice Canel, Microsoft Bing, 2022). Couverture
- Robots les plus bloqués sur environ 140 millions de sites — étude avec Xibeijia Guan sur les taux de blocage robots.txt. Source
- Limite d’environ 2 Mo par URL, ou 64 Mo pour les PDF, documentée par Google en mars 2026. Source
Testez vos connaissances sur l’exploration
Cinq questions rapides sur la découverte et la récupération des pages. Choisissez une réponse, puis vérifiez.
Journal des modifications
Mis à jour le 13 août 2026.
Résumé éditorial et détails enregistrés des changements.Détails des changements
-
Les notes détaillées des changements sont actuellement disponibles en anglais.
-
Les notes détaillées des changements sont actuellement disponibles en anglais.
Comparaison complète indisponible — aucun instantané antérieur n’a été archivé pour cette révision.
Mis à jour le 13 août 2026.
Résumé éditorial et détails enregistrés des changements.Détails des changements
-
Les notes détaillées des changements sont actuellement disponibles en anglais.
-
Les notes détaillées des changements sont actuellement disponibles en anglais.
Comparaison complète indisponible — aucun instantané antérieur n’a été archivé pour cette révision.
Mis à jour le 17 juil. 2026.
Résumé éditorial et détails enregistrés des changements.Détails des changements
-
Les notes détaillées des changements sont actuellement disponibles en anglais.
-
Les notes détaillées des changements sont actuellement disponibles en anglais.
-
Les notes détaillées des changements sont actuellement disponibles en anglais.
Comparaison complète indisponible — aucun instantané antérieur n’a été archivé pour cette révision.