Exploration Web

Comment les moteurs découvrent et téléchargent le Web avec Googlebot et Bingbot, puis rendent, indexent et classent les pages.

Première publication : 22 juin 2026 · Dernière mise à jour : 13 août 2026 · Advanced
Langues
1 indice probant sur cette page

L’exploration est la première étape de la recherche : les robots découvrent et téléchargent les pages avant leur rendu, leur indexation et leur éventuel classement. Elle est nécessaire sans être un facteur de classement et se distingue de l’indexation. Liens, sitemaps et protocoles push alimentent la découverte ; l’ordonnanceur adapte les passages à la santé du serveur. Les journaux constituent la preuve directe et la plupart des sites n’ont pas à gérer leur budget d’exploration.

En bref — L’exploration est la première des trois étapes : explorer → indexer → servir. Les robots découvrent les URL par liens et sitemaps, ou par signalement avec IndexNow et l’API d’indexation, puis les récupèrent selon un calendrier algorithmique adapté à la santé du serveur. Le rendu JavaScript est distinct. L’exploration est nécessaire sans être un signal de classement ; une page bloquée par robots peut encore être indexée. La plupart des sites n’ont pas à gérer leur budget d’exploration, et les journaux constituent la preuve de ce qui s’est réellement passé.

L’exploration est la première des trois étapes

Crawling is stage one of three. A page must clear each stage before it can rank. Source : /technical-seo/how-search-works/crawling/

Three stages run left to right. Crawl: a bot discovers a URL and downloads the page. Index: the engine processes the page and stores eligible information. Serve or rank: the best indexed matches are ordered for a query. The Crawl stage is highlighted, and a note says not every page advances through every stage.

© Patrick Stox LLC · CC BY 4.0 ·

Google formule clairement le pipeline : “Google Search works in three stages, and not all pages make it through each stage” (traduction) « la recherche Google fonctionne en trois étapes et toutes les pages ne franchissent pas chacune d’elles » : exploration, indexation et diffusion. Evidence for this claim Google describes Search as three stages: crawling, indexing, and serving results. Scope: Google Search's documented processing model; it does not guarantee that a page reaches every stage. Confidence: high · Verified: Google Search Central: In-depth guide to how Google Search works Une page peut être explorée sans être indexée, ou indexée sans être proposée pour une requête. Garder ces étapes distinctes est fondamental.

Qui effectue l’exploration ?

« Googlebot » ne désigne pas un programme unique. Dans ma présentation Fonctionnement de la recherche, je décris plus de 1 000 systèmes et une famille de robots spécialisés : ordinateur, mobile, images, actualités, vidéos et annonces. Ils puisent dans le même budget d’exploration ; une explosion d’URL d’images ou de paramètres peut donc priver le contenu utile de capacité.

Les moteurs ne sont plus seuls. Dans mon analyse Cloudflare Radar, À la rencontre des nouveaux robots Web, ceux des moteurs restent premiers, mais les robots d’IA occupent nettement la deuxième place et pourraient les dépasser dans les prochaines années. Les journaux hébergent désormais une population différente.

Comment les robots découvrent-ils les URL ?

Discovery is both pull and push — Google calls the whole thing “URL discovery.” Source : /technical-seo/how-search-works/crawling/

Two discovery routes feed one crawl queue. Pull discovery includes following links and sitemaps. Push discovery includes IndexNow for Bing, Yandex, and other participating engines but not Google for general pages; the Google Indexing API for JobPosting and BroadcastEvent pages; and change notifications through sitemap lastmod, RSS, and WebSub.

© Patrick Stox LLC · CC BY 4.0 ·

La découverte fonctionne par pull et par push :

  • Pull — liens. Google indique : “Other pages are discovered when Google extracts a link from a known page to a new page.” (traduction) « d’autres pages sont découvertes lorsque Google extrait d’une page connue un lien vers une nouvelle page ». Voilà pourquoi les pages orphelines restent difficiles à trouver.
  • Pull — sitemaps. “Still other pages are discovered when you submit a list of pages (a sitemap) for Google to crawl.” (traduction) « d’autres pages encore sont découvertes lorsque vous envoyez une liste de pages, un sitemap, à explorer ».
  • Push — notifications. IndexNow sert Bing, Yandex et d’autres moteurs, mais pas les pages générales de Google. L’API d’indexation Google est officiellement réservée aux pages JobPosting et BroadcastEvent. lastmod, RSS et WebSub complètent ces signaux.

Google regroupe ces mécanismes sous le nom “URL discovery.” (traduction) « découverte d’URL ».

Comment les robots récupèrent-ils les pages ?

  • Le calendrier est algorithmique. “Googlebot uses an algorithmic process to determine which sites to crawl, how often, and how many pages to fetch from each site.” (traduction) « Googlebot détermine algorithmiquement les sites à explorer, la fréquence et le nombre de pages ». Vous l’influencez sans le fixer.
  • L’exploration est polie. Les robots ralentissent pour ne pas surcharger le site : “they try not to crawl the site too fast to avoid overloading it… HTTP 500 errors mean ‘slow down.’” (traduction) « ils évitent d’explorer trop vite ; les erreurs HTTP 500 signifient de ralentir ». Les réponses 503 ou 429 font temporairement reculer Googlebot.
  • Une limite d’octets existe. Depuis la mise à jour Google de mars 2026, Googlebot récupère environ 2 Mo par URL, et jusqu’à 64 Mo pour les PDF. Au-delà, la récupération est tronquée : seule la partie téléchargée part à l’indexation.
  • Le cache réduit le coût. Les requêtes conditionnelles évitent de retélécharger les ressources inchangées. Google ne publie aucune durée fixe pour le cache des ressources de rendu.
Evidence for this claim Googlebot algorithmically determines which sites to crawl, how often to crawl them, and how many pages to fetch. Scope: web Confidence: high · Verified: In-Depth Guide to How Google Search Works

Le rendu n’est pas l’exploration

Cette distinction provoque de nombreuses erreurs. “During the crawl, Google renders the page and runs any JavaScript it finds using a recent version of Chrome.” (traduction) « pendant l’exploration, Google rend la page et exécute le JavaScript trouvé avec une version récente de Chrome ». Le service de rendu Web est sans état : stockage et cookies sont effacés, les demandes d’autorisation refusées et les service workers rejetés. Un contenu accessible seulement après un clic ou une navigation JavaScript sans vrai lien <a href> risque de ne pas être découvert ou rendu. Voir SEO JavaScript.

Exploration, indexation et classement

Les distinctions les plus importantes :

  • Exploration ≠ classement. Elle est nécessaire pour apparaître, mais n’est pas un signal de classement. Le budget relève de l’efficacité.
  • Exploration ≠ indexation. Une page bloquée dans robots.txt peut encore être indexée grâce aux liens ; Google ne peut toutefois lire son contenu ni son noindex. Comme je l’explique dans Indexée malgré un blocage robots.txt, “crawling and indexing are two different things.” (traduction) « exploration et indexation sont deux choses différentes ». Pour retirer une page, autorisez l’exploration et ajoutez noindex.

Je l’ai testé dans L’histoire de deux pages bien classées bloquées par robots.txt. Après blocage, “We lost a position here or there and all of the featured snippets for the pages… I expected a lot more impact, but the world didn’t end.” (traduction) « nous avons perdu une position ici ou là et tous les extraits optimisés ; je m’attendais à bien pire, mais le monde ne s’est pas arrêté ». Ma conclusion : “Don’t block pages you want indexed. It hurts. Not as bad as you might think it does — but it still hurts.” (traduction) « ne bloquez pas les pages à indexer ; cela nuit, moins qu’on pourrait le penser, mais cela nuit ».

Contrôler l’exploration

  • robots.txt contrôle l’exploration, pas l’indexation : il précise quelles URL les robots peuvent consulter. Evidence for this claim robots.txt controls crawler access and is not a reliable way to keep a URL out of Google. Scope: Google Search behavior for URLs blocked by robots.txt; blocked URLs may still be indexed when discovered elsewhere. Confidence: high · Verified: Google Search Central: Introduction to robots.txt Utilisez-le pour les espaces faibles, pas pour désindexer.
  • Architecture et maillage interne déterminent la profondeur et la découverte.
  • Contrôles de cadence. Google a retiré le curseur manuel de Search Console début 2024 et s’appuie sur les réponses serveur ; Bing conserve une grille Crawl Control.

Efficacité et budget d’exploration

Les deux moteurs visent l’efficacité. Gary Illyes décrit Google par limite de cadence + demande d’exploration, selon popularité et ancienneté. Fabrice Canel donne à Bing cet objectif : “crawl efficiency north star … to crawl a URL only when the content has been added … updated.” (traduction) « objectif d’efficacité : explorer une URL seulement lorsque son contenu a été ajouté ou mis à jour ».

Bonne nouvelle : la plupart des sites n’ont pas à s’en préoccuper. Google dit que si le site ne compte pas beaucoup de pages qui changent vite, ou si les pages sont explorées le jour de leur publication, “you don’t need to read this guide.” (traduction) « vous n’avez pas besoin de lire ce guide ». Le sujet devient pertinent autour d’un million de pages modifiées chaque semaine ou de dix mille chaque jour. Evidence for this claim Sites without many rapidly changing pages, or whose new pages are crawled the day they are published, generally do not need crawl-budget management. Scope: large websites Confidence: high · Verified: Optimize your crawl budget

Quand l’exploration échoue : identifier l’étape

Avant de corriger, localisez l’étape réellement défaillante ; symptômes et remèdes diffèrent :

  • Pas découverte ? Aucun lien et aucune présence au sitemap : corrigez maillage et couverture.

  • Découverte mais jamais récupérée ? Erreurs serveur, délais ou blocage robots.txt : consultez statistiques GSC et journaux.

  • Récupérée mais mal rendue ? Un clic ou une navigation uniquement JavaScript bloque le service de rendu : examinez le SEO JavaScript.

  • Récupérée et rendue mais non indexée ? Il s’agit d’une décision de l’index, pas d’un problème d’exploration.

  • L’analyse des journaux fait foi : elle montre les URL réellement demandées, leur fréquence et leurs codes, révèle le gaspillage et les pages jamais atteintes.

  • Les pièges à robots — calendriers, navigation à facettes, identifiants de session ou explosions de liens relatifs — consomment silencieusement le budget sur des URL inutiles.

Pour aller plus loin dans le cluster Exploration

Ce hub sert de carte. Chaque sujet possède son analyse :

Efficacité : volume et fréquence

  • Budget d’exploration — capacité, demande, gaspillage et sites concernés.
  • Cadence d’exploration — vitesse, retrait du curseur GSC et moyens de ralentir ou accélérer.
  • Fréquence d’exploration — popularité, ancienneté et lastmod précis.
  • Profondeur d’exploration — profondeur de clic et proximité de l’accueil.

Identifier les robots

  • Crawler — programme Web et boucle récupération → analyse → suivi.
  • User-agent — chaîne et jeton robots.txt, faciles à usurper.
  • Googlebot — variantes, rendu et vérification.
  • Bingbot — différences et surfaces alimentées.
  • Robots d’IA — entraînement, recherche IA et récupération déclenchée.

Diagnostiquer

  • Analyse des journaux — vérifier les robots et leurs requêtes.
  • Pièges à robots — motifs générant une infinité d’URL et correctifs.

Tous ces sujets sont accessibles dans la barre latérale.

Qualifier les liens sortants relève d’un contrôle connexe : nofollow fournit l’indication générale, tandis que rel=sponsored et rel=ugc couvrent liens payants et contenu généré par les utilisateurs. Voir le cluster balises méta on-page.

Être découvert constitue une étape connexe distincte. Liens internes, sitemaps XML, index, images ou vidéos, ainsi qu’IndexNow et l’API d’indexation Google, sont traités dans le hub Découverte. Pour la vue générale, consultez Fonctionnement de la recherche.

Add an expert note

Pin an expert quote

New person? Create their unclaimed profile at /admin/experts/ → Pin a quote first.