Budget d’exploration
Fonctionnement du budget d’exploration, entre capacité du serveur et demande, sources de gaspillage, seuils réellement concernés et méthodes de mesure.
Langues
1 indice probant sur cette page
- Outil en ligne associéLog File Analyzer
Le budget d’exploration combine ce que le serveur peut supporter et ce que Google souhaite visiter selon la popularité, la fraîcheur et l’inventaire d’URL. Il ne constitue pas un signal de classement. La plupart des sites n’ont rien à gérer : 100k URL ne suffisent généralement pas et une exploration le jour même indique un fonctionnement normal. Le sujet concerne surtout un million de pages modifiées chaque semaine, 10 000 chaque jour ou une forte accumulation d’URL découvertes non indexées. Le principal levier consiste à supprimer facettes, doublons, soft 404s et espaces infinis pour concentrer les ressources sur les URL importantes.
En bref — Le budget d’exploration représente la quantité de pages qu’un moteur de recherche accepte d’explorer sur votre site. Il combine la charge que votre serveur peut supporter et l’intérêt de Google pour vos URL. Davantage d’exploration n’améliore pas le classement et, pour la plupart des sites, ce sujet ne pose aucun problème. Si vos pages sont explorées le jour de leur publication, votre budget est suffisant.
Qu’est-ce que le budget d’exploration ?
Un moteur de recherche n’explore pas indéfiniment un site : il récupère un certain nombre d’URL pendant une période, puis passe à autre chose. Cette quantité constitue le budget d’exploration.
Le moteur répond continuellement à deux questions :
- Quelle quantité puis-je explorer ? Un serveur finit par ralentir ou renvoyer des erreurs. Google observe sa santé et réduit alors la cadence. C’est la capacité d’exploration, autrefois appelée limite de fréquence.
- Quelle quantité est-ce que je veux explorer ? Les pages populaires ou souvent modifiées sont visitées davantage ; celles qui reçoivent peu de liens ou ne changent jamais le sont moins. C’est la demande d’exploration.
La combinaison des deux donne approximativement le nombre d’URL que Google peut et veut explorer. Evidence for this claim Google defines crawl budget using crawl capacity limit and crawl demand. Scope: Google Search crawling for larger sites. Confidence: high · Verified: Google: Large site crawl budget guide
Le budget concerne la récupération d’une URL. Son indexation relève d’une décision ultérieure distincte : une page peut être explorée sans être indexée. L’exploration est une condition préalable, pas une garantie.
Première question : devez-vous réellement vous en préoccuper ?
La plupart des sites n’ont aucun problème de budget d’exploration. Google le dit clairement : si les pages sont explorées le jour de leur publication ou si le site n’est ni immense ni fréquemment modifié, ce guide n’est pas nécessaire. Evidence for this claim Google says sites without many rapidly changing pages, or whose pages are crawled the day they publish, generally do not need crawl-budget guidance. Scope: Google's rough applicability guidance, not a guarantee for every site. Confidence: high · Verified: Google: Large site crawl budget guide
Vérifiez quelques URL dans Google ou avec l’inspection d’URL de Search Console. Si les nouvelles pages apparaissent en un ou deux jours, consacrez plutôt vos efforts au contenu et aux liens.
Le sujet devient pertinent pour des sites comptant des centaines de milliers ou des millions de pages, surtout lorsqu’elles changent constamment, comme dans le grand commerce électronique ou l’actualité.
Plus d’exploration n’améliore pas le classement
Explorer plus souvent une page ne la fait pas monter. L’exploration permet au moteur de découvrir et télécharger le contenu ; elle est nécessaire pour pouvoir se classer, mais sa fréquence n’est pas un signal de classement.
L’objectif n’est donc pas d’être exploré davantage, mais de faire explorer les pages importantes sans laisser le moteur gaspiller ses ressources sur des URL inutiles.
Ce qui gaspille le budget d’exploration
Sur un grand site, le budget est notamment consommé par :
- Les URL de filtres et de tri issues de la navigation à facettes, qui multiplient les variantes presque identiques.
- Les pages en double, accessibles sous plusieurs URL, avec ou sans
wwwou paramètres. - Les soft 404s, qui affichent une absence tout en renvoyant
200 OK. - Les longues chaînes de redirection et pages lentes, qui renchérissent chaque récupération.
La solution consiste presque toujours à supprimer le gaspillage pour concentrer l’exploration sur les vraies pages, et non à convaincre Google d’explorer davantage.
Pour le modèle complet, les seuils, la navigation à facettes, les différences avec Bing et la mesure, ouvrez l’onglet Avancé.
Evidence for this claim Google defines crawl budget using crawl capacity limit and crawl demand. Scope: Google Search crawling for larger sites. Confidence: high · Verified: Google: Large site crawl budget guideEn bref — Budget d’exploration = limite de capacité du serveur × demande d’exploration liée à la popularité, la fraîcheur et l’inventaire perçu. C’est une question d’efficacité, pas un signal de classement. Le système planifie les URL par importance sous la contrainte de charge de l’hôte ; il n’accorde pas un quota quotidien fixe. La plupart des sites peuvent l’ignorer : 100k URL ne suffisent généralement pas, et Google invite les sites explorés le jour même à passer leur chemin. Le sujet apparaît autour d’un million de pages modifiées chaque semaine, de 10 000 pages modifiées chaque jour, ou lorsque « Découvert, actuellement non indexé » augmente fortement. Le meilleur levier consiste à supprimer facettes, doublons, soft 404s et espaces infinis afin de réserver les ressources aux URL utiles.
Le modèle à deux facteurs
Google le définit ainsi : “The amount of time and resources that Google devotes to crawling a site is commonly called the site’s crawl budget and it’s determined by two main elements: crawl capacity limit and crawl demand.” (traduction) « Le temps et les ressources consacrés par Google à l’exploration d’un site forment son budget, déterminé par la capacité et la demande. » Gary Illyes le résume comme “the number of URLs Googlebot can and wants to crawl.” (traduction) « le nombre d’URL que Googlebot peut et veut explorer ». Le budget régit la récupération, jamais la décision distincte d’indexation. Evidence for this claim Google defines crawl budget using crawl capacity limit and crawl demand. Scope: Google Search crawling for larger sites. Confidence: high · Verified: Google: Large site crawl budget guide
Limite de capacité, côté offre. Il s’agit de “the maximum number of simultaneous parallel connections that Google can use to crawl a site, as well as the time delay between fetches.” (traduction) « le nombre maximal de connexions parallèles et le délai entre récupérations ». Des réponses rapides et stables augmentent la limite ; lenteurs, erreurs 5xx et 429 font reculer Googlebot. Mon support How Search Works retient les mêmes déclencheurs.
Demande d’exploration, côté besoin. Elle dépend de la popularité, de l’ancienneté de la dernière visite, de la fréquence des changements et de l’inventaire perçu. Google précise : “Without guidance from you, Google tries to crawl all or most of the URLs that it knows about on your site. If many of these URLs are duplicates, or you don’t want them crawled for some other reason… this wastes a lot of Google crawling time on your site. This is the factor that you can positively control the most.” (traduction) « Sans consigne, Google tente d’explorer presque toutes les URL connues ; les doublons et URL indésirables gaspillent du temps, et cet inventaire est le facteur que vous maîtrisez le mieux. »
Crawl demand comes from popularity, genuine change, and the value of the URL inventory. It orders URLs in a priority queue. Crawl capacity comes from server response speed, stability, and error behavior. It limits how far Googlebot proceeds through that queue. Their interaction is the site's realized crawl budget, not a fixed daily URL quota.
© Patrick Stox LLC · CC BY 4.0 ·
Deux faits structurels surprennent souvent :
- Le budget est propre à chaque nom d’hôte. “
https://www.example.com/andhttps://code.example.com/are two different hostnames, and therefore have separate crawl budgets.” (traduction) « ces deux adresses sont des hôtes différents et disposent donc de budgets séparés ». Les sous-domaines ne partagent pas leur budget. - Les différents Googlebot puisent probablement dans un même ensemble. Mes observations montrent que les robots image, actualités, vidéo et publicité semblent partager le budget du site, mais aucune source primaire récente ne le confirme exactement. Vérifiez la ventilation par type de robot dans les statistiques d’exploration.
Son fonctionnement interne : une planification par importance
« Budget d’exploration » est un terme générique du SEO. En interne, il s’agit plutôt d’une planification limitée par la charge de l’hôte. Illyes explique que le système “sets a bucket of URLs in importance order and GoogleBot will crawl in that order based on the schedule the host load decided. If Google thinks your server can handle it, it will crawl the whole bucket, if not, it will stop.” (traduction) « ordonne un lot d’URL par importance et l’explore selon la charge que l’hôte peut supporter ».
Il ne s’agit donc pas d’un quota de N pages par jour, mais d’une file priorisée liée à la demande de recherche. Illyes indique : “If search demand goes down, then that also correlates to the crawl limit going down,” (traduction) « une baisse de la demande de recherche accompagne une baisse de la limite », et qu’il faut convaincre Search que le contenu mérite d’être récupéré. Google a explicitement rejeté l’idée d’un quota quotidien fixe.
Votre site rencontre-t-il réellement un problème ?
Soyons directs : la plupart des sites n’ont pas à gérer ce budget. Google ouvre son guide ainsi : “If your site doesn’t have a large number of pages that change rapidly, or if your pages seem to be crawled the same day that they are published, you don’t need to read this guide. For Google Search specifically, merely keeping your sitemap up to date and checking your index coverage regularly is adequate.” (traduction) « Sans beaucoup de pages évoluant rapidement, ou si elles sont explorées le jour même, un sitemap à jour et le suivi de couverture suffisent. » Evidence for this claim Google says sites without many rapidly changing pages, or whose pages are crawled the day they publish, generally do not need crawl-budget guidance. Scope: Google's rough applicability guidance, not a guarantee for every site. Confidence: high · Verified: Google: Large site crawl budget guide
John Mueller donne un repère : “100k URLs is usually not enough to affect crawl budget (it’s <1/minute over 3 months).” (traduction) « cent mille URL ne suffisent généralement pas ; cela représente moins d’une par minute sur trois mois ». Sous six chiffres avec une exploration rapide, passez à autre chose.
Lorsque le problème existe, les seuils approximatifs de Google sont :
- Grands sites : au moins un million de pages uniques, modifiées environ chaque semaine.
- Sites moyens ou grands : au moins 10 000 pages uniques, modifiées chaque jour.
- Sites ayant beaucoup d’URL « Découvertes, actuellement non indexées » dans Search Console : Google connaît ces URL sans parvenir à les traiter.
Google rappelle que “the numbers given here are a rough estimate… not exact thresholds.” (traduction) « ces nombres sont des estimations, pas des seuils exacts ». Même sur les grands sites, le retard touche surtout les pages nouvelles, statiques ou faiblement liées.
Le budget d’exploration influence-t-il le classement ? Non.
L’exploration est nécessaire, mais n’est pas un signal de classement. Google écrit : “An increased crawl rate will not necessarily lead to better positions in Search results. Google uses hundreds of signals to rank the results, and while crawling is necessary for being in the results, it’s not a ranking signal.” (traduction) « une fréquence accrue ne garantit pas de meilleures positions ; l’exploration est nécessaire, mais n’est pas un signal ». Mon guide Ahrefs résume : davantage d’exploration n’améliore pas le classement, mais une page jamais explorée ni indexée ne peut se classer.
Ce qui gaspille le budget d’exploration
Illyes publie la liste canonique des URL à faible valeur, par ordre d’importance :
- Navigation à facettes et identifiants de session, surtout les combinaisons de filtres et tris.
- Contenu dupliqué interne : HTTP/HTTPS, www ou non, slash, casse, pages index et paramètres. Google estime qu’environ 60 % du Web est dupliqué.
- Pages d’erreur logicielle, notamment les soft 404s renvoyant
200. - Pages piratées.
- Espaces infinis et proxys, calendriers, défilement infini et pièges à robots.
- Contenu médiocre ou indésirable.
Le coût est concret : “Wasting server resources on pages like these will drain crawl activity from pages that do actually have value, which may cause a significant delay in discovering great content on a site.” (traduction) « gaspiller les ressources sur ces pages détourne l’exploration des pages utiles et retarde la découverte du bon contenu ». Les longues chaînes de redirection et les pages lentes aggravent encore ce coût.
Comment l’optimiser
L’objectif consiste à concentrer le budget sur les URL importantes :
- Regroupez les doublons. Google recommande : “Consolidate duplicate content to focus crawling on unique content rather than unique URLs.” (traduction) « regrouper le contenu dupliqué pour privilégier le contenu unique ». Uniformisez hôte, protocole et slash, utilisez les canoniques et gérez les paramètres.
- Bloquez dans
robots.txtles chemins réellement inutiles, uniquement s’ils ne doivent jamais être explorés. Pour les facettes, bloquez les paramètres?ou placez-les derrière#. - N’utilisez pas
noindexpour économiser le budget. Google récupère encore la page avant de l’abandonner. - N’attendez pas de
robots.txtqu’il réalloue automatiquement le budget. Google ne reporte les ressources libérées que si le serveur atteignait déjà sa limite. - Corrigez les soft 404s et renvoyez 404/410 pour les pages supprimées.
- Raccourcissez les redirections, entretenez les sitemaps et leur
lastmod, améliorez le serveur et renforcez les liens internes.
Google ne cite que deux moyens d’augmenter réellement le budget : “Add more server resources… [and] optimize your content’s quality.” (traduction) « ajouter des ressources serveur et améliorer la qualité du contenu ». Un serveur rapide relève le plafond de capacité, mais une faible demande limite encore l’exploration.
Comment le mesurer
- GSC > Paramètres > Statistiques d’exploration : requêtes dans le temps, durée moyenne de réponse, état de l’hôte et ventilations par réponse, fichier et Googlebot.
- Analyse des journaux serveur : vérité terrain par motif d’URL. Vérifiez l’identité de Googlebot par DNS inverse et direct ou avec les plages IP publiées.
- « Découvert, actuellement non indexé » : une accumulation croissante signale que Google connaît des URL sans les explorer suffisamment.
In a synthetic cohort, product pages are 28 percent of the URL inventory, 24 percent of Googlebot requests, and 52 percent of useful 200 responses. Category pages are 7, 10, and 21 percent. Facet URLs are 45, 61, and 8 percent. Gone URLs are 20, 5, and 0 percent. The figures illustrate comparison logic, not a live log sample.
Bing et les autres moteurs : l’« efficacité d’exploration »
Bing présente le sujet comme une efficacité d’exploration. Fabrice Canel la définit ainsi : “The crawl efficiency is how often we crawl and discover new and fresh content per page crawled.” (traduction) « la fréquence à laquelle nous découvrons du contenu nouveau et frais par page explorée ». L’objectif est de ne récupérer une URL que lorsque son contenu est nouveau ou actualisé. Sa formule est directe : “Less is more for SEO. Never forget that. Less URLs to crawl, better for SEO.” (traduction) « En SEO, moins vaut mieux : moins d’URL à explorer améliore l’efficacité. »
Bing privilégie IndexNow, qui pousse les URL modifiées, et Crawl Control dans Bing Webmaster Tools, qui programme les heures d’exploration pour protéger le serveur. Google a supprimé son ancien limiteur de fréquence dans Search Console, tandis que Bing permet toujours d’agir sur le calendrier.
Mythes corrigés sur le budget d’exploration
- « Tous les sites doivent l’optimiser. » Non : une exploration le jour même et moins de 100k URL indiquent généralement que tout va bien.
- « Plus d’exploration améliore le classement. » Non : elle est nécessaire, mais n’est pas un signal.
- « C’est un quota quotidien fixe. » Non : la planification dépend de l’importance et de la charge de l’hôte.
- «
noindexéconomise le budget. » Non : Google récupère d’abord la page. - « Bloquer avec
robots.txtdonne le budget aux autres pages. » Pas en général, sauf si le serveur atteignait déjà sa limite. - « Un serveur rapide suffit à augmenter le budget. » Il relève seulement la capacité ; la demande peut rester faible.
Pour replacer le sujet dans la chaîne complète — découverte, planification, rendu et indexation — consultez la rubrique sur l’exploration. Les sujets voisins approfondissent fréquence, cadence, pièges à robots et analyse des journaux.
Résumé par l’IA
Version condensée de l’onglet Avancé :
- Budget = capacité × demande. La capacité augmente avec des réponses rapides et baisse avec
5xxou429; la demande combine popularité, fraîcheur et inventaire perçu. - Ce n’est pas un signal de classement, seulement une question d’efficacité.
- Le système planifie une file par importance sous contrainte de charge, sans quota quotidien fixe.
- La plupart des sites n’ont rien à gérer. Environ 100k URL ne suffisent généralement pas ; le sujet concerne plutôt un million de pages hebdomadaires, 10 000 pages quotidiennes ou une forte accumulation d’URL découvertes non indexées.
- Les principaux gaspillages sont facettes, identifiants de session, doublons, soft 404s, pages piratées, espaces infinis, redirections et lenteurs.
- Supprimez le gaspillage : regroupez, bloquez les chemins inutiles dans
robots.txt, corrigez les soft 404s et redirections, entretenez sitemaps et liens internes.noindexn’économise pas une requête. - Mesurez avec les statistiques GSC, les journaux serveur et le rapport d’URL découvertes non indexées.
- Bing parle d’efficacité, avec IndexNow et Crawl Control.
Documentation officielle
Documentation primaire des moteurs de recherche.
- Optimiser le budget d’exploration — documentation canonique sur capacité, demande, sites concernés, gaspillage et optimisation.
- Ce que signifie Crawl Budget pour Googlebot — présentation originale de Gary Illyes et catégories d’URL à faible valeur.
- Exploration et indexation — documentation sur robots, sitemaps, canoniques et contrôles.
- Série Crawling December — Googlebot, cache HTTP, facettes et CDN.
Bing / Microsoft
- Maximiser l’efficacité d’exploration — modèle d’efficacité de Bing.
- Optimiser la fréquence d’exploration — choix de la cadence par Bing.
- Bing Webmaster Tools — Crawl Control — programmation horaire.
- IndexNow / indexnow.org — transmission des URL modifiées.
Citations des sources
Déclarations officielles de Google et Bing. Chaque lien mène au passage cité.
Google — définition
- “The amount of time and resources that Google devotes to crawling a site is commonly called the site’s crawl budget and it’s determined by two main elements: crawl capacity limit and crawl demand.” (traduction) « Le temps et les ressources consacrés à l’exploration forment le budget, déterminé par la capacité et la demande. » — Documentation Google Search Central. Accéder à la citation
- “Google’s crawlers calculate a crawl capacity limit, which is the maximum number of simultaneous parallel connections that Google can use to crawl a site, as well as the time delay between fetches.” (traduction) « Les robots calculent un plafond de connexions parallèles et un délai entre récupérations. » Accéder à la citation
- “Taking crawl rate and crawl demand together we define crawl budget as the number of URLs Googlebot can and wants to crawl.” (traduction) « La fréquence et la demande définissent le nombre d’URL que Googlebot peut et veut explorer. » — Gary Illyes, Google, 2017. Accéder à la citation
Google — quand ne pas s’en préoccuper
- “If your site doesn’t have a large number of pages that change rapidly, or if your pages seem to be crawled the same day that they are published, you don’t need to read this guide.” (traduction) « Sans beaucoup de pages changeant rapidement, ou si elles sont explorées le jour de publication, ce guide est inutile. » Accéder à la citation
- “100k URLs is usually not enough to affect crawl budget (it’s <1/minute over 3 months).” (traduction) « cent mille URL ne suffisent généralement pas ; cela représente moins d’une par minute sur trois mois. » — John Mueller, Google, 2021. Lire l’article
Google — maîtrise du gaspillage et classement
- “If many of these URLs are duplicates, or you don’t want them crawled for some other reason (removed, unimportant, and so on), this wastes a lot of Google crawling time on your site. This is the factor that you can positively control the most.” (traduction) « Les doublons et URL indésirables gaspillent beaucoup de temps ; c’est le facteur que vous maîtrisez le mieux. » Accéder à la citation
- “An increased crawl rate will not necessarily lead to better positions in Search results. Google uses hundreds of signals to rank the results, and while crawling is necessary for being in the results, it’s not a ranking signal.” (traduction) « Une fréquence accrue ne mène pas nécessairement à de meilleures positions ; l’exploration est nécessaire, mais n’est pas un signal de classement. » — Gary Illyes, Google, 2017. Accéder à la citation
Google — liste du gaspillage et pratiques à éviter
- “Faceted navigation and session identifiers / On-site duplicate content / Soft error pages / Hacked pages / Infinite spaces and proxies / Low quality and spam content” (traduction) « Navigation à facettes, identifiants de session, doublons internes, erreurs logicielles, pages piratées, espaces infinis et contenu médiocre ». — Gary Illyes, Google, 2017. Accéder à la citation
- “Consolidate duplicate content to focus crawling on unique content rather than unique URLs.” (traduction) « Regroupez les doublons afin de concentrer l’exploration sur le contenu unique. » Accéder à la citation
- “Don’t use noindex, as Google will still request, but then drop the page when it sees a noindex meta tag or header in the HTTP response, wasting crawling time.” (traduction) « N’utilisez pas noindex : Google récupère encore la page avant de l’abandonner, ce qui gaspille du temps. » Accéder à la citation
- “Google won’t shift this newly available crawl budget to other pages unless Google is already hitting your site’s serving limit.” (traduction) « Google ne reporte pas le budget libéré sur d’autres pages sauf si le site atteignait déjà sa limite de service. » Accéder à la citation
Gary Illyes, Google — planification et charge de l’hôte (via Search Engine Roundtable)
- “Host load kind of sets a bucket of URLs in importance order and GoogleBot will crawl in that order based on the schedule the host load decided. If Google thinks your server can handle it, it will crawl the whole bucket, if not, it will stop.” (traduction) « La charge de l’hôte ordonne un lot d’URL par importance ; Googlebot poursuit tant que le serveur peut le supporter. » Accéder à la citation
Fabrice Canel, Microsoft Bing
- “The crawl efficiency is how often we crawl and discover new and fresh content per page crawled.” (traduction) « L’efficacité mesure la fréquence à laquelle du contenu nouveau et frais est découvert par page explorée. » Accéder à la citation
- « En SEO, moins vaut mieux : moins d’URL à explorer améliore l’efficacité. » Accéder à la citation
Liste de contrôle pour optimiser le budget
À utiliser seulement après confirmation d’un problème réel : grand site, exploration trop lente ou accumulation d’URL découvertes non indexées.
- Vérifier le problème dans les statistiques GSC et le rapport « Découvert, actuellement non indexé ».
- Choisir une convention canonique unique pour hôte, protocole, slash et casse.
- Canonicaliser ou bloquer les paramètres qui ne créent que des variantes sans valeur.
- Maîtriser les facettes avec
robots.txtou derrière un#lorsqu’elles ne doivent pas être explorées. - Corriger les soft 404s et renvoyer
404/410pour les suppressions définitives. - Supprimer ou raccourcir les chaînes de redirection.
- Limiter les sitemaps aux URL canoniques indexables avec un
lastmodhonnête. - Ne pas utiliser
noindexpour économiser le budget ni attendre derobots.txtune réallocation automatique. - Renforcer les liens internes vers les pages importantes et nouvelles.
- Améliorer la réponse du serveur et l’efficacité du chargement.
- Pour Bing, adopter IndexNow et Crawl Control si la charge serveur est la contrainte.
Modèles mentaux
1. Budget = capacité × demande. La capacité dépend du serveur ; la demande combine popularité, fraîcheur et inventaire perçu. Un serveur rapide sans demande reste peu exploré, tandis qu’une forte demande est bridée par un serveur fragile. Pour relever le budget effectif, supprimez généralement le gaspillage.
2. Le filtre « ai-je vraiment un problème ? ». Vérifiez avant toute action : exploration le jour même, aucun problème ; moins d’environ 100k URL, problème très improbable ; un million de pages hebdomadaires, 10 000 quotidiennes ou beaucoup d’URL découvertes non indexées, analyse utile.
3. Supprimer le gaspillage avant de demander plus d’exploration. Google tente de visiter toutes les URL connues. Si la moitié correspond à des doublons, facettes ou soft 404s, le budget part dans des pages inutiles. Réduire cet inventaire concentre les ressources sur les pages utiles.
4. Exploration ≠ classement. L’exploration ouvre la porte sans constituer un score. L’objectif est la couverture des bonnes URL, jamais le volume brut.
5. Une file de priorité, pas un quota. La planification ordonne les URL par importance sous la contrainte de charge de l’hôte. Liens, demande et absence de gaspillage améliorent leur priorité.
Budget d’exploration — aide-mémoire
Ce qui le gaspille, dans l’ordre de Google
| N° | Catégorie | Cause habituelle |
|---|---|---|
| 1 | Navigation à facettes et sessions | Combinaisons de filtres et tris multipliant les URL |
| 2 | Doublons internes | www, protocole, slash, casse, index et paramètres |
| 3 | Erreurs logicielles | Pages absentes renvoyant 200 |
| 4 | Pages piratées | URL indésirables injectées |
| 5 | Espaces infinis et proxys | Calendriers, défilement infini et facettes |
| 6 | Contenu médiocre | Pages minces ou générées automatiquement |
Les longues chaînes de redirection et pages lentes augmentent aussi le coût de chaque récupération.
Devez-vous vous en préoccuper ? Exploration le jour même : non. Moins d’environ 100k URL : presque certainement non. Un million de pages modifiées chaque semaine, 10 000 chaque jour ou une forte accumulation d’URL découvertes non indexées : oui.
Solutions efficaces : regrouper les doublons, bloquer les chemins inutiles dans robots.txt sans employer noindex comme économie, corriger les soft 404s, renvoyer 404/410, raccourcir les redirections, accélérer le serveur, nettoyer les sitemaps et renforcer les liens internes.
Deux seuls moyens d’augmenter le budget selon Google : davantage de capacité serveur et un contenu de meilleure qualité. L’un sans l’autre ne suffit pas.
Bing : parle d’« efficacité d’exploration », pousse les changements avec IndexNow et programme bingbot avec Crawl Control.
Outils de mesure et de gestion
- Google Search Console — Statistiques d’exploration : requêtes, temps de réponse, état de l’hôte et ventilations. Commencez ici.
- GSC « Découvert, actuellement non indexé » : alerte sur les URL connues mais non explorées.
- Analyse des journaux serveur : vérité terrain sur les URL réellement visitées. Utilisez Screaming Frog Log File Analyser, BigQuery ou une plateforme de journaux.
- Ahrefs Site Audit / Screaming Frog SEO Spider : simulation révélant doublons, redirections, soft 404s, blocages et pièges de facettes.
- Ahrefs Webmaster Tools : exploration et audit gratuits des sites vérifiés.
- Inspection d’URL GSC : contrôle rapide de l’exploration d’une URL.
- Bing Webmaster Tools — Crawl Control : programmation horaire de bingbot.
Avez-vous un problème de budget d’exploration ?
Should you work on crawl budget now?
Contrôle mensuel de la santé du budget
- Exporter chaque mois les requêtes des robots depuis les journaux sur une fenêtre identique.
- Les ventiler par code, répertoire, type de page et indexabilité.
- Examiner paramètres fréquents, doublons, redirections, soft 404s et erreurs serveur.
- Comparer la part d’exploration des modèles utiles à la période précédente et annoter les lancements ou migrations.
- Attribuer chaque gaspillage à un responsable et à un contrôle : liens, paramètres, redirections, canonique, suppression ou serveur.
- Revérifier le motif dans la fenêtre suivante ; le processus est terminé lorsque les URL utiles restent accessibles et que le gaspillage baisse par rapport au niveau de référence du site.
Erreurs relatives au budget d’exploration
- Chercher à augmenter le nombre de requêtes. Plus d’exploration n’améliore pas le classement ; mesurez la visite des URL importantes au bon moment.
- Bloquer le gaspillage seulement dans robots.txt. Cela peut empêcher la récupération sans supprimer les URL découvertes ni leurs liens. Corrigez aussi les chemins et regroupez l’inventaire.
- Modifier tous les
lastmodà chaque build. Une fraîcheur fictive détruit la confiance dans le signal. - Ignorer les erreurs serveur en réglant les URL. Les problèmes de capacité plafonnent l’exploration utile ; corrigez d’abord délais et 5xx.
- Considérer toute URL exclue comme inutile. Certaines ressources non indexées servent au rendu ou à la découverte ; classez leur fonction avant blocage.
Invite : classer le gaspillage des journaux
Collez un CSV dérivé des journaux avec URL, modèle, statut, robot, visites, octets et indexabilité. Retirez d’abord les valeurs de requête et les données utilisateur.
Act as a technical SEO analyst. Classify each URL pattern as valuable crawling, necessary support crawling, redirect/error waste, duplicate/parameter waste, or unclear. Do not infer intent from the URL alone: list the evidence needed for every unclear row. Rank patterns by crawler requests and bytes, propose the safest control, and state what could break if that control is wrong. Return a table plus a short validation plan.Invite : contester un diagnostic de budget
Review the crawl-budget diagnosis below. Separate evidence of capacity, demand, discovery, and URL-inventory problems. Flag claims that confuse crawling with indexing or rankings. Then give the three smallest tests that would confirm or reject the diagnosis. Do not invent thresholds; use changes against the site's own baseline.
[PASTE DIAGNOSIS AND OBSERVATIONS] Résumer les codes d’état des robots dans un journal
Exécutez cette commande sur un journal nginx ou Apache après avoir adapté le motif aux robots vérifiés :
awk 'BEGIN{IGNORECASE=1} /Googlebot|bingbot/ {print $9}' access.log | sort | uniq -c | sort -nrAvec PowerShell :
Select-String -Path .\access.log -Pattern 'Googlebot|bingbot' | ForEach-Object { if ($_.Line -match '"\s(\d{3})\s') { $Matches[1] } } | Group-Object | Sort-Object Count -DescendingExtraire les familles de paramètres
Utilisez cette expression régulière dans un export de robot ou un éditeur pour capturer le premier nom de paramètre :
\?([^=&]+)(?:=[^&]*)?Le groupe 1 contient le nom du paramètre. Un grand nombre de requêtes désigne des motifs à étudier, pas des URL à bloquer automatiquement.
Testez vos connaissances : budget d’exploration
Ressources utiles
Mes articles connexes
- Quand faut-il s’inquiéter du budget d’exploration ? — guide Ahrefs complet avec les choix concernant les facettes.
- Corriger « Découvert, actuellement non indexé » — signal GSC qui sert aussi d’alerte.
- Guide du débutant en SEO technique — place du budget dans l’ensemble du SEO technique.
- Stratégies SEO d’entreprise — pour la minorité de grands sites concernés.
Mes conférences
- How Search Works — présentation du modèle demande/limite de fréquence, assortie de l’avertissement qu’il s’agit de ma compréhension des systèmes et qu’elle peut être incomplète.
Dans le secteur
- Série officielle Crawling December, notamment sur la navigation à facettes.
- Google explique le budget d’exploration — résumé de 2017 et contexte “most sites don’t need to worry” (traduction) « la plupart des sites n’ont pas à s’en préoccuper ».
- Gary Illyes distingue budget, planification et charge — source du modèle de file prioritaire.
- Google : 100,000 URL n’affectent généralement pas le budget — repère de Mueller.
- Priorités d’exploration de Google — réfutation du quota fixe.
- Les cinq portes d’infrastructure — philosophie « moins vaut mieux » de Bing.
- Optimiser la fréquence de bingbot — cadence de Bing.
- r/TechSEO — communauté de débogage exploration/indexation.
Statistiques à citer
- Cent mille URL ne suffisent généralement pas. John Mueller : “100k URLs is usually not enough to affect crawl budget (it’s <1/minute over 3 months).” (traduction) « cent mille URL ne suffisent généralement pas ; moins d’une par minute sur trois mois ». Source
- Seuils approximatifs : un million de pages modifiées chaque semaine ou 10 000 chaque jour. Source
- Environ 60 % du Web serait du contenu dupliqué, selon l’estimation interne de Google. Source
Indicateur permanent d’efficacité d’exploration
Google ne fournit pas un nombre appelé budget : il faut l’inférer des destinations réelles des requêtes Googlebot. L’indicateur est la répartition entre pages à indexer et pages inutiles. Ce suivi n’a de sens qu’à grande échelle, principalement autour d’un million de pages ou pour des sites moyens créant beaucoup d’URL automatiques.
Répartition de l’exploration : requêtes utiles et gaspillées
- Mesure : part des requêtes d’un Googlebot vérifié atteignant des URL importantes et indexables, face aux doublons, facettes, variantes non canoniques, redirections et erreurs 4xx/5xx.
- Interprétation : indique si la capacité sert des pages susceptibles de se classer. Une hausse du gaspillage annonce souvent un retard de découverte ou d’indexation.
- Collecte : analysez les journaux avec Log File Analyzer, segmentez par classe d’URL et recoupez avec les statistiques GSC.
- Référence : aucune valeur universelle honnête. Établissez le niveau propre au site et réduisez progressivement la part gaspillée.
- Cadence : chaque mois, et davantage après une nouvelle facette, une migration ou une hausse soudaine des requêtes et erreurs.
Journal des modifications
Mis à jour le 11 août 2026.
Résumé éditorial et détails enregistrés des changements.Détails des changements
-
Les notes détaillées des changements sont actuellement disponibles en anglais.
-
Les notes détaillées des changements sont actuellement disponibles en anglais.
Comparaison complète indisponible — aucun instantané antérieur n’a été archivé pour cette révision.
Mis à jour le 11 août 2026.
Résumé éditorial et détails enregistrés des changements.Détails des changements
-
Les notes détaillées des changements sont actuellement disponibles en anglais.
-
Les notes détaillées des changements sont actuellement disponibles en anglais.
Comparaison complète indisponible — aucun instantané antérieur n’a été archivé pour cette révision.
Mis à jour le 27 juil. 2026.
Résumé éditorial et détails enregistrés des changements.Détails des changements
-
Les notes détaillées des changements sont actuellement disponibles en anglais.
Comparaison complète indisponible — aucun instantané antérieur n’a été archivé pour cette révision.
Mis à jour le 17 juil. 2026.
Résumé éditorial et détails enregistrés des changements.Détails des changements
-
Les notes détaillées des changements sont actuellement disponibles en anglais.
-
Les notes détaillées des changements sont actuellement disponibles en anglais.
-
Les notes détaillées des changements sont actuellement disponibles en anglais.
Comparaison complète indisponible — aucun instantané antérieur n’a été archivé pour cette révision.