Guide : « Bloquée par le fichier robots.txt » dans GSC

Ce que signifie l’état « Bloquée par le fichier robots.txt » dans Google Search Console, comment il diffère de l’avertissement « Indexée malgré le blocage par le fichier robots.txt », pourquoi noindex et Disallow sont incompatibles, et comment corriger un blocage accidentel.

Première publication : 23 juin 2026 · Dernière mise à jour : 9 août 2026 · Advanced
Langues
1 indice probant sur cette page

« Bloquée par le fichier robots.txt » est une exclusion du rapport Indexation des pages : Google a découvert l’URL sans pouvoir l’explorer, donc elle n’est pas indexée dans cet état. Ce résultat est généralement volontaire. robots.txt contrôle l’exploration, pas l’indexation. Pour retirer une page, autorisez son exploration puis servez noindex ; corrigez cet état seulement lorsqu’une URL destinée à l’indexation a été bloquée par erreur.

TL;DR — « Bloquée par le fichier robots.txt » est une exclusion du rapport Indexation des pages : Google a découvert l’URL sans l’explorer, car robots.txt l’interdit ; elle n’est donc pas indexée dans cet état. C’est normalement volontaire et bénin. robots.txt régit l’exploration, pas l’indexation : Disallow ne désindexe jamais. Ne confondez pas cette exclusion avec l’avertissement « Indexée malgré le blocage », où Google indexe tout de même l’URL grâce à des liens entrants. Erreur classique : associer disallow et noindex. Google ne peut alors pas lire noindex, et la page peut rester indexée. Pour retirer une page, autorisez l’exploration et servez noindex. Cet état n’est un bug que si l’URL devait être indexée.

Ce que the status en réalité reports

Dans le rapport Indexation des pages de Search Console, « Bloquée par le fichier robots.txt » est un état exclu, ni erreur ni avertissement. Google indique que la page “was blocked by your site’s robots.txt file,” (traduction) a été bloquée par le fichier robots.txt de votre site, avec cette réserve : “does not guarantee that the page won’t be indexed through some other means.” (traduction) cela ne garantit pas que la page ne sera pas indexée par un autre moyen. Evidence for this claim Google reports Blocked by robots.txt when crawling is disallowed and warns that this does not guarantee the URL cannot be indexed by other means. Scope: Google Search Console report terminology and documented Search behavior; the label alone may not prove the underlying root cause. Confidence: high · Verified: Google: Page indexing report Cette réserve résume tout le sujet.

Concrètement, Googlebot connaît l’URL grâce à un lien, un sitemap ou son historique, rencontre une directive Disallow correspondante et s’arrête. Sans récupération, aucun contenu n’est disponible pour l’indexation : l’URL reste exclue. C’est le résultat attendu d’un blocage, et la plupart des URL de cette catégorie doivent y figurer.

Exploration n’est pas indexation — pourquoi a disallow doesn’t deindex

Google documents robots.txt as crawl-access contrôler, pas a reliable removal mechanism. Evidence for this claim Google says robots.txt manages crawler access and is not a mechanism for keeping a page out of Google. Scope: Google Search Console report terminology and documented Search behavior; the label alone may not prove the underlying root cause. Confidence: high · Verified: Google: robots.txt introduction

C’est le principe essentiel de cet état. robots.txt contrôle l’exploration. Google précise qu’il “is not a mechanism for keeping a web page out of Google.” (traduction) ne constitue pas un mécanisme permettant d’exclure une page Web de Google. Bloquer une URL empêche sa récupération ; cela ne la retire pas de l’index et ne la désindexe pas.

Comme je l’ai écrit dans mon article Ahrefs sur l’état connexe, “crawling and indexing are two different things.” (traduction) L’exploration et l’indexation sont deux opérations distinctes. Une page bloquée peut encore être indexée si d’autres pages pointent vers elle ; Google ne voit alors ni son contenu ni la balise noindex éventuelle. Cela conduit à l’erreur la plus fréquente de ce rapport.

« Bloquée par robots.txt » ou « Indexée malgré le blocage »

Ces deux états sont souvent confondus : ils ont la même cause, mais des résultats opposés.

Blocked by robots.txtIndexé, though blocked by robots.txt
Report bucketExcluded (non indexée)Warning (indexé)
Ce que happenedGoogle trouvé l’URL, didn’t explorer it, isn’t indexation itGoogle indexé l’URL despite pas exploration it
PourquoiDisallow worked, nothing forced indexationDisallow worked, but liens/signals indexé it anyway
Is it usually a problem?Aucun — typically intentionalDépend — souvent fine pour utility URLs

Si vous voyez l’avertissement — une URL bloquée néanmoins indexée et affichée sans description — il s’agit du cas « indexée malgré le blocage », traité séparément. Cet article porte sur l’exclusion simple : bloquée et non indexée.

Pour les URL utilitaires, une indexation malgré le blocage est souvent sans gravité. À propos d’URL WooCommerce ?add-to-cart=, John Mueller a expliqué qu’elles n’avaient pas besoin d’être indexées, qu’un blocage robots.txt convenait et qu’elles avaient peu de chances d’apparaître, sauf requête très précise qu’aucun utilisateur réel ne lance.

Le conflit noindex + disallow : la correction qui se retourne contre vous

Voici le piège : pour retirer une page, quelqu’un la place sous Disallow dans robots.txt et ajoute une balise meta noindex, par précaution. Cela échoue parce que les deux instructions se contredisent.

Google énonce directement la règle : “For the noindex rule to be effective, the page or resource must not be blocked by a robots.txt file, and it has to be otherwise accessible to the crawler.” (traduction) Pour que noindex soit effectif, la page ou ressource ne doit pas être bloquée par robots.txt et doit rester accessible au robot. Si elle est interdite, Google ne l’explore pas, ne voit jamais noindex et peut la laisser indexée. Comme je l’explique dans mon article sur l’état connexe, Google peut encore l’indexer à partir de liens tant qu’il ne peut pas lire la balise.

La séquence de désindexation est donc l’inverse du réflexe habituel :

  1. Autorisez l’exploration de l’URL en retirant Disallow.
  2. Servez noindex dans une balise meta robots ou un en-tête X-Robots-Tag, puis laissez Google réexplorer la page pour le voir.
  3. Une fois la page retirée, laissez-la explorable avec noindex. La rebloquer n’est pas une finition sûre : Google peut perdre de vue noindex, puis réindexer l’URL bloquée à partir de liens, exactement le résultat « indexée malgré le blocage » que vous vouliez éviter. Si le budget d’exploration pose réellement problème, utilisez l’authentification ou une suppression (404/410), pas un retour à robots.txt.

Pour un retrait urgent, l’outil Suppressions de Search Console, une protection par mot de passe ou la suppression de la page avec 404/410 sont plus rapides.

How to trouver qui rule is blocking l’URL

Three outils, chaque doing a différent job — don’t expect un to do the others’ fonctionner:

  • Inspection d’URL (GSC). Collez l’URL précise pour savoir rapidement si elle est actuellement bloquée.
  • Rapport robots.txt (GSC). Ce rapport de surveillance au niveau de la propriété de domaine — et non un testeur modifiable — affiche les fichiers trouvés pour les principaux hôtes, la dernière récupération, son état, les avertissements d’analyse et une action de réexploration après modification. Il ne teste pas chaque URL.
  • Validateur robots.txt ou analyseur open source de Google. Pour connaître la ligne qui s’applique à une URL, utilisez un validateur : la règle correspondante la plus longue et précise l’emporte, et Allow peut supplanter un Disallow plus général.
Evidence for this claim The current Search Console robots.txt report shows fetched files, history, fetch status, and parsing issues and can request a file recrawl; for a specific URL Google points to URL Inspection, a validator, or its open-source robots library rather than an editable legacy GSC tester. Scope: robots.txt diagnosis Confidence: high · Verified: Unblock a page blocked by robots.txt

Une fois la ligne fautive trouvée, la correction dépend de l’emplacement de robots.txt. Si vous contrôlez le fichier, retirez ou corrigez la règle en respectant la syntaxe. Sur Wix, Shopify, Squarespace ou une autre plateforme hébergée, suivez sa documentation : certaines gèrent le fichier pour vous.

My propre experiment: ce que se produit quand vous block une page vous wanted indexé

La question vraiment utile est l’effet d’un blocage accidentel sur une page destinée à se classer. Je l’ai testé directement : le 30 janvier 2023, j’ai bloqué avec robots.txt deux pages déjà classées — « Top Bing Searches » et « Top YouTube Searches » — puis suivi les résultats.

Les dommages étaient réels mais moindres que prévu. Quelques mots-clés ont perdu une ou deux positions, certains en ont gagné, mais toutes les featured snippets ont disparu pendant le blocage puis sont revenues après déblocage. Le résultat affichait « aucune information disponible pour cette page » à la place de la meta description et perdait les titres personnalisés. L’extrait étant moins attractif, les clics ont davantage baissé que les impressions : le CTR a subi l’essentiel du choc.

Mon résumé de l’époque : “We lost a position here or there and all of the featured snippets for the pages. I expected a lot more impact, but the world didn’t end.” (traduction) Nous avons perdu une position ici ou là et toutes les featured snippets ; j’attendais beaucoup plus d’impact, mais le monde ne s’est pas arrêté. Conclusion toujours valable : ne bloquez pas les pages à indexer. Cela fait mal, moins qu’on ne le pense, mais cela fait mal. Si la catégorie ne contient que des blocages voulus, tout va bien ; sinon, débloquez les pages importantes.

Limite de l’expérience : les deux pages étaient déjà classées et indexées. J’ai donc mesuré le passage d’une page indexée à l’état « indexée malgré le blocage », et non le sort d’une URL jamais indexée de cette catégorie d’exclusion. Débloquer une URL jamais indexée permet simplement à Google de l’explorer et de l’évaluer normalement ; elle ne possède aucun historique de featured snippet ou de CTR à perdre.

The decision tree

  • Blocage volontaire ? → Ne changez rien.
  • URL à indexer ? → Retirez ou assouplissez la règle robots.txt, puis demandez l’indexation.
  • URL à retirer de Google ? → N’utilisez pas Disallow. Autorisez l’exploration, servez noindex ou utilisez Suppressions/supprimez la page, puis laissez-la explorable.
  • URL bloquée néanmoins indexée ? → Traitez le cas connexe « indexée malgré le blocage ».
  • Contenu sensible ou privé ? → robots.txt n’est pas un contrôle d’accès ; utilisez une authentification ou un mot de passe.

Le principe exploration/indexation est universel : Bing respecte lui aussi robots.txt pour l’exploration, et le retrait d’une URL utilise l’outil Bloquer des URL ou noindex sur une page explorable, pas un simple Disallow.

Pour la syntaxe, les jokers, l’emplacement et les limites du fichier, consultez le guide robots.txt. Pour les décisions d’indexation en amont, consultez le hub Indexation.

Add an expert note

Pin an expert quote

New person? Create their unclaimed profile at /admin/experts/ → Pin a quote first.