Guide de robots.txt
Fonction réelle de robots.txt — contrôler l’exploration, pas l’indexation —, syntaxe exacte, traitement par Google et erreurs capables d’affecter un site entier.
Langues
1 indice probant sur cette page
- Outil en ligne associérobots.txt Tester
Robots.txt est un fichier texte placé à la racine de chaque hôte qui indique aux robots quelles URL ils peuvent demander. Il contrôle l’exploration, pas l’indexation : une URL interdite peut encore être indexée sans extrait. Pour retirer une page de l’index, utilisez noindex sans la bloquer dans robots.txt. Google ne prend en charge que user-agent, allow, disallow et sitemap ; la portée correspond à un hôte, un protocole et un port. La limite est de 500 KiB, le cache dure environ 24 h, les réponses 4xx signifient généralement aucune restriction et une 5xx peut interrompre l’exploration du site. Ne bloquez pas les CSS/JS nécessaires au rendu et n’utilisez jamais ce fichier public pour cacher des informations.
TL;DR — Robots.txt est un fichier texte placé à la racine du site qui indique aux robots quelles URL ils peuvent demander. L’erreur la plus fréquente consiste à oublier qu’il contrôle l’exploration, pas l’indexation. Bloquer une page ne la retire pas de Google : elle peut encore apparaître sans description. Pour la retirer, utilisez
noindexet ne la bloquez pas dans robots.txt, sinon Google ne verra jamais la consigne.
Qu’est-ce qu’un fichier robots.txt ?
Lorsqu’un moteur veut explorer votre site, il recherche d’abord https://yourdomain.com/robots.txt. Ce fichier texte énumère les parties que les robots peuvent ou non demander. Le robots.txt de n’importe quel site est public : ajoutez simplement /robots.txt au domaine.
Voici un fichier minimal :
Evidence for this claim Cloudflare Radar summarizes which AI user-agent names were observed in robots.txt files during the 28 days ending 2026-07-30. Scope: A dated Cloudflare Radar context chart describing observed robots.txt patterns; it is not a recommendation or a site-specific policy measurement. Confidence: high · Verified: Cloudflare Radar: AI user agents found in robots.txtThe chart summarizes which AI user-agent names Cloudflare observed in robots.txt files during the selected four-week period.
User-agent: *
Disallow: /admin/
Sitemap: https://yourdomain.com/sitemap.xmlIl indique : à tous les robots (*), ne demandez rien sous /admin/, et voici l’emplacement du sitemap.
Point essentiel : bloquer n’est pas retirer
C’est l’erreur la plus courante en SEO : robots.txt empêche l’exploration d’une page, pas son indexation. Evidence for this claim A robots.txt rule controls crawling rather than guaranteeing removal from Google Search; a URL can still appear when Google cannot crawl it. Scope: Google Search crawler behavior. Other crawlers can interpret robots.txt differently. Confidence: high · Verified: Google: Introduction to robots.txt
Ces notions diffèrent. Explorer consiste à récupérer et lire la page ; indexer consiste à la stocker et éventuellement l’afficher dans les résultats. Robots.txt ne bloque que la première étape.
Si une page est interdite, Google ne la récupère pas. Mais si d’autres pages pointent vers son URL, il peut tout de même indexer l’URL et l’afficher sans description, puisqu’il n’a pas été autorisé à lire le contenu.
Pour retirer une page de Google, robots.txt n’est pas le bon outil : utilisez noindex dans une balise meta ou un en-tête HTTP. Cette consigne n’agit que si Google peut explorer la page. Si vous bloquez la page tout en ajoutant noindex, Google ne voit jamais la consigne et l’URL peut rester indexée. Choisissez un seul objectif par URL : bloquer l’exploration ou l’indexation.
Le bon outil pour chaque objectif
- « Ne gaspillez pas d’exploration ici. » →
robots.txtDisallow. - « Retirez cette page de l’index Google. » →
noindex, sans blocage robots.txt. - « Personne ne doit pouvoir la consulter. » → authentification ou mot de passe. Robots.txt est public : y inscrire
/secret/révèle l’existence du dossier.
Quelques règles souvent mal comprises
- Un fichier par hôte.
https://example.com,https://www.example.comethttps://blog.example.comont chacun besoin de leur propre fichier. - À la racine. Le fichier doit se trouver exactement à
/robots.txt, en minuscules ; un fichier dans un sous-dossier n’a aucun effet. - Ne bloquez pas CSS et JavaScript. Google a besoin de ces ressources pour voir la page comme un visiteur.
Pour la syntaxe complète — jokers, règles Allow/Disallow, réponses 404 ou serveur, crawl-delay et robots d’IA — consultez l’onglet Advanced.
TL;DR — Robots.txt est un fichier texte à la racine de chaque hôte (
/robots.txt, en minuscules) qui applique le protocole d’exclusion des robots, RFC 9309. Il contrôle l’exploration, pas l’indexation : une URL interdite peut rester indexée sans extrait. Pour la désindexer, utiliseznoindexsans la bloquer. Google ne prend en charge queuser-agent,allow,disallowetsitemap;noindex,nofollowetcrawl-delayne sont pas pris en charge. La portée est un hôte, un protocole et un port. La règle au chemin le plus long gagne ; à égalité, la moins restrictive.*et$sont des jokers et les chemins sont sensibles à la casse. Google limite le fichier à 500 KiB, le met en cache environ 24 h, traite les 4xx hors 429 comme aucune restriction et, après une 5xx, suspend l’exploration environ 12 h puis reprend la dernière bonne copie pendant environ 30 jours. Ne bloquez pas les CSS/JS nécessaires au rendu et n’utilisez pas ce fichier public comme contrôle d’accès.
Définition et emplacement
Robots.txt applique le Robots Exclusion Protocol, créé par Martijn Koster en 1994 et normalisé en 2022 dans la RFC 9309, coécrite avec Gary Illyes, Henner Zeller et Lizzi Sassman. Le texte précise : “This document specifies and extends the ‘Robots Exclusion Protocol’ method originally defined by Martijn Koster in 1994 for service owners to control how content served by their services may be accessed, if at all, by automatic clients known as crawlers.” (traduction) « Ce document définit et étend la méthode du protocole d’exclusion des robots créée par Martijn Koster en 1994 afin que les propriétaires de services contrôlent l’accès de clients automatiques appelés robots à leurs contenus. »
Quelques faits qui surprennent souvent :
- Racine et minuscules obligatoires. La RFC 9309 dit : “The rules MUST be accessible in a file named ‘/robots.txt’ (all lowercase) in the top-level path of the service.” (traduction) « Les règles DOIVENT être accessibles dans un fichier nommé ‘/robots.txt’, entièrement en minuscules, au niveau supérieur du service. » Google rappelle que l’URL est sensible à la casse.
- Portée : un hôte, un protocole et un port. Google précise : “The rules listed in the robots.txt file apply only to the host, protocol, and port number where the robots.txt file is hosted.” (traduction) « Les règles ne s’appliquent qu’à l’hôte, au protocole et au port où le fichier est hébergé. »
https://example.com,https://www.example.com,https://blog.example.comethttp://example.comont donc chacun besoin de leur fichier. - Protocoles pris en charge par Google : HTTP, HTTPS et FTP.
L’erreur qui définit le sujet : exploration et indexation
Retenez ceci : robots.txt contrôle l’exploration, pas l’indexation. Interdire une URL ne la retire pas de Google. Evidence for this claim A robots.txt rule controls crawling rather than guaranteeing removal from Google Search; a URL can still appear when Google cannot crawl it. Scope: Google Search crawler behavior. Other crawlers can interpret robots.txt differently. Confidence: high · Verified: Google: Introduction to robots.txt
La documentation Google le dit clairement : robots.txt “is not a mechanism for keeping a web page out of Google. To keep a web page out of Google, block indexing with noindex or password-protect the page.” (traduction) « n’est pas un moyen de retirer une page de Google ; utilisez noindex ou protégez-la par mot de passe ». Et pour une URL bloquée : “While Google won’t crawl or index the content blocked by a robots.txt file, we might still find and index a disallowed URL if it is linked from other places on the web.” (traduction) « Google peut encore trouver et indexer une URL interdite si d’autres pages y renvoient ». Elle peut alors apparaître sans description.
La règle disallow reprend cette nuance : “Google can’t index the content of pages which are disallowed for crawling, but it may still index the URL and show it in search results without a snippet.” (traduction) « Google ne peut pas indexer le contenu interdit à l’exploration, mais peut indexer l’URL et l’afficher sans extrait. »
Pourquoi ne jamais bloquer une page à laquelle vous appliquez noindex
Un noindex n’agit que si Google peut explorer la page. Google précise : “For the noindex rule to be effective, the page or resource must not be blocked by a robots.txt file, and it has to be otherwise accessible to the crawler. If the page is blocked by a robots.txt file or the crawler can’t access the page, the crawler will never see the noindex rule, and the page can still appear in search results, for example if other pages link to it.” (traduction) « Pour être efficace, la page ne doit pas être bloquée par robots.txt et doit rester accessible ; sinon le robot ne voit jamais noindex et l’URL peut encore apparaître dans les résultats. » Evidence for this claim Google must be able to crawl a URL to see a noindex rule; blocking the URL in robots.txt can prevent the rule from being observed. Scope: Google Search indexing controls for HTML meta robots and X-Robots-Tag rules. Confidence: high · Verified: Google: Block indexing with noindex
Pour retirer une page de l’index, la règle mémorable de John Mueller est donc simple : ne bloquez pas Google dans robots.txt ; utilisez noindex.
La preuve en conditions réelles : j’ai bloqué deux de nos pages bien classées
Dans mon expérience sur deux pages Ahrefs bien classées, je les ai volontairement bloquées et j’ai suivi les résultats. Elles sont restées indexées et classées, mais ont perdu la fraîcheur apportée par les nouvelles explorations : “We lost a position here or there and all of the featured snippets for the pages.” (traduction) « Nous avons perdu une position ici ou là et tous les extraits optimisés de ces pages. » Le trafic a moins baissé que prévu : “Both pages lost some traffic. But it didn’t result in much change to our traffic estimate like I was expecting.” (traduction) « Les deux pages ont perdu un peu de trafic, sans modifier autant que prévu notre estimation. »
Ma conclusion : “Accidentally blocking pages (that Google already ranks) from being crawled using robots.txt probably isn’t going to have much impact on your rankings, and they will likely still show in the search results.” (traduction) « Bloquer accidentellement l’exploration de pages déjà classées aura probablement peu d’effet sur leur classement et elles resteront sans doute visibles. » En bref : “Don’t block pages you want indexed. It hurts. Not as bad as you might think it does—but it still hurts.” (traduction) « Ne bloquez pas les pages que vous voulez indexer. Cela nuit, moins qu’on ne le pense, mais cela nuit tout de même. »
Google Search Console peut afficher « Indexed, though blocked by robots.txt » pour des URL utilitaires. C’est souvent sans conséquence : elles ne seront guère montrées sans requête très spécifique. Ce signal n’est problématique que pour une page que vous vouliez réellement faire explorer et indexer.
La syntaxe de référence
Un robots.txt contient des groupes. Chaque groupe commence par une ou plusieurs lignes User-agent qui nomment les robots concernés, puis leurs règles.
User-agent: *
Disallow: /cart/
Disallow: /search
Allow: /search/help
User-agent: Googlebot
Disallow: /no-google/
Sitemap: https://example.com/sitemap.xmlUser-agent et groupes. Un robot obéit à exactement un groupe : celui dont le user-agent correspondant est le plus spécifique. Google explique : “Google’s crawlers determine the correct group of rules by finding in the robots.txt file the group with the most specific user agent that matches the crawler’s user agent. Other groups are ignored.” (traduction) « Les robots Google choisissent le groupe dont le user-agent est le plus spécifique ; les autres sont ignorés. » Et : “Only one group is valid for a particular crawler.” (traduction) « Un seul groupe est valide pour un robot donné. »
Un groupe spécifique n’hérite donc pas du groupe global User-agent: *. La spécification indique : “user agent specific groups and global groups (*) are not combined.” (traduction) « Les groupes propres à un user-agent et les groupes globaux ne sont pas combinés. » Un groupe User-agent: googlebot-news doit répéter chaque règle globale dont il a encore besoin depuis le groupe *.
Disallow et Allow. Disallow énumère les chemins à ne pas demander ; Allow crée des exceptions. La règle disallow “specifies paths that must not be accessed by the crawlers identified by the user-agent line the disallow rule is grouped with.” (traduction) « indique les chemins interdits aux robots du groupe ». La règle allow “specifies paths that may be accessed by the designated crawlers. When no path is specified, the rule is ignored.” (traduction) « indique les chemins autorisés ; sans chemin, elle est ignorée ».
Règle de correspondance. La règle au chemin le plus long, donc la plus spécifique, gagne. Google précise : “When matching robots.txt rules to URLs, crawlers use the most specific rule based on the length of the rule path. In case of conflicting rules, including those with wildcards, Google uses the least restrictive rule.” (traduction) « Les robots choisissent la règle au chemin le plus long et, en cas de conflit, la moins restrictive. » À égalité, Allow l’emporte sur Disallow. La RFC appelle cela “Longest Match” et indique : “The following example shows that in the case of two rules, the longest one is used for matching.” (traduction) « Avec deux règles, la plus longue sert à établir la correspondance. » Evidence for this claim Google resolves matching robots.txt rules by path specificity and uses the least restrictive rule when equally specific rules conflict. Scope: Google crawler interpretation of robots.txt rules; other crawlers may implement different extensions. Confidence: high · Verified: Google: Robots.txt interpretation
Exemple :
User-agent: *
Allow: /folder/page
Disallow: /folder/L’URL /folder/page correspond aux deux règles. Allow: /folder/page, plus longue, l’emporte sur Disallow: /folder/ : la page reste explorable.
Jokers * et $. Google : “* designates 0 or more instances of any valid character. $ designates the end of the URL.” (traduction) « * représente zéro caractère valide ou davantage ; $ marque la fin de l’URL. » Ainsi, Disallow: /*.pdf$ bloque les URL finissant par .pdf, et Disallow: /*? bloque celles qui contiennent une requête. La correspondance se fait par préfixe : Disallow: /fish vise /fish, /fish.html et /fish/salmon.html, mais pas /Fish ni /catfish.
Sensibilité à la casse. Les noms de champs et de user-agents sont insensibles à la casse, mais les chemins y sont sensibles. Google dit : “Both the user-agent field name and its value are case-insensitive,” (traduction) « le nom et la valeur de user-agent sont insensibles à la casse », tandis que “The field name (disallow) is case-insensitive, but its value is case-sensitive,” (traduction) « le nom disallow ne l’est pas, mais sa valeur l’est » et “The path value must start with / to designate the root and the value is case-sensitive.” (traduction) « le chemin doit commencer par / et respecte la casse ». Disallow: /Folder/ ne bloque donc pas /folder/.
Sitemap. La directive Sitemap: reçoit une URL absolue et ne dépend d’aucun groupe ; elle peut apparaître n’importe où.
Commentaires. Tout ce qui suit # est ignoré : “To include comments, precede your comment with the # character.” (traduction) « Pour ajouter un commentaire, faites-le précéder du caractère #. »
noindex, nofollow et crawl-delay ne sont PAS des directives robots.txt
Depuis le 1er septembre 2019, Google ne prend plus en charge les règles non documentées noindex, nofollow et crawl-delay. Les champs admis sont user-agent, allow, disallow et sitemap ; la spécification ajoute : “other fields such as crawl-delay aren’t supported.” (traduction) « les autres champs, tels que crawl-delay, ne sont pas pris en charge. »
Si vous utilisiez noindex dans robots.txt, choisissez plutôt une balise meta noindex ou un en-tête X-Robots-Tag, un statut 404/410, une protection par mot de passe, une règle Disallow ou l’outil de suppression de Search Console. N’utilisez pas 401/403 pour réguler l’exploration.
Traitement de robots.txt par Google
- Limite : 500 KiB. “Google enforces a robots.txt file size limit of 500 kibibytes (KiB). Content which is after the maximum file size is ignored.” (traduction) « Google limite robots.txt à 500 kibioctets et ignore le contenu au-delà. » La RFC concorde : “The parsing limit MUST be at least 500 kibibytes [KiB].” (traduction) « La limite d’analyse DOIT être d’au moins 500 kibioctets. »
- Cache : environ 24 heures. “Google generally caches the contents of robots.txt file for up to 24 hours, but may cache it longer in situations where refreshing the cached version isn’t possible.” (traduction) « Google met généralement le fichier en cache jusqu’à 24 heures, parfois davantage si son actualisation est impossible. » Evidence for this claim Google generally caches robots.txt for up to 24 hours and changes crawling behavior according to the HTTP status returned for the file. Scope: Google crawler handling of robots.txt fetches, including documented 4xx, 5xx, and redirect behavior. Confidence: high · Verified: Google: Robots.txt file handling
- Les statuts ont un effet sur tout l’hôte.
- 4xx (hors 429) → aucune restriction. “Google’s crawlers treat all 4xx errors, except 429, as if a valid robots.txt file didn’t exist. This means that Google assumes that there are no crawl restrictions.” (traduction) « Google traite ces erreurs comme l’absence de fichier valide et suppose qu’il n’existe aucune restriction. » Une 404 sur
/robots.txtautorise donc tout ; n’utilisez pas 401/403 pour ralentir l’exploration. - 5xx ou indisponibilité → danger. “For the first 12 hours, Google stops crawling the site but keeps trying to fetch the robots.txt file. If Google can’t fetch a new version, for the next 30 days Google will use the last good version, while still trying to fetch a new version.” (traduction) « Pendant 12 heures, Google arrête l’exploration puis utilise la dernière bonne version jusqu’à 30 jours. » Une erreur sur
/robots.txtpeut donc bloquer tout l’hôte ; après 30 jours, si le site reste accessible, Google agit comme s’il n’existait aucun fichier. - 3xx → Google suit au moins cinq sauts, puis traite la réponse comme une 404.
- 4xx (hors 429) → aucune restriction. “Google’s crawlers treat all 4xx errors, except 429, as if a valid robots.txt file didn’t exist. This means that Google assumes that there are no crawl restrictions.” (traduction) « Google traite ces erreurs comme l’absence de fichier valide et suppose qu’il n’existe aucune restriction. » Une 404 sur
robots.txt dans Bing, Yandex et les autres moteurs
La syntaxe est largement commune, mais deux différences comptent :
- crawl-delay. Google l’ignore, Bing le respecte encore et Yandex l’a abandonné en 2018. Yandex indique : “From February 22, 2018, Yandex doesn’t take into account the Crawl-delay directive,” (traduction) « Depuis le 22 février 2018, Yandex ne prend plus en compte crawl-delay », et renvoie au réglage de fréquence de Yandex Webmaster. Bing précise que le fichier est le seul emplacement valide pour MSNBot et accepte des nombres entiers positifs comme frein relatif.
- Piège du groupe bingbot. Comme pour la règle Google “only one group per crawler” (traduction) « un seul groupe par robot », un groupe
User-agent: bingbotremplace les règles deUser-agent: *; répétez-y toutes les directives nécessaires. - Cache et échecs chez Amazon. Amazon peut utiliser une copie vieille de 30 jours. Si le fichier est inaccessible, ses robots agissent comme s’il n’existait pas. Un outil ne peut prouver quelle copie Amazon a réellement utilisée. Evidence for this claim Amazon says its crawlers may use a robots.txt copy cached within the previous 30 days and behave as though the file does not exist when they cannot fetch it. Scope: Amazon crawler behavior only; a checker result cannot establish which cached copy Amazon used or whether Amazon observed the same fetch failure. Confidence: high · Verified: Amazon: Amazonbot
Gérer les robots d’IA avec robots.txt
Robots.txt est aujourd’hui le principal levier pour ces robots, avec la même syntaxe de groupes. Chaque agent est toutefois indépendant : en bloquer un ne bloque pas les autres.
- OpenAI utilise plusieurs robots distincts.
GPTBotsert à l’entraînement ;OAI-SearchBotalimente les fonctions de recherche de ChatGPT ;OAI-AdsBotvérifie la sécurité des pages publicitaires sans entraîner les modèles. Pour bloquer l’entraînement, utilisezUser-agent: GPTBotavecDisallow: /; cette règle ne bloque pas les autres agents.ChatGPT-Usercorrespond aux actions déclenchées par une personne et OpenAI avertit qu’unDisallowpeut rester sans effet : “robots.txt rules may not apply” (traduction) « les règles robots.txt peuvent ne pas s’appliquer ». Une modification concernantOAI-SearchBotpeut demander environ 24 heures. - Google-Extended contrôle l’entraînement Gemini/Vertex indépendamment de Googlebot.
- Autres agents :
CCBot,ClaudeBot,PerplexityBotetBytespider.
La conformité reste volontaire. Robots.txt formule une demande, sans l’imposer. Pour réellement tenir un robot à l’écart, utilisez l’authentification ou un blocage technique.
Erreurs fréquentes et correctifs
Le fichier répond en 200 mais n’est pas exploitable. Le statut ne suffit pas : vérifiez Content-Type et les premiers octets. Une page d’erreur HTML à /robots.txt peut répondre en 200. Google attend du texte UTF-8 et peut ignorer les caractères invalides. Un BOM UTF-8 initial est toléré, mais un second BOM, un BOM interne, des octets UTF-16, des NUL ou des caractères invisibles peuvent casser une ligne. Signalez l’octet et la ligne concernés sans normaliser silencieusement. Appliquez la limite d’analyse de 500 KiB avant d’évaluer les règles, tout en signalant la partie ignorée.
- Bloquer une page à désindexer. Blocage plus noindex empêche Google de voir noindex ; laissez-la explorable.
- Utiliser robots.txt pour désindexer. Employez noindex.
- Bloquer les CSS/JS nécessaires au rendu. Google doit explorer les fichiers
.csset.js. - Tenter de cacher des données sensibles. La RFC avertit : “The Robots Exclusion Protocol is not a substitute for valid content security measures. Listing paths in the robots.txt file exposes them publicly and thus makes the paths discoverable.” (traduction) « Le protocole ne remplace pas des mesures de sécurité ; les chemins énumérés deviennent publics et découvrables. » N’annoncez pas
/secret-admin/; utilisez l’authentification. - Laisser un
Disallow: /accidentel. Il bloque tout le site pour le robot concerné. - Ignorer le statut de
/robots.txt. Une 5xx peut suspendre l’exploration de tout l’hôte.
Pour replacer ce fichier dans l’ensemble du parcours — découverte, planification de l’exploration, rendu et indexation — consultez le guide de l’exploration et les articles voisins sur le budget d’exploration et les sitemaps.
Résumé par l’IA
Version condensée de l’onglet Advanced :
- Robots.txt est un fichier texte à la racine de chaque hôte, à l’adresse
/robots.txten minuscules, qui applique la RFC 9309. - Il contrôle l’exploration, pas l’indexation. Une URL interdite peut encore apparaître sans description. Pour la retirer, utilisez
noindexsans la bloquer. - Mon expérience l’a confirmé : deux pages bloquées sont restées indexées et classées, mais ont perdu des extraits optimisés. “Don’t block pages you want indexed. It hurts.” (traduction) « Ne bloquez pas les pages que vous voulez indexer : cela nuit. »
- Bon outil : robots.txt pour l’exploration ;
noindexpour l’index ; authentification pour la confidentialité. - Champs Google :
user-agent,allow,disallow,sitemap. Pasnoindex,nofollownicrawl-delay. - Portée : un hôte, un protocole, un port.
- Correspondance : chemin le plus long ; à égalité, règle la moins restrictive. Jokers
*et$; chemins sensibles à la casse ; un groupe spécifique n’hérite pas du groupe*. - Google : 500 KiB, cache d’environ 24 h, 4xx hors 429 sans restriction, 5xx avec arrêt d’environ 12 h puis dernière bonne copie jusqu’à 30 jours ; les 3xx sont suivies puis traitées comme une 404 après la limite.
- Autres moteurs : Bing respecte
crawl-delay; Yandex l’a abandonné en 2018. Un groupebingbotremplace les règles du groupe*. - Robots d’IA : GPTBot, OAI-SearchBot, OAI-AdsBot,
ChatGPT-User, Google-Extended, CCBot, ClaudeBot, PerplexityBot et Bytespider ont des contrôles distincts. La conformité est volontaire. - À éviter : bloquer CSS/JS, révéler des chemins sensibles ou laisser un
Disallow: /.
Documentation officielle
Documentation de première main des moteurs et du standard.
- Introduction à robots.txt — présentation et distinction exploration-indexation.
- Créer et envoyer un fichier robots.txt / interprétation par Google — référence complète : champs, groupes, correspondance, jokers, taille, cache et statuts.
- Bloquer l’indexation avec noindex — pourquoi une page
noindexne doit pas être bloquée. - Note sur les règles non prises en charge — fin de
noindex,nofollowetcrawl-delayau 1er septembre 2019.
Le standard
- RFC 9309 — Robots Exclusion Protocol — standard IETF de septembre 2022 : emplacement
/robots.txt, chemin le plus long, limite de 500 KiB et sécurité.
Bing / Microsoft
- Recommandations Bingbot — valeurs
crawl-delayde 1 à 20 secondes. - Créer un fichier robots.txt — recommandations et outil de test Bing.
Citations tirées des sources
Déclarations publiques de Google, Bing et de la RFC. Chaque lien mène au passage cité.
Google — exploration, pas indexation
- “This is used mainly to avoid overloading your site with requests; it is not a mechanism for keeping a web page out of Google. To keep a web page out of Google, block indexing with
noindexor password-protect the page.” (traduction) « Ce mécanisme sert surtout à éviter de surcharger le site ; il ne retire pas une page de Google. Utilisez noindex ou un mot de passe. » — Google Search Central. Accéder à la citation - “While Google won’t crawl or index the content blocked by a robots.txt file, we might still find and index a disallowed URL if it is linked from other places on the web.” (traduction) « Google peut encore trouver et indexer une URL interdite si d’autres pages y renvoient. » Accéder à la citation
- “If your web page is blocked with a robots.txt file, its URL can still appear in search results, but the search result won’t have a description.” (traduction) « Si une page est bloquée, son URL peut encore apparaître dans les résultats, mais sans description. » Accéder à la citation
Google — une page noindex doit rester explorable
- “For the
noindexrule to be effective, the page or resource must not be blocked by a robots.txt file, and it has to be otherwise accessible to the crawler. If the page is blocked by a robots.txt file or the crawler can’t access the page, the crawler will never see thenoindexrule, and the page can still appear in search results, for example if other pages link to it.” (traduction) « Pour que noindex soit efficace, la page ne doit pas être bloquée par robots.txt et doit rester accessible ; sinon le robot ne voit jamais la règle et l’URL peut encore apparaître. » — Google Search Central. Accéder à la citation
Google — emplacement, portée et spécification
- “The rules listed in the robots.txt file apply only to the host, protocol, and port number where the robots.txt file is hosted.” (traduction) « Les règles ne s’appliquent qu’à l’hôte, au protocole et au port où le fichier est hébergé. » Accéder à la citation
- “Google can’t index the content of pages which are disallowed for crawling, but it may still index the URL and show it in search results without a snippet.” (traduction) « Google ne peut indexer le contenu interdit à l’exploration, mais peut indexer l’URL et l’afficher sans extrait. » Accéder à la citation
- “When matching robots.txt rules to URLs, crawlers use the most specific rule based on the length of the rule path. In case of conflicting rules, including those with wildcards, Google uses the least restrictive rule.” (traduction) « Pour faire correspondre une URL, les robots retiennent le chemin le plus précis ; en cas de conflit, Google choisit la règle la moins contraignante. » Accéder à la citation
- “
*designates 0 or more instances of any valid character.$designates the end of the URL.” (traduction) « L’astérisque correspond à zéro caractère valide ou plus, tandis que le signe dollar ancre la fin de l’URL. » Accéder à la citation - “The field name (
disallow) is case-insensitive, but its value is case-sensitive.” (traduction) « Le nom du champ disallow est insensible à la casse, mais sa valeur y est sensible. » Accéder à la citation
Google — taille, cache et codes d’état
- “Google enforces a robots.txt file size limit of 500 kibibytes (KiB). Content which is after the maximum file size is ignored.” (traduction) « Google limite robots.txt à 500 KiB et ignore le contenu au-delà. » Accéder à la citation
- “Google generally caches the contents of robots.txt file for up to 24 hours, but may cache it longer in situations where refreshing the cached version isn’t possible.” (traduction) « Google met généralement le fichier en cache jusqu’à 24 heures, parfois davantage si l’actualisation est impossible. » Accéder à la citation
- “Google’s crawlers treat all 4xx errors, except 429, as if a valid robots.txt file didn’t exist. This means that Google assumes that there are no crawl restrictions.” (traduction) « Google traite les 4xx hors 429 comme l’absence de fichier valide et suppose qu’il n’existe aucune restriction. » Accéder à la citation
- “For the first 12 hours, Google stops crawling the site but keeps trying to fetch the robots.txt file. If Google can’t fetch a new version, for the next 30 days Google will use the last good version, while still trying to fetch a new version.” (traduction) « Pendant 12 heures, Google arrête l’exploration puis utilise la dernière bonne version pendant 30 jours. » Accéder à la citation
- “If the errors are still not fixed after 30 days: If the site is generally available to Google, Google will behave as if there is no robots.txt file (but still keep checking for a new version).” (traduction) « Après 30 jours, si le site reste accessible, Google agit comme s’il n’existait aucun robots.txt tout en continuant ses vérifications. » Accéder à la citation
- “User agent specific groups and global groups (
*) are not combined.” (traduction) « Les groupes propres à un user-agent et les groupes globaux ne sont pas combinés. » Accéder à la citation
RFC 9309 — le standard
- “This document specifies and extends the ‘Robots Exclusion Protocol’ method originally defined by Martijn Koster in 1994 for service owners to control how content served by their services may be accessed, if at all, by automatic clients known as crawlers.” (traduction) « Ce document définit et étend le protocole créé en 1994 afin que les propriétaires contrôlent l’accès des robots à leurs contenus. » — RFC 9309. Accéder à la citation
- “The rules MUST be accessible in a file named ‘/robots.txt’ (all lowercase) in the top-level path of the service.” (traduction) « Les règles DOIVENT être accessibles dans /robots.txt, en minuscules, au niveau supérieur du service. » Accéder à la citation
- “The Robots Exclusion Protocol is not a substitute for valid content security measures. Listing paths in the robots.txt file exposes them publicly and thus makes the paths discoverable.” (traduction) « Ce protocole ne tient pas lieu de protection du contenu : inscrire des chemins dans robots.txt les publie et permet de les découvrir. » Accéder à la citation
Bing — crawl-delay
- Les recommandations Bingbot documentent une plage
crawl-delayde 1 à 20 secondes. Cette règle est propre à Bing et n’est pas traitée par Google.
Patrick Stox — expérience de blocage (mon expérience Ahrefs, relue par Joshua Hardwick)
- “We lost a position here or there and all of the featured snippets for the pages.” (traduction) « Nous avons perdu une position ici ou là et tous les extraits optimisés de ces pages. » Accéder à la citation
- “Both pages lost some traffic. But it didn’t result in much change to our traffic estimate like I was expecting.” (traduction) « Le trafic des deux pages a reculé, mais l’estimation globale a beaucoup moins changé que je ne l’anticipais. » Accéder à la citation
- “Don’t block pages you want indexed. It hurts. Not as bad as you might think it does—but it still hurts.” (traduction) « N’interdisez pas l’exploration des pages à indexer : l’effet est moins grave qu’on pourrait le croire, mais reste négatif. » Accéder à la citation
Robots.txt — aide-mémoire de syntaxe
Directives prises en charge par Google
| Directive | Effet | Exemple |
|---|---|---|
User-agent: | Commence un groupe et nomme les robots concernés. | User-agent: Googlebot |
Disallow: | Chemins que le robot ne doit pas demander. | Disallow: /cart/ |
Allow: | Crée une exception à Disallow. | Allow: /cart/help |
Sitemap: | URL absolue d’un sitemap, indépendante des groupes. | Sitemap: https://x.com/sitemap.xml |
Caractères spéciaux
| Jeton | Signification |
|---|---|
* | Dans un chemin : zéro caractère ou davantage ; comme user-agent : tous les robots. |
$ | Marque la fin de l’URL. Disallow: /*.pdf$ bloque les URL finissant par .pdf. |
# | Commentaire : le reste de la ligne est ignoré. |
/ | Les chemins commencent par / ; Disallow: / bloque tout le site. |
Règles de correspondance
- La règle au chemin le plus long gagne.
- À égalité, la moins restrictive :
Allowl’emporte surDisallow. - Les chemins sont sensibles à la casse (
/Folder/≠/folder/) ; les noms de champs et de User-agent ne le sont pas. - Un robot obéit à un seul groupe, celui dont le user-agent correspond le plus précisément.
Non pris en charge par Google depuis le 1er septembre 2019 : noindex, nofollow et crawl-delay. Bing respecte encore crawl-delay comme frein relatif ; Yandex l’a abandonné le 22 février 2018.
Fonctionnement interne de Google
- Taille : 500 KiB ; cache : environ 24 h.
- 4xx hors 429 → aucune restriction. 5xx → arrêt d’environ 12 h, dernière bonne copie pendant environ 30 jours, puis aucune restriction si l’erreur persiste. 3xx → au moins cinq sauts puis 404.
- Un groupe
User-agentspécifique n’est jamais fusionné avec le groupe*.
Common recipes
# Block a folder for everyone
User-agent: *
Disallow: /admin/
# Block all PDFs
User-agent: *
Disallow: /*.pdf$
# Block AI training crawler (won't stop search bots)
User-agent: GPTBot
Disallow: /
# Point to the sitemap
Sitemap: https://example.com/sitemap.xml Liste de contrôle pour auditer robots.txt
- Le fichier existe exactement à
https://yourdomain.com/robots.txtet répond en200. - Chaque hôte et protocole possède son propre fichier (
www, non-www, sous-domaines,httpethttps). - Aucun
Disallow: /accidentel ne bloque tout le site. - Aucune page destinée à recevoir
noindexn’est bloquée. - Robots.txt n’est pas utilisé pour désindexer avec
noindexau mauvais endroit. - Les CSS/JS indispensables au rendu restent explorables.
- Aucune ligne
noindex,nofollowoucrawl-delaydestinée à Google. - Aucun chemin sensible n’est révélé ; utilisez l’authentification.
- Les jokers (
*,$) et la casse ont été testés sur de vraies URL. - Chaque groupe propre à un robot, par exemple
User-agent: bingbot, répète les règles globales*encore nécessaires. - Une directive
Sitemap:contient une URL absolue. - Le fichier fait moins de 500 KiB.
- Le rapport robots.txt de Search Console a été vérifié et les URL « Indexed, though blocked » ont été examinées.
Modèles mentaux
1. Contrôle de l’exploration, pas de l’index. Robots.txt détermine si un robot peut récupérer une URL, non si elle sera indexée. Bloquer une URL ne la retire pas de Google.
2. La règle la plus spécifique gagne ; la moins restrictive tranche les égalités. Le chemin le plus long gagne et, à égalité, Allow l’emporte sur Disallow.
3. Blocage ou noindex.
- Retirer de l’index →
noindexsans blocage robots.txt. - Économiser l’exploration sans se soucier de l’affichage éventuel de l’URL →
Disallow. - Rendre privé → authentification.
Ne bloquez jamais une URL tout en lui appliquant noindex : la page peut rester dans l’index.
4. La disponibilité du fichier est critique. Une 4xx signifie « aucune restriction », tandis qu’une 5xx peut arrêter l’exploration de tout l’hôte pendant environ 12 heures. Traitez /robots.txt comme tout autre point de terminaison critique et surveillez directement /robots.txt.
Récupérer et auditer robots.txt sur plusieurs hôtes
La portée étant définie par hôte, protocole et port, une variante s’oublie facilement. Ce script interroge chaque variante et signale les erreurs ou 404.
macOS / Linux
for url in "https://example.com/robots.txt" "https://www.example.com/robots.txt" "http://example.com/robots.txt"; do
code=$(curl -s -o /dev/null -w "%{http_code}" "$url")
echo "$code $url"
doneWindows (PowerShell)
$urls = "https://example.com/robots.txt","https://www.example.com/robots.txt","http://example.com/robots.txt"
foreach ($u in $urls) {
$r = Invoke-WebRequest -Uri $u -UseBasicParsing -SkipHttpErrorCheck
Write-Host "$($r.StatusCode) $u"
}Une réponse 200 sur chaque ligne est souhaitable. Une 4xx signifie que Google considère la variante sans restriction ; une 5xx peut interrompre son exploration.
Expression régulière pour extraire les chemins Disallow et Allow
Utile pour comparer un robots.txt avant et après modification, ou vérifier une liste d’URL.
import re
robots_txt = open("robots.txt").read()
# Captures the directive (Disallow/Allow) and its path value
pattern = re.compile(r'^(Disallow|Allow):\s*(\S*)', re.IGNORECASE | re.MULTILINE)
for directive, path in pattern.findall(robots_txt):
print(f"{directive}: {path or '(empty — matches nothing)'}")(Disallow|Allow)— capture la directive.\s*(\S*)— capture le chemin, y compris unDisallow:vide.re.IGNORECASE— les noms de champs ignorent la casse, contrairement aux chemins.
Extrait pour la console Chrome DevTools
Collez-le dans Console pour récupérer et afficher le robots.txt de l’hôte sans quitter l’onglet :
fetch(new URL('/robots.txt', location.origin))
.then(r => r.text())
.then(t => console.log(t))
.catch(e => console.error('No robots.txt or fetch blocked:', e));Bookmarklet : ouvrir le robots.txt du site courant
Enregistrez le code suivant comme URL d’un favori, puis cliquez dessus depuis n’importe quelle page :
javascript:(function(){var u=new URL('/robots.txt',location.origin).href;location.href=u;})(); Outils pour tester et valider robots.txt
- Google Search Console — rapport robots.txt : fichier récupéré par Google, statut et erreurs d’analyse.
- Inspection d’URL GSC : vérifie si une URL précise est bloquée et comment Google la voit.
- GSC « Indexed, though blocked by robots.txt » : révèle les URL indexées malgré le blocage.
- Bing Webmaster Tools — testeur robots.txt : équivalent Bing pour bingbot.
- Ahrefs Site Audit / Screaming Frog SEO Spider : repèrent les URL bloquées et les règles trop larges.
- Tout navigateur : ouvrez
yourdomain.com/robots.txtet lisez le fichier public.
Incident : vous avez déployé Disallow: / en production
C’est le reste classique d’un environnement de préproduction : User-agent: * / Disallow: / bloque tout le site. Voici l’ordre de rétablissement.
Étape 1 — mesurer l’étendue. Récupérez immédiatement https://yourdomain.com/robots.txt dans un navigateur ou avec curl -I. Si un Disallow: / apparaît sous User-agent: * sans directive Allow: plus précise, tous les robots conformes sont bloqués.
Étape 2 — corriger et vérifier le déploiement. Remplacez la règle par le fichier prévu, ou au minimum User-agent: * / Allow: /. Récupérez ensuite la réponse réelle. Si elle montre encore Disallow: /, purgez le cache CDN de ce chemin.
Étape 3 — déterminer la durée du blocage. Google peut conserver robots.txt environ 24 heures. Consultez le rapport robots.txt de Search Console pour connaître la dernière récupération. Il n’existe pas de commande manuelle de nouvelle récupération ; attendez ou utilisez Inspection d’URL sur les pages prioritaires une fois la correction confirmée.
Étape 4 — rechercher les dégâts.
- Quelques heures produisent généralement peu d’effet visible.
- Après plusieurs jours ou semaines, recherchez une hausse de « Blocked by robots.txt » dans Search Console. Mon expérience a montré que les pages restaient indexées et classées, mais perdaient fraîcheur et extraits optimisés.
- Une baisse des impressions ou positions pendant la période confirme un impact réel.
Étape 5 — vérifier le correctif. Testez les chemins importants avec Robots.txt Tester. Si l’un reste bloqué, revenez à l’étape 2.
Erreurs concrètes à éviter
Bloquer dans robots.txt une page à laquelle vous appliquez noindex. Un noindex ne fonctionne que si le robot peut lire la page. Laissez-la explorable et placez noindex dans une balise meta ou un en-tête X-Robots-Tag ; sinon le noindex reste invisible.
Utiliser robots.txt pour désindexer. Robots.txt contrôle l’exploration, non l’indexation. Google précise qu’il “is not a mechanism for keeping a web page out of Google.” (traduction) « n’est pas un moyen de retirer une page de Google ». Utilisez noindex sans bloquer la page.
Bloquer les CSS ou JavaScript indispensables au rendu. Google utilise un navigateur réel. Laissez /assets/, /static/ et les autres répertoires de ressources explorables ; l’exemple Google réautorise explicitement les fichiers CSS et JavaScript.
Énumérer des chemins sensibles pour les « cacher ». Le fichier est public : une règle comme Disallow: /admin-panel/ annonce ce dossier. La RFC dit qu’il “is not a substitute for valid content security measures.” (traduction) « ne remplace pas des mesures de sécurité valides ». Utilisez l’authentification.
Confondre les chemins avec ou sans barre finale. Disallow: /folder bloque /folder, /folder/, /folder-name/ et /folder.html. Utilisez Disallow: /folder/ si vous ne visez que le dossier, puis testez de vraies URL.
Supposer que les règles ignorent la casse. Les noms de champs l’ignorent, mais les chemins la respectent : Disallow: /Folder/ ne bloque pas /folder/.
Problèmes courants
« J’ai bloqué cette page, mais elle apparaît encore dans Google »
- Symptôme : l’URL apparaît encore, souvent sans description.
- Cause probable : des liens ont permis à Google d’indexer l’URL sans explorer le contenu.
- Correctif : ajoutez
noindexet retirez le blocage robots.txt, puis vérifiez avec Inspection d’URL après une nouvelle exploration.
« Search Console indique “Indexed, though blocked by robots.txt” »
- Symptôme : ce statut apparaît dans le rapport Pages.
- Cause probable : URL utilitaires liées quelque part et indexées sans contenu.
- Correctif : ignorez les URL sans valeur ; pour une page importante, rendez-la explorable et appliquez noindex.
« J’ai modifié robots.txt, mais le changement ne paraît pas en ligne »
- Symptôme : Google ou un outil lit encore les anciennes règles.
- Cause probable : cache Google d’environ 24 heures ou copie périmée du CDN.
- Correctif : récupérez directement
yourdomain.com/robots.txtou utilisez Robots.txt Tester. Si la copie en ligne est correcte, attendez le renouvellement du cache Google.
« Le testeur autorise le chemin, mais Google ne l’explore pas »
- Symptôme : aucune exploration récente malgré l’autorisation.
- Cause probable : autoriser n’oblige pas Google à explorer ; la page peut être orpheline, absente du sitemap ou peu prioritaire.
- Correctif : vérifiez les liens internes et le sitemap plutôt que robots.txt.
« Ma règle Disallow ne correspond pas aux URL prévues »
- Symptôme : la règle bloque trop ou trop peu.
- Cause probable : casse du chemin (
/Folder/≠/folder/) ou correspondance par préfixe (Disallow: /foldervise aussi/folder-name/). - Correctif : vérifiez la casse, ajoutez une barre finale si vous visez un dossier, puis testez les chemins exacts dans Robots.txt Tester.
« Bing a cessé de suivre mes règles globales après l’ajout d’un groupe bingbot »
- Symptôme : les règles de
User-agent: *semblent ignorées après l’ajout deUser-agent: bingbot; le groupe global n’est plus appliqué. - Cause probable : Bing n’applique que le groupe
bingbotle plus spécifique et ignore les valeurs de*. - Correctif : répétez dans le groupe
bingbottoutes les directives nécessaires ; il doit être autonome.
Tests de validation
Exécutez ces tests après toute modification, avant de considérer le changement terminé.
Test 1 : le fichier en ligne est correct
- Test :
curl -I https://yourdomain.com/robots.txt, ouverture dans le navigateur et Robots.txt Tester. - Résultat attendu :
HTTP/1.1 200et règles prévues. - Échec : statut différent de 200 ou copie périmée du cache/CDN.
- Fenêtre : statut immédiat ; jusqu’à 24 heures pour Google.
- Retour arrière : fichier soudainement introuvable, erreur serveur ou règles inattendues.
Test 2 : le chemin modifié se comporte comme prévu
- Test : collez l’URL exacte dans Robots.txt Tester pour Googlebot et, si nécessaire, Bingbot.
- Résultat attendu : « allowed » ou « blocked » conformément à l’intention.
- Échec : une règle
AllowouDisallowplus longue et plus spécifique l’emporte probablement. - Fenêtre : immédiate.
- Retour arrière : verdict incorrect malgré un fichier en ligne conforme.
Test 3 : une page débloquée est réellement explorée
- Test : Inspection d’URL dans Search Console, champs « Crawl allowed? » et dernière exploration.
- Résultat attendu : « Crawl allowed: Yes » et une date postérieure à la modification.
- Échec : cache Google ou autre règle ; l’absence immédiate de nouvelle exploration n’est pas une preuve d’échec.
- Fenêtre : 2 à 4 semaines, parfois davantage.
- Retour arrière : retour inexpliqué à « No ».
Test 4 : aucune autre URL n’a été bloquée accidentellement
- Test : lancez Ahrefs Site Audit ou Screaming Frog et comparez les listes d’URL bloquées avant et après.
- Résultat attendu : seules les URL prévues changent de liste.
- Échec : joker ou préfixe trop large.
- Fenêtre : immédiate.
- Retour arrière : toute page générant du trafic organique devient bloquée.
Prompts prêts à copier
Ajoutez votre contenu robots.txt réel et, pour le second prompt, les URL concernées.
Auditer un fichier robots.txt pour repérer les conflits et règles risquées
I'm going to paste a robots.txt file. Read it as a technical SEO would and
flag:
1. Any Disallow rule that conflicts with an Allow rule on the same or an
overlapping path (tell me which one wins under longest-match rules).
2. Any bare "Disallow: /" under a User-agent group — that blocks everything
for that crawler.
3. Any rule that would block commonly render-critical paths (CSS, JS, fonts,
images used for layout).
4. Any use of noindex, nofollow, or crawl-delay under a Google-facing
User-agent — these are not supported by Google.
5. Anything that looks like it's trying to hide a sensitive path (remember
this file is public).
Here is the file:
<paste robots.txt content>Vérifier si des URL précises sont explorables et indexables en toute sécurité
I want the following URLs to be crawlable AND indexable by Google. Given this
robots.txt file, tell me for each URL whether it would be blocked from
crawling, and separately remind me that robots.txt says nothing about
indexing — a URL can be blocked from crawling but still indexed if it's
linked elsewhere, and a URL can be crawlable but still noindexed via a meta
tag or header this file can't show you.
Robots.txt:
<paste robots.txt content>
URLs:
<paste list of URLs> Ressources à consulter
Mes articles
- J’ai bloqué deux pages bien classées avec robots.txt : voici le résultat — mon expérience montrant que blocage et désindexation diffèrent.
- Guide du SEO technique pour débutants — place de robots.txt dans l’exploration et l’indexation.
- Stratégies SEO pour l’entreprise — gestion à grande échelle.
Mes présentations
- Fonctionnement de la recherche — mon parcours découverte → exploration → rendu → indexation. Avertissement permanent : “This is my understanding of systems… not going to be 100% complete or accurate.” (traduction) « Il s’agit de ma compréhension des systèmes, qui ne sera pas complète ni exacte à 100 %. »
Autres sources
- Robots.txt et SEO : tout ce qu’il faut savoir — guide Ahrefs de Joshua Hardwick.
- Pour désindexer, utilisez noindex et non robots.txt — synthèse des conseils de John Mueller.
- Pourquoi les URL bloquées peuvent encore être indexées — exemple des URL utilitaires.
- Conseil Bing : répétez toutes les directives dans un groupe Bingbot — piège du groupe spécifique.
- Présentation des robots OpenAI — agents et exemples robots.txt officiels.
- r/TechSEO — communauté dédiée aux diagnostics exploration-indexation.
Testez vos connaissances : Robots.txt
Cinq questions rapides sur ce que robots.txt contrôle, et ne contrôle pas. Choisissez une réponse puis vérifiez.
Journal des modifications
Mis à jour le 21 août 2026.
Résumé éditorial et détails enregistrés des changements.Détails des changements
-
Les notes détaillées des changements sont actuellement disponibles en anglais.
Comparaison complète indisponible — aucun instantané antérieur n’a été archivé pour cette révision.
Mis à jour le 30 juil. 2026.
Résumé éditorial et détails enregistrés des changements.Détails des changements
-
Les notes détaillées des changements sont actuellement disponibles en anglais.
Comparaison complète indisponible — aucun instantané antérieur n’a été archivé pour cette révision.
Mis à jour le 19 juil. 2026.
Résumé éditorial et détails enregistrés des changements.Détails des changements
-
Les notes détaillées des changements sont actuellement disponibles en anglais.
Comparaison complète indisponible — aucun instantané antérieur n’a été archivé pour cette révision.
Mis à jour le 18 juil. 2026.
Résumé éditorial et détails enregistrés des changements.Détails des changements
-
Les notes détaillées des changements sont actuellement disponibles en anglais.
-
Les notes détaillées des changements sont actuellement disponibles en anglais.
-
Les notes détaillées des changements sont actuellement disponibles en anglais.
-
Les notes détaillées des changements sont actuellement disponibles en anglais.
-
Les notes détaillées des changements sont actuellement disponibles en anglais.
Comparaison complète indisponible — aucun instantané antérieur n’a été archivé pour cette révision.
Who's been ignoring my robots.txt?
This is live data from this site, not an illustration. My robots.txt
disallows /api/trap/, and the only link to it is invisible to
humans — so a compliant crawler will never request it. Every user-agent
below fetched it anyway. (Humans poking at it with curl show
up too; the user-agent usually gives them away.)