Robots.txt

Qué hace realmente el robots.txt —controla el rastreo, no la indexación— además de la sintaxis exacta, cómo lo gestiona Google internamente y los errores que rompen sitios.

Publicado por primera vez: 23 jun 2026 · Última actualización: 11 ago 2026 · Avanzado
Idiomas
1 señal de evidencia en esta página

Robots.txt es un archivo de texto plano ubicado en la raíz de cada host que indica a los rastreadores qué URL pueden y no pueden solicitar. Lo único que hay que entender bien: controla el rastreo, no la indexación. Una URL con Disallow puede seguir indexándose sin fragmento descriptivo si está enlazada desde otro sitio; para mantener una página fuera del índice se usa noindex, y la página NO debe estar bloqueada en robots.txt o Google nunca verá ese noindex. Google solo admite user-agent, allow, disallow y sitemap (noindex, nofollow y crawl-delay se retiraron el 1 de septiembre de 2019). Vive en /robots.txt, su alcance es un solo host+protocolo+puerto, tiene un límite de 500 KiB, se cachea unas 24 h, y un 4xx significa que no hay restricciones mientras que un 5xx puede detener el rastreo de todo el sitio. No bloquee el CSS/JS crítico para el renderizado y no confíe en él para ocultar nada: el archivo es público.

TL;DR — Robots.txt es un archivo de texto plano ubicado en la raíz de cada host (/robots.txt, en minúsculas) que implementa el Robots Exclusion Protocol (RFC 9309). Controla el rastreo, no la indexación: una URL con Disallow puede seguir indexándose sin fragmento descriptivo si está enlazada desde otro sitio; para desindexar, use noindex en una página que no esté bloqueada. Google solo admite user-agent, allow, disallow y sitemap; noindex/nofollow/crawl-delay se retiraron el 1 de septiembre de 2019. El alcance es un solo host+protocolo+puerto. La coincidencia usa la regla más específica (la más larga) y la menos restrictiva en caso de empate; * y $ son los comodines; las rutas distinguen mayúsculas y minúsculas. Google limita el archivo a 500 KiB, lo cachea unas 24 h, trata los 4xx (salvo el 429) como ausencia de restricciones y, ante un 5xx, detiene el rastreo unas 12 h y luego recurre a la última copia válida durante unos 30 días. No bloquee el CSS/JS crítico para el renderizado y no lo trate como control de acceso: el archivo es público.

Qué es y dónde vive

Robots.txt implementa el Robots Exclusion Protocol, creado por Martijn Koster en 1994 y estandarizado por fin en 2022 como RFC 9309, con la coautoría de Gary Illyes, Henner Zeller y Lizzi Sassman, de Google, y del propio Koster. La formulación de la propia norma: “This document specifies and extends the ‘Robots Exclusion Protocol’ method originally defined by Martijn Koster in 1994 for service owners to control how content served by their services may be accessed, if at all, by automatic clients known as crawlers.” (traducción) «Este documento especifica y amplía el método “Robots Exclusion Protocol”, definido originalmente por Martijn Koster en 1994, para que los responsables de un servicio controlen cómo puede accederse al contenido que sirven sus servicios, si es que puede accederse, por parte de clientes automáticos conocidos como rastreadores.»

Algunos datos que sorprenden a mucha gente:

  • Debe estar en la raíz y en minúsculas. RFC 9309 es explícito: “The rules MUST be accessible in a file named ‘/robots.txt’ (all lowercase) in the top-level path of the service.” (traducción) «Las reglas DEBEN estar accesibles en un archivo llamado “/robots.txt” (todo en minúsculas) en la ruta de nivel superior del servicio.» Google añade que la URL en sí distingue mayúsculas y minúsculas, como cualquier URL.
  • El alcance es un host + protocolo + puerto. Google: “The rules listed in the robots.txt file apply only to the host, protocol, and port number where the robots.txt file is hosted.” (traducción) «Las reglas indicadas en el archivo robots.txt se aplican únicamente al host, el protocolo y el número de puerto donde está alojado el archivo robots.txt.» Así que https://example.com, https://www.example.com, https://blog.example.com y http://example.com necesitan cada uno su propio archivo. Los subdominios y los protocolos no comparten uno.
  • Protocolos admitidos por Google: HTTP, HTTPS y FTP.

La idea equivocada que define este tema: rastreo frente a indexación

Si solo se queda con una cosa de esta página, que sea esta: robots.txt controla el rastreo, no la indexación. Bloquear una URL no es lo mismo que eliminarla de Google. Evidence for this claim A robots.txt rule controls crawling rather than guaranteeing removal from Google Search; a URL can still appear when Google cannot crawl it. Scope: Google Search crawler behavior. Other crawlers can interpret robots.txt differently. Confidence: high · Verified: Google: Introduction to robots.txt

El propio documento introductorio de Google lo dice sin rodeos: robots.txt “is not a mechanism for keeping a web page out of Google. To keep a web page out of Google, block indexing with noindex or password-protect the page.” (traducción) «no es un mecanismo para mantener una página web fuera de Google. Para mantener una página web fuera de Google, bloquee la indexación con noindex o proteja la página con contraseña.» Y sobre lo que le ocurre realmente a una URL bloqueada: “While Google won’t crawl or index the content blocked by a robots.txt file, we might still find and index a disallowed URL if it is linked from other places on the web.” (traducción) «Aunque Google no rastreará ni indexará el contenido bloqueado por un archivo robots.txt, es posible que aun así encontremos e indexemos una URL con Disallow si está enlazada desde otros lugares de la web.» El resultado es el listado sin fragmento descriptivo de siempre: “its URL can still appear in search results, but the search result won’t have a description.” (traducción) «su URL puede seguir apareciendo en los resultados de búsqueda, pero el resultado de búsqueda no tendrá descripción.»

Evidence for this claim Robots.txt controls crawler access, not index eligibility; Google may still index a disallowed URL discovered through links, typically without a content snippet. Scope: web crawling Confidence: high · Verified: Robots.txt Introduction and Guide

La especificación repite el mismo matiz para la propia regla disallow: “Google can’t index the content of pages which are disallowed for crawling, but it may still index the URL and show it in search results without a snippet.” (traducción) «Google no puede indexar el contenido de las páginas cuyo rastreo está bloqueado con Disallow, pero aun así puede indexar la URL y mostrarla en los resultados de búsqueda sin fragmento descriptivo.»

Por qué NO debe bloquear una página a la que quiere aplicar noindex

Esta es la trampa que arruina en silencio los intentos de desindexación. Un noindex solo funciona si Google puede rastrear la página para leerlo. El documento de Google sobre bloqueo de la indexación detalla la dependencia: noindex solo funciona si la página o el recurso no están bloqueados por robots.txt y siguen siendo accesibles para el rastreador. Si un archivo robots.txt bloquea la página o el rastreador no puede acceder a ella, nunca verá la regla y la URL aún puede aparecer en los resultados, por ejemplo si recibe enlaces de otras páginas.

Evidence for this claim Google must be able to crawl a URL to see a noindex rule; blocking the URL in robots.txt can prevent the rule from being observed. Scope: Google Search indexing controls for HTML meta robots and X-Robots-Tag rules. Confidence: high · Verified: Google: Block indexing with noindex

Así que, si su objetivo es sacar una página del índice, la orientación de John Mueller es la forma más limpia de recordarlo: cuando quiera desindexar páginas, no debe bloquear a Google con robots.txt, sino usar noindex.

La prueba vivida: bloqueé dos de nuestras propias páginas mejor posicionadas

No tengo que defender esto desde la teoría. En mi experimento bloqueando dos páginas de Ahrefs muy bien posicionadas, las bloqueé deliberadamente en robots.txt y seguí lo que ocurría. Las páginas siguieron indexadas y siguieron posicionando: no desaparecieron. Lo que perdimos fue la frescura que Google obtiene al volver a rastrear: “We lost a position here or there and all of the featured snippets for the pages.” (traducción) «Perdimos alguna posición aquí y allá, y todos los fragmentos destacados de las páginas.» El tráfico cayó, pero menos de lo que esperaba: “Both pages lost some traffic. But it didn’t result in much change to our traffic estimate like I was expecting.” (traducción) «Las dos páginas perdieron parte del tráfico, pero el cambio en nuestra estimación de tráfico fue menor de lo que esperaba.»

Mi conclusión a partir de los datos: “Accidentally blocking pages (that Google already ranks) from being crawled using robots.txt probably isn’t going to have much impact on your rankings, and they will likely still show in the search results.” (traducción) «Bloquear accidentalmente con robots.txt el rastreo de páginas (que Google ya posiciona) probablemente no tendrá mucho impacto en sus posiciones, y lo más seguro es que sigan apareciendo en los resultados de búsqueda.» Y la versión sin rodeos: “Don’t block pages you want indexed. It hurts. Not as bad as you might think it does—but it still hurts.” (traducción) «No bloquee las páginas que quiera indexar. Hace daño; no tanto como podría imaginar, pero sigue siendo perjudicial.»

La otra cara es tranquilizadora: cuando Search Console marca “Indexed, though blocked by robots.txt” en una URL utilitaria —carrito, filtro, basura de parámetros—, suele ser irrelevante. Como dijo Mueller a propósito de las URL de añadir al carrito, bloquearlas está bien y, aunque acaben «indexadas», es poco probable que se muestren en la búsqueda salvo que alguien lance una consulta muy concreta para esas URL, cosa que los usuarios reales no hacen. Distinga la advertencia que suena alarmante de un problema real: solo importa si la URL bloqueada es una página que sí quería que se rastreara e indexara.

La sintaxis (la referencia)

Un robots.txt es un conjunto de grupos. Cada grupo empieza con una o varias líneas User-agent que nombran a qué rastreador o rastreadores se aplica, seguidas de las reglas para ellos.

User-agent: *
Disallow: /cart/
Disallow: /search
Allow: /search/help

User-agent: Googlebot
Disallow: /no-google/

Sitemap: https://example.com/sitemap.xml

User-agent y grupos. Un rastreador obedece exactamente un grupo —aquel con el agente de usuario más específico que coincida con él— e ignora el resto. Google: “Google’s crawlers determine the correct group of rules by finding in the robots.txt file the group with the most specific user agent that matches the crawler’s user agent. Other groups are ignored.” (traducción) «Los rastreadores de Google determinan el grupo de reglas correcto buscando en el archivo robots.txt el grupo con el agente de usuario más específico que coincide con el agente de usuario del rastreador. Los demás grupos se ignoran.» Y: “Only one group is valid for a particular crawler.” (traducción) «Solo un grupo es válido para un rastreador concreto.» (Bing se comporta igual; más sobre esto abajo.)

Eso también significa que un grupo específico no se completa con las reglas del grupo comodín: se usa por sí solo, no se fusiona con User-agent: *. La especificación de Google es explícita al decir que “user agent specific groups and global groups (*) are not combined.” (traducción) «Los grupos específicos de agente de usuario y los grupos globales (*) no se combinan.» Así que, si escribe un grupo User-agent: googlebot-news, tiene que ser autosuficiente: todo lo que siga queriendo que obedezca del grupo * hay que repetirlo dentro de él, o Googlebot-News sencillamente no verá esas reglas.

Evidence for this claim For Google's crawlers, the most specific matching user-agent group applies; rules from that specific group are not combined with the global asterisk group, although multiple matching specific groups are merged internally. Scope: robots.txt parsing and fetching Confidence: high · Verified: How Google Interprets the robots.txt Specification

Disallow y Allow. Disallow lista rutas que un rastreador no debe solicitar; Allow recorta excepciones. La regla disallow “specifies paths that must not be accessed by the crawlers identified by the user-agent line the disallow rule is grouped with.” (traducción) «especifica rutas a las que no deben acceder los rastreadores identificados por la línea user-agent con la que está agrupada la regla disallow.» La regla allow “specifies paths that may be accessed by the designated crawlers. When no path is specified, the rule is ignored.” (traducción) «especifica rutas a las que pueden acceder los rastreadores designados. Cuando no se especifica ninguna ruta, la regla se ignora.»

La regla de coincidencia (que la mayoría de las guías explican mal). Cuando dos reglas entran en conflicto, gana la más específica, y «más específica» significa la ruta más larga: “When matching robots.txt rules to URLs, crawlers use the most specific rule based on the length of the rule path. In case of conflicting rules, including those with wildcards, Google uses the least restrictive rule.” (traducción) «Al comparar las reglas de robots.txt con las URL, los rastreadores aplican la regla más específica según la longitud de su ruta. Si hay conflicto, incluso con comodines, Google elige la regla menos restrictiva.» Así que, en un empate real, gana la regla menos restrictiva: Allow vence a Disallow. RFC 9309 lo plantea como la «Longest Match»: “The following example shows that in the case of two rules, the longest one is used for matching.” (traducción) «El siguiente ejemplo muestra que, en el caso de dos reglas, se usa la más larga para la coincidencia.» Evidence for this claim Google resolves matching robots.txt rules by path specificity and uses the least restrictive rule when equally specific rules conflict. Scope: Google crawler interpretation of robots.txt rules; other crawlers may implement different extensions. Confidence: high · Verified: Google: Robots.txt interpretation

Ejemplo resuelto:

User-agent: *
Allow: /folder/page
Disallow: /folder/

La URL /folder/page coincide con ambas reglas. Allow: /folder/page (12 caracteres) es más larga que Disallow: /folder/ (8 caracteres), así que gana el Allow, más largo y más específico, y la página es rastreable.

Comodines * y $. Google: * designates 0 or more instances of any valid character. $ designates the end of the URL.” (traducción) «El asterisco representa cero o más caracteres válidos; el signo de dólar marca el final de la URL.» Así que Disallow: /*.pdf$ bloquea toda URL que termine en .pdf, y Disallow: /*? bloquea toda URL que contenga una cadena de consulta. La coincidencia es por prefijo: Disallow: /fish coincide con /fish, /fish.html y /fish/salmon.html, pero no con /Fish (distingue mayúsculas y minúsculas) ni con /catfish (es un prefijo, no una subcadena).

Mayúsculas y minúsculas (el detalle sutil). Los nombres de campo y de agente de usuario no distinguen mayúsculas de minúsculas; los valores de ruta sí. Google: “Both the user-agent field name and its value are case-insensitive,” (traducción) «Tanto el nombre del campo user-agent como su valor no distinguen mayúsculas de minúsculas,» pero “The field name (disallow) is case-insensitive, but its value is case-sensitive,” (traducción) «El nombre del campo (disallow) no distingue mayúsculas de minúsculas, pero su valor sí las distingue,» y “The path value must start with / to designate the root and the value is case-sensitive.” (traducción) «El valor de ruta debe empezar por / para designar la raíz y el valor distingue mayúsculas de minúsculas.» Así que Disallow: /Folder/ no bloquea /folder/.

Sitemap. La directiva Sitemap: toma una URL absoluta completa y es independiente de los grupos: puede situarse en cualquier punto del archivo.

Comentarios. Todo lo que va después de # se ignora: “To include comments, precede your comment with the # character.” (traducción) «Para incluir comentarios, anteponga a su comentario el carácter #

noindex, nofollow y crawl-delay NO son directivas de robots.txt

Este es un mito persistente. Desde el 1 de septiembre de 2019, Google retiró el soporte de las reglas no admitidas y no documentadas, incluidas noindex, nofollow y crawl-delay. El anuncio de Google se centró en las reglas no admitidas por el borrador de internet, como crawl-delay, nofollow y noindex, señalando que Google nunca las había documentado, y dijo que Google retiraba en esa fecha todo el código que gestiona reglas no admitidas y no publicadas (como noindex). La lista de campos admitidos es corta, y la especificación menciona la exclusión directamente: Google admite user-agent, allow, disallow y sitemap, y “other fields such as crawl-delay aren’t supported.” (traducción) «otros campos, como crawl-delay, no se admiten.»

Si dependía de noindex en robots.txt, las alternativas son una metaetiqueta noindex o una cabecera X-Robots-Tag, códigos de estado 404/410, protección con contraseña, un Disallow o la herramienta de eliminaciones de Search Console.

Cómo gestiona Google el robots.txt internamente

  • Límite de tamaño: 500 KiB. Google aplica un límite de tamaño de archivo robots.txt de 500 kibibytes (KiB); el contenido que supera el tamaño máximo se ignora. RFC 9309 concuerda: “The parsing limit MUST be at least 500 kibibytes [KiB].” (traducción) «El límite de análisis DEBE ser de al menos 500 kibibytes [KiB].»
  • Caché: unas 24 horas. “Google generally caches the contents of robots.txt file for up to 24 hours, but may cache it longer in situations where refreshing the cached version isn’t possible.” (traducción) «Google normalmente almacena en caché el contenido del archivo robots.txt hasta 24 horas, pero puede cachearlo más tiempo en situaciones en las que no sea posible actualizar la versión almacenada.» Así que un cambio no se recoge necesariamente al instante. Evidence for this claim Google generally caches robots.txt for up to 24 hours and changes crawling behavior according to the HTTP status returned for the file. Scope: Google crawler handling of robots.txt fetches, including documented 4xx, 5xx, and redirect behavior. Confidence: high · Verified: Google: Robots.txt file handling
  • Los códigos de estado importan en todo el sitio. Esta es la parte que la mayoría de las guías se salta:
    • 4xx (salvo el 429) → sin restricciones. Los rastreadores de Google tratan todos los errores 4xx, salvo el 429, como si no existiera un archivo robots.txt válido: Google asume que no hay restricciones de rastreo. Un 404 en /robots.txt significa «rastréalo todo». (No use 401/403 para limitar el rastreo.)
    • 5xx / inaccesible → peligroso. Durante las primeras 12 horas, Google deja de rastrear el sitio pero sigue intentando descargar el archivo robots.txt. Si no puede descargar una versión nueva, durante los 30 días siguientes usa la última versión válida mientras sigue intentando obtener una nueva. Así que un error de servidor en /robots.txt puede, en la práctica, bloquear todo su sitio durante las primeras 12 horas aproximadamente, y luego funcionar con la última copia cacheada durante unos 30 días. Un robots.txt que da error de forma persistente es un riesgo de rastreo para todo el sitio. Y si sigue roto después de esos 30 días: “If the errors are still not fixed after 30 days: If the site is generally available to Google, Google will behave as if there is no robots.txt file (but still keep checking for a new version).” (traducción) «Si los errores siguen sin corregirse después de 30 días: si el sitio está disponible para Google en general, Google se comportará como si no hubiera archivo robots.txt (pero seguirá comprobando si hay una versión nueva).» En otras palabras, un robots.txt que nunca se recupera no queda bloqueado para siempre: Google acaba recurriendo a rastrear sin restricciones, igual que ante un 404.
    • 3xx → Google sigue al menos cinco saltos de redirección y luego lo trata como un 404.

robots.txt en Bing, Yandex y más allá

La agrupación y la sintaxis son esencialmente comunes, pero hay dos divergencias que importan:

  • crawl-delay. Google la ignora, Bing sigue respetándola y Yandex la abandonó en 2018: la propia documentación de Yandex indica que “From February 22, 2018, Yandex doesn’t take into account the Crawl-delay directive,” (traducción) «Desde el 22 de febrero de 2018, Yandex no tiene en cuenta la directiva Crawl-delay,» y le remite en su lugar al ajuste de velocidad de rastreo del sitio en Yandex Webmaster. Bing es explícito al decir que “The robots.txt file is the only valid place to set a crawl-delay directive for MSNBot,” (traducción) «El archivo robots.txt es el único lugar válido para establecer una directiva crawl-delay para MSNBot,» y que la directiva “accepts only positive, whole numbers as values… the higher the value, the more throttled down the crawl rate will be.” (traducción) «solo acepta números enteros positivos como valores… cuanto mayor sea el valor, más se reducirá la velocidad de rastreo.» Tenga en cuenta que Bing trata el valor como una limitación relativa, no literalmente como N segundos.
  • El truco de la sección de bingbot. Igual que la regla de Google de “only one group per crawler” (traducción) «solo un grupo por rastreador», si crea una sección User-agent: bingbot, Bing aplica solo esa sección e ignora los valores por defecto de User-agent: * (con la excepción de crawl-delay). Así que un grupo específico de bingbot debe repetir todas las directivas que siga queriendo que se apliquen.
  • La caché y el comportamiento ante fallos de Amazon. Amazon indica que sus rastreadores pueden usar una copia de robots.txt cacheada en los 30 días anteriores. Si no pueden descargar el archivo, se comportan como si no existiera. Un verificador puede informar de la copia que descargó, pero no puede demostrar qué versión cacheada usó Amazon, ni que Amazon observó el mismo fallo que el verificador. Evidence for this claim Amazon says its crawlers may use a robots.txt copy cached within the previous 30 days and behave as though the file does not exist when they cannot fetch it. Scope: Amazon crawler behavior only; a checker result cannot establish which cached copy Amazon used or whether Amazon observed the same fetch failure. Confidence: high · Verified: Amazon: Amazonbot

Gestionar los rastreadores de IA con robots.txt

Robots.txt es actualmente la palanca principal para gestionar los rastreadores de IA, y obedecen la misma sintaxis de grupos y agentes de usuario. El detalle: son tokens distintos, así que bloquear uno no bloquea los demás.

  • OpenAI opera varios bots distintos, y los controles de cada uno son independientes: permitir uno no permite los demás, y bloquear uno no bloquea los demás. GPTBot rastrea contenido para entrenar los modelos de OpenAI; OAI-SearchBot hace que los sitios aparezcan en las funciones de búsqueda de ChatGPT; OAI-AdsBot comprueba la seguridad de las páginas enviadas como anuncios (sus datos no se usan para el entrenamiento). Bloquee el entrenamiento con User-agent: GPTBot / Disallow: /; eso por sí solo no detendrá a los bots de búsqueda ni de anuncios. ChatGPT-User es otra cosa: se activa por acciones que una persona desencadena dentro de ChatGPT o de un GPT personalizado, no por rastreo automático, y OpenAI dice que “robots.txt rules may not apply” (traducción) «puede que las reglas de robots.txt no se apliquen» a él, así que no cuente con un Disallow para mantenerlo fuera. Si cambia lo que OAI-SearchBot puede rastrear, OpenAI señala que puede tardar unas 24 horas en que la actualización llegue a sus sistemas de búsqueda.
  • Google-Extended controla el entrenamiento de Gemini/Vertex y es independiente de Googlebot.
  • Otros que merece la pena nombrar: CCBot (Common Crawl), ClaudeBot (Anthropic), PerplexityBot y Bytespider.

La salvedad dura: el cumplimiento es voluntario. Robots.txt pide; no impone. Los rastreadores que se comportan bien lo obedecen; los scrapers pueden ignorarlo y lo ignoran. Si de verdad necesita mantener algo lejos de un bot, eso es un problema de autenticación o de bloqueo, no de robots.txt.

Errores comunes (y cómo se corrigen)

El archivo devuelve 200, pero no es en realidad un archivo robots utilizable. El código de estado por sí solo no basta. Capture el Content-Type de la respuesta y sus primeros bytes: una plantilla de error personalizada o de un CDN puede devolver HTML en /robots.txt con un 200, lo que debe ser una advertencia y no un aprobado de «permitir todo». Google documenta robots.txt como texto plano UTF-8 y puede ignorar caracteres no válidos. Se tolera una única BOM UTF-8 al principio, pero una segunda BOM, una BOM en medio, bytes UTF-16, NUL o caracteres invisibles o de control pueden alterar el primer token o invalidar una línea. Muestre el desplazamiento de bytes y la línea afectada; no normalice el archivo en silencio antes de decirle al usuario qué recibió el rastreador. Aplique el límite efectivo de análisis de 500 KiB de Google antes de calcular los resultados de allow/disallow, informando aun así de la cola descartada.

  • Bloquear una página que además quiere desindexar. Bloqueo + noindex significa que Google nunca la rastrea para ver el noindex. Use noindex sin el bloqueo.
  • Usar robots.txt para desindexar. Herramienta equivocada por completo: ese es el trabajo de noindex.
  • Bloquear CSS/JS crítico para el renderizado. Google necesita esos recursos para ver la página como la ve un usuario; el propio robots.txt de ejemplo de Google vuelve a permitir explícitamente .css/.js para que Googlebot pueda rastrearlos.
  • Intentar ocultar datos sensibles. RFC 9309 es tajante: el Robots Exclusion Protocol no sustituye a unas medidas válidas de seguridad del contenido; listar rutas en el archivo robots.txt las expone públicamente y, por tanto, hace que sean detectables. Bloquear /secret-admin/ con Disallow es, literalmente, anunciarlo. Use autenticación.
  • Un Disallow: / despistado. Esto bloquea el sitio entero para el rastreador nombrado: el clásico resto de staging que saca un sitio de Google.
  • Ignorar el código de respuesta de /robots.txt. Un 5xx puede detener el rastreo de todo el sitio; trate la disponibilidad del archivo como crítica para producción.

Para el proceso más amplio en el que esto se inserta —el descubrimiento, el planificador de rastreo, el renderizado y en qué se diferencia el rastreo de la indexación—, consulte el hub de rastreo. Los temas hermanos (el presupuesto de rastreo y cómo gestiona Google los sitemaps) profundizan cada uno en una pieza de esto.

Who's been ignoring my robots.txt?

This is live data from this site, not an illustration. My robots.txt disallows /api/trap/, and the only link to it is invisible to humans — so a compliant crawler will never request it. Every user-agent below fetched it anyway. (Humans poking at it with curl show up too; the user-agent usually gives them away.)

Loading trap log…

Add an expert note

Pin an expert quote

New person? Create their unclaimed profile at /admin/experts/ → Pin a quote first.