Rastreadores web
Qué es realmente un rastreador web (araña, bot), cómo funciona el bucle recuperar → analizar → poner en cola, y por qué el rastreo no es lo mismo que la indexación, el renderizado o la clasificación.
Idiomas
2 señales de evidencia en esta página
- Datos de origen enlazadosgooglebot.json
- Herramienta activa relacionadarobots.txt Tester
Los rastreadores web —también llamados arañas o bots— son programas automatizados que recuperan páginas, extraen enlaces y ponen en cola nuevas URL para visitar, alimentando el índice del motor de búsqueda. El bucle mecánico es descubrir → recuperar → analizar → programar, repetido indefinidamente. El rastreo es la primera de tres etapas (rastreo → indexación → servicio) y es un requisito previo para la clasificación, no un factor de clasificación: un mayor rastreo no mejora las posiciones. El rastreo también es distinto de la indexación y del renderizado. Los rastreadores reputados respetan robots.txt y limitan su frecuencia de rastreo; hoy en día no solo están los motores de búsqueda: los bots de IA representan una parte grande y creciente del tráfico. Para consultar detalles específicos de cada motor, consulta las páginas relacionadas con Googlebot, Bingbot, rastreadores de IA y agente de usuario (user-agent).
Resumen — Un rastreador web es un programa automatizado que visita páginas web, las descarga y sigue los enlaces para encontrar más páginas. «Rastreador», «araña» y «bot» significan lo mismo. Los motores de búsqueda utilizan rastreadores para encontrar tus páginas y que puedan aparecer en la búsqueda, pero una página tiene que ser rastreada antes de que pueda ser indexada y posicionada, y ser rastreada con más frecuencia no hace que obtengas una posición más alta.
Qué es un rastreador
Un rastreador web es un software que navega por la web automáticamente. Visita una página, descarga lo que hay en ella, extrae los enlaces y luego va a visitar también esos enlaces — una y otra vez, a través de miles de millones de páginas.
Escucharás tres nombres para exactamente lo mismo: rastreador, araña y bot. Son intercambiables. El rastreador de Google se llama Googlebot; el de Bing es Bingbot. Evidence for this claim Google defines a crawler as an automated program that discovers and scans websites and describes Googlebot as its web crawler. Scope: Google crawler terminology. Confidence: high · Verified: Google: Googlebot overview
Los motores de búsqueda necesitan rastreadores porque no pueden mostrarte una página en los resultados a menos que primero la hayan encontrado y descargado. El rastreador genera la materia prima; el índice del motor de búsqueda es la enorme base de datos en la que este busca cuando escribes una consulta.
Un rastreador no es lo mismo que un scraper. El trabajo de un rastreador es el descubrimiento a gran escala: seguir enlaces a través de una amplia parte de la web (o de toda ella). El trabajo de un scraper es la extracción: extraer piezas específicas de datos de las páginas que ya se le han indicado. En la práctica, la línea se difumina: muchas herramientas hacen ambas cosas: rastrean para encontrar páginas y luego extraen los datos que necesitan de cada una.
Cómo encuentra un rastreador tus páginas
Principalmente, de dos maneras:
- Siguiendo enlaces. Cuando un rastreador descarga una página, lee los enlaces que hay en ella y añade esas nuevas URL a su lista de tareas. Un buen enlazado interno es la forma en que se descubren nuevas páginas.
- Sitemaps. Un sitemap XML es una lista de tus URL que entregas directamente a los motores de búsqueda, lo que puede ayudarlos a descubrir URL. Evidence for this claim Google discovers URLs through links from known pages and through submitted sitemaps. Scope: Google URL discovery; sitemap submission does not guarantee crawling or indexing. Confidence: high · Verified: Google: How Search works
Los tres pasos que importan
La búsqueda funciona en un orden fijo:
- Rastreo — un bot encuentra una URL y descarga la página.
- Indexación — el motor procesa esa página y la guarda en su base de datos.
- Ofrecer (posicionar) — cuando alguien busca, el motor recupera las mejores coincidencias y las ordena.
El rastreo es el primer paso. Si una página nunca se rastrea, no puede indexarse, y si no está indexada, no puede posicionarse. Así que el rastreo es una puerta por la que tienes que pasar — pero no es un marcador. Que te rastreen más no te hará subir en los resultados.
The search pipeline has three stages: crawl, index, and serve. Crawl is highlighted as the stage where a bot discovers and fetches a page. The page must still be processed and selected for the index before it can become eligible to be served in search results. Not every page passes every stage.
© Patrick Stox LLC · CC BY 4.0 ·
Lo que la gente entiende mal
Bloquear una página en robots.txt no la elimina de Google. robots.txt
solo le dice al rastreador “no leas esto.” La página aún puede aparecer en los resultados si
otros sitios enlazan con ella. Si realmente quieres que una página desaparezca, dejas que se rastree y
añades una etiqueta noindex en su lugar.
¿Quieres la versión mecánica — la cola de rastreo, la obtención y el análisis, por qué el renderizado es un paso separado y cómo distinguir un rastreador real de uno falso? Cambia a la pestaña Avanzado.
TL;DR — Un rastreador (araña, bot) es un programa automatizado que descubre, obtiene, analiza y reprograma URLs en un bucle. En palabras del propio Google: «downloads text, images, and videos from pages it found on the internet with automated programs called crawlers.» (traducción) «descarga texto, imágenes y videos de páginas que encontró en internet con programas automatizados llamados rastreadores.» La mecánica consiste en una frontera (la cola de URLs), una obtención (descargar el HTML), un análisis (extraer enlaces + contenido), y un planificador que decide qué obtener a continuación y a qué velocidad — regulándose según la salud de tu servidor. El renderizado de JavaScript es un paso separado. El rastreo es necesario para posicionar, pero no es una señal de posicionamiento, y es distinto de la indexación — una página bloqueada por robots aún puede indexarse. Y en 2026 no solo los motores de búsqueda rastrean: los bots de IA son una parte grande y de rápido crecimiento del tráfico.
Qué es realmente un rastreador
La definición de Google es casi lo más sencilla posible: «downloads text, images, and videos from pages it found on the internet with automated programs called crawlers.» (traducción) «descarga texto, imágenes y videos de páginas que encontró en internet con programas automatizados llamados rastreadores.» La redacción del propio glosario de Google es aún más amplia: «a crawler is a generic term for any program that is used to automatically discover and scan websites.» (traducción) «un rastreador es un término genérico para cualquier programa que se usa para descubrir y escanear sitios web automáticamente.» Rastreador, araña, bot, spiderbot: mismo concepto, diferente nombre. Evidence for this claim Google defines a crawler as an automated program that discovers and scans websites and describes Googlebot as its web crawler. Scope: Google crawler terminology. Confidence: high · Verified: Google: Googlebot overview
La razón por la que el rastreo importa en absoluto es el flujo de procesamiento. Google es directo al respecto: «Google Search works in three stages, and not all pages make it through each stage» (traducción) «Google Search funciona en tres etapas, y no todas las páginas pasan por cada etapa» — rastreo, indexación y publicación. El rastreo es la puerta uno. Una página que nunca se rastrea no puede indexarse, y una página que no está indexada no puede posicionarse.
Cómo funciona un rastreador, mecánicamente
Si eliminas la marca, la mayoría de los rastreadores que siguen enlaces ejecutan alguna versión del mismo bucle: descubrir → obtener → analizar → programar → repetir. Es un modelo mental útil para razonar sobre el comportamiento del rastreador — no una garantía de que cada rastreador que se haya creado implemente estas etapas exactas de manera idéntica.
La frontera (la cola). Un rastreador no deambula aleatoriamente. Mantiene una cola de URL que conoce pero que aún no ha visitado — la frontera de rastreo — y un programador que decide qué URL extraer a continuación. Comienza a partir de un conjunto semilla de URL conocidas y hace crecer la cola a medida que descubre más. Google describe el descubrimiento así: “Other pages are discovered when Google extracts a link from a known page to a new page… Still other pages are discovered when you submit a list of pages (a sitemap) for Google to crawl. This process is called ‘URL discovery.’” (traducción) «Otras páginas se descubren cuando Google extrae un enlace de una página conocida a una página nueva… Otras páginas se descubren cuando envías una lista de páginas (un sitemap) para que Google las rastree. Este proceso se llama ‘URL discovery’.» Evidence for this claim Google discovers URLs through links from known pages and through submitted sitemaps. Scope: Google URL discovery; sitemap submission does not guarantee crawling or indexing. Confidence: high · Verified: Google: How Search works
Fetch. El rastreador envía una solicitud HTTP; el servidor devuelve la página. En este paso, descarga el HTML sin procesar (los recursos como JavaScript y CSS se obtienen por separado, a menudo más tarde). Fabrice Canel, de Bing, describe claramente el objetivo de todo este proceso: “Crawling is the process by which bingbot discovers new and updated documents or content to be added to Bing’s searchable index.” (traducción) «El rastreo es el proceso mediante el cual Bingbot descubre documentos o contenido nuevos y actualizados para añadirlos al índice de búsqueda de Bing».
Análisis. El HTML obtenido se analiza para extraer enlaces, texto, encabezados, imágenes, y metadatos. Las URL recién encontradas se normalizan y se devuelven a la frontera — que es lo que mantiene el bucle en marcha.
Programación. Lo que se obtiene, con qué frecuencia y cuántas páginas por visita se decide algorítmicamente, no por ti. Google: “Googlebot uses an algorithmic process to determine which sites to crawl, how often, and how many pages to fetch from each site.” (traducción) «Googlebot utiliza un proceso algorítmico para determinar qué sitios rastrear, con qué frecuencia y cuántas páginas obtener de cada sitio». Las páginas populares y que cambian con frecuencia se vuelven a visitar antes; las poco conocidas y estáticas se vuelven a visitar rara vez. (Cómo se establece esa programación —presupuesto de rastreo, frecuencia de rastreo, frecuencia de rastreo— tiene cada uno su propio análisis en profundidad en este clúster.)
Evidence for this claim Googlebot algorithmically determines which sites to crawl, how often, and how many pages to fetch. Scope: web Confidence: high · Verified: In-Depth Guide to How Google Search Works”Googlebot” no es un solo programa
Esta es la idea que la mayoría de las explicaciones pasan por alto. «Googlebot» suena como un único programa; no lo es. En mi presentación How Search Works lo describo como más de 1 000 sistemas que ejecutan una familia de rastreadores especializados — escritorio, móvil, imágenes, noticias, video, anuncios — todos los cuales extraen del mismo grupo de presupuesto de rastreo. Gary Illyes ha hecho el mismo señalamiento desde dentro: el nombre es, en esencia, un término inapropiado para una plataforma de rastreo central a través de la cual muchos productos de Google (Shopping, AdSense y el resto) canalizan sus solicitudes, bajo diferentes nombres de agente de usuario (user-agent). Así que cuando lees tus registros, no estás viendo un solo bot — estás viendo una flota que casualmente comparte una etiqueta. (Los detalles específicos de cada motor están en las páginas hermanas de Googlebot y Bingbot.)
Cortesía — cómo los rastreadores evitan saturar tu sitio
Un rastreador bien comportado se autorregula deliberadamente. Google: «They try not to crawl the site too fast to avoid overloading it. This mechanism is based on the responses of the site (for example, HTTP 500 errors mean ‘slow down’).» (traducción) «Intentan no rastrear el sitio demasiado rápido para evitar sobrecargarlo. Este mecanismo se basa en las respuestas del sitio (por ejemplo, los errores HTTP 500 significan ‘reduce la velocidad’).»
Esa es también la palanca para ralentizar temporalmente un rastreo — las respuestas 5xx/429 sostenidas
hacen que Googlebot retroceda (por uno o dos días, no para siempre). La cortesía no es una gentileza opcional;
a la escala en que operan los rastreadores, es lo único que evita que saturen los servidores hasta dejarlos fuera de la web.
Robots.txt — el control de rastreo estándar
robots.txt es la convención de control de acceso de facto. Google: «A robots.txt file tells search engine crawlers which URLs the crawler can access on your site.» (traducción) «Un archivo robots.txt indica a los rastreadores de motores de búsqueda a qué URL puede acceder el rastreador en tu sitio.»
Dos
cosas que debes tener claras:
- Controla el rastreo, no la indexación. Una página que bloqueas aún puede indexarse
si otras páginas enlazan a ella — Google simplemente no puede ver el contenido (ni ninguna etiqueta
noindexque pongas allí). Como indiqué en Indexed, though blocked by robots.txt: “crawling and indexing are two different things.” (traducción) «el rastreo y la indexación son dos cosas diferentes.» Para eliminar realmente una página, permite el rastreo y añadenoindex— no la bloquees. - Los rastreadores reputados lo obedecen; los actores malintencionados no. Googlebot, Bingbot, Ahrefsbot
y similares respetan
robots.txt; muchos scrapers y bots de poca reputación lo ignoran por completo. Es una convención, no un mecanismo de aplicación.
Probé directamente el aspecto del bloqueo. En La historia de bloquear 2 páginas con posicionamiento alto usando Robots.txt bloqueé dos de nuestras páginas que posicionaban durante casi cinco meses. Perdieron todos sus fragmentos destacados y sus títulos personalizados (los resultados mostraban “no information is available” (traducción) «no hay información disponible» ), y los clics bajaron más de lo que la posición por sí sola explicaría — pero la estimación de tráfico apenas se movió. Mi conclusión se mantiene: no bloquees las páginas que quieres que se indexen. Perjudica. No tanto como podrías pensar — pero aun así perjudica.
Rastreo ≠ indexación ≠ renderizado ≠ posicionamiento
Las distinciones que causan más confusión:
- Rastreo ≠ indexación. El rastreo es obtención + descarga; la indexación es entender + almacenar. Una página puede ser rastreada y no indexada (Google decidió no incluirla), y una página bloqueada puede ser indexada sin haber sido leída nunca. “Indexing isn’t guaranteed; not every page that Google processes will be indexed.” (traducción) «La indexación no está garantizada; no todas las páginas que Google procesa se indexarán.»
- Rastreo ≠ renderizado. La obtención del HTML y la ejecución de su JavaScript son dos pasos diferentes. “During the crawl, Google renders the page and runs any JavaScript it finds using a recent version of Chrome,” (traducción) «Durante el rastreo, Google renderiza la página y ejecuta cualquier JavaScript que encuentra usando una versión reciente de Chrome», pero ese renderizado ocurre en una cola separada que puede retrasarse respecto a la obtención inicial. Si tu contenido solo aparece después de que se ejecuta JavaScript, no está disponible en la misma pasada que el HTML.
- Rastreo ≠ posicionamiento. Ser rastreado con más frecuencia no es una señal de posicionamiento. La frecuencia de rastreo es una cuestión de eficiencia, y punto — por eso la mayoría de los sitios nunca necesitan gestionar el presupuesto de rastreo en absoluto.
Tipos de rastreadores (a alto nivel)
Para mantener esto breve — cada uno tiene una página hermana que profundiza:
- Rastreadores de motores de búsqueda — Googlebot, Bingbot. Construyen los índices que impulsan los resultados de búsqueda.
- Rastreadores de IA / LLM — GPTBot, ClaudeBot, CCBot y otros, que recopilan contenido web para entrenar o impulsar modelos de IA. Crecen rápidamente (consulta más abajo).
- Rastreadores de auditoría SEO — Ahrefs Site Audit, Screaming Frog y herramientas similares que simulan un rastreo para detectar problemas técnicos.
- Recuperadores activados por el usuario — herramientas que hacen una única solicitud a petición (la herramienta de inspección de URL de Google, Rich Results Test). No son rastreadores autónomos.
Quién está rastreando la web ahora
Ya no se trata solo de los motores de búsqueda. En mi análisis de los datos de Cloudflare Radar (Conoce los nuevos rastreadores web), los bots de motores de búsqueda siguen siendo los que más rastrean, pero los bots de IA están firmemente en segundo lugar. La escala aquí es difícil de exagerar: solo Bing descubre decenas de miles de millones de URL normalizadas que nunca antes había visto cada día (Fabrice Canel) — que es exactamente la razón por la que los motores tienen que priorizar de forma agresiva lo que realmente recuperan.
Cómo verificar que un rastreador es quien dice ser
Cualquier bot puede poner “Googlebot” en su cadena de agente de usuario (user-agent), así que no confíes
solo en la cadena. La verificación real es una resolución DNS inversa + directa (consulta la pestaña Scripts):
aplica resolución DNS inversa a la IP de tus registros, confirma que se resuelve en un nombre de host googlebot.com /
google.com y luego aplica resolución DNS directa a ese nombre de host y confirma que apunta de vuelta a
la misma IP. Google también publica sus rangos de IP. Los detalles completos del agente de usuario (user-agent) por motor
están en la página hermana user-agent.
Adónde ir a continuación
Esta es la página de conceptos generales. Para obtener información específica:
- Googlebot — el rastreador de Google: agentes de usuario (user-agent), rastreo mobile-first, renderizado, Crawl Stats de Search Console.
- Bingbot — el rastreador de Bing: Crawl Control e IndexNow.
- Rastreadores de IA — GPTBot, ClaudeBot, CCBot y los bots agénticos más nuevos.
- User-agent — qué es la cadena de agente de usuario (user-agent) y cómo leerla.
- Centro de rastreo — todo el flujo, además de presupuesto de rastreo, frecuencia de rastreo, frecuencia de rastreo, crawl depth, spider traps y log file analysis.
Resumen de IA
Una síntesis condensada de la versión avanzada:
- Un rastreador = una araña = un bot. Los tres nombres significan una sola cosa: un programa automatizado que “automatically discover[s] and scan[s] websites,” (traducción) «descubre y escanea automáticamente sitios web,» y descarga páginas para que los motores de búsqueda puedan indexarlas y clasificarlas.
- El bucle mecánico es descubrir → obtener → analizar → planificar → repetir. Una frontera (cola de URL conocidas pero no visitadas) alimenta un planificador; cada obtención descarga HTML, el análisis extrae enlaces + contenido, y las nuevas URL vuelven a la cola. Google llama al descubrimiento “URL discovery” (enlaces + sitemaps).
- El rastreo es la etapa uno de tres (rastreo → indexación → servicio), y “not all pages make it through each stage.” (traducción) «no todas las páginas pasan por cada etapa.» Es necesario para la clasificación, pero no es una señal de clasificación.
- Rastreo ≠ indexación ≠ renderizado ≠ clasificación. La indexación no está garantizada; el renderizado de JavaScript es un paso separado y posterior; una página bloqueada por robots.txt aún puede indexarse a través de enlaces.
- “Googlebot” es una flota, no un programa — una plataforma central de rastreo a través de la cual muchos productos de Google se enrutan bajo diferentes agentes de usuario (user-agent).
- Los rastreadores reputados son respetuosos y obedecen
robots.txt(limitando la frecuencia ante5xx/429— “ralentizar”); los actores malintencionados y muchos scrapers no lo hacen. - Ya no se trata solo de motores de búsqueda. Los bots de IA son un claro n.º 2 por volumen y se acercan a los bots de búsqueda; solo Bing ve decenas de miles de millones de URL nuevas al día.
- Verifica un rastreador con DNS inversa + directa, no con la cadena del agente de usuario (user-agent).
Documentación oficial
Documentación de fuentes primarias de los motores de búsqueda.
- Guía detallada sobre cómo funciona la búsqueda de Google — la visión general de rastreo → indexación → servicio, el descubrimiento de URL y el programador de rastreo.
- Visión general de los rastreadores y captadores de Google — la definición de un rastreador, todos los agentes de usuario (user-agent) de Google y los rangos de IP publicados.
- Googlebot — las dos variantes de Googlebot (Smartphone y Desktop) y su comportamiento técnico.
- Introducción a robots.txt — lo que robots.txt hace (y no hace).
- Optimiza tu presupuesto de rastreo — capacidad de rastreo + demanda, y quién realmente lo necesita.
Bing / Microsoft
- Serie de Bingbot: Maximizar la eficiencia de rastreo — la definición de rastreo de Bing y su “crawl efficiency north star.” (traducción) «estrella polar de la eficiencia de rastreo».
Citas de la fuente
Declaraciones oficiales de Google y Bing. Cada enlace es un enlace profundo que salta al fragmento citado en la página de origen.
Google — qué es un rastreador y cómo funciona
- “Google downloads text, images, and videos from pages it found on the internet with automated programs called crawlers.” (traducción) «Google descarga texto, imágenes y videos de las páginas que encontró en internet con programas automatizados llamados rastreadores.» — Documentación de Google Search Central. Ir a la cita
- «Google Search works in three stages, and not all pages make it through each stage.» (traducción) «Google Search atraviesa tres etapas, pero algunas páginas no llegan a todas ellas.» Ir a la cita
- “Other pages are discovered when Google extracts a link from a known page to a new page… Still other pages are discovered when you submit a list of pages (a sitemap) for Google to crawl. This process is called ‘URL discovery’.” (traducción) «Otras páginas se descubren cuando Google extrae un enlace de una página conocida a una página nueva… Otras páginas adicionales se descubren cuando envías una lista de páginas (un sitemap) para que Google las rastree. Este proceso se llama ‘URL discovery’.» Ir a la cita
- “Googlebot uses an algorithmic process to determine which sites to crawl, how often, and how many pages to fetch from each site.” (traducción) «Googlebot utiliza un proceso algorítmico para determinar qué sitios rastrear, con qué frecuencia y cuántas páginas obtener de cada sitio.» Ir a la cita
- «They try not to crawl the site too fast to avoid overloading it. This mechanism is based on the responses of the site (for example, HTTP 500 errors mean ‘slow down’).» (traducción) «Para no sobrecargar el sitio, ajustan el ritmo de rastreo según sus respuestas; por ejemplo, los errores HTTP 500 indican que deben ir más despacio.» Ir a la cita
- “During the crawl, Google renders the page and runs any JavaScript it finds using a recent version of Chrome.” (traducción) «Durante el rastreo, Google renderiza la página y ejecuta cualquier JavaScript que encuentra utilizando una versión reciente de Chrome.» Ir a la cita
Google — robots.txt
- «A robots.txt file tells search engine crawlers which URLs the crawler can access on your site.» (traducción) «Un archivo robots.txt indica a los rastreadores de los motores de búsqueda a qué URL puede acceder el rastreador en tu sitio.» — Documentación de Google Search Central. Ir a la cita
Fabrice Canel, Microsoft Bing
- “Crawling is the process by which bingbot discovers new and updated documents or content to be added to Bing’s searchable index.” (traducción) «El rastreo es el proceso mediante el cual Bingbot descubre documentos o contenido nuevos y actualizados para añadirlos al índice de búsqueda de Bing.» Ir a la cita
- “Our crawl efficiency north star is to crawl an URL only when the content has been added (URL not crawled before), updated (fresh on-page context or useful outbound links).” (traducción) «Nuestra estrella polar de eficiencia de rastreo es rastrear una URL solo cuando el contenido se ha añadido (URL no rastreada antes) o actualizado (contexto nuevo en la página o enlaces salientes útiles).» Ir a la cita
Asegúrate de que los rastreadores puedan hacer su trabajo — lista de verificación
Un repaso rápido para confirmar que los bots pueden encontrar, obtener y leer lo importante:
- Las páginas importantes están enlazadas desde algún lugar rastreable (sin huérfanas) — los enlaces son la forma en que los rastreadores descubren las URL.
- Se envía un sitemap XML para que el descubrimiento no dependa solo de los enlaces.
-
robots.txtno bloquea nada que quieras indexar (y sí bloquea los espacios de bajo valor que nunca quieres que se rastreen). - No estás usando
robots.txtpara intentar desindexar — esa es la función denoindex(con el rastreo permitido). - El servidor devuelve respuestas rápidas y estables — los bots reducen la frecuencia de rastreo ante
5xx/429(«ralentizar»). - El contenido dependiente de JS es accesible mediante enlaces
<a href>reales, no solo mediante navegación por clics (el renderizado es un paso separado y posterior). - Los bots de tus registros se verifican como genuinos (DNS inversa + directa), no solo se confía en su cadena de agente de usuario (user-agent).
Los modelos mentales
1. El bucle — descubrir → recuperar → analizar → programar → repetir. La mayoría de los rastreadores que siguen enlaces ejecutan alguna versión de este bucle. Una frontera contiene las URL que conoce; un programador elige la siguiente; una recuperación la descarga; un análisis extrae enlaces que retroalimentan la frontera. Si una página no se está rastreando, pregúntate qué paso está fallando: ¿alguna vez fue descubierta (estaba siquiera en la frontera)? ¿El programador la está despriorizando?
2. La canalización — rastreo → indexación → servicio. Cada etapa es un filtro, y _“not all pages make it through each stage.” (traducción) «no todas las páginas superan cada etapa.» Cuando una página tiene un rendimiento inferior, averigua en qué etapa está fallando antes de cambiar nada.
3. El conjunto de los “no es igual”. Mantén estas cuatro distinciones por separado y la mayor parte de la confusión sobre los rastreadores desaparece:
- El rastreo ≠ la indexación (una página bloqueada aún puede indexarse a través de enlaces)
- El rastreo ≠ el renderizado (JavaScript se ejecuta en un paso separado y posterior)
- El rastreo ≠ el posicionamiento (la frecuencia de rastreo no es una señal de posicionamiento)
- “Googlebot” ≠ un programa (es una flota enrutada a través de una plataforma)
4. La regla de decisión para eliminar una página.
¿Quieres que desaparezca de la búsqueda? Permite el rastreo + noindex. ¿Quieres que los bots omitan un espacio
por completo (y no te importa la indexación)? disallow de robots.txt. Nunca uses
disallow para desindexar.
Rastreador — hoja de referencia
Tres nombres, una misma cosa: rastreador = araña = bot (spiderbot). Intercambiables.
El bucle: descubrir (frontera) → obtener (descargar HTML) → analizar (extraer enlaces + contenido) → programar (decidir qué es lo siguiente) → repetir.
El flujo: rastrear → indexar → servir. El rastreo es la puerta uno; “not all pages make it through each stage.” (traducción) «no todas las páginas pasan por cada etapa.»
Los “no es igual”:
| Distinción | Qué significa |
|---|---|
| Rastreo ≠ indexación | Una página bloqueada aún puede indexarse a través de enlaces; la indexación no está garantizada |
| Rastreo ≠ renderizado | JavaScript se ejecuta en un paso separado y posterior |
| Rastreo ≠ posicionamiento | Más rastreo no mejorará las posiciones; no es una señal de posicionamiento |
| ”Googlebot” ≠ un programa | Una flota de rastreadores enrutada a través de una plataforma |
Cortesía: los rastreadores se autorregulan; 5xx/429 sostenidos = “desacelera.”
Control: robots.txt controla el rastreo, no la indexación — no lo uses para
desindexar. Los rastreadores de buena reputación lo obedecen; muchos scrapers, no.
Verifica un rastreador: DNS inversa + directa, nunca solo la cadena de agente de usuario (user-agent).
El panorama (2026): los bots de los motores de búsqueda son los que más rastrean, los bots de IA son el #2 en rápido ascenso, y solo Bing descubre decenas de miles de millones de URL nuevas al día.
Verifica que un bot es realmente el rastreador que dice ser
Una cadena de agente de usuario (user-agent) es trivial de falsificar, por lo que la única comprobación fiable es DNS. Para Googlebot, confirma que una consulta DNS inversa + directa se resuelve en un dominio de Google y vuelve a la misma IP.
macOS / Linux
# 1) Reverse DNS the IP from your logs — it should end in googlebot.com or google.com
host 66.249.66.1
# → 1.66.249.66.in-addr.arpa domain name pointer crawl-66-249-66-1.googlebot.com
# 2) Forward DNS that hostname back — it must resolve to the same IP
host crawl-66-249-66-1.googlebot.com
# → crawl-66-249-66-1.googlebot.com has address 66.249.66.1Windows
nslookup 66.249.66.1
nslookup crawl-66-249-66-1.googlebot.comSi la consulta inversa no termina en un dominio de Google, o la consulta directa no coincide con la IP original, no es realmente Googlebot. También puedes comparar la IP con los rangos publicados de Google (googlebot.json). El mismo patrón de inversa y luego directa funciona para verificar otros rastreadores de buena reputación con sus propios nombres de host publicados.
Herramientas para inspeccionar el acceso y la actividad de los rastreadores
- Robots.txt Tester — prueba si un rastreador concreto tiene permiso para solicitar una URL antes de tratar una brecha de rastreo como un problema de programación.
- Log File Analyzer — comprueba qué rastreadores acceden realmente al servidor, qué URL solicitan y los códigos de estado que reciben.
- HTTP Header Checker — inspecciona la respuesta que recibe un rastreador, incluidas las redirecciones y las directivas para rastreadores enviadas en los encabezados.
- Render Gap Analyzer — compara el HTML sin procesar y el HTML renderizado cuando un rastreador puede obtener una página, pero el contenido importante depende del renderizado del lado del cliente.
Ponte a prueba: rastreadores web
Recursos que vale la pena consultar
Mis escritos relacionados
- ¿Qué es Googlebot y cómo funciona? — un análisis en profundidad de la flota específica de rastreadores de Google.
- Indexed, though blocked by robots.txt — por qué las páginas bloqueadas aún se indexan (rastreo ≠ indexación).
- La historia de bloquear 2 páginas con posicionamiento alto usando robots.txt — mi experimento propio de rastreo frente a posicionamiento.
- ¿Cuándo deberías preocuparte por el presupuesto de rastreo? — cuando la eficiencia de rastreo realmente importa.
- Conoce los nuevos rastreadores web: los bots de IA se acercan a los bots de los motores de búsqueda — el elenco cambiante de rastreadores.
Mis ponencias
- Cómo funciona la búsqueda (SlideShare) — mi explicación detallada del rastreo, el renderizado, la indexación y el posicionamiento. (Se aplica el descargo de responsabilidad permanente:
- “This is my understanding of systems… not going to be 100% complete or accurate.” (traducción) «Esta es mi comprensión de los sistemas… no va a ser 100 % completa ni precisa.»)
De otras fuentes
- Pódcast de Google sobre rastreo — «¿Qué es realmente un rastreador web?» — Gary Illyes y Lizzi Sassman sobre qué es un rastreador y el punto de que «Googlebot is a misnomer» (traducción) «Googlebot es un nombre inapropiado».
- Search Off the Record — “Rastrear de manera más inteligente, no más difícil” (Ep. 79) — Gary Illyes y John Mueller sobre el presupuesto de rastreo, el planificador y por qué más del 90 % de los sitios no necesitan preocuparse por él.
- Google Search Central Blog — Recursos de diciembre sobre rastreo (2024) — la propia serie seleccionada por Google que profundiza en los fundamentos del rastreo.
- Search Engine Journal — Prioridades de rastreo de Google: perspectivas de Gary Illyes — cubre la misión declarada de Illyes de reducir el rastreo sin sacrificar la calidad.
- Search Engine Land — Google explica qué significa el “presupuesto de rastreo” para los webmasters — la cobertura original de 2017, cuando Google definió por primera vez la capacidad de rastreo y la demanda de rastreo.
- Wikipedia — Rastreador web — útil para la terminología formal de ciencias de la computación (frontera, política de cortesía) y la historia.
- r/TechSEO — la comunidad para depurar el rastreo y la indexación.
Estadísticas que vale la pena citar
- Los bots de IA se están acercando a los bots de búsqueda. Según mi análisis de Cloudflare Radar, los rastreadores de los motores de búsqueda siguen siendo los que más rastrean, pero los bots de IA son un claro #2 por volumen. Fuente
- Decenas de miles de millones de URL normalizadas nunca antes vistas son descubiertas por Bing cada día — la escala del problema de descubrimiento que los motores filtran agresivamente (Fabrice Canel, Microsoft Bing, 2022). Cobertura
Registro de cambios
Actualizado el 8 ago 2026.
Resumen editorial y detalles registrados del cambio.Detalles del cambio
-
Los detalles del cambio están disponibles actualmente en inglés.
La comparación completa no está disponible: no se archivó una instantánea anterior para esta revisión.
Actualizado el 2 ago 2026.
Resumen editorial y detalles registrados del cambio.Detalles del cambio
-
Los detalles del cambio están disponibles actualmente en inglés.
La comparación completa no está disponible: no se archivó una instantánea anterior para esta revisión.
Actualizado el 2 ago 2026.
Resumen editorial y detalles registrados del cambio.Detalles del cambio
-
Los detalles del cambio están disponibles actualmente en inglés.
La comparación completa no está disponible: no se archivó una instantánea anterior para esta revisión.
Actualizado el 2 ago 2026.
Resumen editorial y detalles registrados del cambio.Detalles del cambio
-
Los detalles del cambio están disponibles actualmente en inglés.
La comparación completa no está disponible: no se archivó una instantánea anterior para esta revisión.
Actualizado el 17 jul 2026.
Resumen editorial y detalles registrados del cambio.Detalles del cambio
-
Los detalles del cambio están disponibles actualmente en inglés.
-
Los detalles del cambio están disponibles actualmente en inglés.
-
Los detalles del cambio están disponibles actualmente en inglés.
La comparación completa no está disponible: no se archivó una instantánea anterior para esta revisión.