Rastreadores web

Qué es realmente un rastreador web (araña, bot), cómo funciona el bucle recuperar → analizar → poner en cola, y por qué el rastreo no es lo mismo que la indexación, el renderizado o la clasificación.

Publicado por primera vez: 24 jun 2026 · Última actualización: 8 ago 2026 · Avanzado
Idiomas
2 señales de evidencia en esta página

Los rastreadores web —también llamados arañas o bots— son programas automatizados que recuperan páginas, extraen enlaces y ponen en cola nuevas URL para visitar, alimentando el índice del motor de búsqueda. El bucle mecánico es descubrir → recuperar → analizar → programar, repetido indefinidamente. El rastreo es la primera de tres etapas (rastreo → indexación → servicio) y es un requisito previo para la clasificación, no un factor de clasificación: un mayor rastreo no mejora las posiciones. El rastreo también es distinto de la indexación y del renderizado. Los rastreadores reputados respetan robots.txt y limitan su frecuencia de rastreo; hoy en día no solo están los motores de búsqueda: los bots de IA representan una parte grande y creciente del tráfico. Para consultar detalles específicos de cada motor, consulta las páginas relacionadas con Googlebot, Bingbot, rastreadores de IA y agente de usuario (user-agent).

TL;DR — Un rastreador (araña, bot) es un programa automatizado que descubre, obtiene, analiza y reprograma URLs en un bucle. En palabras del propio Google: «downloads text, images, and videos from pages it found on the internet with automated programs called crawlers.» (traducción) «descarga texto, imágenes y videos de páginas que encontró en internet con programas automatizados llamados rastreadores.» La mecánica consiste en una frontera (la cola de URLs), una obtención (descargar el HTML), un análisis (extraer enlaces + contenido), y un planificador que decide qué obtener a continuación y a qué velocidad — regulándose según la salud de tu servidor. El renderizado de JavaScript es un paso separado. El rastreo es necesario para posicionar, pero no es una señal de posicionamiento, y es distinto de la indexación — una página bloqueada por robots aún puede indexarse. Y en 2026 no solo los motores de búsqueda rastrean: los bots de IA son una parte grande y de rápido crecimiento del tráfico.

Qué es realmente un rastreador

La definición de Google es casi lo más sencilla posible: «downloads text, images, and videos from pages it found on the internet with automated programs called crawlers.» (traducción) «descarga texto, imágenes y videos de páginas que encontró en internet con programas automatizados llamados rastreadores.» La redacción del propio glosario de Google es aún más amplia: «a crawler is a generic term for any program that is used to automatically discover and scan websites.» (traducción) «un rastreador es un término genérico para cualquier programa que se usa para descubrir y escanear sitios web automáticamente.» Rastreador, araña, bot, spiderbot: mismo concepto, diferente nombre. Evidence for this claim Google defines a crawler as an automated program that discovers and scans websites and describes Googlebot as its web crawler. Scope: Google crawler terminology. Confidence: high · Verified: Google: Googlebot overview

La razón por la que el rastreo importa en absoluto es el flujo de procesamiento. Google es directo al respecto: «Google Search works in three stages, and not all pages make it through each stage» (traducción) «Google Search funciona en tres etapas, y no todas las páginas pasan por cada etapa» — rastreo, indexación y publicación. El rastreo es la puerta uno. Una página que nunca se rastrea no puede indexarse, y una página que no está indexada no puede posicionarse.

Cómo funciona un rastreador, mecánicamente

Si eliminas la marca, la mayoría de los rastreadores que siguen enlaces ejecutan alguna versión del mismo bucle: descubrir → obtener → analizar → programar → repetir. Es un modelo mental útil para razonar sobre el comportamiento del rastreador — no una garantía de que cada rastreador que se haya creado implemente estas etapas exactas de manera idéntica.

La frontera (la cola). Un rastreador no deambula aleatoriamente. Mantiene una cola de URL que conoce pero que aún no ha visitado — la frontera de rastreo — y un programador que decide qué URL extraer a continuación. Comienza a partir de un conjunto semilla de URL conocidas y hace crecer la cola a medida que descubre más. Google describe el descubrimiento así: “Other pages are discovered when Google extracts a link from a known page to a new page… Still other pages are discovered when you submit a list of pages (a sitemap) for Google to crawl. This process is called ‘URL discovery.’” (traducción) «Otras páginas se descubren cuando Google extrae un enlace de una página conocida a una página nueva… Otras páginas se descubren cuando envías una lista de páginas (un sitemap) para que Google las rastree. Este proceso se llama ‘URL discovery’.» Evidence for this claim Google discovers URLs through links from known pages and through submitted sitemaps. Scope: Google URL discovery; sitemap submission does not guarantee crawling or indexing. Confidence: high · Verified: Google: How Search works

Fetch. El rastreador envía una solicitud HTTP; el servidor devuelve la página. En este paso, descarga el HTML sin procesar (los recursos como JavaScript y CSS se obtienen por separado, a menudo más tarde). Fabrice Canel, de Bing, describe claramente el objetivo de todo este proceso: “Crawling is the process by which bingbot discovers new and updated documents or content to be added to Bing’s searchable index.” (traducción) «El rastreo es el proceso mediante el cual Bingbot descubre documentos o contenido nuevos y actualizados para añadirlos al índice de búsqueda de Bing».

Análisis. El HTML obtenido se analiza para extraer enlaces, texto, encabezados, imágenes, y metadatos. Las URL recién encontradas se normalizan y se devuelven a la frontera — que es lo que mantiene el bucle en marcha.

Programación. Lo que se obtiene, con qué frecuencia y cuántas páginas por visita se decide algorítmicamente, no por ti. Google: “Googlebot uses an algorithmic process to determine which sites to crawl, how often, and how many pages to fetch from each site.” (traducción) «Googlebot utiliza un proceso algorítmico para determinar qué sitios rastrear, con qué frecuencia y cuántas páginas obtener de cada sitio». Las páginas populares y que cambian con frecuencia se vuelven a visitar antes; las poco conocidas y estáticas se vuelven a visitar rara vez. (Cómo se establece esa programación —presupuesto de rastreo, frecuencia de rastreo, frecuencia de rastreo— tiene cada uno su propio análisis en profundidad en este clúster.)

Evidence for this claim Googlebot algorithmically determines which sites to crawl, how often, and how many pages to fetch. Scope: web Confidence: high · Verified: In-Depth Guide to How Google Search Works

”Googlebot” no es un solo programa

Esta es la idea que la mayoría de las explicaciones pasan por alto. «Googlebot» suena como un único programa; no lo es. En mi presentación How Search Works lo describo como más de 1 000 sistemas que ejecutan una familia de rastreadores especializados — escritorio, móvil, imágenes, noticias, video, anuncios — todos los cuales extraen del mismo grupo de presupuesto de rastreo. Gary Illyes ha hecho el mismo señalamiento desde dentro: el nombre es, en esencia, un término inapropiado para una plataforma de rastreo central a través de la cual muchos productos de Google (Shopping, AdSense y el resto) canalizan sus solicitudes, bajo diferentes nombres de agente de usuario (user-agent). Así que cuando lees tus registros, no estás viendo un solo bot — estás viendo una flota que casualmente comparte una etiqueta. (Los detalles específicos de cada motor están en las páginas hermanas de Googlebot y Bingbot.)

Cortesía — cómo los rastreadores evitan saturar tu sitio

Un rastreador bien comportado se autorregula deliberadamente. Google: «They try not to crawl the site too fast to avoid overloading it. This mechanism is based on the responses of the site (for example, HTTP 500 errors mean ‘slow down’).» (traducción) «Intentan no rastrear el sitio demasiado rápido para evitar sobrecargarlo. Este mecanismo se basa en las respuestas del sitio (por ejemplo, los errores HTTP 500 significan ‘reduce la velocidad’).» Esa es también la palanca para ralentizar temporalmente un rastreo — las respuestas 5xx/429 sostenidas hacen que Googlebot retroceda (por uno o dos días, no para siempre). La cortesía no es una gentileza opcional; a la escala en que operan los rastreadores, es lo único que evita que saturen los servidores hasta dejarlos fuera de la web.

Robots.txt — el control de rastreo estándar

robots.txt es la convención de control de acceso de facto. Google: «A robots.txt file tells search engine crawlers which URLs the crawler can access on your site.» (traducción) «Un archivo robots.txt indica a los rastreadores de motores de búsqueda a qué URL puede acceder el rastreador en tu sitio.» Dos cosas que debes tener claras:

  • Controla el rastreo, no la indexación. Una página que bloqueas aún puede indexarse si otras páginas enlazan a ella — Google simplemente no puede ver el contenido (ni ninguna etiqueta noindex que pongas allí). Como indiqué en Indexed, though blocked by robots.txt: “crawling and indexing are two different things.” (traducción) «el rastreo y la indexación son dos cosas diferentes.» Para eliminar realmente una página, permite el rastreo y añade noindex — no la bloquees.
  • Los rastreadores reputados lo obedecen; los actores malintencionados no. Googlebot, Bingbot, Ahrefsbot y similares respetan robots.txt; muchos scrapers y bots de poca reputación lo ignoran por completo. Es una convención, no un mecanismo de aplicación.

Probé directamente el aspecto del bloqueo. En La historia de bloquear 2 páginas con posicionamiento alto usando Robots.txt bloqueé dos de nuestras páginas que posicionaban durante casi cinco meses. Perdieron todos sus fragmentos destacados y sus títulos personalizados (los resultados mostraban “no information is available” (traducción) «no hay información disponible» ), y los clics bajaron más de lo que la posición por sí sola explicaría — pero la estimación de tráfico apenas se movió. Mi conclusión se mantiene: no bloquees las páginas que quieres que se indexen. Perjudica. No tanto como podrías pensar — pero aun así perjudica.

Rastreo ≠ indexación ≠ renderizado ≠ posicionamiento

Las distinciones que causan más confusión:

  • Rastreo ≠ indexación. El rastreo es obtención + descarga; la indexación es entender + almacenar. Una página puede ser rastreada y no indexada (Google decidió no incluirla), y una página bloqueada puede ser indexada sin haber sido leída nunca. “Indexing isn’t guaranteed; not every page that Google processes will be indexed.” (traducción) «La indexación no está garantizada; no todas las páginas que Google procesa se indexarán.»
  • Rastreo ≠ renderizado. La obtención del HTML y la ejecución de su JavaScript son dos pasos diferentes. “During the crawl, Google renders the page and runs any JavaScript it finds using a recent version of Chrome,” (traducción) «Durante el rastreo, Google renderiza la página y ejecuta cualquier JavaScript que encuentra usando una versión reciente de Chrome», pero ese renderizado ocurre en una cola separada que puede retrasarse respecto a la obtención inicial. Si tu contenido solo aparece después de que se ejecuta JavaScript, no está disponible en la misma pasada que el HTML.
  • Rastreo ≠ posicionamiento. Ser rastreado con más frecuencia no es una señal de posicionamiento. La frecuencia de rastreo es una cuestión de eficiencia, y punto — por eso la mayoría de los sitios nunca necesitan gestionar el presupuesto de rastreo en absoluto.

Tipos de rastreadores (a alto nivel)

Para mantener esto breve — cada uno tiene una página hermana que profundiza:

  • Rastreadores de motores de búsqueda — Googlebot, Bingbot. Construyen los índices que impulsan los resultados de búsqueda.
  • Rastreadores de IA / LLM — GPTBot, ClaudeBot, CCBot y otros, que recopilan contenido web para entrenar o impulsar modelos de IA. Crecen rápidamente (consulta más abajo).
  • Rastreadores de auditoría SEO — Ahrefs Site Audit, Screaming Frog y herramientas similares que simulan un rastreo para detectar problemas técnicos.
  • Recuperadores activados por el usuario — herramientas que hacen una única solicitud a petición (la herramienta de inspección de URL de Google, Rich Results Test). No son rastreadores autónomos.

Quién está rastreando la web ahora

Ya no se trata solo de los motores de búsqueda. En mi análisis de los datos de Cloudflare Radar (Conoce los nuevos rastreadores web), los bots de motores de búsqueda siguen siendo los que más rastrean, pero los bots de IA están firmemente en segundo lugar. La escala aquí es difícil de exagerar: solo Bing descubre decenas de miles de millones de URL normalizadas que nunca antes había visto cada día (Fabrice Canel) — que es exactamente la razón por la que los motores tienen que priorizar de forma agresiva lo que realmente recuperan.

Cómo verificar que un rastreador es quien dice ser

Cualquier bot puede poner “Googlebot” en su cadena de agente de usuario (user-agent), así que no confíes solo en la cadena. La verificación real es una resolución DNS inversa + directa (consulta la pestaña Scripts): aplica resolución DNS inversa a la IP de tus registros, confirma que se resuelve en un nombre de host googlebot.com / google.com y luego aplica resolución DNS directa a ese nombre de host y confirma que apunta de vuelta a la misma IP. Google también publica sus rangos de IP. Los detalles completos del agente de usuario (user-agent) por motor están en la página hermana user-agent.

Adónde ir a continuación

Esta es la página de conceptos generales. Para obtener información específica:

  • Googlebot — el rastreador de Google: agentes de usuario (user-agent), rastreo mobile-first, renderizado, Crawl Stats de Search Console.
  • Bingbot — el rastreador de Bing: Crawl Control e IndexNow.
  • Rastreadores de IA — GPTBot, ClaudeBot, CCBot y los bots agénticos más nuevos.
  • User-agent — qué es la cadena de agente de usuario (user-agent) y cómo leerla.
  • Centro de rastreo — todo el flujo, además de presupuesto de rastreo, frecuencia de rastreo, frecuencia de rastreo, crawl depth, spider traps y log file analysis.

Add an expert note

Pin an expert quote

New person? Create their unclaimed profile at /admin/experts/ → Pin a quote first.