Cómo funciona la búsqueda

Cómo funciona la búsqueda — Español

Español › Contenido

Informe de indexación de páginas (GSC)

Cómo funciona el informe de indexación de páginas de Google Search Console, antes llamado Index Coverage: páginas indexadas y no indexadas, la columna Fuente, todos los estados, Validar corrección y el retraso del informe.

Leer artículo →
Español › Contenido

Descubrimiento

Cómo descubren URL los buscadores mediante enlaces internos, backlinks, sitemaps, RSS/Atom y protocolos push como IndexNow y la API de indexación. El centro de todo lo relacionado con el descubrimiento.

Leer artículo →
Español › Contenido

Sitelinks y SEO

Qué son los sitelinks de Google, por qué son 100% algorítmicos y cómo influir (no controlar) en ellos: además, la herramienta de degradación que ya no existe, la desaprobación del cuadro de búsqueda de Sitelinks, los enlaces profundos de Bing y en qué se diferencian los sitelinks de pago de los orgánicos.

Leer artículo →
Español › Contenido

IndexNow para SEO

IndexNow es el protocolo abierto de push que informa al instante a Bing, Yandex, Naver, Seznam y Yep cuando tus URLs cambian: un solo envío, compartido entre todos ellos. Cómo funciona, cómo configurarlo y por qué no hace nada por Google.

Leer artículo →
Español › Contenido

Sitemaps de noticias

Qué es un sitemap de noticias, la estructura y el anidamiento exactos del espacio de nombres news:, la ventana de frescura de dos días, el límite de 1 00 URL, las etiquetas obsoletas que debes dejar de copiar y cómo enviarlo.

Leer artículo →
Español › Contenido

Indexación

Cómo almacenan y organizan las páginas los motores de búsqueda para poder posicionarlas: análisis del contenido, canonicalización, por qué rastreada no significa indexada y cómo leer el Informe de indexación de páginas de GSC.

Leer artículo →
Español › Contenido

Cómo conseguir que Google indexe tu sitio web

La forma correcta de conseguir que Google indexe tus páginas: sitemaps, enlaces internos, Request Indexing, la Indexing API e IndexNow, y por qué la calidad es el verdadero filtro.

Leer artículo →
Español › Contenido

Indexación móvil primero

Qué es realmente la indexación móvil primero: Google usa tu HTML móvil para indexar y clasificar, por qué la paridad de contenido es la regla

Leer artículo →
Español › Contenido

No se ha encontrado (404)

Qué significa "No se ha encontrado (404)" en el informe "Indexación de páginas" de Google Search Console: por qué Google encontró URLs que usted nunca envió, por qué los 404 normalmente no perjudican al SEO y el pequeño conjunto de 404 que realmente merece la pena corregir.

Leer artículo →
Español › Contenido

Página alternativa con etiqueta canonical correcta

«Página alternativa con etiqueta canonical correcta» en el informe de indexación de páginas de Google Search Console no es un error: es el sistema de canonicalización funcionando como debe. Qué significa, por qué las cifras altas suelen ser normales, cómo se diferencia de los dos estados de duplicados y cuáles son los pocos casos que conviene investigar.

Leer artículo →
Español › Contenido

User Agent y SEO

Qué es un user agent: el encabezado HTTP que los rastreadores y navegadores usan para identificarse, el token de robots.txt frente a la cadena completa, y cómo verificar que un bot es real.

Leer artículo →
Español › Contenido

Análisis de archivos de registro

Cómo leer los registros de acceso sin procesar de tu servidor para ver exactamente qué obtuvieron Googlebot, Bingbot y los rastreadores de IA — verificando bots reales, encontrando desperdicio de rastreo y páginas huérfanas, y por qué los registros son la verdad fundamental que las herramientas de rastreo y Search Console solo aproximan.

Leer artículo →
Español › Contenido

Fuentes RSS

Cómo utilizan los motores de búsqueda las fuentes RSS 2,0 y Atom 1,0 como canal de descubrimiento de contenido nuevo: Feedfetcher, robots.txt, WebSub y por qué una fuente complementa pero nunca reemplaza a un sitemap XML.

Leer artículo →
Español › Contenido

Sitemaps

Qué es un sitemap, cuándo es necesario, cómo encontrarlo y presentarlo, los límites y errores comunes, y cómo medir la cobertura de indexación.

Leer artículo →
Español › Contenido

Índice de sitemaps

Qué es un índice de sitemaps, cómo permite superar el límite de 50 000 URL, cuánta capacidad ofrece y cómo dividir los archivos para obtener informes útiles.

Leer artículo →
Español › Contenido

Error del servidor (5xx)

Qué significa el estado "Server error (5xx)" del informe Indexación de páginas de Google Search Console: por qué una respuesta de nivel 500 ralentiza el rastreo y termina retirando páginas, cómo diagnosticarla y corregirla, y cómo desactivar deliberadamente un sitio con 503 y Retry-After.

Leer artículo →
Español › Contenido

Página con redirección (estado de GSC)

Qué significa «Página con redirección» en el informe Indexación de páginas de Google Search Console, por qué esas URL no se indexan por diseño, en qué se diferencia de «Error de redirección» y qué casos excepcionales requieren actuar.

Leer artículo →
Español › Contenido

Página indexada sin contenido

Qué significa el estado «Página indexada sin contenido» de Google Search Console —la página está en el índice, pero Googlebot no pudo leerla— y cómo diagnosticarlo. A menudo se debe a un bloqueo del servidor o CDN, no solo a JavaScript.

Leer artículo →
Español › Contenido

PageRank y SEO

PageRank es el algoritmo original de análisis de enlaces de Google: qué es, el modelo del navegante aleatorio y la fórmula, la actualización del Navegante Razonable, su historia desde la barra de herramientas hasta la filtración de la API de 2024, por qué sigue siendo un sistema de clasificación central, y qué significa para tus enlaces y arquitectura interna.

Leer artículo →
Español › Contenido

Trampas para rastreadores

Qué son las trampas para rastreadores, cómo las crean filtros, calendarios, parámetros y bucles, cómo detectarlas en registros y cómo corregirlas sin perjudicar la indexación.

Leer artículo →
Español › Contenido

SEO y Accesibilidad

Dónde la accesibilidad web y el SEO realmente se superponen (texto alternativo, encabezados, texto de enlace, velocidad) y dónde divergen, además de por qué Google dice que la accesibilidad no es un factor de ranking.

Leer artículo →
Español › Contenido

URL marcada como 'noindex' (estado de GSC)

Qué significa el estado "URL marcada como 'noindex'" en Google Search Console, y la variante "URL enviada marcada como 'noindex'" y el nombre heredado "Excluida por la etiqueta 'noindex'". Cuándo es intencional vs. un error, dónde vive el noindex (etiqueta meta vs. cabecera X-Robots-Tag), el conflicto con robots.txt, el noindex fantasma/CDN, y cómo corregirlo y validarlo.

Leer artículo →
Español › Contenido

Rastreador Baiduspider

Qué es Baiduspider: las variantes y los user-agents del rastreador de Baidu, el cumplimiento de robots.txt (y la excepción de cpro/ads), la verificación mediante DNS inverso, la débil renderización de JS y el control del rastreo en Ziyuan.

Leer artículo →
Español › Contenido

Rastreador Bingbot

Qué es Bingbot, qué impulsa más allá de Bing, cómo verificarlo mediante DNS inverso y cómo controlar su rastreo con robots.txt, Crawl Control e IndexNow.

Leer artículo →
Español › Contenido

Redirecciones JavaScript

Qué es una redirección JavaScript, cómo el pipeline de renderizado de Google la trata de manera diferente a un 301 del lado del servidor, cuándo es un último recurso aceptable, y cómo implementarla y detectarla — además de dónde encajan el meta refresh y la API History.

Leer artículo →
Español › Contenido

Robots.txt

Qué hace realmente el robots.txt —controla el rastreo, no la indexación— además de la sintaxis exacta, cómo lo gestiona Google internamente y los errores que rompen sitios.

Leer artículo →
Español › Contenido

API de indexación de Google: usos admitidos y mitos

Qué hace realmente la API de indexación de Google: solo admite oficialmente páginas JobPosting y BroadcastEvent (emisiones en directo), no contenido general. Mitos, documentación real de Google y alternativas.

Leer artículo →
Español › Contenido

Bloqueado por acceso prohibido (403)

Qué significa el estado «Blocked due to access forbidden (403)» en el informe de Indexación de páginas de Google Search Console, por qué Googlebot recibe un 403 cuando tu navegador no, en qué se diferencia de 401 y cómo diagnosticarlo, corregirlo y validarlo.

Leer artículo →
Español › Contenido

Googlebot: rastreo, renderizado y verificación

Qué es realmente Googlebot: Smartphone frente a Desktop, renderizado con Chromium evergreen, cadenas de user-agent, verificación de rangos de IP, límites de bytes y la diferencia entre rastrear y posicionar.

Leer artículo →
Español › Contenido

Canonicalización: cómo elegir la URL principal

Cómo los motores de búsqueda eligen una URL canónica entre duplicados y consolidan en ella las señales de posicionamiento; por qué rel=canonical es una sugerencia, no una regla, y cómo alinear todas las señales.

Leer artículo →
Español › Contenido

Contenido duplicado

No existe una penalización por contenido duplicado. Qué costes reales puede tener la duplicación, cómo agrupan los motores las URL y eligen una canónica, y cómo corregirla.

Leer artículo →
Español › Contenido

Bloqueado por otro error 4xx

Qué significa «Blocked due to other 4xx issue» en el informe de Indexación de páginas de Google Search Console, qué códigos de estado suelen aparecer aquí (400, 405, 408, 410, 411, 413, 414, 421, 422, 451 y el matiz de 429), cómo los trata Google y cómo diagnosticar, corregir y validar el problema.

Leer artículo →
Español › Contenido

Bloqueado por robots.txt (estado de GSC)

Qué significa el estado de Indexación de páginas «Blocked by robots.txt» de Google Search Console: una URL excluida de la indexación porque robots.txt impidió el rastreo. Normalmente es intencionado. En qué se diferencia de «Indexed, though blocked», por qué noindex y Disallow entran en conflicto y cómo corregirlo si el bloqueo fue un error.

Leer artículo →
Español › Contenido

Bloqueado por solicitud no autorizada (401)

Qué significa el estado de indexación de páginas de Google Search Console «Bloqueado por solicitud no autorizada (401)», en qué se diferencia del 403 según RFC 9110, cuáles son las causas habituales, cómo diagnosticarlo como bot y cuál es la solución correcta según el tipo de página: pública, privada, falso positivo del WAF o contenido de pago.

Leer artículo →
Español › Contenido

Rastreadas: actualmente no indexadas

Qué significa _«Crawled – currently not indexed»_ _(traducción)_ «rastreada: actualmente no indexada» en Google Search Console: Google obtuvo la página pero decidió no indexarla; normalmente es una decisión sobre la calidad del contenido o del sitio. Cómo se diferencia de _«Discovered – currently not indexed,»_ _(traducción)_ «descubierta: actualmente no indexada»; cuándo vale la pena revisarla y cómo solucionarla.

Leer artículo →
Español › Contenido

Rastreo

Cómo los motores de búsqueda descubren y descargan la web: Googlebot y Bingbot, URL discovery, el programador de rastreo, el renderizado y en qué se diferencia el rastreo de la indexación y del posicionamiento. El hub de todo lo relacionado con el rastreo.

Leer artículo →
Español › Contenido

Directiva crawl-delay

La directiva crawl-delay de robots.txt — qué hace, por qué Google dejó de respetarla en 2019 y Yandex la eliminó en 2018, cómo Bing todavía interpreta el valor, qué otros rastreadores la respetan y qué usar en su lugar.

Leer artículo →
Español › Contenido

Presupuesto de rastreo

Qué es realmente el presupuesto de rastreo —capacidad de rastreo más demanda de rastreo—, qué lo desperdicia y la prueba honesta para saber si su sitio es lo bastante grande como para preocuparse.

Leer artículo →
Español › Contenido

Demanda de rastreo

El lado del «deseo» del presupuesto de rastreo: lo que hace que Google quiera rastrear tus páginas (popularidad, obsolescencia, inventario percibido), cómo la demanda se encuentra con la capacidad de carga del host y por qué no puedes forzarla.

Leer artículo →
Español › Contenido

Frecuencia de rastreo

Con qué frecuencia los motores de búsqueda vuelven a rastrear una página que ya conocen: qué la impulsa (popularidad, falta de actualización, un lastmod honesto), qué no (changefreq, priority, publicar a diario) y por qué no se puede forzar.

Leer artículo →
Español › Contenido

Frecuencia de rastreo

La rapidez con la que los motores de búsqueda obtienen tus páginas — qué es la frecuencia de rastreo, por qué Google retiró el control deslizante de frecuencia de Search Console, cómo ralentizar a Googlebot de forma segura hoy, por qué no puedes forzar un aumento y en qué difiere el Crawl Control manual de Bing.

Leer artículo →
Español › Contenido

Problemas de rastreabilidad: qué rompe el rastreo y cómo corregirlo

Los problemas de rastreabilidad son las condiciones técnicas que impiden que los motores de búsqueda descubran, accedan u obtengan sus páginas. Guía de triaje para los cuatro grupos: acceso bloqueado, enlaces rotos, servidores que fallan e inventario de URL inflado; cómo encontrarlos y cómo corregirlos.

Leer artículo →
Español › Contenido

Rastreadores web

Qué es realmente un rastreador web (araña, bot), cómo funciona el bucle recuperar → analizar → poner en cola, y por qué el rastreo no es lo mismo que la indexación, el renderizado o la clasificación.

Leer artículo →
Español › Contenido

Rastreadores de IA

Los tres tipos de rastreadores de IA —bots de entrenamiento, indexadores de búsqueda con IA y obtenedores activados por el usuario—, los principales bots identificados y cómo controlar cada uno sin perjudicar el SEO.

Leer artículo →
Español › Contenido

Mapa del sitio XML

Qué es un mapa del sitio XML, su anatomía, las etiquetas ignoradas (priority/changefreq), lastmod preciso, los límites de 50 000/50MB, hreflang en mapas del sitio y cómo enviar uno.

Leer artículo →