Cómo funciona la búsqueda
Cómo funciona la búsqueda — Español
Informe de indexación de páginas (GSC)
Cómo funciona el informe de indexación de páginas de Google Search Console, antes llamado Index Coverage: páginas indexadas y no indexadas, la columna Fuente, todos los estados, Validar corrección y el retraso del informe.
Español › ContenidoDescubrimiento
Cómo descubren URL los buscadores mediante enlaces internos, backlinks, sitemaps, RSS/Atom y protocolos push como IndexNow y la API de indexación. El centro de todo lo relacionado con el descubrimiento.
Español › ContenidoSitelinks y SEO
Qué son los sitelinks de Google, por qué son 100% algorítmicos y cómo influir (no controlar) en ellos: además, la herramienta de degradación que ya no existe, la desaprobación del cuadro de búsqueda de Sitelinks, los enlaces profundos de Bing y en qué se diferencian los sitelinks de pago de los orgánicos.
Español › ContenidoIndexNow para SEO
IndexNow es el protocolo abierto de push que informa al instante a Bing, Yandex, Naver, Seznam y Yep cuando tus URLs cambian: un solo envío, compartido entre todos ellos. Cómo funciona, cómo configurarlo y por qué no hace nada por Google.
Español › ContenidoSitemaps de noticias
Qué es un sitemap de noticias, la estructura y el anidamiento exactos del espacio de nombres news:, la ventana de frescura de dos días, el límite de 1 00 URL, las etiquetas obsoletas que debes dejar de copiar y cómo enviarlo.
Español › ContenidoIndexación
Cómo almacenan y organizan las páginas los motores de búsqueda para poder posicionarlas: análisis del contenido, canonicalización, por qué rastreada no significa indexada y cómo leer el Informe de indexación de páginas de GSC.
Español › ContenidoCómo conseguir que Google indexe tu sitio web
La forma correcta de conseguir que Google indexe tus páginas: sitemaps, enlaces internos, Request Indexing, la Indexing API e IndexNow, y por qué la calidad es el verdadero filtro.
Español › ContenidoIndexación móvil primero
Qué es realmente la indexación móvil primero: Google usa tu HTML móvil para indexar y clasificar, por qué la paridad de contenido es la regla
Español › ContenidoNo se ha encontrado (404)
Qué significa "No se ha encontrado (404)" en el informe "Indexación de páginas" de Google Search Console: por qué Google encontró URLs que usted nunca envió, por qué los 404 normalmente no perjudican al SEO y el pequeño conjunto de 404 que realmente merece la pena corregir.
Español › ContenidoPágina alternativa con etiqueta canonical correcta
«Página alternativa con etiqueta canonical correcta» en el informe de indexación de páginas de Google Search Console no es un error: es el sistema de canonicalización funcionando como debe. Qué significa, por qué las cifras altas suelen ser normales, cómo se diferencia de los dos estados de duplicados y cuáles son los pocos casos que conviene investigar.
Español › ContenidoUser Agent y SEO
Qué es un user agent: el encabezado HTTP que los rastreadores y navegadores usan para identificarse, el token de robots.txt frente a la cadena completa, y cómo verificar que un bot es real.
Español › ContenidoAnálisis de archivos de registro
Cómo leer los registros de acceso sin procesar de tu servidor para ver exactamente qué obtuvieron Googlebot, Bingbot y los rastreadores de IA — verificando bots reales, encontrando desperdicio de rastreo y páginas huérfanas, y por qué los registros son la verdad fundamental que las herramientas de rastreo y Search Console solo aproximan.
Español › ContenidoFuentes RSS
Cómo utilizan los motores de búsqueda las fuentes RSS 2,0 y Atom 1,0 como canal de descubrimiento de contenido nuevo: Feedfetcher, robots.txt, WebSub y por qué una fuente complementa pero nunca reemplaza a un sitemap XML.
Español › ContenidoSitemaps
Qué es un sitemap, cuándo es necesario, cómo encontrarlo y presentarlo, los límites y errores comunes, y cómo medir la cobertura de indexación.
Español › ContenidoÍndice de sitemaps
Qué es un índice de sitemaps, cómo permite superar el límite de 50 000 URL, cuánta capacidad ofrece y cómo dividir los archivos para obtener informes útiles.
Español › ContenidoError del servidor (5xx)
Qué significa el estado "Server error (5xx)" del informe Indexación de páginas de Google Search Console: por qué una respuesta de nivel 500 ralentiza el rastreo y termina retirando páginas, cómo diagnosticarla y corregirla, y cómo desactivar deliberadamente un sitio con 503 y Retry-After.
Español › ContenidoPágina con redirección (estado de GSC)
Qué significa «Página con redirección» en el informe Indexación de páginas de Google Search Console, por qué esas URL no se indexan por diseño, en qué se diferencia de «Error de redirección» y qué casos excepcionales requieren actuar.
Español › ContenidoPágina indexada sin contenido
Qué significa el estado «Página indexada sin contenido» de Google Search Console —la página está en el índice, pero Googlebot no pudo leerla— y cómo diagnosticarlo. A menudo se debe a un bloqueo del servidor o CDN, no solo a JavaScript.
Español › ContenidoPageRank y SEO
PageRank es el algoritmo original de análisis de enlaces de Google: qué es, el modelo del navegante aleatorio y la fórmula, la actualización del Navegante Razonable, su historia desde la barra de herramientas hasta la filtración de la API de 2024, por qué sigue siendo un sistema de clasificación central, y qué significa para tus enlaces y arquitectura interna.
Español › ContenidoTrampas para rastreadores
Qué son las trampas para rastreadores, cómo las crean filtros, calendarios, parámetros y bucles, cómo detectarlas en registros y cómo corregirlas sin perjudicar la indexación.
Español › ContenidoSEO y Accesibilidad
Dónde la accesibilidad web y el SEO realmente se superponen (texto alternativo, encabezados, texto de enlace, velocidad) y dónde divergen, además de por qué Google dice que la accesibilidad no es un factor de ranking.
Español › ContenidoURL marcada como 'noindex' (estado de GSC)
Qué significa el estado "URL marcada como 'noindex'" en Google Search Console, y la variante "URL enviada marcada como 'noindex'" y el nombre heredado "Excluida por la etiqueta 'noindex'". Cuándo es intencional vs. un error, dónde vive el noindex (etiqueta meta vs. cabecera X-Robots-Tag), el conflicto con robots.txt, el noindex fantasma/CDN, y cómo corregirlo y validarlo.
Español › ContenidoRastreador Baiduspider
Qué es Baiduspider: las variantes y los user-agents del rastreador de Baidu, el cumplimiento de robots.txt (y la excepción de cpro/ads), la verificación mediante DNS inverso, la débil renderización de JS y el control del rastreo en Ziyuan.
Español › ContenidoRastreador Bingbot
Qué es Bingbot, qué impulsa más allá de Bing, cómo verificarlo mediante DNS inverso y cómo controlar su rastreo con robots.txt, Crawl Control e IndexNow.
Español › ContenidoRedirecciones JavaScript
Qué es una redirección JavaScript, cómo el pipeline de renderizado de Google la trata de manera diferente a un 301 del lado del servidor, cuándo es un último recurso aceptable, y cómo implementarla y detectarla — además de dónde encajan el meta refresh y la API History.
Español › ContenidoRobots.txt
Qué hace realmente el robots.txt —controla el rastreo, no la indexación— además de la sintaxis exacta, cómo lo gestiona Google internamente y los errores que rompen sitios.
Español › ContenidoAPI de indexación de Google: usos admitidos y mitos
Qué hace realmente la API de indexación de Google: solo admite oficialmente páginas JobPosting y BroadcastEvent (emisiones en directo), no contenido general. Mitos, documentación real de Google y alternativas.
Español › ContenidoBloqueado por acceso prohibido (403)
Qué significa el estado «Blocked due to access forbidden (403)» en el informe de Indexación de páginas de Google Search Console, por qué Googlebot recibe un 403 cuando tu navegador no, en qué se diferencia de 401 y cómo diagnosticarlo, corregirlo y validarlo.
Español › ContenidoGooglebot: rastreo, renderizado y verificación
Qué es realmente Googlebot: Smartphone frente a Desktop, renderizado con Chromium evergreen, cadenas de user-agent, verificación de rangos de IP, límites de bytes y la diferencia entre rastrear y posicionar.
Español › ContenidoCanonicalización: cómo elegir la URL principal
Cómo los motores de búsqueda eligen una URL canónica entre duplicados y consolidan en ella las señales de posicionamiento; por qué rel=canonical es una sugerencia, no una regla, y cómo alinear todas las señales.
Español › ContenidoContenido duplicado
No existe una penalización por contenido duplicado. Qué costes reales puede tener la duplicación, cómo agrupan los motores las URL y eligen una canónica, y cómo corregirla.
Español › ContenidoBloqueado por otro error 4xx
Qué significa «Blocked due to other 4xx issue» en el informe de Indexación de páginas de Google Search Console, qué códigos de estado suelen aparecer aquí (400, 405, 408, 410, 411, 413, 414, 421, 422, 451 y el matiz de 429), cómo los trata Google y cómo diagnosticar, corregir y validar el problema.
Español › ContenidoBloqueado por robots.txt (estado de GSC)
Qué significa el estado de Indexación de páginas «Blocked by robots.txt» de Google Search Console: una URL excluida de la indexación porque robots.txt impidió el rastreo. Normalmente es intencionado. En qué se diferencia de «Indexed, though blocked», por qué noindex y Disallow entran en conflicto y cómo corregirlo si el bloqueo fue un error.
Español › ContenidoBloqueado por solicitud no autorizada (401)
Qué significa el estado de indexación de páginas de Google Search Console «Bloqueado por solicitud no autorizada (401)», en qué se diferencia del 403 según RFC 9110, cuáles son las causas habituales, cómo diagnosticarlo como bot y cuál es la solución correcta según el tipo de página: pública, privada, falso positivo del WAF o contenido de pago.
Español › ContenidoRastreadas: actualmente no indexadas
Qué significa _«Crawled – currently not indexed»_ _(traducción)_ «rastreada: actualmente no indexada» en Google Search Console: Google obtuvo la página pero decidió no indexarla; normalmente es una decisión sobre la calidad del contenido o del sitio. Cómo se diferencia de _«Discovered – currently not indexed,»_ _(traducción)_ «descubierta: actualmente no indexada»; cuándo vale la pena revisarla y cómo solucionarla.
Español › ContenidoRastreo
Cómo los motores de búsqueda descubren y descargan la web: Googlebot y Bingbot, URL discovery, el programador de rastreo, el renderizado y en qué se diferencia el rastreo de la indexación y del posicionamiento. El hub de todo lo relacionado con el rastreo.
Español › ContenidoDirectiva crawl-delay
La directiva crawl-delay de robots.txt — qué hace, por qué Google dejó de respetarla en 2019 y Yandex la eliminó en 2018, cómo Bing todavía interpreta el valor, qué otros rastreadores la respetan y qué usar en su lugar.
Español › ContenidoPresupuesto de rastreo
Qué es realmente el presupuesto de rastreo —capacidad de rastreo más demanda de rastreo—, qué lo desperdicia y la prueba honesta para saber si su sitio es lo bastante grande como para preocuparse.
Español › ContenidoDemanda de rastreo
El lado del «deseo» del presupuesto de rastreo: lo que hace que Google quiera rastrear tus páginas (popularidad, obsolescencia, inventario percibido), cómo la demanda se encuentra con la capacidad de carga del host y por qué no puedes forzarla.
Español › ContenidoFrecuencia de rastreo
Con qué frecuencia los motores de búsqueda vuelven a rastrear una página que ya conocen: qué la impulsa (popularidad, falta de actualización, un lastmod honesto), qué no (changefreq, priority, publicar a diario) y por qué no se puede forzar.
Español › ContenidoFrecuencia de rastreo
La rapidez con la que los motores de búsqueda obtienen tus páginas — qué es la frecuencia de rastreo, por qué Google retiró el control deslizante de frecuencia de Search Console, cómo ralentizar a Googlebot de forma segura hoy, por qué no puedes forzar un aumento y en qué difiere el Crawl Control manual de Bing.
Español › ContenidoProblemas de rastreabilidad: qué rompe el rastreo y cómo corregirlo
Los problemas de rastreabilidad son las condiciones técnicas que impiden que los motores de búsqueda descubran, accedan u obtengan sus páginas. Guía de triaje para los cuatro grupos: acceso bloqueado, enlaces rotos, servidores que fallan e inventario de URL inflado; cómo encontrarlos y cómo corregirlos.
Español › ContenidoRastreadores web
Qué es realmente un rastreador web (araña, bot), cómo funciona el bucle recuperar → analizar → poner en cola, y por qué el rastreo no es lo mismo que la indexación, el renderizado o la clasificación.
Español › ContenidoRastreadores de IA
Los tres tipos de rastreadores de IA —bots de entrenamiento, indexadores de búsqueda con IA y obtenedores activados por el usuario—, los principales bots identificados y cómo controlar cada uno sin perjudicar el SEO.
Español › ContenidoMapa del sitio XML
Qué es un mapa del sitio XML, su anatomía, las etiquetas ignoradas (priority/changefreq), lastmod preciso, los límites de 50 000/50MB, hreflang en mapas del sitio y cómo enviar uno.