Contenido duplicado

No existe una penalización por contenido duplicado. Qué costes reales puede tener la duplicación, cómo agrupan los motores las URL y eligen una canónica, y cómo corregirla.

Publicado por primera vez: 23 jun 2026 · Última actualización: 8 ago 2026 · Avanzado
Idiomas
1 señal de evidencia en esta página

No existe una penalización general por contenido duplicado: Google y Bing lo dicen; la duplicación normal se gestiona mediante deduplicación y selección de la URL representativa, no mediante una acción de política. Los costes reales son indirectos y posibles, no garantizados: dilución de señales, elección de la URL equivocada (aunque otro miembro del grupo puede servirse en un contexto concreto), rastreo menos eficiente y medición más confusa. Los motores agrupan las URL coincidentes y eligen una URL representativa a partir de señales para representar el conjunto. La mayoría de la duplicación es técnica, no editorial (http/https, www, parámetros, navegación facetada, URL de impresión y móvil); filtros, ordenaciones, paginación, variantes y traducciones completas requieren revisar cada caso. Corrige según la intención: causa raíz/301 → rel=canonical → parámetros → noindex solo cuando quieras eliminar → hreflang → sindicación, donde la guía actual favorece que el socio aplique noindex a su copia. Las penalizaciones solo afectan al abuso engañoso y a escala.

TL;DR — No existe una penalización general por contenido duplicado: Google y Bing lo dicen explícitamente. La duplicación normal se resuelve mediante deduplicación y selección de la URL representativa, no mediante una acción de política. Los costes reales son indirectos y posibles, no garantizados: dilución de señales, elección de la URL equivocada (aunque otro miembro del grupo puede servirse en un contexto concreto), rastreo menos eficiente y medición más confusa. Los motores detectan duplicados → los agrupaneligen una URL representativa a partir de señales; la URL declarada es una pista, no una regla. La mayoría de los duplicados son técnicos, no editoriales, pero filtros, ordenaciones, paginación, variantes y traducciones necesitan una revisión caso por caso. Corrige según la intención, aproximadamente en este orden: causa raíz / 301 → rel="canonical" → gestión de parámetros → noindex solo para eliminar → hreflang → sindicación (la guía actual de Google favorece que el socio aplique noindex a su copia en vez de depender solo de esa señal). Las penalizaciones solo afectan al abuso engañoso y a escala, como raspar y republicar masivamente sin aportar valor.

Evidence for this claim Ordinary duplicate content is generally handled through canonicalization rather than a general duplicate-content penalty. Scope: Google duplicate URL handling. Confidence: high · Verified: Google Search Central: Duplicate URLs Evidence for this claim Redirects and rel=canonical are strong signals for specifying a preferred canonical URL, but Google may select another canonical. Scope: Google canonicalization signals. Confidence: high · Verified: Google Search Central: Canonical URLs

Qué es realmente el contenido duplicado

Como lo expresé en mi guía de Ahrefs: “Duplicate content is the same or similar content that appears on the web in more than one place. It can exist on one website or across multiple websites.” (traducción) «El contenido duplicado es el mismo contenido o uno similar que aparece en la web en más de un lugar. Puede existir en un solo sitio o en varios». La definición antigua de Google (de una publicación de Search Central de 2006) hablaba de bloques sustanciales dentro de un dominio o entre dominios que coinciden por completo o son apreciablemente similares.

La idea clave es reformularlo: la mayoría del contenido duplicado es un artefacto técnico, no plagio. Una página se sirve en varias direcciones y cada dirección es una URL distinta para un rastreador. La duplicación editorial también existe, pero es minoritaria y ni siquiera se penaliza salvo que sea engañosa.

La documentación actual de Google es más precisa: se refiere al contenido principal que es igual o muy parecido, no a una coincidencia palabra por palabra, y puede ocurrir dentro de un sitio o en toda la web. Conviene distinguirlo de: contenido pobre (una página demasiado escasa para ser útil, sea duplicada o no), plagio (una cuestión legal/ética, no técnica), canibalización de palabras clave (varias páginas distintas de tu sitio compiten por la misma consulta) y la puntuación de «casi duplicado» de un rastreador (un umbral configurable de una herramienta, no algo que Google publique o use directamente).

¿Existe una penalización por contenido duplicado? No.

Este es el eje de todo el tema, así que no puedo ser más claro: no existe una penalización general por contenido duplicado. Los dos grandes motores lo dicen.

La publicación de Google de 2008, Desmitificar la «penalización por contenido duplicado», empieza con la frase que todo el mundo debería conocer: “There’s no such thing as a ‘duplicate content penalty.’ At least, not in the way most people mean when they say that.” (traducción) «No existe una “penalización por contenido duplicado”, al menos no en el sentido que la mayoría da a esa frase». John Mueller lo ha reafirmado durante años; en mi guía de Ahrefs lo cito directamente: “We don’t have a duplicate content penalty. It’s not that we would demote a site for having a lot of duplicate content.” (traducción) «La penalización por contenido duplicado no existe: tener muchas copias no hace que rebajemos la posición de un sitio».

Bing volvió a decirlo recientemente. En su publicación de diciembre de 2025 escribió: “Duplicate content doesn’t trigger search penalties on its own, but it does reduce visibility by diluting authority.” (traducción) «El contenido duplicado no activa penalizaciones de búsqueda por sí solo, pero reduce la visibilidad al diluir la autoridad».

Llevo una década defendiendo esta idea. Mi artículo de 2016 en Search Engine Land, *El mito de la penalización por contenido duplicado *, lo expresó así: “Duplicate content is not grounds for action unless its intent is to manipulate search results.” (traducción) «El contenido duplicado no es motivo de acción salvo que su intención sea manipular los resultados de búsqueda». Esa frase sigue siendo toda la historia.

La única excepción real: abuso engañoso y a escala

Las penalizaciones solo entran en escena cuando la duplicación es manipuladora. Eso vive en las políticas de spam de Google, no en una regla de «contenido duplicado». La línea clara es el abuso de contenido a escala: “Scaled content abuse is when many pages are generated for the primary purpose of manipulating search rankings and not helping users.” (traducción) «El abuso de contenido a escala ocurre cuando se generan muchas páginas principalmente para manipular las posiciones y no para ayudar a los usuarios». También se menciona el scraping: “Republishing content from other sites without adding any original content or value, or even citing the original source” (traducción) «republicar contenido de otros sitios sin añadir contenido o valor original, ni siquiera citar la fuente original». La consecuencia es que “Sites that violate our policies may rank lower in results or not appear in results at all.” (traducción) «los sitios que infringen nuestras políticas pueden posicionarse más abajo o no aparecer en los resultados».

La distinción importante es esta: la duplicación benigna (la misma página en www y sin www) no es eso; Google normalmente gestiona el contenido duplicado mediante deduplicación y selección de la URL representativa, no mediante una acción de política. La duplicación engañosa y a escala es otro asunto de las políticas de spam. No confundas ambas cosas ni adoptes el absoluto contrario: «no hay penalización» no significa que la duplicación nunca pueda llevar a una acción; significa que la duplicación normal por sí sola no es el detonante.

Los costes reales del contenido duplicado

Si no hay penalización, ¿para qué molestarse? Hay algunos costes indirectos y posibles —no garantizados y no equivalentes a perder posiciones—:

  1. Señales diluidas o divididas. Cuando varias URL contienen el mismo contenido, las señales de posicionamiento se dispersan. Bing dice que “When several URLs contain the same content, signals such as clicks, links, impressions, and engagement are often diluted.” (traducción) «Cuando varias URL contienen el mismo contenido, las señales como clics, enlaces, impresiones y participación suelen diluirse». La documentación de Google lo formula de manera condicional: consolidar señales es una razón para especificar una URL preferida, lo que implica que la dilución es posible, no automática; una redirección o señal fuerte es lo que apila las señales en una URL.
  2. Se elige la URL equivocada, o aparece otra en un caso concreto. Google agrupa el conjunto y selecciona una URL representativa. Si tus señales están mezcladas puede elegir una versión no deseada; eso es lo que indica el estado de Search Console «Duplicate, Google chose different canonical than user» (traducción) «Google eligió una URL representativa distinta de la declarada». No siempre hay una única elección fija: la guía de Google sobre cómo funciona Search señala que otro miembro puede servirse si encaja mejor en un contexto concreto, como un dispositivo o una consulta específica.
  3. El rastreo es menos eficiente, no necesariamente «desperdiciado». Google rastrea la URL representativa elegida con más frecuencia y los demás miembros del grupo con menos frecuencia para reducir carga. Es un cambio relativo de cadencia, no una prueba de que cada duplicado consuma una cantidad material de crawl budget; pero en sitios grandes sí se acumula y se solapa con el crawl budget, la navegación facetada y las trampas de araña.
  4. La medición se vuelve más confusa. Tráfico, clics y conversiones divididos entre URL dificultan ver el rendimiento real de una pieza de contenido; Google enumera «simplificar las métricas de seguimiento» como una razón para consolidar.

Cómo gestionan los duplicados Google y Bing

El mecanismo es el mismo en ambos motores: detectar → agrupar → elegir una URL representativa.

La publicación de Google de 2008 describe el proceso en primera persona: cuando detecta contenido duplicado, por ejemplo por variaciones de parámetros de URL, agrupa las URL duplicadas en un conjunto y selecciona la que considera mejor para representarlo en los resultados. El motivo es ofrecer variedad: quiere mostrar diez resultados distintos, no diez URL con el mismo contenido. Google intenta filtrar documentos duplicados para reducir la redundancia y también señala el coste de rastreo: cuanto más tiempo y recursos dedica Googlebot a duplicados en varias URL, menos tiempo tiene para el resto del contenido.

Mueller también ha descrito la fase de publicación: si Google encuentra exactamente la misma información en varias páginas, cuando alguien la busca intenta encontrar la que mejor encaja y no muestra todas.

El giro de la búsqueda con IA en 2025. Bing aplica el mismo modelo al descubrimiento mediante LLM: “LLMs group near-duplicate URLs into a single cluster and then choose one page to represent the set. If the differences between pages are minimal, the model may select a version that is outdated.” (traducción) «Los LLM agrupan las URL casi duplicadas en un solo conjunto y eligen una página para representarlo. Si las diferencias son mínimas, el modelo puede seleccionar una versión desactualizada». Por eso la consolidación protege también tu visibilidad en búsqueda con IA, no solo los enlaces azules.

Esta es la relación con la canonicalización: agrupar y elegir una URL representativa es canonicalización. El contenido duplicado es el problema; la canonicalización es el proceso que lo resuelve. Tu URL declarada es una pista fuerte, no una instrucción: Google pondera las señales reunidas —redirecciones, rel="canonical", enlaces internos y sitemaps— para elegir la representante. Ninguna garantiza por sí sola el resultado.

Qué causa el contenido duplicado

Casi todo es técnico. Esta es la taxonomía completa de mi guía de Ahrefs, agrupada:

Variantes de protocolo y host

  • HTTP frente a HTTPS
  • sin www frente a www

Variantes de URL y parámetros

  • Parámetros de seguimiento (UTM, etc.)
  • ID de sesión en las URL
  • URL sensibles a mayúsculas
  • Barra final frente a ausencia de barra final

Páginas creadas por funciones del sitio

  • URL para imprimir
  • URL específicas de móvil (subdominios m.)
  • URL AMP
  • Navegación facetada o filtrada
  • Páginas de etiquetas y categorías (archivo)
  • URL de adjuntos o imágenes (texto repetitivo)
  • Comentarios paginados
  • Páginas de resultados de búsqueda interna
  • Localización (variantes regionales en el mismo idioma)

Entre sitios

  • Entornos de staging o desarrollo que se indexaron
  • Sindicación y contenido raspado

La pregunta es: «¿cuántas URL distintas pueden llevar al mismo contenido?» Cada respuesta adicional es un duplicado. Los parámetros de URL son la fuente más prolífica, por eso reciben un tratamiento propio.

No todo lo que parece duplicación lo es

Algunos casos se llaman «contenido duplicado» por error cuando la respuesta correcta es «depende». Haz una revisión separada antes de tocar nada:

  • Filtros, ordenaciones y paginación. Un parámetro no es automáticamente un duplicado. Los parámetros de seguimiento y sesión (?utm_source=, ?sessionid=) crean contenido equivalente y deberían apuntar mediante canonicalización a la URL limpia. Pero un filtro u ordenación puede cambiar la página; la guía de URL para comercio electrónico de Google pide revisarlos caso por caso. La paginación es otro caso: la guía de paginación dice que cada página debe tener su propia URL y una canónica autorreferente; no se recomienda llevar todas a la página uno.
  • Variantes de producto. Tampoco son siempre duplicados. URL separadas para un color, tamaño o configuración realmente distintos pueden ayudar a descubrir esa variante; lo que duplica es tener rutas equivalentes y parámetros redundantes para el mismo inventario. Evalúa la intención, no el hecho de que sea «solo una variante».
  • Traducciones completas. Una página traducida a otro idioma no es un duplicado solo porque coincidan la plantilla y el diseño; la guía de versiones localizadas sitúa el límite en el idioma, no en el diseño. Las variantes regionales en el mismo idioma (en-us frente a en-gb) sí pueden agruparse como casi duplicados; por eso se relacionan con hreflang, no con consolidación.
  • Porcentaje de «casi duplicado» de un rastreador. Herramientas como Ahrefs y Screaming Frog marcan páginas que superan un umbral, a menudo ~90 %. Es una configuración diagnóstica de la herramienta, no un número que Google publique o aplique. Compara el contenido principal renderizado; no lo trates como un veredicto.

Cómo encontrar contenido duplicado

  • Search Console — «Duplicate, Google chose different canonical than user» (traducción) «Google eligió una URL representativa distinta de la declarada». Es la señal más fuerte que tienes: Google sustituyó la URL declarada. Las causas habituales son contenido duplicado o similar, cadenas o bucles de canonical, errores en la etiqueta preferida, contenido internacional sin traducir y renderizado de una app shell de JavaScript. Escribí una guía completa sobre este estado.
  • Un rastreador del sitio (Ahrefs Site Audit o Screaming Frog) detecta páginas duplicadas o casi duplicadas, títulos duplicados y variantes de protocolo, host y barra.
  • Búsquedas site: para localizar casos obvios: HTTP y HTTPS activos, URL con parámetros indexadas o subdominios de staging que escaparon.
  • Comprobación de accesibilidad. Prueba manualmente las variantes de una página importante (http/https, www/sin www, barra final y mayúsculas) y observa cuál resuelve con 200 en vez de redirigir.
  • Compara el contenido renderizado, no solo el HTML original. Google indexa lo que se renderiza, incluido JavaScript. Dos URL con fuentes distintas pero la misma salida renderizada pueden agruparse; dos HTML parecidos con contenido renderizado distinto tampoco. Cuando haya dudas, comprueba qué carga realmente en un navegador.

Cómo corregir contenido duplicado (orden de preferencia)

El orden siguiente es un buen valor predeterminado, pero la primera pregunta real es qué quieres que ocurra con esta URL: la solución correcta depende de la intención, no de una clasificación universal.

  • ¿Quieres eliminar por completo el duplicado y redirigir el tráfico? → 301.
  • ¿Necesitas mantenerlo accesible, pero quieres que otra URL lo represente en los resultados? → rel="canonical".
  • ¿Es una página distinta que se agrupó por error? → hazla realmente diferente; eso no es una solución de canonicalización.
  • ¿Quieres sacarla deliberadamente del índice de Google? → noindex.

Con ese marco, este es el orden, empezando por las soluciones más fuertes y de causa raíz y dejando la eliminación para el final:

1. Corrige la causa raíz o consolida con redirecciones 301. Para variantes de protocolo, host, barra y mayúsculas, haz que solo resuelva una versión y redirige las demás hacia ella con 301. Una redirección es la señal de consolidación más fuerte de Google: “A strong signal that the target of the redirect should become canonical.” (traducción) «Una señal fuerte de que el destino de la redirección debe convertirse en canónico». Bing coincide: “Use 301 redirects to consolidate variants into a single preferred URL.” (traducción) «Usa redirecciones 301 para consolidar las variantes en una única URL preferida». Es la solución preferida porque elimina el duplicado y transmite las señales.

2. rel="canonical" cuando debes mantener accesible el duplicado. Si la copia debe seguir activa (una versión para imprimir o una URL con parámetros que el usuario necesita), añade una referencia a la URL preferida. Google dice: “A strong signal that the specified URL should become canonical.” (traducción) «Una señal fuerte de que la URL especificada debe convertirse en representativa». La palabra importante es señal: es una pista, no una instrucción. Google puede elegir otra si las demás señales entran en conflicto.

3. Gestión de parámetros y enlaces internos coherentes. Gestiona los parámetros de forma consistente: canonicaliza a la URL limpia y enlaza siempre internamente con la única versión preferida. La antigua herramienta de parámetros de URL de GSC se retiró en 2022; ahora se gestionan mediante canonical, robots y enlaces internos, no desde un panel. Incluir una URL en el sitemap es una señal débil que ayuda a que se convierta en representativa; deja los sitemaps solo con URL preferidas.

4. noindex, solo cuando realmente quieres eliminar la página. noindex elimina una página; no consolida señales en la URL preferida como sí hacen un 301 o una referencia preferida. Úsalo solo cuando quieres sacar la página del índice (por ejemplo, resultados de búsqueda interna pobres), no como solución predeterminada para duplicados. Si aplicas noindex cuando querías consolidar, tiras las señales en vez de fusionarlas.

Conviene distinguirlo con claridad: robots.txt y la herramienta de eliminación de URL de Search Console tampoco son métodos de canonicalización. Bloquear una URL en robots.txt impide que Googlebot vea la página, de modo que no puede evaluarla ni incorporarla a un grupo; no asigna un duplicado a una URL preferida. La eliminación oculta una URL temporalmente de los resultados; no consolida nada. Usa noindex, una redirección o una canónica cuando el objetivo sea consolidar.

Evidence for this claim robots.txt and the URL removal tool are not canonicalization methods. Blocking crawling can prevent Google from seeing page content, while removal hides URLs rather than mapping one duplicate to a representative. Scope: duplicate and similar URLs Confidence: high · Verified: How to specify a canonical URL with rel=canonical and other methods

5. hreflang para variantes localizadas. En variantes regionales del mismo idioma (en-us frente a en-gb), hreflang relaciona las versiones para mostrar la correcta a cada audiencia. No aumenta las posiciones ni es una herramienta de consolidación: solo muestra la variante regional adecuada.

6. Sindicación, y esta parte ha cambiado. Republicar no es arriesgado si la relación está bien configurada. Las políticas de spam de Google excluyen explícitamente la sindicación: “News publications that have syndicated news content from other news publications” (traducción) «publicaciones de noticias que han sindicado contenido de otras publicaciones de noticias» no se considera abuso. El riesgo nunca fue la sindicación en sí.

Pero el mecanismo recomendado ha dejado atrás el consejo de poner la URL preferida primero que yo y gran parte de la industria dábamos antes. La guía actual de solución de problemas de canonicalización ya no trata rel="canonical" como la vía principal para impedir que la copia del socio compita con el original: las páginas sindicadas suelen diferir lo suficiente (plantilla, introducción, anuncios o enlaces relacionados) para que Google no siempre respete la referencia hacia tu URL. Lo que Google describe ahora como más eficaz es que el socio de sindicación bloquee su copia para que no se indexe (su propio noindex o dejarla fuera del sitemap), en vez de depender de una referencia que apunte a tu página.

En la práctica, sigue pidiendo al socio que ponga una referencia hacia ti si está dispuesto: no perjudica y ayuda cuando las páginas son casi idénticas. Pero si controlas el riesgo de que la copia del socio supere a la original, la petición más fiable es mantener su copia fuera del índice por completo. Es una actualización real del consejo antiguo de «URL preferida o noindex, cualquiera sirve»; si configuraste una sindicación basándote solo en canonical hace tiempo, conviene revisarla con los socios relevantes.

Mitos del contenido duplicado, desmontados

  • «Existe una penalización por contenido duplicado». No. Google: “There’s no such thing as a ‘duplicate content penalty.’” (traducción) «No existe una “penalización por contenido duplicado”». Bing dice que “doesn’t trigger search penalties on its own” (traducción) «no activa penalizaciones por sí solo». Las penalizaciones solo corresponden al abuso engañoso y a escala.
  • «Si dos páginas son más de un X % similares, te penalizan». No. No hay un umbral porcentual que active una penalización. Los motores agrupan y eligen una URL representativa; no restan puntos por un porcentaje. Matt Cutts dijo una vez que entre el 25 % y el 30 % del contenido web era duplicado: es normal y esperado.
  • «Citar fuentes o repetir texto fijo te perjudica». No. Los pies, avisos, especificaciones y citas son repeticiones normales que los motores esperan.
  • «Tener http:// y https:// (o www y sin www) activos provoca una penalización». No hay penalización, pero sí un problema real de división de señales. Corrígelo con un 301 por eficiencia, no por miedo.
  • «Una referencia rel=canonical garantiza el resultado». No. rel="canonical" es una señal/pista, no una instrucción; un 301 es más fuerte y las señales contradictorias pueden hacer que Google elija otra.
  • «noindex es la solución predeterminada para duplicados». Normalmente es incorrecto. Elimina una página, no consolida. Prefiere 301 o canonical y usa noindex solo para eliminar de verdad.

En resumen

No hay penalización. Hay dilución, una URL equivocada en los resultados y rastreo menos eficiente; la solución para las tres cosas es consolidarlo todo en una URL representativa usando la señal más fuerte razonable. Si prefieres no ordenar los duplicados tú mismo, Google puede agruparlos y elegir una representante. Yo prefiero tomar esa decisión por adelantado.

Add an expert note

Pin an expert quote

New person? Create their unclaimed profile at /admin/experts/ → Pin a quote first.