Pruebas A/B de SEO

Cómo ejecutar experimentos SEO controlados —con etiquetas title, meta descriptions, datos estructurados y cambios en la página— mediante enfoques de series temporales o split-URL para medir el impacto causal.

Publicado por primera vez: 2 jul 2026 · Última actualización: 13 ago 2026 · Avanzado
Idiomas

Las pruebas A/B de SEO miden si un cambio causó una mejora orgánica. Como el buscador indexa una versión de cada URL, se aleatorizan páginas similares entre control y variante o se modela un contrafactual mediante series temporales. Se pueden probar títulos, meta descriptions, datos estructurados, enlaces internos, contenido y diseño; los backlinks no se controlan así. La muestra depende de la variación, el tráfico y el efecto esperado. Las pruebas suelen durar entre 2 y 6 semanas y no deben detenerse ante una tendencia temprana. Según Google, hay que canonicalizar las variantes, usar 302 en vez de 301, evitar el encubrimiento y retirar la prueba al terminar.

TL;DR — Las pruebas A/B clásicas por visitante no se trasladan al SEO: los buscadores indexan una versión de cada URL. Por eso se aleatorizan páginas. Los métodos son split-URL/holdout y series temporales/impacto causal. Se pueden probar títulos, metas, datos estructurados, enlaces, contenido y diseño; no backlinks ni cambios globales. Es un cuasiexperimento porque las páginas no son totalmente independientes. Define la regla de parada antes de empezar. Canonicaliza las variantes, usa 302 en vez de 301, evita el encubrimiento y retira la prueba al terminar.

Evidence for this claim CausalImpact estimates an intervention's causal effect from a Bayesian structural time-series counterfactual under stated assumptions. Scope: Original methodology; validity depends on controls, stable relationships, and experimental design. Confidence: high · Verified: Brodersen et al.: Inferring causal impact using Bayesian structural time-series models Evidence for this claim Search experiments must avoid showing materially different content to Googlebot and users in ways that constitute cloaking; temporary tests should preserve normal crawlability and canonical intent. Scope: Current Google spam and testing constraints, not a universal test-duration prescription. Confidence: high · Verified: Google Search Central: Website testing and Google Search

Por qué las pruebas A/B de CRO no funcionan para la búsqueda orgánica

Craig Bradford, de SearchPilot, lo explica así: “The ‘user’ we are testing for is Googlebot, not human users. That means it’s not possible, for instance, to show 10,000 ‘Googlebots’ control and variant pages randomly. There is only one Googlebot.” (traducción) «El “usuario” para el que hacemos la prueba es Googlebot, no las personas. Por ejemplo, no es posible mostrar aleatoriamente páginas de control y variantes a 10.000 “Googlebots”. Solo hay un Googlebot». Fuente: https://www.searchpilot.com/resources/blog/what-is-seo-split-testing#:~:text=There%20is%20only%20one%20Googlebot.

Hay dos razones estructurales por las que la aleatorización por visitante que usa la optimización de conversiones no sirve para la búsqueda orgánica:

  1. Los buscadores indexan y posicionan una versión de una URL. No mantienen dos versiones rivales para compararlas.
  2. No existe una asignación aleatoria por consulta. El propietario del sitio no puede repartir las impresiones orgánicas entre variantes.

La solución de ambos métodos reales es aleatorizar por página, no por visitante ni consulta.

Las herramientas que sustituyen contenido con JavaScript después de cargar pueden distorsionar la prueba. SearchPilot advierte que hacerlo “can cause significant problems or even invalidate the results” (traducción) «puede causar problemas importantes o incluso invalidar los resultados». Sirve la variante en el HTML inicial, desde el servidor o el perímetro. Fuente.

Las dos metodologías reales

Conviene separarlas porque responden a preguntas ligeramente distintas.

1. Prueba split-URL o por grupos de páginas (holdout)

Un conjunto grande de páginas con la misma plantilla se asigna al azar al control o a la variante. El cambio solo llega a la variante y después se comparan las sesiones o los clics orgánicos.

La estacionalidad y las actualizaciones deberían mover ambos grupos en paralelo. El efecto medido es la divergencia que aparece después de aplicar el cambio.

La potencia estadística depende del número de páginas, el tráfico por página y su variación natural.

Las páginas de un sitio no son observaciones totalmente independientes: comparten plantillas y enlaces internos y compiten en las mismas SERP. El efecto puede filtrarse al control, por lo que se trata de un cuasiexperimento y exige prudencia.

2. Series temporales o impacto causal

El modelo pronostica el tráfico contrafactual que habría tenido la variante sin el cambio, usando páginas similares no afectadas como referencia. La diferencia entre el pronóstico y el resultado real estima el impacto.

La base es el modelo bayesiano de series temporales estructurales del trabajo “Inferring Causal Impact Using Bayesian Structural Time-Series Models” (traducción) «Inferencia del impacto causal mediante modelos bayesianos estructurales de series temporales» (Google Research, preprint) y el paquete CausalImpact de R.

Herramientas de este ámbito

El mercado cambia, así que comprueba el estado actual antes de comprometerte:

Google Search Console no ofrece hoy una función general de experimentos SEO en directo. Las herramientas de la época de AMP no equivalen a un producto actual llamado «GSC Experiments».

Microsoft presenta las pruebas split-URL como el enfoque adecuado para cambios estructurales y combina IndexNow con Microsoft Clarity: https://blogs.bing.com/webmaster/August-2024/A-B-Test-for-Better-Search-Engine-Performance-with-IndexNow-and-Microsoft-Clarity .

Cuánto tráfico y cuántas páginas necesitas

No existe una cifra universal. El tamaño de la muestra depende de tres factores:

  • La variación natural de las páginas: cuanto más ruido, más datos.
  • El efecto que quieres detectar: los efectos pequeños necesitan mucha más información.
  • El número de páginas por grupo: más páginas aportan más señal.

Como referencia práctica, SearchPilot afirma que suele trabajar con “at least hundreds of pages on the same template and at least 30,000 organic sessions per month to the group of pages you want to test on.” (traducción) «al menos cientos de páginas con la misma plantilla y al menos 30,000 sesiones orgánicas mensuales en el grupo de páginas que se quiere probar». Fuente: https://www.searchpilot.com/resources/blog/what-is-seo-split-testing#:~:text=at%20least%2030%2C000%20organic%20sessions%20per%20month . La guía de Ahrefs sitúa el nivel cómodo en “tens or hundreds of thousands of organic visits per month.” (traducción) «decenas o cientos de miles de visitas orgánicas al mes». Fuente. Los sitios menores necesitan efectos mucho mayores para superar el ruido.

La métrica debe ser sesiones o clics orgánicos del grupo, no posiciones. Un rastreador no cubre toda la cola de consultas y la posición media de Search Console es demasiado agregada.

Cuánto tiempo debe durar una prueba

Los periodos habituales son de 2 a 6 semanas: Google debe volver a rastrear y evaluar las variantes, y cada grupo debe acumular tráfico suficiente.

El error cardinal es detenerse pronto. Ryan Jones, de SEOTesting.com, lo resume así: “Never end a test early just because you see good results!” (traducción) «¡Nunca termines una prueba antes de tiempo solo porque ves buenos resultados!». Fuente. Mantén el umbral fijado, por ejemplo un 95 % de confianza (p < 0,05); una prueba sin potencia debe alargarse o abandonarse, no proclamarse ganadora.

Cómo controlar la estacionalidad y las actualizaciones

El grupo de control y el modelo de pronóstico existen precisamente para separar los movimientos externos comunes del tratamiento estudiado.

Una mala agrupación destruye ese control. Si todas las páginas sobre gatos quedan en la variante justo antes del Día Internacional del Gato, un pico estacional parecerá una victoria. La solución es asignar las páginas al azar.

Qué puedes y qué no puedes probar de forma fiable

Se puede probar:

  • Etiquetas title y meta descriptions
  • Estructura de H1 y encabezados
  • Datos estructurados
  • Patrones de enlaces internos
  • Contenido de la página
  • Diseño e interfaz, incluso rediseños completos

No se puede probar de forma fiable así:

  • Backlinks. No puedes asignar enlaces entrantes aleatoriamente y en dosis iguales; terceros enlazan cuando quieren. Se analizan antes/después o por correlación, no mediante una verdadera prueba dividida. Explicación.
  • Actualizaciones de algoritmo y cambios globales, porque afectan a todo el sitio.
  • Cualquier tratamiento que no pueda aislarse de las páginas de control.

Cómo cumplir las reglas durante la prueba

Google autoriza expresamente estas pruebas si se respetan sus reglas:

Las variantes correctamente canonicalizadas no sufren una penalización por contenido duplicado. El riesgo real es el encubrimiento, no la duplicación.

Dónde encaja esta disciplina

Las pruebas A/B de SEO son especialmente valiosas en sitios grandes con miles de páginas basadas en plantillas. Ofrecen una respuesta honesta a la pregunta «¿funcionó este cambio?».

Add an expert note

Pin an expert quote

New person? Create their unclaimed profile at /admin/experts/ → Pin a quote first.