Testy A/B SEO

Jak prowadzić kontrolowane eksperymenty SEO — testować title tagi, meta descriptions, dane strukturalne i zmiany na stronie metodą split-URL lub szeregu czasowego.

Opublikowano po raz pierwszy: 2 lip 2026 · Ostatnia aktualizacja: 13 sie 2026 · Advanced
Języki

Testy A/B SEO mierzą przyczynowy wpływ zmiany na ruch organiczny. Ponieważ wyszukiwarka indeksuje jedną wersję URL-a, losuje się podobne strony do grupy kontrolnej i wariantu albo modeluje kontrfaktyczny szereg czasowy. Można testować tytuły, meta descriptions, dane strukturalne, linki wewnętrzne, treść i układ; backlinków nie da się tak kontrolować. Wielkość próby zależy od wariancji, ruchu i oczekiwanego efektu. Testy zwykle trwają 2–6 tygodni i nie należy kończyć ich wcześniej. Warianty muszą wskazywać canonical, przekierowania powinny używać 302 zamiast 301, cloaking jest zabroniony, a eksperyment należy po decyzji usunąć.

TL;DR — Klasyczne losowanie użytkowników nie przenosi się do SEO: wyszukiwarki indeksują jedną wersję URL-a. Losuje się więc strony. Metody to split-URL/holdout oraz szereg czasowy/causal impact. Testuj tytuły, opisy, dane strukturalne, linkowanie, treść i układ; nie traktuj backlinków ani zmian ogólnowitrynowych jak kontrolowanego zabiegu. Grupy stron nie są w pełni niezależne, więc jest to quasi-eksperyment. Regułę zatrzymania ustal z góry. Warianty kanonikalizuj, przy przekierowaniu stosuj 302 zamiast 301, unikaj cloakingu i zakończ eksperyment po uzyskaniu odpowiedzi.

Evidence for this claim CausalImpact estimates an intervention's causal effect from a Bayesian structural time-series counterfactual under stated assumptions. Scope: Original methodology; validity depends on controls, stable relationships, and experimental design. Confidence: high · Verified: Brodersen et al.: Inferring causal impact using Bayesian structural time-series models Evidence for this claim Search experiments must avoid showing materially different content to Googlebot and users in ways that constitute cloaking; temporary tests should preserve normal crawlability and canonical intent. Scope: Current Google spam and testing constraints, not a universal test-duration prescription. Confidence: high · Verified: Google Search Central: Website testing and Google Search

Dlaczego testy CRO nie działają dla ruchu organicznego

Craig Bradford z SearchPilot wyjaśnia: “The ‘user’ we are testing for is Googlebot, not human users. That means it’s not possible, for instance, to show 10,000 ‘Googlebots’ control and variant pages randomly. There is only one Googlebot.” (tłumaczenie) „W tym eksperymencie odbiorcą jest Googlebot, nie człowiek. Nie można przydzielić 10 000 Googlebotów do kontroli i wariantu, ponieważ istnieje tylko jeden.” https://www.searchpilot.com/resources/blog/what-is-seo-split-testing#:~:text=There%20is%20only%20one%20Googlebot.

Są dwa powody, dla których losowanie na poziomie użytkownika nie działa w SEO:

  1. Wyszukiwarka indeksuje i szereguje jedną wersję URL-a. Nie utrzymuje dwóch rywalizujących wersji.
  2. Nie ma losowego przydziału zapytań. Właściciel witryny nie dzieli wyświetleń organicznych między warianty.

Obie właściwe metody losują na poziomie strony, nie użytkownika ani zapytania.

Narzędzia podmieniające treść JavaScriptem po załadowaniu mogą zniekształcić test. Wariant powinien znaleźć się w początkowym HTML, po stronie serwera lub edge. Ostrzeżenie SearchPilot.

Dwie właściwe metody

Warto je rozdzielić, ponieważ odpowiadają na nieco inne pytania.

1. Test split-URL / grup stron (holdout)

Duży zbiór stron szablonowych dzieli się losowo na kontrolę i wariant. Zmiana trafia wyłącznie do wariantu, a następnie porównuje się sesje lub kliknięcia organiczne.

Sezonowość i aktualizacje powinny poruszać obie grupy równolegle. Efektem testu jest rozbieżność po wdrożeniu zmiany.

Moc statystyczna zależy od liczby stron, ruchu i naturalnej zmienności.

Strony jednej witryny nie są całkowicie niezależne: współdzielą szablony i linkowanie oraz konkurują w SERP-ach. Efekt może przenikać do kontroli, dlatego wynik jest quasi-eksperymentalny i wymaga ostrożności.

2. Szereg czasowy / causal impact

Model prognozuje kontrfaktyczny ruch wariantu bez zmiany, używając podobnych niezmienionych stron jako podstawy. Różnica między prognozą a wynikiem jest szacowanym wpływem.

Podstawą jest bayesowski strukturalny model szeregu czasowego z pracy “Inferring Causal Impact Using Bayesian Structural Time-Series Models” (tłumaczenie) „Wnioskowanie o wpływie przyczynowym za pomocą bayesowskich strukturalnych modeli szeregów czasowych” (Google Research, preprint) i pakietu CausalImpact.

Narzędzia

Rynek się zmienia, dlatego przed zakupem sprawdź bieżący status:

Google Search Console nie oferuje dziś ogólnej funkcji aktywnych eksperymentów SEO. Narzędzia z epoki AMP nie są współczesnym „GSC Experiments”.

Bing zaleca split-URL dla zmian strukturalnych oraz łączy https://blogs.bing.com/webmaster/August-2024/A-B-Test-for-Better-Search-Engine-Performance-with-IndexNow-and-Microsoft-Clarity.

Ile ruchu i stron potrzeba

Nie istnieje uniwersalny próg. Rozmiar próby zależy od:

  • naturalnej zmienności stron,
  • najmniejszego efektu wartego wykrycia,
  • liczby stron w każdej grupie.

SearchPilot zwykle pracuje z “at least hundreds of pages on the same template and at least 30,000 organic sessions per month to the group of pages you want to test on.” (tłumaczenie) „co najmniej setkami stron na tym samym szablonie i co najmniej 30 000 sesji organicznych miesięcznie w testowanej grupie”. https://www.searchpilot.com/resources/blog/what-is-seo-split-testing#:~:text=at%20least%2030%2C000%20organic%20sessions%20per%20month Ahrefs wskazuje komfortowy poziom dziesiątek lub setek tysięcy wizyt.

Mierz organiczne sesje lub kliknięcia całej grupy, nie same pozycje. Rank tracking nie obejmuje długiego ogona, a średnia pozycja w Search Console jest zbyt zagregowana.

Jak długo prowadzić test

Typowy okres to 2–6 tygodni: Google musi ponownie zeskanować strony, a grupy muszą zgromadzić wystarczający ruch.

Nie zatrzymuj testu przy pierwszym korzystnym trendzie. “Never end a test early just because you see good results!” (tłumaczenie) „Nigdy nie kończ testu wcześniej tylko dlatego, że wyniki wyglądają dobrze!” SEOTesting.com. Ustal z góry próg 95% (p < 0,05) lub właściwą regułę wiarygodności.

Kontrola sezonowości i aktualizacji

Grupa kontrolna i model prognozy służą właśnie oddzielaniu wspólnych zmian zewnętrznych od badanego zabiegu.

Błędne grupowanie niszczy kontrolę. Umieszczenie wszystkich stron o kotach w wariancie przed International Cat Day myli sezonowy wzrost z wynikiem testu. Rozwiązaniem jest losowy przydział.

Co można, a czego nie można wiarygodnie testować

Można testować:

  • title tagi i meta descriptions
  • strukturę H1 i nagłówków
  • dane strukturalne
  • linkowanie wewnętrzne
  • treść
  • układ i interfejs

Nie można wiarygodnie testować w ten sposób:

  • Backlinków, bo nie da się losowo dozować pozyskiwania linków (wyjaśnienie).
  • Aktualizacji algorytmu i zmian ogólnowitrynowych, bo obejmują wszystkich.
  • Zabiegów przenikających do grupy kontrolnej.

Zgodność testu z wytycznymi

Google dopuszcza testy, jeśli przestrzegasz zasad:

Prawidłowo kanonikalizowane warianty nie powodują kary za duplicate content. Ryzykiem jest cloaking, nie samo powielenie.

Miejsce w strategii

Testy A/B SEO są dyscypliną pomiarową szczególnie wartościową w dużych serwisach z tysiącami stron szablonowych. Odpowiadają uczciwie na pytanie: „czy ta zmiana zadziałała?”.

Add an expert note

Pin an expert quote

New person? Create their unclaimed profile at /admin/experts/ → Pin a quote first.