SEO A/Bテスト
時系列またはURL分割アプローチを使用して、タイトルタグ、メタディスクリプション、構造化データ、オンページ変更を分割テストし、因果的影響を測定する、管理されたSEO実験の実行方法。
言語
SEO A/Bテストは、変更が実際にオーガニック検索に影響を与えたかどうかを測定します。あなたがそう思うかどうかではありません。コンバージョン用のランディングページをテストするようにSEOをテストすることはできません。なぜなら、Googlebotは1つしかなく、検索エンジンはURLの1つのバージョンをインデックスし、クエリの検索を50/50に分割する方法がないからです。そのため、代わりにページレベルでランダム化します。2つの実際の方法:URL分割/ホールドアウトテスト(類似したテンプレートページの大規模なグループをコントロールとバリアントにランダムに分割し、オーガニックトラフィックを比較)と時系列/因果影響テスト(コントロールグループをベースラインとして、変更がなかった場合のバリアントページの予測を立てる)。タイトルタグ、メタディスクリプション、構造化データ、内部リンク、コンテンツはテスト可能ですが、バックリンクはテストできません。ノイズを打ち負かすには十分なページ数とトラフィックが必要です(SearchPilotの実用的な最低基準は、数百の同一テンプレートページと月間約3万以上のオーガニックセッション)。テストは通常2〜6週間実行され、良好に見えるトレンドで早期に停止してはいけません。Googleに準拠するには:バリアントURLを正規化し、リダイレクトする場合は301ではなく302を使用し、クローキングをせず、テストが完了したら停止します。
Evidence for this claim CausalImpact estimates an intervention's causal effect from a Bayesian structural time-series counterfactual under stated assumptions. Scope: Original methodology; validity depends on controls, stable relationships, and experimental design. Confidence: high · Verified: Brodersen et al.: Inferring causal impact using Bayesian structural time-series models Evidence for this claim Search experiments must avoid showing materially different content to Googlebot and users in ways that constitute cloaking; temporary tests should preserve normal crawlability and canonical intent. Scope: Current Google spam and testing constraints, not a universal test-duration prescription. Confidence: high · Verified: Google Search Central: Website testing and Google SearchTL;DR — SEO A/Bテストは、SEOの変更が機能したことを推測ではなく証明する方法です。マーケターがランディングページをテストするようにSEOをテストすることはできません。Googleは一つしかなく、あなたのページの一つのバージョンしか見ません。そのため、人を2つのグループに分ける代わりに、ページを分けます。一部のページを変更し、類似したページはそのままにして、各グループの検索でのパフォーマンスを比較します。変更が違いを引き起こしたのか、それとも単に季節性や偶然によるものなのかがわかります。
SEO A/Bテストとは
タイトルタグを変更したり、ページにコンテンツを追加したりすると、トラフィックは増減しますが、それはなぜでしょうか? 変更が機能したのかもしれません。季節的な上昇だったのかもしれません。その週にGoogleがアップデートを実行したのかもしれません。変更を他のすべての出来事から分離する方法がなければ、推測しているにすぎません。
SEO A/Bテスト(SEOスプリットテストとも呼ばれます)は、推測をやめる方法です。一部のページに変更を加え、類似したページのセットを比較用に変更せずに維持し、2つのグループ間のオーガニック検索トラフィックの差を測定します。変更したページが変更していないページを上回った場合、その変更が原因である可能性が高いです。
通常のA/BテストのようにSEOをテストできない理由
以前にA/Bテストを聞いたことがあるなら、それはおそらくマーケティングの種類でしょう。訪問者の半数に赤いボタンを表示し、半数に緑のボタンを表示して、どちらがより多くのクリックを得るかを見ます。これは、ウェブサイトが同じページの2つの異なるバージョンを同時に2人の異なる人に表示できるため機能します。
検索エンジンはそのようには機能しません。基本的に1つのGooglebotがあり、あなたのページの1つのバージョンしか見ません。キーワードを検索している人の半数に「バージョンA」を表示し、残りの半数に「バージョンB」を表示することはできません。ランクを決めるのはGoogleであり、あなたではありません。また、Googleは1つのバージョンのみをインデックスします。Googleに実際の訪問者とは異なるコンテンツを表示することはクローキングと呼ばれ、ルールに違反します。
そのため、SEOテストは次善の策を実行します。人を分割する代わりに、ページを分割します。
実際の仕組み
類似したページのセットが必要です。同じテンプレートを使用するすべての商品ページやブログ投稿を考えてください。次に、以下の手順を実行します。
- それらをランダムに2つのグループに分割します:対照グループ(変更なし)とバリアントグループ(変更を適用)。
- バリアントグループのみに変更を加えます。
- 数週間待って、2つのグループ間のオーガニック検索トラフィックを比較します。
両方のグループが同じ天候(同じ季節、同じGoogleアップデート)を経験するため、両方のグループを一緒に動かすものはあなたの変更ではありません。それらの間のギャップだけがあなたの変更です。
テストできることとできないこと
オンページの要素をテストできます:タイトルタグ、メタディスクリプション、見出し、構造化データ、内部リンク、コンテンツ。一般的に、この方法でバックリンクを確実にテストすることはできません。タイトルタグを切り替えるように、スケジュールに従って正確に半分のページにリンクを配布することはできません。
実践者向けのバージョン(2つの実際の方法論、必要なトラフィック量、実行期間、Googleのルールの正しい側に留まる方法)が必要ですか? Advancedタブに切り替えてください。
Evidence for this claim CausalImpact estimates an intervention's causal effect from a Bayesian structural time-series counterfactual under stated assumptions. Scope: Original methodology; validity depends on controls, stable relationships, and experimental design. Confidence: high · Verified: Brodersen et al.: Inferring causal impact using Bayesian structural time-series models Evidence for this claim Search experiments must avoid showing materially different content to Googlebot and users in ways that constitute cloaking; temporary tests should preserve normal crawlability and canonical intent. Scope: Current Google spam and testing constraints, not a universal test-duration prescription. Confidence: high · Verified: Google Search Central: Website testing and Google SearchTL;DR — 従来のランダム化A/BテストはオーガニックSEOには適用できません。なぜなら、Googlebotは1つしか存在せず、検索エンジンはURLの1つのバージョンをインデックスし、クエリの検索を50/50に分割できないからです。そのため、ページレベルでランダム化します。2つの方法論があります:URL分割/ホールドアウト(同じテンプレートの多数のページをランダムにコントロール群とバリアント群に分割し、オーガニックセッションを比較する)と時系列/因果インパクト(Google自身のCausalImpact研究に基づき、コントロール群をベースラインとして反事実を予測する)です。テスト可能なもの:タイトル、メタデータ、構造化データ、内部リンク、コンテンツ、レイアウト。確実にテストできないもの:バックリンク、アルゴリズム更新、サイト全体に関わるもの。分散を推定するには、十分な数の比較可能なページ、観測値、テスト前の履歴が必要です。普遍的なトラフィックの下限や期間はありません。これは完全なRCTではなく、準実験として扱ってください。ページ群は完全に独立しているわけではなく、共有テンプレート、内部リンク、SERPでの競合により、バリアント群の変更がコントロール群に影響を与える可能性があります。好ましい傾向に見えるからといって終了するのではなく、停止ルールを事前に定義してください。コンプライアンスを維持:バリアントを正規化し、301ではなく302を使用し、クローキングをせず、テストが終了したら撤去してください。
CROスタイルのA/Bテストがオーガニック検索に機能しない理由
SEOテストに独自の方法論が必要な理由は、テスト対象が人間ではないからです。SearchPilotのCraig Bradford氏が述べているように、“The ‘user’ we are testing for is Googlebot, not human users. That means it’s not possible, for instance, to show 10,000 ‘Googlebots’ control and variant pages randomly. There is only one Googlebot.” (翻訳) 「私たちがテストしている『ユーザー』はGooglebotであり、人間のユーザーではありません。つまり、例えば10,000の『Googlebot』にコントロールページとバリアントページをランダムに表示することは不可能です。Googlebotは1つしかいません。」
ランダム化された、ビジター単位のA/Bテスト(コンバージョン率最適化で使用される種類)をオーガニック検索に適用できない理由は、構造的に2つあります:
- 検索エンジンはURLの1つのバージョンをインデックスし、ランク付けします。 Webサーバーは、Cookieによってビジターの半数をバケットAに、残り半数をバケットBにリアルタイムで振り分けることができます。Googlebotは、配信された1つのバージョンをクロールし、インデックスします。同じURLの2つの競合するバージョンを保持し、それらを互いにランク付けするメカニズムはありません。
- クエリごとのランダム割り当てはありません。 広告プラットフォームがインプレッションの半数にバリアントクリエイティブを表示するように、「[キーワード]の検索の半数」にバリアントコンテンツを表示することはできません。どのページがクエリでランク付けされるかを決定するのはGoogleであり、そのトラフィックを分割することはできません。
両方の実際の方法論における回避策は同じです:ビジターやクエリレベルではなく、ページレベルでランダム化します。 類似した多数のページのグループを母集団として扱い、ページをコントロール群とバリアント群に分割します。
これはまた、CROで安全な習慣が自動的にSEOで安全であるとは限らないことも意味します。読み込み後にコンテンツを置き換えるクライアントサイドのJavaScript A/Bツールは人間には問題ありませんが、クローラーにとってはリスクがあります。SearchPilotは、SEOテストにJavaScriptを使用すると「重大な問題を引き起こしたり、結果を無効にしたりする可能性がある」と警告しています。SEOをテストする場合は、クローラーが初期HTMLでバリアントを認識できるように、サーバーサイド(またはエッジサイド)で行ってください。
2つの実際の方法論
ほとんどのガイドはすべてを「SEO A/Bテスト」としてひとくくりにしています。これら2つの異なるアプローチを分離する価値があります。なぜなら、それらはわずかに異なる質問に答えるからです。
1. URL分割 / ページグループ(ホールドアウト)テスト
テンプレート化された多数のページ(すべての商品ページ、すべてのカテゴリページ、すべてのブログ記事)を取得し、それらをランダムにコントロール群とバリアント群に割り当てます。バリアント群には変更が適用され、コントロール群には適用されません。テスト期間中、2つのグループ間のオーガニックトラフィック(セッション/クリック)を比較します。
両グループは同じ外部条件を経験するため、季節性やアルゴリズムの更新など全員に影響するものは、両グループで平行な動きとして現れ、あなたの変更のせいにはされません。測定しているのは、変更が公開された後のグループ間の乖離です。
問題は統計的検出力です。ページ数と、各ページのトラフィックが十分に必要で、それらのページが日々示すノイズを超えて実際の効果を検出できるようにする必要があります。
正直に言うべき点があります。ページグループは、ウェブサイトのA/Bテストにおける個々の訪問者のように完全に独立した観測ではありません。同じサイトのページは、テンプレートや内部リンクを共有し、同じSERPで互いに競合することがよくあります。バリアントグループへの変更は、内部リンクの評価を変えたり、クリックを奪い合ったりして、コントロールグループにも影響を与える可能性があります。これは脚注ではなく、実際の限界です。これが、これが準実験であり、完全なランダム化比較試験ではない理由です。ページの独立性が低いほど、結果を有意と呼ぶ前に慎重になるべきです。
2. 時系列/因果インパクトテスト
ライブのコントロールグループを保持する代わりに(またはそれに加えて)、変更を適用し、変更がなかった場合のバリアントページのトラフィックを予測します(反事実)。その予測を構築するために、類似した影響を受けていないページのコントロールグループを使用します。予測と実際に起こったことのギャップが、推定されたインパクトです。
この背後にある統計エンジンはベイズ構造時系列モデリングで、Google自身の研究から直接来ています。Brodersen、Gallusser、Koehler、Remy、Scottによる”Inferring Causal Impact Using Bayesian Structural Time-Series Models”(The Annals of Applied Statistics、2015年)で、オープンソースのCausalImpact Rパッケージとして公開されています(プレプリントはこちら)。「ベイズ」や「因果インパクト」の手法を主張するほとんどすべてのSEOテストツールは、引用していなくてもこの論文に基づいています。この手法が実際にどこから来たのかを知っておく価値があります。
この分野のツール
状況は変化するので、コミットする前に現在の状態を確認してください。しかし、主なプレイヤーは以下の通りです。
- SearchPilot — 厳密なSEOスプリットテストに最も関連付けられるプラットフォーム。DistilledのODN(Optimisation Delivery Network)から発展しました。Distilledは2020年にBrainlabsに買収され、テスト製品はSearchPilotとしてスピンアウトしました。エッジでテストを実行するため、バリアントはクローラーが見るHTMLで提供されます。
- SEOTesting.com — より軽量で、Search Console駆動のテストツールで、統計的有意性に重点を置いています。
- seoClarity — エンタープライズスイートにはSEOスプリットテストモジュールが含まれています。
仮定してはいけないことが1つあります。Google Search Consoleは、現在、ライブで汎用的なSEO実験機能を提供していません。 AMP時代に関連した実験ツールはありましたが、実質的に一般的なPage Experienceレポートに統合されています。「GSC Experiments」を現在のスプリットテストツールとして使おうとしないでください。そうではありません。
Bing側では、Microsoftは構造変更にはスプリットURLテストが適切なアプローチであると説明し、新しいバリアントURLを迅速にクロールさせるためにIndexNowを、ランキング側の測定に対するUX側のコンパニオンとしてMicrosoft Clarityを位置づけています。
必要なトラフィック量とページ数
普遍的な数字はありません。数字を示すガイドは単純化しすぎです。必要なサンプルサイズは、次の3つの要素によって決まります。
- ページがすでに示している自然変動の大きさ — ノイズが多いページほど多くのデータが必要です。
- 検出しようとしている効果の大きさ — 小さな効果にははるかに多くのデータが必要です。
- 各グループに入れられるページ数 — ページが多いほどシグナルが強くなります。
実用的な下限として、SearchPilot は 「一般的に、同じテンプレートで少なくとも数百ページ、テストしたいページグループへのオーガニックセッションが月に少なくとも 30,000 あるサイトで作業しています。」 と述べています。 Ahrefs のテストガイドでは、快適な閾値を 「月に数万から数十万のオーガニック訪問」 としています。 小規模なサイトでもテストは 可能 ですが、有意性に達するにははるかに大きな効果が必要です。つまり、小さな改善はノイズに埋もれ、大きな変化だけが記録されることがよくあります。
ここでの指標に注意してください: ページグループへのオーガニックセッション/クリックであり、ランキングではありません。 SearchPilot がそのように主張する理由は実用的です — ランクトラッキングではページがランクインするクエリの全体をカバーできず、Search Console の順位データはまばらで平均化されており、厳密なテスト指標にはなりません。グループへのトラフィックの方がより完全なシグナルです。
テストの実行期間
一般的な期間は 2〜6 週間 です。下限は 2 つの要因で決まります: Google がバリアントページを再クロールして再評価する必要があることと、各グループで有意性に達するのに十分なトラフィックを蓄積する必要があることです。
最大の禁忌は早期終了です。初期のポジティブな動きは非常に多くの場合ノイズであり、良さそうに見えた瞬間にテストを終了すると、偽陽性を出してしまいます。SEOTesting.com の Ryan Jones 氏はこれを率直に述べています — 「良い結果が見えたからといって、テストを早期に終了してはいけません!」 — そして、95% 信頼水準 (p < 0,05) を標準として維持することを推奨しています。検出力が不十分なテストは、勝者を宣言するのではなく、長く実行するか中止すべきです。
季節性とアルゴリズムアップデートの制御
これはまさに、コントロールグループと予測モデルが ある 理由です。季節的なスパイクやコアアップデートが発生した場合、それはコントロールグループとバリアントグループの両方に影響し、並行した動きとして見えます — 変更のせいだと誤って判断されることはありません。
これが崩れるのは バケット割り当ての不備 です。SearchPilot 自身の例を示します: 国際猫の日の直前にサイトの「猫」ページをすべてバリアントグループに入れた場合、実際の外部の季節スパイクがテストの勝利として誤って解釈されます。修正方法はグループへのランダムな割り当てであり、コントロールとバリアントの両方が代表的なページの混合を含み、どちらも外部の力に一方的にさらされないようにします。
確実にテストできることとできないこと
テスト可能:
- タイトルタグとメタディスクリプション
- H1/見出し構造
- 構造化データ (スキーマタイプまたは存在)
- 内部リンクパターン
- オンページコンテンツ (深さ、配置、カテゴリページの「SEO コンテンツ」ブロック)
- ページレイアウトと UI 構造 — 上級レベルではランディングページ全体のリデザインも
この方法では確実にテストできないもの:
- 被リンク。 これは明確な例です。インバウンドリンクをページグループの半分にランダムかつ均等に割り当て、残りの半分には与えないということはできません。リンク獲得は、スケジュールに従って投与したり、ページ間で標準化したりできる処理ではありません。第三者サイトはリンクしたいときにリンクします。Gorilla Marketing の Liam Blackledge 氏が言うように、製品ページの半分にリンクを構築し、残りの半分には構築しないことは 制御された実験ではありません。リンクは、真のスプリットテストではなく、前後比較や相関分析で評価されます。
- アルゴリズムアップデートとサイト全体の変更。 定義上、すべての人に影響するため、比較する真のコントロールグループがありません。
- バリアントページに隔離できず、コントロールグループに漏れる可能性があるもの。
テスト中のコンプライアンス維持
Googleはこの種のテストを明示的に認めています — 専用のドキュメントがあります — 以下の衛生規則に従う限り、問題ありません。
- バリアントURLを元のURLに正規化する。 Googleはテストバリアントに対して
noindexよりもrel="canonical"を推奨しています。これはバリエーションをグループ化し、元のURLを正規としてインデックスし続けるためです。(正規選択の仕組みをもっと深く知りたい場合は、それは別のトピックです。) - リダイレクトする場合は、301ではなく302を使用する。 Googleは明確に述べています: “If you’re running a test that redirects users from the original URL to a variation URL, use a 302 (temporary) redirect, not a 301 (permanent) redirect.” (翻訳) 「元のURLからバリエーションURLへユーザーをリダイレクトするテストを実行している場合は、301(恒久)リダイレクトではなく、302(一時)リダイレクトを使用してください。」
- クローキングをしない。 “Don’t show one set of URLs to Googlebot, and a different set to humans.” (翻訳) 「GooglebotにはあるURLセットを、人間には別のセットを見せないでください。」
- テストが終わったら、テストを終了する。 Googleは警告しています: “If we discover a site running an experiment for an unnecessarily long time, we may interpret this as an attempt to deceive search engines and take action accordingly.” (翻訳) 「不必要に長い期間実験を実行しているサイトを発見した場合、検索エンジンを欺こうとする試みと解釈し、それに応じて対処する可能性があります。」
そして、根強い誤解を解消するために: 適切に正規化されたテストバリアントに対して「重複コンテンツペナルティ」は存在しません。本当のリスクはクローキングであり、重複ではありません。Googleは意図的なテストバリエーションをその本質として理解しています。
位置づけ
SEO A/Bテストは、スケールが大きいほど効果を発揮する測定手法であり、数千のテンプレート化されたページがあるときに直面するレポートやアトリビューションの問題と並んで、エンタープライズツールキットに位置づけられています。これは「その変更は効果があったのか?」という問いに対する誠実な答えであり、大規模サイトでは誠実な答えには大きな価値があります。
Use SEO testing to make portfolio decisions under uncertainty, not to manufacture certainty: predefine the hypothesis, control, duration, and rollout rule before results arrive.
- Search experiments randomize comparable pages because search engines cannot be split like website visitors.
- Seasonality, algorithm changes, and regression to the mean can make simple before-and-after comparisons misleading.
- A documented stopping rule reduces pressure to ship a favorable-looking result early.
Controlled evidence helps teams scale changes that improve organic performance and avoid rolling weak ideas across a large template inventory.
無視した場合のリスク: The organization attributes normal volatility to its changes and scales decisions that have not demonstrated incremental value.
チームに確認: Was the success threshold and rollout rule written before the test, and is the control group comparable enough to support the decision?
AIまとめ
Advancedバージョンの簡潔な見解:
- CROスタイルのA/BテストがSEOに失敗する理由。 Googlebotは1つしかなく、検索エンジンはURLの1つのバージョンをインデックスし、クエリの検索を50/50に分割することはできません。そのため、ページレベルでランダム化します。訪問者やクエリレベルではありません。
- 2つの方法論。 分割URL/ホールドアウト(同じテンプレートのページをランダムにコントロール群とバリアント群に分け、オーガニックセッションを比較する)と時系列/因果インパクト(コントロール群をベースラインとして反事実を予測する — Google自身のCausalImpact研究、Brodersen et al. 2015)。
- これは完全なRCTではなく、準実験です。 ページグループは完全に独立しているわけではありません — 共有テンプレート、内部リンク、SERP競争により、バリアントグループの変更がコントロールグループに波及する可能性があります。ページの独立性が低いほど、有意性についてはより慎重になる必要があります。
- ツール。 SearchPilot(DistilledのODNから発展し、2020年のBrainlabs買収後にスピンアウト)、SEOTesting.com、seoClarityのモジュール。GSCにはライブの汎用実験機能はありません(それはAMP時代のものでした)。Bingは分割URLテスト + IndexNow + Clarityを推奨しています。
- サンプルサイズ。 普遍的な数値はありません — ページグループの分散、効果量、グループサイズによって決まります。SearchPilotの下限:数百の同一テンプレートページ + 月間約3万以上のオーガニックセッション。指標はランキングではなく、グループへのオーガニックセッションです。
- 期間。 通常2〜6週間。見た目が良いトレンドで早期に停止しないでください — 初期の動きはしばしばノイズです。95%信頼度(p < 0,05)を維持してください。
- 季節性/アップデート。 コントロールグループがそれらを処理します — 外部要因は両グループに平行移動として影響します。失敗モードはバケット分割の不良です。ランダム割り当てで修正してください。
- テスト可能: タイトル、メタ、見出し、構造化データ、内部リンク、コンテンツ、レイアウト。テスト不可: バックリンク(リンク獲得を均等に投与できない)、アルゴリズムアップデート、サイト全体の変更。
- コンプライアンス(Google): バリアントを正規化し、リダイレクトする場合は301ではなく302を使用し、クローキングをせず、テストを迅速に終了してください。正規化されたバリアントに対する重複コンテンツペナルティはありません。
公式ドキュメント
SEOテストを規定する一次情報源のガイダンス。
- A/B Testing Best Practices for Search — 検索に悪影響を与えずにテストを実行する方法に関するGoogleの公式ドキュメント:正規化、301ではなく302、クローキングなし、テストを永久に実行しないこと。
- Inferring Causal Impact Using Bayesian Structural Time-Series Models — Brodersen et al. (Google, 2015)、時系列SEOテストの背後にある研究と
CausalImpactパッケージ。プレプリント。 - Consolidate duplicate URLs (canonicalization) —
rel="canonical"がどのように機能するか。これはテストバリアントの正規化に関係します。
Bing / Microsoft
- A/B Test for Better Search Engine Performance with IndexNow and Microsoft Clarity — 構造変更のための分割URLテストに対するBingの推奨、およびIndexNowとClarityを補完ツールとして紹介。
ソースからの引用
公式見解。各Googleリンクは、ソースページの引用箇所にジャンプするディープリンクです。
Google — A/Bテストのベストプラクティス
- “Don’t show one set of URLs to Googlebot, and a different set to humans. This is called cloaking, and is against our spam policies, whether you’re running a test or not.” (翻訳) 「Googlebot にはある URL セットを見せ、人間には別の URL セットを見せないでください。これはクローキングと呼ばれ、テストを実行しているかどうかに関係なく、スパム ポリシーに違反します。」 引用にジャンプ
- “If you’re running a test that redirects users from the original URL to a variation URL, use a 302 (temporary) redirect, not a 301 (permanent) redirect.” (翻訳) 「元の URL からバリエーション URL にユーザーをリダイレクトするテストを実行している場合は、301 (恒久) リダイレクトではなく、302 (一時) リダイレクトを使用してください。」 引用にジャンプ
- “If we discover a site running an experiment for an unnecessarily long time, we may interpret this as an attempt to deceive search engines and take action accordingly.” (翻訳) 「不必要に長い期間実験を実行しているサイトを発見した場合、検索エンジンを欺こうとする試みと解釈し、それに応じて対処する可能性があります。」 引用にジャンプ
Craig Bradford、SearchPilot — 訪問者レベルでの SEO テストが存在しない理由
- “The ‘user’ we are testing for is Googlebot, not human users. That means it’s not possible, for instance, to show 10,000 ‘Googlebots’ control and variant pages randomly. There is only one Googlebot.” (翻訳) 「テスト対象の『ユーザー』は Googlebot であり、人間のユーザーではありません。つまり、たとえば 10,000 体の『Googlebot』にコントロール ページとバリアント ページをランダムに表示することは不可能です。Googlebot は 1 つしかありません。」 引用にジャンプ
- 実用的な最小条件について: “at least hundreds of pages on the same template and at least 30,000 organic sessions per month to the group of pages you want to test on.” (翻訳) 「テストしたいページ群に対して、同じテンプレートのページが少なくとも数百ページ、かつ月あたり少なくとも 30,000 セッションのオーガニック トラフィックが必要です。」 引用にジャンプ
SEO A/B テストを実行すべきか、またどの種類を選ぶべきか
意思決定を素早く進めるための道筋。
1. 類似したテンプレート化されたページの大きなグループがありますか? (例: テンプレートを共有する何百もの商品ページ、カテゴリ ページ、ブログ投稿)
- いいえ → SEO スプリット テストはまだ向いていないかもしれません。クリーンなバリアント グループに変更を分離できません。一致するコントロール セットを使った慎重な前後比較を検討してください。ただし、結果は方向性を示すものとして扱い、証明とはみなさないでください。
- はい → 続行します。
2. それらのページは意味のあるオーガニック トラフィックを得ていますか? (SearchPilot の実用的な下限: テスト グループへの月あたり約 3 万以上のオーガニック セッション。快適なのは数万から数十万)
- いいえ / 非常に少ない → テストは可能ですが、大きな効果しか検出できません。長い期間を想定し、小さな結果を過大評価しないでください。
- はい → 続行します。
3. 何をテストしようとしていますか?
- タイトル タグ、メタ、構造化データ、内部リンク、コンテンツ、レイアウト → テスト可能です。続行します。
- 被リンク、サイト全体の変更、アルゴリズムの更新 → スプリット テストでは確実にテストできません。前後比較や相関分析を使用し、交絡因子について正直に説明してください。
4. どの方法論を選びますか?
- ライブのコントロール ページ グループを確保できる場合 → スプリット URL / ページ グループ (ホールドアウト) テストを実行します: コントロールとバリアントにランダムに分割し、オーガニック セッションを比較します。
- ページを確保できない場合 (変更を全体に適用する必要がある) が、モデル化に使える類似の影響を受けないページがある場合 → 時系列 / 因果インパクト テストを実行します: 反事実を予測し、ギャップを測定します。
5. テストを公開する前に:
- グループへのランダム割り当て(季節的なスパイクの直前にテーマ別バケットを使わない)。
- バリアントはサーバーサイド/エッジサイドで配信し、クライアントサイドのJSでは配信しない。
- バリアントを正規化する。リダイレクトする場合は301ではなく302を使用し、クローキングはしない。
- 期間(通常2〜6週間)と有意性の基準を事前に決め、良い傾向が見えても早期に停止しない。
SEOテストが失敗する一般的な方法
CROテストのように扱う。 クライアントサイドのJavaScript A/Bツールを実行し、人間にとって安全だからSEOにも安全だと仮定する。コンテンツのちらつきや遅延読み込みの変更は、クローラーに見逃されたり誤ってインデックスされたりする可能性がある。バリアントはサーバーサイドまたはエッジで配信する。
テーマ別バケット。 国際猫の日の直前に、すべての「猫」ページをバリアントグループに入れる(SearchPilot自身の例)。実際の季節的なスパイクがテストの勝利のように見える。ページをランダムにグループに割り当て、両グループが代表的な混合を含むようにする。
テストを早期に停止する。 傾向が良さそうに見えた瞬間に勝者を宣言する。初期の動きは通常ノイズです。期間と有意性の基準を事前に決め、それらを守る。
ランキングで判断する。 ランクトラッカーの順位や平均化されたSearch Consoleの順位を主要な指標として使用する。ランクトラッキングは完全なクエリテールをカバーできず、GSCの順位データはまばらで平均化されすぎている。代わりに、ページグループへのオーガニックセッション/クリックを測定する。
分離できないものをテストする。 「バックリンクのスプリットテスト」を試みたり、サイト全体/技術的な変更をバリアントグループに帰属させたりする。処理がコントロールグループに漏れる(または全員に影響する)場合、クリーンな比較はできない。
テストを永遠に実行し続ける。 Googleは、不必要に長い間放置された実験は欺瞞の試みと読まれる可能性があると明示的に警告している。答えが得られたら、テストを終了して勝者を公開する(または元に戻す)。
GSCに実験機能があると仮定する。 存在していた実験ツールはAMP時代のものだった。一般的なSEOテストのために現在提供されていないGSC機能を中心にテスト計画を構築しない。
SEO A/Bテスト設定チェックリスト
テストを開始する前にこれを確認してください:
- テストするための類似した、同じテンプレートのページの大きなグループがある。
- ページグループが、関心のある効果を検出するのに十分なオーガニックトラフィックを獲得している(最低〜月30k+セッション、効果が小さい場合はそれ以上)。
- 変更がテスト可能である(タイトル、メタ、見出し、構造化データ、内部リンク、コンテンツ、レイアウト)— バックリンクやサイト全体/アルゴリズム要因ではない。
- ページがランダムにコントロールとバリアントに割り当てられている — テーマ別バケットなし。
- バリアントはサーバーサイドまたはエッジで配信され、クライアントサイドのJSではない。
- バリアントURLは元のURLに正規化されている。
- リダイレクトは301ではなく302である。
- クローキングなし — Googlebotと人間は、配信される各バージョンに対して一致するコンテンツを見る。
- ライブのコントロールグループを保持できるかどうかに応じて、適切な方法論(分割URLホールドアウト vs. 時系列/因果インパクト)を選択している。
- 指標はページグループへのオーガニックセッション/クリックであり、ランク順位ではない。
- 期間と有意性の基準を事前にコミット(通常2〜6週間、95%信頼)— そして早期に停止しない計画。
- 結論が出たらすぐにテストを終了し、公開または元に戻す計画。
SEO A/Bテストのツール
- SearchPilot — 厳密なSEOスプリットテストで最もよく知られるプラットフォーム。エッジでテストを実行し、 バリアントがクローラーから見えるHTMLに表示されるようにします。DistilledのODNから発展しました。
- SEOTesting.com — Search Consoleを活用した軽量なテストツールで、統計的有意性に重点を置いています。
- seoClarity — スプリットテストモジュールを備えたエンタープライズSEOスイート。
CausalImpact— ベイズ構造時系列因果推論のためのGoogleのオープンソースRパッケージ。 独自に分析を構築したい場合の時系列SEOテストの背後にある手法です。- Google Search Console + Bing Webmaster Tools — テスト中のインデックス/トラフィック監視用。 GSCには現在、一般的な目的の実験機能はないことに注意してください。
- IndexNow — 反復テスト中にBing側でバリアントURLを迅速に再クロールさせるため。
- Microsoft Clarity — ランキング側の測定と対になるUX側のコンパニオンとしてのヒートマップとセッション録画。
SEOテストを設計するためのフレームワーク
処理-対照-結果のフレーム
ツールを議論する前に、すべてのテストを3行で定義します。
- 処理: バリアントページに適用される単一の隔離された変更。
- 対照: 変更されず、同じ季節性と外部検索条件を共有する類似ページ。
- 結果: 事前にコミットされた期間におけるページグループのオーガニッククリックまたはセッション。
処理が対照グループに漏れた場合、グループが比較可能でない場合、または結果が判明した後に結果が変わった場合、そのテストは因果関係の主張を支持できません。
反事実のフレーム
すべての結果は次の問いに答えるべきです: 変更がなかった場合、何が起こっていた可能性が高いか? ホールドアウトテストは、変更されていないページを通じてその比較を観察します。時系列テストは、類似の影響を受けていないページとテスト前の行動を使用してそれをモデル化します。信頼できる反事実のない前後比較チャートは、証明ではなく観察です。
開始前の検出力のフレーム
統計的検出力は設計上の要件であり、後から交渉する結果ではありません。ページ数、トラフィック、自然変動、期待される効果が検出可能なシグナルを生み出せるかどうかを推定します。できない場合は、より大きなグループをテストするか、より大きな変更を対象にするか、計画された期間を延長するか、結果を方向性のあるものとしてラベル付けします。
データ前の意思決定のフレーム
テスト開始前にローンチ決定ルールを書きます:
- 主要指標、
- 最小実行期間、
- 有意性または信頼区間のルール、
- 出荷する価値のある実用的な効果、
- そして、ポジティブ、ネガティブ、および結論が出ない結果に対するアクション。
事前にコミットすることで、有望な初期トレンドが実験を書き換えるのを防ぎます。
SEO A/Bテストのチートシート
| 決定 | このルールを使用 |
|---|---|
| 割り当て単位 | 訪問者やクエリではなく、類似したページを分割 |
| ホールドアウト方法 | ランダムな対照ページグループとバリアントページグループ; オーガニックトラフィックを比較 |
| 時系列方法 | 影響を受けていないページから変更なしの反事実を予測 |
| 主要な結果 | テスト対象のページグループへのオーガニッククリックまたはセッション |
| 一般的なテスト可能な変更 | タイトル、メタ、見出し、構造化データ、内部リンク、コンテンツ、レイアウト |
| スプリットテストに不向きな候補 | バックリンク、アルゴリズム更新、サイト全体に影響する変更 |
| 配信 | クローラーがHTMLでバリアントを受け取るようにサーバーサイドまたはエッジサイド |
| バリアントURL | 元のURLに正規化; リダイレクトする場合は302を使用 |
| 典型的な期間 | 期間を事前にコミット; 多くのテストは2〜6週間実行 |
| 停止ルール | トレンドがポジティブに見えても早期に停止しない |
| 最終状態 | 出荷または元に戻し、その後すぐに実験を削除 |
クイック妥当性チェック
- 同一テンプレートのページが十分な量存在する。
- 割り当てはトピックや季節でグループ化されるのではなく、ランダムである。
- 1つの処理だけが変更され、他のすべては安定したままである。
- 対照ページは処理の影響を受けない。
- 指標と判定ルールは開始前に選択されている。
- Googlebotとユーザーに異なるコンテンツが表示されない。
- 結論は効果なしと効果が不明を区別する。
SEO実験の計画とレビューのためのプロンプト
実験デザインを厳しく検証する
提案されたページセット、変更、指標、実行期間を貼り付けてください。勝者の予測ではなく、デザインへの批判を期待してください。
Review this proposed SEO A/B test for causal validity. Identify the treatment,
assignment unit, control, primary outcome, expected recrawl lag, likely confounders,
spillover risks, seasonality risks, compliance issues, and reasons the test may be
underpowered. Recommend changes to randomization and measurement. Do not invent a
minimum sample size or effect estimate when the supplied data cannot support one.
[PASTE TEST DESIGN AND PAGE-GROUP DATA]過剰主張せずに完了したテストを解釈する
事前にコミットしたルールと結果の要約を貼り付けてください。不確実性をそのまま残した構造化された決定を期待してください。
Evaluate this completed SEO test against its precommitted decision rules. Return:
result (positive, negative, or inconclusive), estimated practical effect, statistical
uncertainty, control-vs-variant behavior, evidence of seasonality or algorithm-update
confounding, whether the run window was honored, and the recommended action (ship,
revert, or retest). Do not convert correlation into causation or treat an
inconclusive result as proof of no effect.
[PASTE PRECOMMITTED RULES, TIME SERIES, AND RESULT SUMMARY] 自分で試す:SEO A/Bテスト
SEOスプリットテストが実際にどのように機能するかに関する5つの質問。それぞれに回答を選び、確認してください。
時間をかける価値のあるリソース
関連する私の記事
- SEOテスト:シンプル(だが完全な)ガイド — 私が在籍していた頃のAhrefsのSEOテストガイド。A/B/スプリットテストをテスト方法の中で最も安全なものと位置づけ、トラフィックと期間の期待値を設定しています。
- 最大成長のためのエンタープライズSEO戦略 — SEOテストが最も効果を発揮するスケールの文脈。大規模なテンプレート化されたページセットに依存するためです。
- 技術的SEOの初心者向けガイド — ここでのコンプライアンスルールが基づく技術的なベースライン(正規化、リダイレクト、クロール)。
業界から
- 検索のためのA/Bテストのベストプラクティス — Google検索セントラル — 公式ルール:正規、302であって301ではない、クローキングなし、テストを永遠に実行しない。
- SEO A/Bテストとは? — SearchPilot(クレイグ・ブラッドフォード) — ツールを構築するチームによる、最も権威のある実践者向け解説。
- ベイズ構造時系列モデルを用いた因果インパクトの推論 — Brodersenら、Google — 時系列SEOテストの背後にある研究論文と
CausalImpactパッケージ。 - SEOテストにおける統計的有意性 — SEOTesting.com(ライアン・ジョーンズ) — 95%信頼水準とテストを早期に停止しないことの根拠。
- IndexNowとMicrosoft Clarityで検索エンジンのパフォーマンスを向上させるA/Bテスト — Bing Webmasterブログ — Bingの見解:構造変更のためのスプリットURLテスト、さらにIndexNowとClarity。
- SEOでA/Bテストできることとできないこと — Gorilla Marketing(リアム・ブラックレッジ) — バックリンクやサイト全体の要因がスプリットテストの対象外である理由を明確に解説。
- SEO A/Bテストガイド — VWO — オーガニック向上の実際のケーススタディ例を含むCROベンダーの視点。
変更履歴
2026年7月19日に更新。
編集概要と記録された変更の詳細。変更の詳細
- Advanced
変更の詳細な注記は現在英語でのみ提供されています。
- AI Summary
変更の詳細な注記は現在英語でのみ提供されています。
完全な比較は利用できません — この改訂の以前のスナップショットがアーカイブされていません。
2026年7月16日に更新。
編集概要と記録された変更の詳細。変更の詳細
- For Decision-Makers
変更の詳細な注記は現在英語でのみ提供されています。
完全な比較は利用できません — この改訂の以前のスナップショットがアーカイブされていません。