SEO A/Bテスト

時系列またはURL分割アプローチを使用して、タイトルタグ、メタディスクリプション、構造化データ、オンページ変更を分割テストし、因果的影響を測定する、管理されたSEO実験の実行方法。

初回公開:2026年7月2日 · 最終更新:2026年8月3日 · Advanced
言語

SEO A/Bテストは、変更が実際にオーガニック検索に影響を与えたかどうかを測定します。あなたがそう思うかどうかではありません。コンバージョン用のランディングページをテストするようにSEOをテストすることはできません。なぜなら、Googlebotは1つしかなく、検索エンジンはURLの1つのバージョンをインデックスし、クエリの検索を50/50に分割する方法がないからです。そのため、代わりにページレベルでランダム化します。2つの実際の方法:URL分割/ホールドアウトテスト(類似したテンプレートページの大規模なグループをコントロールとバリアントにランダムに分割し、オーガニックトラフィックを比較)と時系列/因果影響テスト(コントロールグループをベースラインとして、変更がなかった場合のバリアントページの予測を立てる)。タイトルタグ、メタディスクリプション、構造化データ、内部リンク、コンテンツはテスト可能ですが、バックリンクはテストできません。ノイズを打ち負かすには十分なページ数とトラフィックが必要です(SearchPilotの実用的な最低基準は、数百の同一テンプレートページと月間約3万以上のオーガニックセッション)。テストは通常2〜6週間実行され、良好に見えるトレンドで早期に停止してはいけません。Googleに準拠するには:バリアントURLを正規化し、リダイレクトする場合は301ではなく302を使用し、クローキングをせず、テストが完了したら停止します。

TL;DR — 従来のランダム化A/BテストはオーガニックSEOには適用できません。なぜなら、Googlebotは1つしか存在せず、検索エンジンはURLの1つのバージョンをインデックスし、クエリの検索を50/50に分割できないからです。そのため、ページレベルでランダム化します。2つの方法論があります:URL分割/ホールドアウト(同じテンプレートの多数のページをランダムにコントロール群とバリアント群に分割し、オーガニックセッションを比較する)と時系列/因果インパクト(Google自身のCausalImpact研究に基づき、コントロール群をベースラインとして反事実を予測する)です。テスト可能なもの:タイトル、メタデータ、構造化データ、内部リンク、コンテンツ、レイアウト。確実にテストできないもの:バックリンク、アルゴリズム更新、サイト全体に関わるもの。分散を推定するには、十分な数の比較可能なページ、観測値、テスト前の履歴が必要です。普遍的なトラフィックの下限や期間はありません。これは完全なRCTではなく、準実験として扱ってください。ページ群は完全に独立しているわけではなく、共有テンプレート、内部リンク、SERPでの競合により、バリアント群の変更がコントロール群に影響を与える可能性があります。好ましい傾向に見えるからといって終了するのではなく、停止ルールを事前に定義してください。コンプライアンスを維持:バリアントを正規化し、301ではなく302を使用し、クローキングをせず、テストが終了したら撤去してください。

Evidence for this claim CausalImpact estimates an intervention's causal effect from a Bayesian structural time-series counterfactual under stated assumptions. Scope: Original methodology; validity depends on controls, stable relationships, and experimental design. Confidence: high · Verified: Brodersen et al.: Inferring causal impact using Bayesian structural time-series models Evidence for this claim Search experiments must avoid showing materially different content to Googlebot and users in ways that constitute cloaking; temporary tests should preserve normal crawlability and canonical intent. Scope: Current Google spam and testing constraints, not a universal test-duration prescription. Confidence: high · Verified: Google Search Central: Website testing and Google Search

CROスタイルのA/Bテストがオーガニック検索に機能しない理由

SEOテストに独自の方法論が必要な理由は、テスト対象が人間ではないからです。SearchPilotのCraig Bradford氏が述べているように、“The ‘user’ we are testing for is Googlebot, not human users. That means it’s not possible, for instance, to show 10,000 ‘Googlebots’ control and variant pages randomly. There is only one Googlebot.” (翻訳) 「私たちがテストしている『ユーザー』はGooglebotであり、人間のユーザーではありません。つまり、例えば10,000の『Googlebot』にコントロールページとバリアントページをランダムに表示することは不可能です。Googlebotは1つしかいません。」

ランダム化された、ビジター単位のA/Bテスト(コンバージョン率最適化で使用される種類)をオーガニック検索に適用できない理由は、構造的に2つあります:

  1. 検索エンジンはURLの1つのバージョンをインデックスし、ランク付けします。 Webサーバーは、Cookieによってビジターの半数をバケットAに、残り半数をバケットBにリアルタイムで振り分けることができます。Googlebotは、配信された1つのバージョンをクロールし、インデックスします。同じURLの2つの競合するバージョンを保持し、それらを互いにランク付けするメカニズムはありません。
  2. クエリごとのランダム割り当てはありません。 広告プラットフォームがインプレッションの半数にバリアントクリエイティブを表示するように、「[キーワード]の検索の半数」にバリアントコンテンツを表示することはできません。どのページがクエリでランク付けされるかを決定するのはGoogleであり、そのトラフィックを分割することはできません。

両方の実際の方法論における回避策は同じです:ビジターやクエリレベルではなく、ページレベルでランダム化します。 類似した多数のページのグループを母集団として扱い、ページをコントロール群とバリアント群に分割します。

これはまた、CROで安全な習慣が自動的にSEOで安全であるとは限らないことも意味します。読み込み後にコンテンツを置き換えるクライアントサイドのJavaScript A/Bツールは人間には問題ありませんが、クローラーにとってはリスクがあります。SearchPilotは、SEOテストにJavaScriptを使用すると「重大な問題を引き起こしたり、結果を無効にしたりする可能性がある」と警告しています。SEOをテストする場合は、クローラーが初期HTMLでバリアントを認識できるように、サーバーサイド(またはエッジサイド)で行ってください。

2つの実際の方法論

ほとんどのガイドはすべてを「SEO A/Bテスト」としてひとくくりにしています。これら2つの異なるアプローチを分離する価値があります。なぜなら、それらはわずかに異なる質問に答えるからです。

1. URL分割 / ページグループ(ホールドアウト)テスト

テンプレート化された多数のページ(すべての商品ページ、すべてのカテゴリページ、すべてのブログ記事)を取得し、それらをランダムにコントロール群とバリアント群に割り当てます。バリアント群には変更が適用され、コントロール群には適用されません。テスト期間中、2つのグループ間のオーガニックトラフィック(セッション/クリック)を比較します。

両グループは同じ外部条件を経験するため、季節性やアルゴリズムの更新など全員に影響するものは、両グループで平行な動きとして現れ、あなたの変更のせいにはされません。測定しているのは、変更が公開された後のグループ間の乖離です。

問題は統計的検出力です。ページ数と、各ページのトラフィックが十分に必要で、それらのページが日々示すノイズを超えて実際の効果を検出できるようにする必要があります。

正直に言うべき点があります。ページグループは、ウェブサイトのA/Bテストにおける個々の訪問者のように完全に独立した観測ではありません。同じサイトのページは、テンプレートや内部リンクを共有し、同じSERPで互いに競合することがよくあります。バリアントグループへの変更は、内部リンクの評価を変えたり、クリックを奪い合ったりして、コントロールグループにも影響を与える可能性があります。これは脚注ではなく、実際の限界です。これが、これが準実験であり、完全なランダム化比較試験ではない理由です。ページの独立性が低いほど、結果を有意と呼ぶ前に慎重になるべきです。

2. 時系列/因果インパクトテスト

ライブのコントロールグループを保持する代わりに(またはそれに加えて)、変更を適用し、変更がなかった場合のバリアントページのトラフィックを予測します(反事実)。その予測を構築するために、類似した影響を受けていないページのコントロールグループを使用します。予測と実際に起こったことのギャップが、推定されたインパクトです。

この背後にある統計エンジンはベイズ構造時系列モデリングで、Google自身の研究から直接来ています。Brodersen、Gallusser、Koehler、Remy、Scottによる”Inferring Causal Impact Using Bayesian Structural Time-Series Models”The Annals of Applied Statistics、2015年)で、オープンソースのCausalImpact Rパッケージとして公開されています(プレプリントはこちら)。「ベイズ」や「因果インパクト」の手法を主張するほとんどすべてのSEOテストツールは、引用していなくてもこの論文に基づいています。この手法が実際にどこから来たのかを知っておく価値があります。

この分野のツール

状況は変化するので、コミットする前に現在の状態を確認してください。しかし、主なプレイヤーは以下の通りです。

  • SearchPilot — 厳密なSEOスプリットテストに最も関連付けられるプラットフォーム。DistilledのODN(Optimisation Delivery Network)から発展しました。Distilledは2020年にBrainlabsに買収され、テスト製品はSearchPilotとしてスピンアウトしました。エッジでテストを実行するため、バリアントはクローラーが見るHTMLで提供されます。
  • SEOTesting.com — より軽量で、Search Console駆動のテストツールで、統計的有意性に重点を置いています。
  • seoClarity — エンタープライズスイートにはSEOスプリットテストモジュールが含まれています。

仮定してはいけないことが1つあります。Google Search Consoleは、現在、ライブで汎用的なSEO実験機能を提供していません。 AMP時代に関連した実験ツールはありましたが、実質的に一般的なPage Experienceレポートに統合されています。「GSC Experiments」を現在のスプリットテストツールとして使おうとしないでください。そうではありません。

Bing側では、Microsoftは構造変更にはスプリットURLテストが適切なアプローチであると説明し、新しいバリアントURLを迅速にクロールさせるためにIndexNowを、ランキング側の測定に対するUX側のコンパニオンとしてMicrosoft Clarityを位置づけています。

必要なトラフィック量とページ数

普遍的な数字はありません。数字を示すガイドは単純化しすぎです。必要なサンプルサイズは、次の3つの要素によって決まります。

  • ページがすでに示している自然変動の大きさ — ノイズが多いページほど多くのデータが必要です。
  • 検出しようとしている効果の大きさ — 小さな効果にははるかに多くのデータが必要です。
  • 各グループに入れられるページ数 — ページが多いほどシグナルが強くなります。

実用的な下限として、SearchPilot は 「一般的に、同じテンプレートで少なくとも数百ページ、テストしたいページグループへのオーガニックセッションが月に少なくとも 30,000 あるサイトで作業しています。」 と述べています。 Ahrefs のテストガイドでは、快適な閾値を 「月に数万から数十万のオーガニック訪問」 としています。 小規模なサイトでもテストは 可能 ですが、有意性に達するにははるかに大きな効果が必要です。つまり、小さな改善はノイズに埋もれ、大きな変化だけが記録されることがよくあります。

ここでの指標に注意してください: ページグループへのオーガニックセッション/クリックであり、ランキングではありません。 SearchPilot がそのように主張する理由は実用的です — ランクトラッキングではページがランクインするクエリの全体をカバーできず、Search Console の順位データはまばらで平均化されており、厳密なテスト指標にはなりません。グループへのトラフィックの方がより完全なシグナルです。

テストの実行期間

一般的な期間は 2〜6 週間 です。下限は 2 つの要因で決まります: Google がバリアントページを再クロールして再評価する必要があることと、各グループで有意性に達するのに十分なトラフィックを蓄積する必要があることです。

最大の禁忌は早期終了です。初期のポジティブな動きは非常に多くの場合ノイズであり、良さそうに見えた瞬間にテストを終了すると、偽陽性を出してしまいます。SEOTesting.com の Ryan Jones 氏はこれを率直に述べています — 「良い結果が見えたからといって、テストを早期に終了してはいけません!」 — そして、95% 信頼水準 (p < 0,05) を標準として維持することを推奨しています。検出力が不十分なテストは、勝者を宣言するのではなく、長く実行するか中止すべきです。

季節性とアルゴリズムアップデートの制御

これはまさに、コントロールグループと予測モデルが ある 理由です。季節的なスパイクやコアアップデートが発生した場合、それはコントロールグループとバリアントグループの両方に影響し、並行した動きとして見えます — 変更のせいだと誤って判断されることはありません。

これが崩れるのは バケット割り当ての不備 です。SearchPilot 自身の例を示します: 国際猫の日の直前にサイトの「猫」ページをすべてバリアントグループに入れた場合、実際の外部の季節スパイクがテストの勝利として誤って解釈されます。修正方法はグループへのランダムな割り当てであり、コントロールとバリアントの両方が代表的なページの混合を含み、どちらも外部の力に一方的にさらされないようにします。

確実にテストできることとできないこと

テスト可能:

  • タイトルタグとメタディスクリプション
  • H1/見出し構造
  • 構造化データ (スキーマタイプまたは存在)
  • 内部リンクパターン
  • オンページコンテンツ (深さ、配置、カテゴリページの「SEO コンテンツ」ブロック)
  • ページレイアウトと UI 構造 — 上級レベルではランディングページ全体のリデザインも

この方法では確実にテストできないもの:

  • 被リンク。 これは明確な例です。インバウンドリンクをページグループの半分にランダムかつ均等に割り当て、残りの半分には与えないということはできません。リンク獲得は、スケジュールに従って投与したり、ページ間で標準化したりできる処理ではありません。第三者サイトはリンクしたいときにリンクします。Gorilla Marketing の Liam Blackledge 氏が言うように、製品ページの半分にリンクを構築し、残りの半分には構築しないことは 制御された実験ではありません。リンクは、真のスプリットテストではなく、前後比較や相関分析で評価されます。
  • アルゴリズムアップデートとサイト全体の変更。 定義上、すべての人に影響するため、比較する真のコントロールグループがありません。
  • バリアントページに隔離できず、コントロールグループに漏れる可能性があるもの。

テスト中のコンプライアンス維持

Googleはこの種のテストを明示的に認めています — 専用のドキュメントがあります — 以下の衛生規則に従う限り、問題ありません。

そして、根強い誤解を解消するために: 適切に正規化されたテストバリアントに対して「重複コンテンツペナルティ」は存在しません。本当のリスクはクローキングであり、重複ではありません。Googleは意図的なテストバリエーションをその本質として理解しています。

位置づけ

SEO A/Bテストは、スケールが大きいほど効果を発揮する測定手法であり、数千のテンプレート化されたページがあるときに直面するレポートやアトリビューションの問題と並んで、エンタープライズツールキットに位置づけられています。これは「その変更は効果があったのか?」という問いに対する誠実な答えであり、大規模サイトでは誠実な答えには大きな価値があります。

Add an expert note

Pin an expert quote

New person? Create their unclaimed profile at /admin/experts/ → Pin a quote first.