情報利得

SEOとAI検索における情報利得とは何か — GoogleのInformation Gain Score特許の仕組み、オリジナル調査と独自データが焼き直しコンテンツを上回る理由、測定方法を解説します。

初回公開:2026年7月2日 · 最終更新:2026年8月3日 · Advanced
言語

情報利得とは、そのトピックについて検索者が検索結果ですでに見た内容を超えて、ページが加える*新しい*情報の量です。既存コーパスに対する新規性であり、一般的なコンテンツ品質ではありません。この語は実在するGoogleの特許(「Contextual estimation of link information gain」、2018年出願、2022年付与)に由来し、文書の新規性を0,00〜1,00でスコア化し、そのスコアに基づいて一部の順位付けを行います。ただし、Googleはライブランキングで使っているとは一度も確認していません。特許の枠組みは、ユーザーがいくつかの結果を見た後に*次に*何を表示するかであり、最初のページではありません。Search Consoleに目に見えるスコアも、APIも、公開された計算式もありません。ツールにある「情報利得スコア」は近似です。実際に公式なのは、Googleの有用なコンテンツに関するガイダンスが「独自の情報、報道、調査、分析」を提供しているかを尋ねることです。今、重要性が増しているのは、AI OverviewsとAI Modeがコンセンサスのコンテンツをすでに合成できるからです。AIが取り込むのではなく引用する必要があるのは、真に新しい情報(独自データ、オリジナル調査、一次体験の専門知識)だけです。

TL;DR — 情報利得は、検索者がトピックについてすでに見たコーパスに対する新規性です。包括性でも、E-E-A-Tでも、抽象的な意味での「品質」でもありません。この名称は、2018年に出願され2022年に付与されたGoogleの特許「Contextual estimation of link information gain」に由来し、文書が加える新情報の量を0,00〜1,00でスコア化し、そのスコアに基づいて一部の順位付けを行います。ただし、Googleはライブでの利用を確認していません。特許自体の枠組みは、ユーザーがいくつかの結果を見た後に次に何を示すかであり、最初のページではありません。また、目に見えるスコアもAPIも公開された計算式もありません。公式に確認できるのは、Googleの有用なコンテンツに関するガイダンスが「独自の情報、報道、調査、分析」を求めていることです。AI回答型SERPでは、LLMがコンセンサスを無料で合成するため、重要性が増します。AIに引用させるには、真に新しい情報だけが必要です。

情報利得の実際の意味(意味しないものも含む)

引用される特許は、特定の本番ランキングシステムがまさにその方法で動作しているという証拠ではなく、あり得る方法を説明したものです。 Evidence for this claim Official or primary documentation supporting the adjacent article claim, with scope limited to the source's published description. Scope: No ranking guarantee or undisclosed system mechanics are inferred beyond the cited source. Confidence: high · Verified: Google patent: Contextual estimation of link information gain 独自価値に関するガイダンスは、測定可能なランキング保証ではなく、編集上の原則として使ってください。 Evidence for this claim Official or primary documentation supporting the adjacent article claim, with scope limited to the source's published description. Scope: No ranking guarantee or undisclosed system mechanics are inferred beyond the cited source. Confidence: high · Verified: Google: Helpful content guidance

このトピックに関する多くの記事は、異なる3つのものをひそかに混同しています。分けて考えましょう。

  • 情報利得 — 検索者がそのトピックですでに見た内容に対して、文書が加える限界的な新情報です。差分です。

  • 包括性/トピカルな深さ — トピックについてすべてをカバーすることです。上位にランキングしているページのすべての事実がすでに存在していれば、ページが最大限に包括的でも情報利得はゼロになり得ます。

  • E-E-A-T/コンテンツ品質 — 信頼、専門性、経験、権威性です。関連はしますが、別の判断です。疑いようのない専門家でも、新しいものを何も加えないページを公開することはあります。

  • 真実性と正確性 — 新しいことと正しいことは同じではありません。ページが真に新しい主張を加えても、それが間違っていることはあります。新規性、正確性、信頼性は別々に判断し、独自性は公開判断の1つの材料として扱い、検証の代わりにしないでください。

このページから1つだけ持ち帰るなら、情報利得は差分そのものであり、深さでも信頼でもないということです。この区別こそ、ほぼすべての競合解説が曖昧にしている点です。

もう1つ、名前を挙げておく価値のある区別があります。SEOはこの用語を緩く借用しましたが、検索以外ではより古く、技術的な意味があります。情報理論では、Claude Shannonの1948年のエントロピーと情報量に関する研究にさかのぼります。これは信号が不確実性をどれだけ減らすかを数学的に扱うもので、検索順位とは関係ありません。情報検索の研究では、並行する考え方が新規性多様性として現れます。Maximal Marginal Relevance(CarbonellとGoldstein、1998年)のような手法は、読者がすでに見た内容に対する重複を減らすため、結果を再順位付けまたは選択します。Googleの特許は、「すでに示されたものに対して新しい」という同じ基礎的な直感に依拠していますが、これらはいずれも互換的ではありません。SEO業界の「情報利得」は、特定の特許を基にした略称であり、Shannonの数学や公開されたIRの多様性アルゴリズムを直接適用したものではありません。3つに共通する直感(すでにあるものをただ繰り返さない)は響き合っていますが、それぞれは別のものです。

Information gain is the delta beyond what was already available—not the total length or polish of the candidate page. 出典: /ai-search/optimization/information-gain/

The top box represents consensus facts A, B, and C that the reader has already seen. The low-gain candidate repeats A, B, and C in different wording. The high-gain candidate adds original evidence D that was absent from the earlier sources. The comparison is conceptual, not a confirmed ranking factor or public Google score.

© Patrick Stox LLC · CC BY 4.0 ·

この用語の背景にあるGoogleの特許

特許の内容

この特許は「Contextual estimation of link information gain」です(US20200349181A1。2018年10月出願、2022年6月付与。発明者にはVictor CarbuneとPedro Gonnet Andersが含まれます)。特許からの中核定義を逐語的に示します。

“An information gain score for a given document is indicative of additional information that is included in the given document beyond information contained in other documents that were already presented to the user.” (翻訳)「ある文書の情報利得スコアは、ユーザーにすでに提示された他の文書に含まれていた情報を超えて、その文書に含まれる追加情報を示します。」 — Contextual estimation of link information gain.

これは、ユーザーがすでに閲覧した文書からのセマンティックベクトルと、新しい候補文書からのデータを受け取る機械学習モデルを説明しています。特許の言葉では、次のような出力です。

“a quantitative score between 0.00 and 1.00, with 0.00 indicating that no information gain is to be expected” (翻訳)「0,00は情報利得が期待されないことを示す、0,00から1,00までの定量的なスコア」

つまり、1,00は、すでに見た内容にはない情報だけを文書が含むことを意味します。その後、文書はそれぞれの情報利得スコアに少なくとも部分的に基づいて順位付けされる可能性があります。

特許が述べていないこと

ここはSEOコンテンツの多くが言い過ぎる部分なので、限界を正確に説明します。

  • ライブでの利用は確認されていません。 付与された特許が示すのは、Googleがこれを導入できるということであって、導入しているということではありません。Googleは、この仕組みをランキングで使っているとも、使っていないとも確認していません。これが確認済みのランキング要因だと言う人は推測しています。
  • 想定されるより狭い範囲です。 特許の枠組みは、次に表示する文書またはリンクを選ぶことを中心にしています。つまり、ユーザーがすでにいくつかの結果を見た後の会話型またはアシスタントのフォローアップであり、10件の青いリンクの最初のページではありません。Search Engine JournalのRoger Monttiによる分析はこの範囲をよく示しています。重点は自動アシスタントにあり、これらのスコアが最初の結果セットに適用されるとは説明されていません(SEJ)。
  • 公開された計算式はありません。 特許は「セマンティックベクトル」と抽出された顕著な情報に触れていますが、重み、特徴量一覧、再現可能なスコアリング方法は開示していません。Googleがどう計算するかを正確な「方法」として示す記事を信用しないでください。作り物です。
  • 1件の出願ではなく、特許ファミリーです。 Googleは同じファミリーで継続出願の特許を取得しています。US12013887B2で、同じタイトル、同じ譲受人(Google LLC)、優先日は元の2018年10月出願にさかのぼります。継続出願によってファミリー内で開示されたクレーム文言が増えることはあっても、導入について新しいことが確認されたわけではありません。付与特許とその継続出願が確立するのは、Googleが構築できると開示した内容だけであり、本番環境で稼働しているものではありません。

Go Fish Digitalに掲載されたBill Slawskiの初期分析は、多くの文書が同じトピックを扱うと似た情報を含むようになるという、Googleが解決しようとしている根本問題と、それに対処するため特許が情報利得スコアに基づく部分的な順位付けを提案していることを説明しています(Go Fish Digital)。

この考え方に通じるGoogleの公式ガイダンス

多くの解説が省く正直な点があります。Googleの公開検索ガイダンスで「information gain」という語を使っているGoogleの文書、ブログ記事、広報担当者の発言はありません。 この語は業界の略称です。しかし、Googleの実際の公式ガイダンスである「有用で信頼性の高い、ユーザー第一のコンテンツの作成」は、自己評価の質問で同じ基礎的な考え方を繰り返し説明しています。以下はそのページからの逐語引用です。

“Does the content provide original information, reporting, research, or analysis?” (翻訳)「そのコンテンツは、独自の情報、報道、調査、分析を提供していますか?」

“If the content draws on other sources, does it avoid simply copying or rewriting those sources, and instead provide substantial additional value and originality?” (翻訳)「そのコンテンツが他の情報源を利用する場合、それらを単にコピーまたは書き換えるのではなく、実質的な付加価値と独自性を提供していますか?」

“Does the content provide insightful analysis or interesting information that is beyond the obvious?” (翻訳)「そのコンテンツは、明白な範囲を超える洞察に富んだ分析または興味深い情報を提供していますか?」

“Does the content provide substantial value when compared to other pages in search results?” (翻訳)「そのコンテンツは、検索結果の他のページと比べて実質的な価値を提供していますか?」

最後の質問、つまり検索結果の他のページと比べた実質的な価値は、この用語を使わずに情報利得の概念に最も近づいたGoogleの公式文言です。これは、合法的に公式と言える最も強い関連付けであり、「情報利得」がGoogleの言葉ではないにもかかわらず、Googleが明らかに重視している現実の原則を表す便利な略称として定着した理由です。

Bingは情報利得を使っているか

私が調べた限りでは、そうではありません。確認した資料で、BingまたはMicrosoftの文書や広報担当者がこの語を使っているものはありません。Bingが公開しているランキング要因(サイトと著者の評判、コンテンツの完全性、意味的な関連性)は、似た方向(同業ページに対する深さと独自性)を示しますが、隣接する考え方であって、同じ主張でも同じ用語でもありません。Bingが文字どおり「information gain」と言ったと誰かが引用していたら、一次情報源を見るまで疑ってください。

AI回答中心のSERPで情報利得がより重要になる理由

ここが、情報利得を特許の豆知識以上のものにする部分です。

AIはインターネットを読みました。ChatGPT、Claude、Gemini、そしてGoogle自身のAI OverviewsとAI Modeは、Web全体にすでに存在するものを合成し、再パッケージするという1つのことに非常に長けています。AnimalzのNathan Wahlはこの主張を鋭く展開しています。これらのシステムは、公開済みのものをすべて言い直し、再パッケージできます。だからこそ、付加価値のないものをなぜ公開するのかが問題になります。Googleが回答を合成するときは複数の情報源から取り出します。Wahlの枠組みでは、コンテンツに巨大サイトにはない情報が含まれているなら、それらを上回る必要はありません(Animalz)。

これが仕組みです。ページがコンセンサスを言い換えるだけなら、AI Overviewはそれを取り込み、誰もあなたのページへ送らずに回答します。ページに自分だけが持つもの、つまり独自データ、実際の実験、専門家の一次的な見解があれば、AIシステムはその事実を含めるために、他の場所にあるものを言い換えるのではなく、あなたを参照する必要があります。ただし、これは保証ではありません。取得、モデルのコンテキストへの組み込み、生成、引用は別々の段階であり、独自性が1つを通過しても残りを通過するとは限りません。生成エンジンでの可視性に関する限定的な研究(Aggarwalらの「GEO: Generative Engine Optimization」)では、テストした環境において、コンテンツに情報源、統計、引用を加えるとAI生成回答での可視性が向上することが示されています。これは独自性が役立つ証拠ですが、引用、順位、トラフィックを保証する証拠ではありません。情報利得は、言い換えられるのではなく引用されるための前提条件であって、引用の約束ではありません。

ClearscopeのBernard HuangはこれをGoogleのKnowledge Graphに結び付け、Googleがトピックについてすでに「知っている」内容の周縁にある概念やエンティティをカバーするコンテンツを目指そうと述べています。LLMはコンセンサスが得意ですが、真の新規性は今でも人間が価値を加える場所です(Clearscope)。Search Engine LandでAmanda Kingが初期に示した枠組みでは、情報利得スコアは本質的に、コンテンツがコーパスの他の部分に対してどれだけユニークかの尺度です。同じ考えを別の言葉で述べただけなら、独自性がなく、コンテンツは降格されるおそれがあります(Search Engine Land)。Andrew Hollandは後にAI時代向けに全体を捉え直しました。この語は人によって意味が異なりますが、仕事は情報利得の速度を上げ続けることであり、GoogleだけでなくAIに向けて最適化することが増えています(Search Engine Land)。

私も逆方向からこれを見てきました。GoogleのAI Modeでコンテンツをランキングさせようとテストしたところ、私の見た限りでは、ランキングしたページより良く関連性も高かったにもかかわらず、コンテンツはランキングしませんでした。公開の場で挙げた可能性の1つは、記事に情報利得が欠けていたことです。コンテンツがWeb上にすでにあるものを上手に言い換えただけなら、システムが評価できるものは何もないのかもしれません(Xでの投稿)。

実際に情報利得を生むもの

情報源と私自身の経験をまとめると、本当に効果を動かすのは次のものです。

  • オリジナル調査、アンケート、実験。 最も主張を裏付けやすい形です。調査を実施し、データを公開し、他者が引用できるようにします。Ahrefsでは、まさにこの理由から、成果の高いコンテンツはデータ調査に大きく偏っています。
  • 独自/ファーストパーティーデータ。 他者が再現できない社内の製品または利用データです。データセットがあるなら、そのデータセット自体が情報利得です。
  • 専門家インタビューと一次体験。 私がよく使う方法です。出所を示さない生成テキストを公開する代わりに、すでに連絡できる実在の分野専門家へ、Slack、メール、短いAI支援の通話などで、週に数回、鋭い質問を送ります。実際の話と経験を記録します。それは、あなたが公開するまでWeb上に存在しなかったオリジナル情報です。私はこれを、AhrefsのテクニカルSEOハブ(およそ160ページのAI生成ページ)を自分で再構築した際に適用し、専門家レビューと読者フィードバックを重ねることで、ページに焼き直されたコンセンサスを超える内容を持たせました。
  • コンセンサスに対する反対意見または更新された見解。 広く繰り返される主張を検証し、実際に起きたことを報告するのは、「調査」が小規模でも情報利得です。
  • 先行研究を土台にすること。 誰かが公開した調査を取り上げ、広げ、次のデータポイントを加えます。コーパスに加えるのであり、コピーするのではありません。

Ahrefs独自のコンテンツ品質ラダー(Si Quan Ongの「質の高いコンテンツを作る方法」)は、ここで役立つ地図です。単純なリスト記事から調査研究やオリジナルのアイデアまで上がっていきます。用語自体は使っていませんが、情報利得のラダーとして機能し、集約よりも一次データを重視しています。

自分のコンテンツの情報利得を評価する方法

Googleの有用なコンテンツに関する質問を、公開前の直感チェックに変えてみます。

  • 目的のクエリで上位の結果を開きます。それぞれがすでに述べていることを一覧にします。
  • 自分のドラフトで、その一覧にない事実、数字、角度、経験を加える**すべての文を強調表示します。**何も強調されないなら、それはリソースではなく書き換えです。
  • すでにランキングしているページだけで、AIがクエリに完全に答えられるかを尋ねます。答えが「はい」なら、関連性を持つ唯一の道は、それらのページにないものを加えることです。
  • 「検索結果の他のページと比べた価値」という質問を文字どおりに確認します。「これは良いか」ではなく、「これは付加的か」と考えます。

結論

情報利得は、確認されていない仕組みの上に成り立つ、現実的で役立つ概念です。調整できるスコアを持つGoogleの確認済みランキング要因として社内に売り込まないでください。それは真実ではなく、出典を尋ねられたときに信用を失います。AI中心のSERPで明らかに機能しているものとして、「すでにあるものをより最適化した版」の公開をやめ、自分だけが提供できるものを公開し始めることとして伝えてください。それが堀です。

このクラスターの関連記事として、エンティティSEOAI向けの構造化データGEOAEOがあります。コンテンツが実際に新しいことを言えるようになった後、どのように表示され引用されるかにつながります。

Add an expert note

Pin an expert quote

New person? Create their unclaimed profile at /admin/experts/ → Pin a quote first.