Guide : Information Gain

Ce que information gain signifie dans SEO et AI recherche — comment Google's Information Gain Score patent fonctionne, pourquoi original research et unique données outperform regurgitated contenu, et comment mesurer il.

Première publication : 2 juil. 2026 · Dernière mise à jour : 3 août 2026 · Avancé

Information gain est comment beaucoup *nouveau* information votre page ajoute au-delà ce que a searcher a déjà vu dans le résultats pour a topic — novelty relative à le existing corpus, pas general qualité du contenu. Le term comes depuis a réel Google patent ('Contextual estimation de lien information gain,' filed 2018, granted 2022) que scores documents 0,00–1,00 pour novelty et se classe partly on que score — mais Google a jamais confirmed en utilisant il dans actif classement, et le patent's framing est à propos de ce que à montrer *suivant* après a utilisateur a vu some résultats, pas le premier page. il y a aucun visible score dans Search Console, aucun API, et aucun public formula: quelconque 'information gain score' dans a outil est an approximation. qu’est-ce que réel et official est Google's utile-contenu guidance asking si contenu offers 'original information, reporting, research, or analysis.' Il matters plus maintenant parce que AI Overviews et AI Mode peut déjà synthesize consensus contenu — seulement genuinely nouveau information (proprietary données, original research, premier-hand expertise) est ce que AI a à cite au lieu de absorb.

TL;DR — Information gain est novelty relative à le corpus a searcher a déjà vu on a topic — pas comprehensiveness, pas E-E-A-T, pas “qualité” dans le abstract. c’est named après a granted Google patent (“Contextual estimation de lien information gain,” filed 2018, granted 2022) que scores documents 0,00–1,00 pour comment beaucoup nouveau information ils ajouter et se classe partly on que. Mais: Google a jamais confirmed actif utiliser; le patent’s propre framing est à propos de ce que à montrer suivant après a utilisateur a vu some résultats, pas le premier page; et il y a aucun visible score, aucun API, aucun disclosed formula. Ce que est official est Google’s utile-contenu guidance asking pour “original information, reporting, research, or analysis.” Il matters plus dans an AI-réponse SERP parce que LLMs synthesize consensus pour gratuit — seulement genuinely nouveau information forces a citation.

Ce que information gain en réalité is (and isn’t)

Le cited patent décrit possible méthodes, pas proof que a spécifique production classement système operates exactly que façon. Preuve à l’appui de cette affirmation Official or primary documentation supporting the adjacent article claim, with scope limited to the source's published description. Portée : No ranking guarantee or undisclosed system mechanics are inferred beyond the cited source. Niveau de confiance : élevé · Vérifié : Google patent: Contextual estimation of link information gain Utiliser original-valeur guidance as an editorial principle, pas a measurable classement guarantee. Preuve à l’appui de cette affirmation Official or primary documentation supporting the adjacent article claim, with scope limited to the source's published description. Portée : No ranking guarantee or undisclosed system mechanics are inferred beyond the cited source. Niveau de confiance : élevé · Vérifié : Google: Helpful content guidance

La plupart articles on ce topic quietly conflate three différent choses. Garder les separate:

  • Information gain — le marginal nouveau information a document ajoute relative à ce que le searcher a déjà vu on le topic. c’est a delta.

  • Comprehensiveness / topical depth — covering tout à propos de a topic. Une page peut être maximally comprehensive et ont zero information gain si chaque fact dans il déjà exists on lune pages classement ci-dessus il.

  • E-E-A-T / qualité du contenu — confiance, expertise, experience, autorité. Connexe, mais a différent judgment. Vous pouvez être an unimpeachable expert et encore publish a page que ajoute rien nouveau.

  • Truth et accuracy — étant novel n’est pas le même as étant correct. Une page peut ajouter a genuinely nouveau claim et encore obtenir il incorrect. Novelty, accuracy, et confiance sont séparé judgments; treat originality as un entrée à publish, pas a substitute pour verifying il.

Si vous prendre un chose depuis ce page: information gain est précisément à propos de le delta, pas le depth et pas le confiance. Que distinction est le chose nearly chaque competing explainer blurs.

Un plus distinction worth naming, parce que SEO borrowed le term loosely: “information gain” aussi a an older, plus technique meaning à l’extérieur recherche. Dans information theory il traces back à Claude Shannon’s 1948 fonctionner on entropy et information mesure — a mathematical account de comment beaucoup a signal reduces uncertainty, unrelated à recherche rankings. Dans information retrieval research, a parallel idea montre up as novelty et diversity: méthodes comme Maximal Marginal Pertinence (Carbonell et Goldstein, 1998) rerank or sélectionner résultats à reduce redundancy contre ce que a lecteur a déjà vu. Google’s patent draws on le même underlying intuition — nouveau relative à qu’est-ce que déjà été affiché — mais none de ces sont interchangeable. Le SEO industry’s “information gain” est shorthand construit on a spécifique patent, pas a direct application de Shannon’s math or de publié IR diversity algorithms, même though le instinct ils share (ne pas simplement repeat qu’est-ce que déjà là) rhymes à travers tout three.

Information gain est le delta au-delà ce que était déjà disponible—pas le total length or polish de le candidate page. Source : /ai-search/optimization/information-gain/

Le top box represents consensus facts A, B, et C que le lecteur a déjà vu. Le faible-gain candidate repeats A, B, et C dans différent wording. Le élevé-gain candidate ajoute original evidence D que était absent depuis le précédent sources. Le comparaison est conceptual, pas a confirmed facteur de classement or public Google score.

© Patrick Stox LLC · CC BY 4.0 ·

Le Google patent behind le term

Ce que it dit

Le patent est “Contextual estimation of link information gain” (US20200349181A1, filed October 2018, granted June 2022; inventors inclure Victor Carbune et Pedro Gonnet Anders). Le core definition, verbatim depuis le patent:

“An information gain score pour a donné document est indicative de additional information que est inclus dans le donné document au-delà information contained dans autre documents que étaient déjà presented à le utilisateur.”

Il décrit a machine-learning model que takes semantic vectors depuis documents le utilisateur déjà viewed plus données depuis a candidate nouveau document, et outputs, dans le patent’s words:

“a quantitative score entre 0,00 et 1,00, avec 0,00 indicating que aucun information gain est à être attendu”

— avec 1,00 meaning le document contient seulement information pas dans ce que était déjà vu. Documents peut alors être ranked au moins partly on leur respective information gain scores.

Ce que it doesn’t dire

Ce is où la plupart SEO content overreaches, so let me be precise à propos de the limites:

  • Aucun confirmed actif utiliser. A granted patent est evidence Google pourrait deploy ce, pas que il fait. Google a pas confirmed or denied en utilisant ce mechanism dans classement. Anyone telling vous c’est a confirmed facteur de classement est guessing.
  • Narrower scope que assumed. Le patent’s framing centers on choosing ce que document or lien à surface suivant — think a conversational or assistant suivre-up après a utilisateur a déjà viewed some résultats — pas on le premier page de ten blue liens. Roger Montti’s analysis à Moteur de recherche Journal rend ce scope point bien: le emphasis est on automated assistants, et ces scores ne sont pas décrit as applying à le premier définir de résultats (SEJ).
  • Aucun public formula. Le patent noms “semantic vectors” et salient extracted information, mais discloses aucun weights, aucun fonctionnalité liste, et aucun reproducible scoring méthode. Ne faites pas confiance quelconque article que hands vous a precise “comment Google calculates il” formula — c’est invented.
  • c’est a patent family, pas un filing. Google était granted a continuation dans le même family — US12013887B2, même titre, même assignee (Google LLC), priority date back à le original October 2018 filing. A continuation signifie plus disclosed claim langue exists dans le family, pas que n’importe quoi nouveau à propos de deployment a été confirmed — a granted patent et son continuation encore seulement establish ce que Google disclosed il pourrait construire, pas qu’est-ce que running dans production.

Bill Slawski’s early breakdown à Go Fish Digital framed le underlying problème Google est solving — que quand nombreux documents share a topic, ils tend à contenir similaire information — et comment le patent proposes classement partly on information gain scores à adresse il (Go Fish Digital).

Google’s official guidance que echoes the idea

Ici’s le honest partie la plupart explainers skip: aucun Google document, blog post, or spokesperson utilise le phrase “information gain” dans public recherche guidance. Le term est industry shorthand. Mais Google’s réel official guidance — “Creating helpful, reliable, people-first content” — repeatedly décrit le même underlying idea dans son self-assessment questions. Ces sont verbatim depuis que page:

“Fait le contenu provide original information, reporting, research, or analysis?”

«> “If the content draws on other sources, does it avoid simply copying or rewriting

those sources, and instead provide substantial additional value and originality?” » (Traduction) (Résumé en français de la section quarante-trois, sous-partie un : le texte source est conservé pour vérification lors de la relecture francophone.)

«> “Does the content provide insightful analysis or interesting information that is

beyond the obvious?” » (Traduction) (Résumé en français de la section quarante-quatre, sous-partie un : le texte source est conservé pour vérification lors de la relecture francophone.)

«> “Does the content provide substantial value when compared to other pages in

search results?” » (Traduction) (Résumé en français de la section quarante-cinq, sous-partie un : le texte source est conservé pour vérification lors de la relecture francophone.)

Que dernier un — substantial valeur comparé à autre pages dans résultats de recherche — est à propos de as fermer as Google’s official langue obtient à le information-gain concept sans en utilisant le term. Ce est le strongest legitimately-official tie-dans disponible, et c’est pourquoi “information gain” caught on as utile shorthand pour a réel principle Google clairement cares à propos de, même though c’est pas Google’s word.

Fait Bing utiliser information gain?

Pas que j’ai trouvé. Aucun Bing or Microsoft document or spokesperson utilise le term dans le material j’ai reviewed. Bing’s publicly discussed facteurs de classement — site et author reputation, contenu completeness, semantic pertinence — point dans a similaire direction (depth et originality versus peers), mais c’est an adjacent idea, pas le même claim et pas le même vocabulary. Si quelqu’un citations Bing en utilisant le literal phrase “information gain,” treat il avec suspicion jusqu’à vous voir le principal source.

Pourquoi information gain matters plus in an AI-answer-heavy SERP

Ce is the partie que rend information gain plus que a patent-trivia curiosity.

AI a lire le internet. ChatGPT, Claude, Gemini, et Google’s propre AI Overviews et AI Mode sont excellent à un spécifique chose: synthesizing et repackaging ce que déjà exists à travers le web. Nathan Wahl à Animalz rend le argument sharply — ces systèmes peut déjà reiterate et repackage tout c’est été publié, donc le question becomes pourquoi publish n’importe quoi que n’est pas additive. Quand Google synthesizes an réponse, il pulls depuis plusieurs sources — Wahl’s framing est que vous ne pas besoin à outrank giants si votre contenu contient information theirs ne fait pas (Animalz).

c’est le mechanism. Si votre page restates consensus, an AI Overview absorbs il et réponses sans sending anyone à vous. Si votre page contient quelque chose seulement vous ont — a proprietary number, a réel experiment, an expert’s premier-hand prendre — an AI système a à draw on vous précisément à inclure que fact, plutôt que paraphrasing il depuis wherever sinon il apparaît. c’est pas a guarantee: retrieval, inclusion dans le model’s context, generation, et citation sont séparé étapes, et originality clearing un de les ne fait pas signifier il clears le rest. Scoped research on generative-moteur visibility (Aggarwal et al., “GEO: Generative Engine Optimization”) trouve que ajout sources, statistics, et quotations à contenu peut améliorer visibility dans AI-generated réponses dans leur testé setups — evidence que originality aide, pas proof que il guarantees a citation, a classement, or trafic. Information gain est a precondition pour étant cited au lieu de paraphrased, pas a promise de il.

Bernard Huang à Clearscope a tied ce à Google’s Knowledge Graph: aim pour contenu que covers concepts et entities on le fringe de ce que Google déjà “knows” à propos de a topic, parce que LLMs sont great à consensus mais genuine novelty est encore où humans ajouter valeur (Clearscope). Amanda King’s early Moteur de recherche Land framing captured le core idea — an information gain score est essentially a mesurer de comment unique votre contenu est versus le rest de le corpus, et contenu risques étant demoted si il lacks uniqueness même quand c’est simplement le même ideas dans différent words (Moteur de recherche Land). Andrew Holland plus tard reframed le entier chose pour le AI era: le term signifie différent choses à différent personnes, mais le job est à garder increasing le rate de information gain — et increasingly nous sommes optimizing pour AI, pas simplement pour Google (Moteur de recherche Land).

j’ai vu ce depuis le autre direction, aussi. Je ran some tests trying à classer contenu dans Google’s AI Mode, et le contenu simplement n’a pas classer — même though il était, as far as Je pourrait tell, meilleur et plus pertinent que pages que a fait. Un de le possibilities Je floated publicly était a lack de information gain dans le articles: si le contenu est a well-written restatement de qu’est-ce que déjà out là, là peut être rien pour le système à reward (mon post on X).

Ce que en réalité produces information gain

Synthesizing à travers le sources — et mon propre experience — ici’s ce que genuinely moves le needle:

  • Original research, surveys, et experiments. Le la plupart defensible formulaire. Exécuter a study, publish le données, let others cite vous. À Ahrefs, notre meilleur-performing contenu skews heavily toward données studies pour exactly ce raison.
  • Proprietary / premier-party données. Internal produit or usage données nobody sinon peut reproduce. Si vous ont a dataset, que dataset est votre information gain.
  • Expert interviews et premier-hand experience. Ce est mon go-à tactic. Plutôt que shipping unsourced generated texte, message a handful de réel subject-matter experts vous déjà ont accès à — over Slack, email, or a rapide AI-assisted appel — a quelques times a week, et capture leur réel stories et experience. c’est original information que n’a pas exist on le web avant vous publié il. Je applied ce à mon propre rebuild de Ahrefs’ SEO technique hub (roughly 160 AI-generated pages) par layering expert examiner et lecteur feedback on top donc le pages carry quelque chose au-delà regurgitated consensus.
  • Contrarian or mis à jour takes on consensus. Testing a widely repeated claim et reporting ce que en réalité happened est information gain, même quand le “study” est petit.
  • Building on a predecessor’s fonctionner. Prendre quelqu’un’s publié research, extend il, ajouter le suivant données point. vous êtes ajout à le corpus, pas copying il.

Ahrefs’ propre contenu-qualité ladder (Si Quan Ong’s “How to Create Quality Content”) est a utile map ici: il climbs depuis simple listicles up à research studies et original ideas — effectively an information-gain ladder, prizing premier-hand données over aggregation, sans ever en utilisant le term.

How to evaluate votre propre content pour information gain

Adapt Google’s utile-contenu questions dans a pre-publish gut vérifier:

«- Open the top results for your target query. List what each one already says. » (Traduction) (Résumé en français de la section soixante et un, sous-partie un : le texte source est conservé pour vérification lors de la relecture francophone.) «- For your draft, highlight every sentence that adds a fact, number, angle, or experience not on that list. If nothing is highlighted, you have a rewrite, not a resource. » (Traduction) (Résumé en français de la section soixante et un, sous-partie deux : le texte source est conservé pour vérification lors de la relecture francophone.) «- Ask whether an AI could answer the query fully from the pages already ranking. If yes, your only path to relevance is contributing something those pages lack. » (Traduction) (Résumé en français de la section soixante et un, sous-partie trois : le texte source est conservé pour vérification lors de la relecture francophone.) «- Sanity-check the “value compared to other pages in search results” question literally — not “is this good,” but “is this additive.” » (Traduction) (Résumé en français de la section soixante et un, sous-partie quatre : le texte source est conservé pour vérification lors de la relecture francophone.)

L’essentiel

Information gain est a réel, utile concept sitting on top de an unconfirmed mechanism. ne pas sell il internally as a confirmed Google facteur de classement avec a score vous pouvez dial — c’est pas vrai, et il’ll burn votre credibility. Sell il as le chose c’est demonstrably fonctionnement dans an AI-heavy SERP: arrêter publishing meilleur-optimized versions de ce que déjà exists, et commencer publishing ce que seulement vous pouvez. c’est le moat.

Connexe reading dans ce cluster: entity SEO, balisage de données structurées pour AI, GEO, et AEO tout connecter à comment vous obtenir surfaced et cited une fois votre contenu en réalité a quelque chose nouveau à dire.

Ajouter une note d’expert

Épingler une citation d’expert

Nouvelle personne ? Créez son profil non revendiqué à /admin/experts/ → Épingler une citation d’expert d’abord.