정보 이득

SEO와 AI 검색에서 정보 이득이 뜻하는 것: Google의 Information Gain Score 특허 작동 방식, 독창적 연구와 고유 데이터가 재탕한 콘텐츠보다 나은 성과를 내는 이유, 평가 방법을 설명합니다.

정보 이득은 검색자가 해당 주제의 결과에서 이미 본 것 외에 페이지가 얼마나 새로운 정보를 더하는지입니다. 일반 콘텐츠 품질이 아니라 기존 문서 집합 대비 새로움입니다. 용어는 실제 Google 특허 'Contextual estimation of link information gain'(링크 정보 이득의 맥락적 추정, 2018년 출원, 2022년 등록)에서 왔습니다. 문서의 새로움에 0.00–1.00 점수를 매기고 일부는 그 점수로 순위를 정하지만, Google은 실제 순위에 사용한다고 확인한 적이 없습니다. 특허는 첫 페이지가 아니라 사용자가 일부 결과를 본 뒤 다음에 보여 줄 대상을 다룹니다. Search Console에 표시되는 점수, API, 공개 공식은 없으므로 도구의 '정보 이득 점수'는 근사치입니다. 실제 공식 지침은 'original information, reporting, research, or analysis'(독창적인 정보, 보도, 연구 또는 분석)를 제공하는지 묻는 Google의 유용한 콘텐츠 지침입니다. AI Overviews와 AI Mode는 이미 공통 콘텐츠를 종합할 수 있으므로 중요성이 더 커졌습니다. 독점 데이터, 독창적 연구, 직접 얻은 전문성처럼 정말 새로운 정보만이 AI가 흡수하는 대신 인용해야 하는 대상입니다.

TL;DR — 정보 이득은 검색자가 해당 주제에서 이미 본 문서 집합에 비해 얼마나 새로운지를 뜻합니다. 포괄성, E-E-A-T, 추상적인 “품질”이 아닙니다. 이름은 2018년 출원되고 2022년 등록된 Google 특허 “Contextual estimation of link information gain”(링크 정보 이득의 맥락적 추정)에서 왔습니다. 추가하는 새 정보의 양에 따라 문서에 0.00–1.00 점수를 매기고 일부는 그 점수로 순위를 정합니다. 하지만 Google은 실제 사용을 확인하지 않았습니다. 특허 자체의 맥락도 첫 페이지가 아니라 사용자가 일부 결과를 본 뒤 다음에 보여 줄 대상을 다룹니다. 볼 수 있는 점수, API, 공개 공식은 없습니다. 공식적인 것은 “독창적인 정보, 보도, 연구 또는 분석”을 요구하는 Google의 유용한 콘텐츠 지침입니다. LLM이 공통 내용을 무료로 종합하는 AI 답변 중심 SERP에서는 정말 새로운 정보만이 인용을 강제하므로 중요성이 커집니다.

정보 이득은 정확히 무엇이며 무엇이 아닌가

인용된 특허는 가능한 방법을 설명할 뿐 특정 운영 순위 시스템이 정확히 그렇게 작동한다는 증거가 아닙니다. 이 주장에 대한 근거 Official or primary documentation supporting the adjacent article claim, with scope limited to the source's published description. 범위: No ranking guarantee or undisclosed system mechanics are inferred beyond the cited source. 신뢰도: 높음 · 검증일: Google patent: Contextual estimation of link information gain 독창적 가치에 관한 지침은 측정 가능한 순위 보장이 아닌 편집 원칙으로 사용하세요. 이 주장에 대한 근거 Official or primary documentation supporting the adjacent article claim, with scope limited to the source's published description. 범위: No ranking guarantee or undisclosed system mechanics are inferred beyond the cited source. 신뢰도: 높음 · 검증일: Google: Helpful content guidance

대부분의 관련 기사는 서로 다른 세 가지를 은근히 섞습니다. 구분해서 보세요.

  • 정보 이득 — 검색자가 해당 주제에서 이미 본 것에 비해 문서가 더하는 추가적인 새 정보입니다. 차이분입니다.

  • 포괄성 / 주제 깊이 — 주제의 모든 내용을 다루는 것입니다. 모든 사실이 상위 페이지에 이미 있다면 최대한 포괄적인 페이지도 정보 이득이 0일 수 있습니다.

  • E-E-A-T / 콘텐츠 품질 — 신뢰, 전문성, 경험, 권위입니다. 관련은 있지만 다른 판단입니다. 흠잡을 데 없는 전문가도 새로운 정보가 전혀 없는 페이지를 게시할 수 있습니다.

  • 진실과 정확성 — 새롭다고 옳은 것은 아닙니다. 정말 새로운 주장을 더하면서도 틀릴 수 있습니다. 새로움, 정확성, 신뢰는 별개의 판단입니다. 독창성은 게시 판단의 한 요소이지 검증의 대체물이 아닙니다.

한 가지만 기억한다면 정보 이득은 구체적으로 차이분의 문제라는 점입니다. 깊이나 신뢰가 아닙니다. 거의 모든 경쟁 설명이 흐리는 구분입니다.

SEO가 용어를 느슨하게 빌려 썼으므로 한 가지를 더 구분해야 합니다. 검색 밖의 “information gain”에는 더 오래되고 기술적인 의미가 있습니다. 정보 이론에서는 Claude Shannon의 1948년 엔트로피와 정보량 연구로 거슬러 올라갑니다. 신호가 불확실성을 얼마나 줄이는지 수학적으로 설명하며 검색 순위와는 무관합니다. 정보 검색 연구에서는 비슷한 생각이 새로움과 다양성으로 나타납니다. Maximal Marginal Relevance(최대 한계 관련성, Carbonell과 Goldstein, 1998) 같은 방법은 독자가 이미 본 내용과의 중복을 줄이도록 결과를 재정렬하거나 선택합니다. Google 특허도 이미 보여 준 것에 비해 새롭다는 직관을 공유하지만 이 개념들은 서로 바꿔 쓸 수 없습니다. SEO 업계의 “정보 이득”은 특정 특허에 기초한 약칭이지 Shannon의 수학이나 공개된 정보 검색 다양성 알고리즘을 직접 적용한 것이 아닙니다. 기존 내용을 반복하지 말자는 공통 직관만 세 분야에서 비슷하게 나타납니다.

정보 이득은 후보 페이지의 전체 길이나 완성도가 아니라 이미 이용할 수 있던 내용 외에 더해지는 차이입니다. 출처: /ai-search/optimization/information-gain/

위 상자는 독자가 이미 본 공통 사실 A, B, C를 나타냅니다. 정보 이득이 낮은 후보는 A, B, C를 다른 표현으로 반복합니다. 정보 이득이 높은 후보는 이전 출처에 없던 독창적 증거 D를 더합니다. 개념적 비교이지 확인된 순위 요소나 공개 Google 점수가 아닙니다.

© Patrick Stox LLC · CC BY 4.0 ·

용어의 바탕이 된 Google 특허

특허가 말하는 것

특허명은 “Contextual estimation of link information gain”(링크 정보 이득의 맥락적 추정)입니다. US20200349181A1 문서는 2018년 10월 출원되고 2022년 6월 등록되었으며, 발명자에는 Victor Carbune과 Pedro Gonnet Anders가 포함됩니다. 특허의 핵심 정의를 그대로 인용하면 다음과 같습니다.

“An information gain score for a given document is indicative of additional information that is included in the given document beyond information contained in other documents that were already presented to the user.” (번역) 「특정 문서의 정보 이득 점수는 사용자에게 이미 제시된 다른 문서의 정보 외에 해당 문서에 포함된 추가 정보를 나타냅니다.」

사용자가 이미 본 문서의 의미 벡터와 새 후보 문서의 데이터를 입력받는 머신러닝 모델을 설명합니다. 특허의 표현에 따르면 출력은 다음과 같습니다.

“a quantitative score between 0.00 and 1.00, with 0.00 indicating that no information gain is to be expected” (번역) 「0.00에서 1.00 사이의 정량적 점수이며, 0.00은 정보 이득을 기대할 수 없음을 나타냅니다.」

1.00은 문서가 이미 본 내용에 없던 정보만 담는다는 뜻입니다. 이후 문서들은 각자의 정보 이득 점수를 적어도 부분적으로 반영해 순위가 매겨질 수 있습니다.

특허가 말하지 않는 것

대부분의 SEO 콘텐츠가 과도하게 해석하는 부분이므로 한계를 정확히 짚겠습니다.

  • 실제 사용은 확인되지 않았습니다. 등록 특허는 Google이 이를 배포할 수 있다는 증거이지 했다는 증거가 아닙니다. Google은 순위에서 이 메커니즘의 사용을 확인하지도 부인하지도 않았습니다. 확인된 순위 요소라고 말하는 사람은 추측하고 있는 것입니다.
  • 범위는 흔히 생각하는 것보다 좁습니다. 특허는 다음에 보여 줄 문서나 링크의 선택에 집중합니다. 사용자가 이미 일부 결과를 본 뒤의 대화나 어시스턴트 후속 응답을 생각하세요. 파란 링크 열 개의 첫 페이지가 아닙니다. Search Engine Journal의 Roger Montti는 자동화된 어시스턴트에 초점을 맞추며 첫 결과 집합에 이 점수를 적용한다고 설명하지 않는다는 범위를 잘 짚었습니다(SEJ).
  • 공개 공식은 없습니다. 특허는 “의미 벡터”와 추출된 주요 정보를 언급하지만 가중치, 특징 목록, 재현 가능한 점수 계산법은 공개하지 않습니다. “Google이 계산하는 정확한 방법”을 제시하는 기사는 믿지 마세요. 지어낸 것입니다.
  • 출원 하나가 아니라 특허군입니다. Google은 같은 특허군의 계속출원인 US12013887B2 역시 등록받았습니다. 제목과 권리자(Google LLC)가 같고 우선일은 최초 2018년 10월 출원으로 거슬러 올라갑니다. 계속출원은 특허군에 추가 청구 내용이 공개되었다는 뜻이지 실제 도입에 관한 새 사실이 확인되었다는 뜻이 아닙니다. 원특허와 계속출원은 Google이 만들 수 있다고 공개한 것을 보여 줄 뿐 운영 중인 시스템을 보여 주지 않습니다.

Go Fish Digital의 Bill Slawski는 초기 분석에서 같은 주제를 다루는 많은 문서가 비슷한 정보를 담는다는 기초 문제와, 이를 해결하기 위해 특허가 정보 이득 점수를 일부 반영한 순위 산정을 제안하는 방식을 설명했습니다(Go Fish Digital).

같은 생각을 담은 Google 공식 지침

대부분의 설명이 건너뛰는 사실은 Google의 공개 검색 지침에서 문서, 블로그 글, 대변인이 “information gain”이라는 표현을 사용하지 않는다는 것입니다. 업계의 약칭입니다. 하지만 Google의 실제 공식 지침인 “Creating helpful, reliable, people-first content”, 즉 유용하고 신뢰할 수 있는 사용자 중심 콘텐츠 만들기는 자가 평가 질문에서 같은 기본 생각을 반복합니다. 다음은 해당 페이지의 정확한 인용입니다.

“Does the content provide original information, reporting, research, or analysis?” (번역) 「콘텐츠가 독창적인 정보, 보도, 연구 또는 분석을 제공하나요?」

“If the content draws on other sources, does it avoid simply copying or rewriting those sources, and instead provide substantial additional value and originality?” (번역) 「다른 출처를 참고한 콘텐츠라면 단순히 복사하거나 다시 쓰는 대신 상당한 추가 가치와 독창성을 제공하나요?」

“Does the content provide insightful analysis or interesting information that is beyond the obvious?” (번역) 「콘텐츠가 뻔한 수준을 넘어서는 통찰력 있는 분석이나 흥미로운 정보를 제공하나요?」

“Does the content provide substantial value when compared to other pages in search results?” (번역) 「검색 결과의 다른 페이지와 비교할 때 콘텐츠가 상당한 가치를 제공하나요?」

마지막 질문인 검색 결과의 다른 페이지와 비교한 상당한 가치는 해당 용어를 쓰지 않으면서 정보 이득 개념에 가장 가까이 다가간 Google 공식 표현입니다. 정당하게 공식 지침과 연결할 수 있는 가장 강한 근거입니다. Google의 용어는 아니지만 Google이 분명히 중요하게 여기는 실제 원칙의 유용한 약칭으로 “정보 이득”이 자리 잡은 이유입니다.

Bing도 정보 이득을 사용하나요?

제가 찾은 범위에서는 아닙니다. 검토한 자료의 Bing 또는 Microsoft 문서나 대변인은 그 용어를 사용하지 않았습니다. 공개적으로 논의된 Bing 순위 요소인 사이트와 작성자의 평판, 콘텐츠 완전성, 의미적 관련성은 다른 페이지 대비 깊이와 독창성이라는 비슷한 방향을 가리킵니다. 하지만 인접한 생각이지 같은 주장이나 어휘는 아닙니다. Bing이 “information gain”이라고 말했다는 인용은 1차 출처를 보기 전까지 의심하세요.

AI 답변이 많은 SERP에서 정보 이득이 더 중요한 이유

이 부분 때문에 정보 이득이 특허에 관한 사소한 상식 이상의 의미를 가집니다.

AI는 인터넷을 읽었습니다. ChatGPT, Claude, Gemini, Google의 AI Overviews와 AI Mode는 웹에 이미 존재하는 내용을 종합하고 다시 포장하는 데 매우 능숙합니다. Animalz의 Nathan Wahl은 이미 게시된 모든 것을 반복하고 재구성할 수 있는 시스템 앞에서 추가 가치가 없는 것을 왜 게시하느냐고 묻습니다. Google이 여러 출처로 답을 종합할 때, Wahl의 관점에서는 대형 사이트에 없는 정보가 있다면 반드시 그 사이트보다 높은 순위일 필요는 없습니다(Animalz).

작동 원리는 이렇습니다. 공통 내용을 다시 말하는 페이지는 AI Overview가 흡수해 방문자를 보내지 않고 답합니다. 반면 여러분만 가진 수치, 실제 실험, 전문가의 직접 경험이 있다면 그 사실을 포함하려는 AI는 다른 곳의 내용을 바꿔 말하는 대신 여러분을 구체적으로 참고해야 합니다. 그렇다고 보장되는 것은 아닙니다. 검색, 모델 맥락에 포함, 생성, 인용은 별도 단계이며 독창성이 한 단계를 통과했다고 나머지도 통과하는 것은 아닙니다. 제한된 범위의 생성형 엔진 가시성 연구인 Aggarwal et al., “GEO: Generative Engine Optimization”, 즉 생성형 엔진 최적화 연구는 테스트한 환경에서 출처, 통계, 인용을 더하면 AI 생성 답변의 가시성이 개선될 수 있음을 발견했습니다. 독창성이 도움이 된다는 증거이지 인용, 순위, 트래픽을 보장한다는 증거는 아닙니다. 정보 이득은 단순히 바꿔 말해지는 대신 인용되기 위한 전제 조건이지 약속이 아닙니다.

Clearscope의 Bernard Huang은 이를 Google Knowledge Graph와 연결했습니다. LLM은 공통 내용에 능숙하지만 진정한 새로움은 여전히 사람이 가치를 더하는 영역이므로, Google이 해당 주제에 관해 이미 “아는” 것의 주변부 개념과 엔터티를 다루라는 것입니다(Clearscope). Search Engine Land에서 Amanda King이 처음 제시한 관점은 정보 이득 점수가 본질적으로 나머지 문서 집합 대비 콘텐츠의 고유성을 측정하며, 단지 같은 생각을 다른 말로 표현했더라도 고유성이 없으면 순위가 낮아질 위험이 있다는 것입니다(Search Engine Land). Andrew Holland는 이후 AI 시대에 맞춰 재해석했습니다. 용어의 뜻은 사람마다 다르지만 해야 할 일은 정보 이득이 늘어나는 속도를 계속 높이는 것이며, 점점 Google뿐 아니라 AI를 위해 최적화한다는 설명입니다(Search Engine Land).

저도 반대 방향에서 경험했습니다. Google AI Mode에서 콘텐츠를 순위에 올리려는 테스트를 했지만, 제가 보기에는 순위에 오른 페이지보다 더 좋고 관련성도 높았는데도 순위에 오르지 않았습니다. 제가 공개적으로 제시한 가능성 중 하나는 기사에 정보 이득이 부족했다는 것입니다. 기존 내용을 잘 쓴 말로 다시 설명할 뿐이라면 시스템이 보상할 것이 없을 수 있습니다(제 X 게시물).

실제로 정보 이득을 만드는 것

여러 출처와 제 경험을 종합하면 실제로 차이를 만드는 것은 다음과 같습니다.

  • 독창적인 연구, 설문, 실험. 가장 방어 가능한 형태입니다. 연구를 수행하고 데이터를 공개해 다른 사람이 인용하게 하세요. Ahrefs에서 성과가 좋은 콘텐츠가 데이터 연구에 크게 치우치는 이유입니다.
  • 독점 / 자사 데이터. 다른 사람이 재현할 수 없는 내부 제품 또는 사용 데이터입니다. 데이터셋이 있다면 그 데이터셋 자체가 정보 이득입니다.
  • 전문가 인터뷰와 직접 경험. 제가 즐겨 쓰는 방법입니다. 출처 없는 생성 텍스트를 내보내기보다 이미 연락할 수 있는 실제 전문가 몇 명에게 매주 몇 번 Slack, 이메일, 짧은 AI 보조 통화로 질문하고 실제 이야기와 경험을 기록하세요. 게시 전에는 웹에 없던 독창적인 정보입니다. 저는 약 160개의 AI 생성 페이지로 Ahrefs 기술 SEO 허브를 재구축하면서 전문가 검토와 독자 피드백을 더해 공통 내용을 되풀이하는 수준을 넘도록 했습니다.
  • 통설과 다른 관점 또는 갱신된 관점. 널리 반복되는 주장을 테스트하고 실제 결과를 보고하면 연구가 작더라도 정보 이득입니다.
  • 앞선 연구의 확장. 공개된 연구를 확장하고 다음 데이터 지점을 더하세요. 복사가 아니라 문서 집합에 추가하는 것입니다.

Ahrefs의 콘텐츠 품질 단계도 유용한 지도입니다. Si Quan Ong의 “How to Create Quality Content”, 즉 양질의 콘텐츠 만들기는 간단한 목록형 글에서 연구와 독창적인 아이디어까지 올라갑니다. 해당 용어를 쓰지는 않지만 취합보다 직접 얻은 데이터를 높이 평가하는 사실상의 정보 이득 단계입니다.

자체 콘텐츠의 정보 이득 평가하기

Google의 유용한 콘텐츠 질문을 게시 전 점검에 적용하세요.

  • 목표 검색어의 상위 결과를 열고 각 페이지가 이미 말하는 것을 나열하세요.
  • 초안에서 목록에 없는 사실, 수치, 관점, 경험을 더하는 모든 문장을 강조하세요. 강조할 것이 없다면 자료가 아니라 재작성입니다.
  • AI가 이미 순위에 있는 페이지들만으로 질문에 완전히 답할 수 있는지 물으세요. 그렇다면 관련성을 얻는 유일한 길은 그 페이지들에 없는 것을 기여하는 것입니다.
  • “검색 결과의 다른 페이지 대비 가치”를 문자 그대로 점검하세요. “좋은가?”가 아니라 “추가하는 것이 있는가?”입니다.

결론

정보 이득은 확인되지 않은 메커니즘 위에 놓인 실제적이고 유용한 개념입니다. 조절 가능한 점수가 있는 확인된 Google 순위 요소라고 내부에 설명하지 마세요. 사실이 아니며 신뢰를 잃게 됩니다. 대신 AI가 많은 SERP에서 실제로 효과를 보이는 원칙으로 설명하세요. 기존 내용의 최적화된 버전을 계속 게시하지 말고 여러분만 게시할 수 있는 것을 내놓으세요. 그것이 경쟁자가 따라오기 어려운 강점입니다.

이 클러스터의 관련 글인 엔터티 SEO, AI를 위한 스키마 마크업, GEO, AEO는 콘텐츠에 실제로 새로운 말이 있을 때 어떻게 노출되고 인용되는지와 연결됩니다.

전문가 메모 추가

전문가 인용문 고정

새로운 사람인가요? 미등록 프로필을 다음 위치에서 /admin/experts/ → 전문가 인용문 고정 먼저 만드세요.