セマンティック検索
検索エンジンがキーワードではなく意味をどのように一致させるか — Knowledge Graph、Hummingbird、RankBrain、ニューラルマッチング、BERT、MUM、そしてSEOにとっての意味。
言語
セマンティック検索は、正確なキーワード一致ではなく、意味によって結果を取得します。Googleは段階的にそこに到達しました — Knowledge Graph(2012年、「文字列ではなくモノ」)、Hummingbird(2013年、クエリ全体の意味)、RankBrain(2015年、新しいクエリ)、ニューラルマッチング(2018年、概念レベルの同義語)、BERT(2019年、文脈に応じた単語の意味)、MUM(2021年、マルチモーダル)。これが、キーワードの詰め込みやすべての同義語を追いかけることが機能しなくなり、トピックの深さ、明確なエンティティ、意図の一致が重要になり始めた理由です。セマンティック検索は目標であり、ベクトル検索はその一つの方法です。「LSIキーワード」は神話です — John Muellerがそう断言しました。最適化の答えは10年にわたるアップデートを通じて変わっていません:自然に書き、トピックを網羅し、エンティティに名前を付けましょう。
TL;DR — セマンティック検索とは、検索エンジンが入力された正確な単語だけでなく、意味に基づいてマッチングを行うことを意味します。Googleは「この人は実際に何を求めているのか?」「このページは実際に何について書かれているのか?」を理解し、その2つを結びつけます。そのため、キーワードを何度も繰り返す必要はなくなり、トピックについて自然に書くことが、フレーズを詰め込むよりも効果的になるのです。
セマンティック検索とは
セマンティック検索は、正確な用語に加えて、意味と文脈に基づいてマッチングを求めます。 Evidence for this claim BERT learns bidirectional contextual language representations that can be fine-tuned for search-relevant language tasks. Scope: BERT research; semantic retrieval systems may use many other models and signals. Confidence: high · Verified: Devlin et al.: BERT 現代のシステムは、単一の技術に依存するのではなく、言語モデル、語彙検索、エンティティ、その他のシグナルを組み合わせる場合があります。 Evidence for this claim Google reported using BERT to better understand language and context in some Search queries. Scope: Google Search's documented rollout; it does not mean lexical matching was replaced or disclose the full ranking system. Confidence: high · Verified: Google: Understanding searches better than ever before
長い間、検索エンジンは主に単語を数えていました。「格安航空券」を検索すると、「格安」と「航空券」という単語が含まれるページを探していました。便利ではありますが、賢くはありませんでした。「お手頃な航空運賃」が同じ意味であることや、「ジャガー」が動物または車を指す可能性があることを理解していなかったからです。
セマンティック検索は、この問題を解決します。文字や単語をマッチングする代わりに、意味を理解しようとします。これを支える2つの考え方があります:
- あなたの意図を理解する。 Googleはクエリ全体をキーワードの集まりではなく、文章として読み取ります。あなたの意図(何かを購入したいのか、何かを学びたいのか、特定のサイトを見つけたいのか)を推測します。
- ページの内容を理解する。 ページがカバーするトピックや、そこで言及されている現実世界の事物(人、場所、製品)を把握します。単にどの単語が出現するかだけではありません。
分かりやすい例えとして、「蛇口の水漏れを直す方法」と「水滴が垂れる蛇口を修理する」という検索は、ほとんど共通する単語がなくても、同じ結果を返すべきです。キーワードエンジンにとっては無関係に見えますが、セマンティックエンジンにとっては同じ意味です。
SEOが変わった理由
Googleが意味を理解するようになると、多くの古いテクニックは効果を失いました:
- キーワードを詰め込む必要はありません。 Googleは同義語や関連用語をすでに認識しています。「最高のランニングシューズ」を20回繰り返しても効果はなく、むしろ逆効果になる可能性があります。
- 表現ごとに別々のページを作る必要はありません。 「Pythonチュートリアル」「Pythonガイド」「Pythonを学ぶ」はすべてほぼ同じ意味なので、Googleはそのすべてに対して1つのページを選んでランキングします。それらを複数のページに分けると、自分自身と競合することになります。
- キーワードの数を達成することよりも、トピックをしっかりとカバーすることが重要です。 読者が求める関連する詳細を含めて、質問に真摯に答えるページは、キーワードを多く言及するだけのページよりも優れています。
多くの人が誤解していること
セマンティック検索はキーワードが死んだことを意味しません。 キーワードリサーチは、人々が何をどのくらいの頻度で検索しているかを今でも教えてくれます。死んだのはキーワードの詰め込みと、正確なフレーズを繰り返さなければならないという考え方です。そして明確にしておきます:「LSIキーワード」は実在しません。 GoogleのJohn Mueller氏が直接そう述べています。ツールから「意味的に関連するキーワード」を散りばめるのはこの仕組みではありません。トピックを自然にカバーすることが重要なのです。
完全な歴史(Knowledge Graph、Hummingbird、RankBrain、BERT、MUM)と、その仕組みの技術的な詳細を知りたいですか? 上級タブに切り替えてください。
TL;DR — セマンティック検索は、正確なキーワードマッチではなく、意味によって情報を取得します。 Googleはこれを段階的に構築しました — Knowledge Graph(2012年)、Hummingbird(2013年)、RankBrain(2015年)、ニューラルマッチング(2018年)、BERT(2019年)、MUM(2021年)— それぞれが異なる課題(エンティティ、クエリ全体の意味、新しいクエリ、概念レベルの同義語、文脈に応じた単語の意味、マルチモーダル推論)を解決しました。これらはキーワード検索(BM25は今でも大規模には最初に実行されます)を補完するものであり、置き換えるものではありません。セマンティック検索は目標であり、ベクトル検索はその1つの実装です。「LSIキーワード」は神話です。最適化の答えは10年間変わっていません:自然な言語、トピックの深さ、明確なエンティティ、意図の一致です。
キーワード検索とセマンティック検索
キーワード検索とセマンティック検索は、相互に排他的な時代ではなく、補完的なものです。 Evidence for this claim BERT learns bidirectional contextual language representations that can be fine-tuned for search-relevant language tasks. Scope: BERT research; semantic retrieval systems may use many other models and signals. Confidence: high · Verified: Devlin et al.: BERT Googleの公式説明は、言語理解システムを確認しつつも、完全なランキングの重み付けは明らかにしていません。 Evidence for this claim Google reported using BERT to better understand language and context in some Search queries. Scope: Google Search's documented rollout; it does not mean lexical matching was replaced or disclose the full ranking system. Confidence: high · Verified: Google: Understanding searches better than ever before
従来の検索は、文書を単語の統計に基づいてランク付けします。TF-IDF(単語頻度×逆文書頻度)は、文書内での単語の出現頻度と、コーパス全体での希少性を比較して重み付けします。BM25(「ベストマッチ25」)は、長さの正規化と飽和曲線でこれを改良したもので、現在もElasticsearch、Solr、Lucene、そしてGoogleやBingの内部で、第一段階のベースラインとして主流です。強力で高速、そして完全に単語に基づいています。「蛇口の水漏れ」と「水滴が垂れる蛇口」が同じ意味であることは認識しません。
セマンティック検索は、その上に理解の層を追加します:
| 次元 | キーワード検索 | セマンティック検索 |
|---|---|---|
| 一致対象 | 正確な用語 | 意味 / 意図 |
| 同義語 | 手動設定のみ | ネイティブ対応 |
| エンティティのバリエーション | 正規化されている場合のみ | エンティティ認識による |
| 長い / 会話的なクエリ | 不十分(各単語が個別に重み付け) | 良好(フレーズ全体を理解) |
| 依然として優位な場面 | 正確なブランド名、SKU、技術文字列 | それ以外の曖昧なものすべて |
重要な枠組み:セマンティック検索はキーワード検索を置き換えるのではなく、強化します。Googleの規模では、転置インデックスによるBM25スタイルのパスが、速度のために高い再現率の最初のカットを行い、その後ニューラルシステムが再ランク付けし、単語は共有しないが概念を共有する文書を追加します。Pandu Nayakの2023年のDOJ証言は、まさにこれを説明しています — 従来の検索で特定された文書に「さらにいくつかの文書を追加する」埋め込みシステム(内部的にはRankEmbed)です。キーワード検索は死にませんでした。意味を理解するパートナーを得たのです。
Googleがセマンティック検索を構築した方法 — マイルストーン
進化は段階的でした。単一のアップデートでGoogleが「キーワード」から「意味」に切り替わったわけではありません — それぞれが異なる問題を解決する、10年にわたるレイヤーの積み重ねでした。
The timeline begins with Knowledge Graph in 2012, followed by Hummingbird in 2013, RankBrain in 2015, neural matching in 2018, BERT in 2019, MUM in 2021, and the 2023-plus LLM era.
© Patrick Stox LLC · CC BY 4.0 ·
2012年 — ナレッジグラフ(「文字列ではなくモノ」)
Googleの実世界のエンティティとその関係のデータベース。Amit Singhalの発表時のフレームワーク — 「文字列ではなくモノ」 — は、今でもセマンティックシフトの最も簡潔な説明です。5億以上のエンティティと35億以上の事実で開始されました。数字よりもフレームワークが重要です。これにより、Googleは「タージ・マハル」(記念碑、ミュージシャン、カジノ)を曖昧性解消し、エンティティの質問に直接答えることができます。ナレッジグラフは、スタックの他の部分が依存するエンティティのバックボーンです — これについてはエンティティSEOで詳しく説明します。
2013年 — ハミングバード(クエリ全体の意味)
Googleのコアクエリエンジンの完全な書き換え — PandaやPenguinのような微調整ではなく、新しいエンジンです。Singhalはこれを2001年以来の最も劇的な変更と呼びました。目標は、会話的でロングテールなクエリに対応することでした:特定の単語ではなく、クエリ全体 — 文全体、意味 — に注意を払うことです。Danny Sullivanの当時の要約はこれをよく捉えています:ハミングバードは*「クエリ内の各単語により注意を払い、クエリ全体…が考慮されるようにしている。特定の単語ではなく。」* Googleはこれが検索の90%に影響したと述べています。(現在はランキングシステムガイドで廃止としてリストされており、そこから進化したシステムに取って代わられています。)
2015年 — RankBrain(前例のないクエリ)
クエリ解釈に適用される機械学習。RankBrainの役割は、Googleがこれまで見たことのない毎日のクエリの約15%を処理することです。未知のクエリを数学的なベクトルに変換し、理解している概念的に類似したクエリを見つけ出します。これを確認したGoogleの科学者グレッグ・コラード(Googleのブログ投稿ではなくBloomberg経由)は、これを「膨大な量の書かれた言語を、コンピュータが理解できる数学的実体——ベクトルと呼ばれる——に埋め込む」と説明しました。2016年までにすべてのクエリを処理しました。境界に注意してください:RankBrainは未知のクエリを既知の概念にマッピングします。BERTと同じではありません。
2018年 — ニューラルマッチング(概念レベルの同義語)
RankBrainがクエリを概念に関連付けたのに対し、ニューラルマッチングは概念マッチングをドキュメント側に拡張しました。クエリの概念とページの概念を、語彙が共有されていない場合でも接続します。ダニー・サリバンの平易な説明が最も優れています:「ここ数ヶ月、Googleはニューラルマッチングを使用しています。[これは]言葉を概念により良く結びつけるAI手法です。ある意味でスーパー同義語であり、クエリの30%に影響を与えています。」 典型的な例:「なぜ私のテレビは奇妙に見えるのか」というクエリが、「ソープオペラ効果」に関する結果を表示できることです。これはどちらのフレーズも名前を挙げていない概念です。(内部的には、2023年のDOJ証言でこの系統がRankEmbed / RankEmbedBERTとして明らかにされました。)
2019年 — BERT(文脈に応じた単語の意味)
大きなNLPの進歩。BERT(Bidirectional Encoder Representations from Transformers)は、単語を文脈の中で読み取ります。単語の前と後の両方を見るのです。左から右へ一度に一つずつではなく。これにより、「2019 brazil traveler to usa need a visa」における「to」が意味を変えることを捉えられます(米国へ旅行するブラジル人。古いシステムはこれを逆に理解していました)。パンドゥ・ナヤックはこれを*「過去5年間で最大の飛躍であり、検索の歴史の中で最大の飛躍の一つ」と呼び、ローンチ時には米国英語クエリの10件に1件、現在ではほぼすべてに影響を与えています。これはまた、SEO担当者が最も誤解しがちなアップデートでもあります。ダニー・サリバンの回答は率直でした——「BERTに関して最適化すべきものは何もありません。」*
2021年 — MUM(マルチモーダル、多言語)
Multitask Unified Model — T5フレームワーク上に構築され、75言語でトレーニングされ、テキストと画像にわたる情報を理解できます。GoogleはBERTの1 000倍強力であり、BERTとは異なり、言語を理解し生成することができると述べています。重要な注意点:MUMは特定の高複雑性ケース(複雑な多段階の質問、特定の注目スニペット、ショッピング)に使用されます。Googleの一般的なランキングエンジンでは決してなく、BERTを「置き換えた」わけでもありません。
2023年以降 — LLMとAI検索
意味的検索は現在、生成的回答を供給しています。AI OverviewsとAI Modeは同じ意味ベースの検索を使用して関連するパッセージを見つけ、その後LLMが回答を合成します——RAGを参照してください。意味レイヤーが何が取得され引用されるかを決定します。モデルはそれを書き上げるだけです。
意味的検索とベクトル検索
これらは常に混同されるので、正確にしましょう:
- 意味的検索は目標です——意味と意図によって検索します。
- ベクトル検索は実装の一つです——クエリとドキュメントを密なベクトルとして表現し、コサイン距離によって最近傍を見つけます。
ベクトル検索は最も一般的な現代の実装ですが、意味的検索への唯一の道ではありません。クエリ拡張、同義語ルール、Knowledge Graphルックアップ、エンティティ認識はすべて、単一の埋め込みを計算せずにそこに到達できます。意味的検索を目的地と考え、ベクトル検索をその(高速でスケーラブルな)乗り物の一つと考えてください。乗り物の仕組み——埋め込み、コサイン類似度、最近傍検索——は埋め込みとベクトル検索の記事でカバーされています。ここでは再導出しません。
実際の内部動作
4つの可動部分、おおよそ順に:
- クエリ理解 — 意図の分類(情報、ナビゲーション、 トランザクション、コマーシャル)、エンティティ抽出、類義語・概念の拡張。これは RankBrainとBERTの領域です。
- エンティティ認識+ナレッジグラフ — クエリと文書がについている現実世界の事物を 特定し、曖昧性を解消すること。英語の単語の約40%は複数の意味を持ちます。 文脈がどちらの意味かを判断します。
- 埋め込みと意味的類似性 — 意味をベクトルとしてエンコードし、「fix a leaky faucet」と「repairing a dripping tap」が近くに配置されるようにします(類似度約0,89、 ほとんど単語を共有していないにもかかわらず)。詳細は埋め込みで解説します。
- パッセージランキングとニューラル再ランキング — 2020年以降、ページ全体が完全に ターゲットに合っていなくても、ページの個々のパッセージがクエリでランク付けされることがあり、 ニューラル再ランカーがキーワードで取得したセットを意味的適合度で並べ替えます。これが、 各セクションが単独で成立する必要がある理由です。
LSIキーワードの神話
これは多くの悪いアドバイスを生むため重要です。「LSIキーワード」(潜在意味 インデックス)は1988年の情報検索技術であり、Googleがランキング入力として使用していることを 決して確認していません。John Muellerは率直に述べています:「LSIキーワードなどというものは存在しません。そう言う人は誰でも間違っています、すみません。」 Googleが 実際に使用しているのは、はるかに洗練されたものです — ニューラルマッチング、BERT、単語 埋め込み、エンティティ認識。したがって、ツールが「LSIキーワード」のリストを渡してきたとき、 有用なのはLSIの部分ではなく、それらの用語がトピックの語彙を反映していることです。 トピックを自然にカバーすれば、それは無料で得られます。
意味的検索がSEOに与える意味
主要な意味的アップデートはすべて同じ方向に進んでおり、そのためプレイブックは 異常なほど安定しています:
- トピックカバレッジはキーワード密度に勝る。 Googleはページがトピックを 徹底的にカバーしているかを判断し、キーワードをn回使用しているかではありません。深いカバレッジは、 個別にターゲットにしていない数十の関連クエリでランク付けされます。
- エンティティ最適化。 エンティティを明確に名前付けして説明し、構造化データ
(
sameAs、@id)を使用してWikipedia/Wikidataに対して曖昧性を解消します。これが エンティティSEOの分野です。 - 意図の一致は必須です。 Googleはクエリの意図を分類し、それでフィルタリングします。 クエリと異なる意図に答えるページは、キーワードがどれだけ一致してもランク付けされません。
- 自然に書く。 BERTが文脈を読むため、前置詞や文構造が意味を持ちます。 Gary IllyesのRankBrainに関するアドバイスは今も有効です:「機械のように書こうとすると、RankBrainは混乱して、おそらくあなたを押し戻すでしょう。」
- 類義語は自動で処理されます。 すべてのバリエーションは必要ありません。 トピックの自然な語彙をカバーすることで、詰め込みなしに深さを示せます。
- パッセージレベルの品質。 各H2/セクションは、クリーンで自己完結した回答として 単独で成立する必要があります — それがパッセージランキングとAI Overviewsが取得するものです。
意味的SEOが重要でない場合
正直な確認:単一サービスのローカルビジネスや薄いサイトでは、大規模なエンティティや トピックオーソリティの作業は報われないかもしれません。ROIが現れるのは、トピック全体で 情報の深さを競っているときです。Sally Millsが述べたように、「SEOを適切に行えば、 自動的に意味的SEOを行っていることになります。ただ、ほとんどの人が適切に行っていないだけです。」 そしてGoogleはすぐに純粋に意味的なものにはならないでしょう — 完全な意味的 検索はコストがかかり、完全一致は依然として一般的なユーザー行動であり、純粋に意味的な 結果は信頼性が低いままです。キーワード検索と意味的理解は共存します。
AI検索がこれを基盤に構築する方法
AI Overviews、AI Mode、AIアシスタントは、意味検索プラス生成です。意味によってパッセージを取得し(通常は高密度検索 — RAG と ベクトル検索 を参照)、その後LLMが回答を書きます。Bingのこの変化の捉え方は鋭いものです。彼らの言葉を借りれば、グラウンディングインデックスは「AIシステムが何を言うべきかを決めるのを助けるために構築されている」のです。実際的な結果として、パッセージが上位にランクされるのを助けるもの — 明確なエンティティ、自己完結型のセクション、トピックの深さ — が、AI回答で引用される可能性を高めるものなのです。特別なトリックはありません。
AIまとめ
Advancedバージョンの簡潔な見解:
- 意味検索 = 正確なキーワード一致ではなく、意味による取得。 その区別がすべての要点です。「Fix a leaky faucet」と「repairing a dripping tap」は、単語を共有していなくても同じ結果を返すべきです。
- キーワード検索を強化するものであり、置き換えるものではありません。 BM25スタイルの取得は、依然として大規模に最初に実行されます(速度+再現率)。ニューラルシステムは再ランク付けし、概念に一致するドキュメントを追加します。DOJの証言は、Googleの埋め込みレイヤー(RankEmbed)が従来の取得にドキュメントを追加することを確認しました。
- Googleはそれをレイヤーで構築しました: Knowledge Graph(2012年、「文字列ではなくモノ」)→ Hummingbird(2013年、クエリ全体の意味、検索の90%)→ RankBrain(2015年、新しいクエリ)→ ニューラルマッチング(2018年、概念レベルの「スーパー同義語」、クエリの30%)→ BERT(2019年、文脈に応じた単語の意味、10件に1件のクエリ)→ MUM(2021年、マルチモーダル、75言語、一般的なランキングエンジンではない)。
- 意味検索 ≠ ベクトル検索。 意味検索は目標であり、ベクトル検索はその実装の1つです(他には、クエリ拡張、同義語ルール、Knowledge Graphルックアップ)。
- 「LSIキーワード」は神話です — John Muellerが直接そう言いました。Googleは代わりにニューラルマッチング、BERT、埋め込みを使用しています。
- SEOプレイブック(10年間変わらず): キーワード密度よりもトピックカバレッジ、明確なエンティティ+構造化データ、意図の一致、自然言語での執筆、パッセージレベルの品質。キーワードリサーチは依然として重要です。キーワードの詰め込みは重要ではありません。
- AI検索 = 意味検索+生成。 上位にランクされるもの(明確なエンティティ、自己完結型のパッセージ、深さ)が引用されるものです。
公式ドキュメント
GoogleとMicrosoftからの一次情報のドキュメントと発表。
- A guide to Google Search ranking systems — BERT、ニューラルマッチング、RankBrain、MUM、パッセージランキング(およびHummingbirdを含む廃止されたシステムのリスト)に関する公式の現在の説明。
- Introducing the Knowledge Graph: things, not strings — 2012年のエンティティ発表と「things, not strings」という枠組み。
- Understanding searches better than ever before (BERT) — Pandu Nayakによる2019年のBERT発表、ビザ/エステティシャンの例付き。
- MUM: A new AI milestone for understanding information — 2021年のマルチモーダル、多言語モデル。
- How AI powers great search results — RankBrain、ニューラルマッチング、BERT、MUMがどのように連携するかについてのGoogleの概要。
Microsoft / Bing
- The Science Behind Semantic Search (Azure AI) — “a Transformer-based semantic ranking engine that understands the meaning behind the text.”
- Semantic ranking in Azure AI Search — the BM25/RRF retrieval → transformer re-ranking pattern, spelled out.
- Towards More Intelligent Search: Deep Learning for Query Semantics — rare technical depth on Bing’s pre-BERT neural ranking (GloVe vectors, CNN + cosine similarity).
- Introducing Deep Search — one of the earliest public descriptions of query fan-out at production scale.
ソースからの引用
GoogleとMicrosoftの担当者による公式声明。ディープリンクが利用可能な場合は、ソースページの引用箇所にジャンプします。
Google — 意味的シフト
- “Things, not strings.” — Amit Singhal、Knowledge Graphを紹介、2012年。 引用にジャンプ
Google — BERT(Pandu Nayak、2019年)
- “BERT models can therefore consider the full context of a word by looking at the words that come before and after it — particularly useful for understanding the intent behind search queries.”
- “[The] biggest leap forward in the past five years, and one of the biggest leaps forward in the history of Search.”
- “Language understanding remains an ongoing challenge, and it keeps us motivated to continue to improve Search.” 引用にジャンプ
Danny Sullivan、Google検索担当
- ニューラルマッチングについて(2018年): “Last few months, Google has been using neural matching — AI method to better connect words to concepts. Super synonyms, in a way, and impacting 30% of queries.”
- “RankBrain helps Google better relate pages to concepts. Neural matching helps Google better relate words to searches. It’s like a super synonym system.”
- BERTの最適化について(2019年): “There’s nothing to optimize for with BERT, nor anything for a site owner to be ‘concerned’ about. The fundamentals of us seeking to reward great content remain unchanged.”
Gary Illyes、Google
- RankBrain向けの執筆について(Big Digital Adelaide、2016年): “Optimizing for RankBrain is actually super easy… write in natural language. Try to write content that sounds human. If you try to write like a machine then RankBrain will just get confused and probably just pushes you back.”
John Mueller、Google
- LSIの神話について(Twitter、2019年7月30日): “There’s no such thing as LSI keywords — anyone who’s telling you otherwise is mistaken, sorry.”
Greg Corrado、Google(RankBrainについて、Bloomberg経由、2015年)
- “RankBrain uses artificial intelligence to embed vast amounts of written language into mathematical entities — called vectors — that the computer can understand. If RankBrain sees a word or phrase it isn’t familiar with, the machine can make a guess as to what words or phrases might have a similar meaning and filter the result accordingly.”
Pandu Nayak、Google(DOJ独占禁止法証言、2023年)
- “RankEmbed identifies a few more documents to add to those identified by the traditional retrieval.” (Googleの意味的埋め込みレイヤーが古典的なキーワード検索を補完するものであり、置き換えるものではないことを確認している。)
Microsoft — Azure AI / Bing
- “Semantic search is moving beyond keyword-based ranking to a Transformer-based semantic ranking engine that understands the meaning behind the text.” — Microsoft Research、2021年。
Googleのセマンティックマイルストーン — 早見表
階層化されたスタックを順に示します。それぞれが異なる問題を解決しました。どれも前のものを置き換えたわけではありません。
| 年 | マイルストーン | 解決したこと | 規模(発表時点) |
|---|---|---|---|
| 2012 | Knowledge Graph | 文字列 → 事物(エンティティと関係性) | 5億以上のエンティティ、35億以上の事実(発表時) |
| 2013 | Hummingbird | キーワード → クエリ全体の意味(会話型、ロングテール) | 検索の約90%;現在は廃止 |
| 2015 | RankBrain | 未見のクエリ → 既知の概念 | 毎日のクエリの約15%;2016年までに全クエリ |
| 2018 | Neural matching | クエリの概念 ↔ ドキュメントの概念(「スーパー同義語」) | クエリの約30% |
| 2019 | BERT | 文内の文脈に応じた単語の意味(双方向) | 米国英語クエリの10件に1件 → ほぼすべて |
| 2021 | MUM | マルチモーダル、多言語、多段階推論 | 75言語;BERTの1 000倍;一般的なランカーではない |
| 2023+ | LLM + RAG | セマンティック検索が生成回答を供給 | AI Overviews、AI Mode、AIアシスタント |
混同しやすい点の早わかり
- RankBrain vs. BERT — RankBrainは未知のクエリを既知の概念にマッピングします。BERTは クエリ文内の単語の文脈上の意味を理解します。
- セマンティック検索 vs. ベクター検索 — セマンティック検索は目標であり、ベクター検索は 一つの実装です(他には:クエリ拡張、同義語ルール、Knowledge Graph)。
- セマンティックSEO — トピックカバレッジ、エンティティ関係、意図マッチング。同義語の詰め込みではなく、ましてや「LSIキーワード」(神話です — 記事を参照)でもありません。
- キーワード検索は死んでいない — BM25スタイルの検索が依然として最初に実行されます。セマンティックシステムは再ランク付けし、概念が一致したドキュメントをその上に追加します。
メンタルモデル
1. 目標 vs. 実装。 セマンティック検索は目的地です(意味で取得する)。ベクター検索は一つの手段です (埋め込み+最近傍)。徒歩でも行けます — クエリ拡張、同義語ルール、エンティティルックアップ。目的地と一つの経路を混同しないでください。
2. スイッチではなく、階層化されたスタック。 Knowledge Graph(エンティティ)+ RankBrain(未知のクエリ)+ neural matching(概念の同義語)+ BERT(単語の文脈)+ MUM(マルチモーダル)。これらは積み重なり、協力します。どのアップデートも前のものを捨てませんでした。「Googleがこのクエリをどう理解するか」を考えるときは、どの層が働いているかを問うてください。
3. 検索は2段階です。 段階1:高速、キーワードベース、高再現率(転置インデックス上のBM25)。段階2: ニューラル再ランク付け+概念一致の追加。セマンティック検索は主に段階2です — 段階1を補強するもので、削除するものではありません。
4. 最適化の不変条件。 すべてのセマンティックアップデートは同じ方向を指します:自然言語、トピックの深さ、明確なエンティティ、意図の一致。ある戦術がキーワード数を数えるエンジンにしか意味をなさない場合(詰め込み、完全一致へのこだわり、「LSIキーワード」)、それはもはや存在しない機械に向けた最適化です。
5. AI検索の「引用される」ルール。 AI回答=セマンティック検索+生成。パッセージをランク付けするもの(明確なエンティティ、自己完結型セクション、深さ)が、取得され引用されるものになります。別のAI検索のトリックはありません — 同じパッセージレベルの品質です。
セマンティック検索の間違い
「LSIキーワード」のリストを中心にページを構築する
LSIキーワードのアドバイスは、現代の検索の仕組みを誤ってラベル付けしています。主題を自然にカバーし、実際のエンティティと関係性に名前を付け、機械的に生成された同義語リストを追加する代わりにユーザーの意図に答えてください。
セマンティック検索とベクター検索を同義語として扱う
セマンティック検索は意味の一致を目指すものであり、ベクトルはそれをサポートできる一つの手法です。システムを評価したり監査を選んだりする際には、この区別を保ってください。
見出し語を繰り返す代わりに曖昧さを解消する
繰り返しを増やしても、ページがどのエンティティや意図に対応しているかは明確になりません。明示的な名前、属性、文脈、関連するサブトピックを使用して、単一のキーワード文字列を超えて意味が伝わるようにしてください。
自分で試す: セマンティック検索
時間をかける価値のあるリソース
関連する私のレビュー
- Semantic SEO (Ahrefs) — 上級実務者向けガイド(私はこの記事のレビュアーです)。EAVモデルと、Googleが完全にセマンティックな検索に移行しない理由を解説しています。
このサイト内
- Entity SEO — エンティティの命名、説明、曖昧さの解消に関する実践的な分野(セマンティック検索のKnowledge Graph側)。
- Embeddings と ベクトル検索 — 意味ベースの類似性を機能させる技術的メカニズム。
- RAG — AI検索がどのようにパッセージを取得し、生成された回答を裏付けるか。
他の情報源
- Semantic Search — Mateusz MakosiewiczによるAhrefsの意味ベースの検索、エンティティ、コンテンツに関するガイド。
- Google’s Knowledge Graph — Despina GavoyannisとMichal PecánekによるAhrefsのエンティティデータとSEOに関するガイド。
- RankBrain glossary と Hummingbird glossary (Ahrefs) — Ahrefs編集チームによるクイックリファレンス。
- Googleの Search ranking systems guide — 現在稼働中および廃止されたシステムの権威あるリスト。
- SEO by the Sea — Hummingbird retrospective — Singhalの文脈を含む詳細な歴史。
- Google Hummingbird (Search Engine Land) — Danny Sullivanによる2013年のオリジナル発表レポート。Singhalの引用を含み、「検索の90%」とフレーズ全体の意味に関する一次情報源。
- Meet RankBrain, Google’s Artificial Intelligence Search Algorithm (Search Engine Land) — RankBrainを報じた2015年のオリジナルレポート。Greg Corradoによるベクトルと未知のクエリに関する逐語的な引用を含む。
- Google Neural Matching (Search Engine Journal) — 2018年のニューラルマッチング開始、Danny Sullivanの「スーパー同義語」ツイート、RankBrainとの違いを解説。
- FAQ: All About the BERT Algorithm in Google Search (Search Engine Land) — Danny Sullivanの「最適化するものは何もない」という指針を含む包括的なQ&A。
- Google Turning Its Lucrative Web Search Over to AI Machines (Bloomberg) — RankBrainの最初の公開記事。Greg Corradoが「3番目に重要なシグナル」と確認。
- The Science Behind Semantic Search: How AI from Bing Is Powering Azure Cognitive Search (Microsoft Research) — BingのBM25からトランスフォーマーへの再ランキングパイプラインを解説。Microsoft Docsのテストによる2% / 4,5%のCTR向上データを含む。
動画
- Google Search Central (YouTube) — How Google Search Works シリーズ。クエリ理解とその背後にあるシステムに関する解説を含む。 チャンネル
引用に値する統計
- 英語の単語の約40%には複数の意味がある — そのため、セマンティック検索が「apple」や「jaguar」を曖昧さなく解釈するために使うのは、文脈(場所、履歴、周囲の単語)です。出典
- 「how to fix a leaky faucet」と「repairing a dripping tap」のベクトル類似度は約0,89 — ほとんど単語を共有していないにもかかわらず。意味ベースのマッチングの具体的な姿です。出典
- ニューラルマッチングはクエリの約30%に影響(ダニー・サリバン、2018年)— 概念レベルの「スーパー同義語」マッチングの範囲。
- BERTは開始時に米国英語クエリの10件に1件に影響(パンドゥ・ナヤック、2019年)し、現在ではほぼすべての英語クエリで役割を果たしています。出典
- ナレッジグラフは現在、約540億のエンティティに関する約1,6兆の事実を保持(2012年の開始時は5億エンティティから増加)— Googleのエンティティ基盤の規模。出典
変更履歴
2026年7月22日に更新。
編集概要と記録された変更の詳細。変更の詳細
-
変更の詳細な注記は現在英語でのみ提供されています。
完全な比較は利用できません — この改訂の以前のスナップショットがアーカイブされていません。
2026年7月17日に更新。
編集概要と記録された変更の詳細。変更の詳細
-
変更の詳細な注記は現在英語でのみ提供されています。
完全な比較は利用できません — この改訂の以前のスナップショットがアーカイブされていません。