セマンティック検索

検索エンジンがキーワードではなく意味をどのように一致させるか — Knowledge Graph、Hummingbird、RankBrain、ニューラルマッチング、BERT、MUM、そしてSEOにとっての意味。

初回公開:2026年6月24日 · 最終更新:2026年8月3日 · Advanced
言語

セマンティック検索は、正確なキーワード一致ではなく、意味によって結果を取得します。Googleは段階的にそこに到達しました — Knowledge Graph(2012年、「文字列ではなくモノ」)、Hummingbird(2013年、クエリ全体の意味)、RankBrain(2015年、新しいクエリ)、ニューラルマッチング(2018年、概念レベルの同義語)、BERT(2019年、文脈に応じた単語の意味)、MUM(2021年、マルチモーダル)。これが、キーワードの詰め込みやすべての同義語を追いかけることが機能しなくなり、トピックの深さ、明確なエンティティ、意図の一致が重要になり始めた理由です。セマンティック検索は目標であり、ベクトル検索はその一つの方法です。「LSIキーワード」は神話です — John Muellerがそう断言しました。最適化の答えは10年にわたるアップデートを通じて変わっていません:自然に書き、トピックを網羅し、エンティティに名前を付けましょう。

TL;DR — セマンティック検索は、正確なキーワードマッチではなく、意味によって情報を取得します。 Googleはこれを段階的に構築しました — Knowledge Graph(2012年)、Hummingbird(2013年)、RankBrain(2015年)、ニューラルマッチング(2018年)、BERT(2019年)、MUM(2021年)— それぞれが異なる課題(エンティティ、クエリ全体の意味、新しいクエリ、概念レベルの同義語、文脈に応じた単語の意味、マルチモーダル推論)を解決しました。これらはキーワード検索(BM25は今でも大規模には最初に実行されます)を補完するものであり、置き換えるものではありません。セマンティック検索は目標であり、ベクトル検索はその1つの実装です。「LSIキーワード」は神話です。最適化の答えは10年間変わっていません:自然な言語、トピックの深さ、明確なエンティティ、意図の一致です。

キーワード検索とセマンティック検索

キーワード検索とセマンティック検索は、相互に排他的な時代ではなく、補完的なものです。 Evidence for this claim BERT learns bidirectional contextual language representations that can be fine-tuned for search-relevant language tasks. Scope: BERT research; semantic retrieval systems may use many other models and signals. Confidence: high · Verified: Devlin et al.: BERT Googleの公式説明は、言語理解システムを確認しつつも、完全なランキングの重み付けは明らかにしていません。 Evidence for this claim Google reported using BERT to better understand language and context in some Search queries. Scope: Google Search's documented rollout; it does not mean lexical matching was replaced or disclose the full ranking system. Confidence: high · Verified: Google: Understanding searches better than ever before

従来の検索は、文書を単語の統計に基づいてランク付けします。TF-IDF(単語頻度×逆文書頻度)は、文書内での単語の出現頻度と、コーパス全体での希少性を比較して重み付けします。BM25(「ベストマッチ25」)は、長さの正規化と飽和曲線でこれを改良したもので、現在もElasticsearch、Solr、Lucene、そしてGoogleやBingの内部で、第一段階のベースラインとして主流です。強力で高速、そして完全に単語に基づいています。「蛇口の水漏れ」と「水滴が垂れる蛇口」が同じ意味であることは認識しません。

セマンティック検索は、その上に理解の層を追加します:

次元キーワード検索セマンティック検索
一致対象正確な用語意味 / 意図
同義語手動設定のみネイティブ対応
エンティティのバリエーション正規化されている場合のみエンティティ認識による
長い / 会話的なクエリ不十分(各単語が個別に重み付け)良好(フレーズ全体を理解)
依然として優位な場面正確なブランド名、SKU、技術文字列それ以外の曖昧なものすべて

重要な枠組み:セマンティック検索はキーワード検索を置き換えるのではなく、強化します。Googleの規模では、転置インデックスによるBM25スタイルのパスが、速度のために高い再現率の最初のカットを行い、その後ニューラルシステムが再ランク付けし、単語は共有しないが概念を共有する文書を追加します。Pandu Nayakの2023年のDOJ証言は、まさにこれを説明しています — 従来の検索で特定された文書に「さらにいくつかの文書を追加する」埋め込みシステム(内部的にはRankEmbed)です。キーワード検索は死にませんでした。意味を理解するパートナーを得たのです。

Googleがセマンティック検索を構築した方法 — マイルストーン

進化は段階的でした。単一のアップデートでGoogleが「キーワード」から「意味」に切り替わったわけではありません — それぞれが異なる問題を解決する、10年にわたるレイヤーの積み重ねでした。

Semantic search evolved through systems with different jobs; the milestones are not one interchangeable algorithm. 出典: Semantic Search

The timeline begins with Knowledge Graph in 2012, followed by Hummingbird in 2013, RankBrain in 2015, neural matching in 2018, BERT in 2019, MUM in 2021, and the 2023-plus LLM era.

© Patrick Stox LLC · CC BY 4.0 ·

2012年 — ナレッジグラフ(「文字列ではなくモノ」)

Googleの実世界のエンティティとその関係のデータベース。Amit Singhalの発表時のフレームワーク — 「文字列ではなくモノ」 — は、今でもセマンティックシフトの最も簡潔な説明です。5億以上のエンティティと35億以上の事実で開始されました。数字よりもフレームワークが重要です。これにより、Googleは「タージ・マハル」(記念碑、ミュージシャン、カジノ)を曖昧性解消し、エンティティの質問に直接答えることができます。ナレッジグラフは、スタックの他の部分が依存するエンティティのバックボーンです — これについてはエンティティSEOで詳しく説明します。

2013年 — ハミングバード(クエリ全体の意味)

Googleのコアクエリエンジンの完全な書き換え — PandaやPenguinのような微調整ではなく、新しいエンジンです。Singhalはこれを2001年以来の最も劇的な変更と呼びました。目標は、会話的でロングテールなクエリに対応することでした:特定の単語ではなく、クエリ全体 — 文全体、意味 — に注意を払うことです。Danny Sullivanの当時の要約はこれをよく捉えています:ハミングバードは*「クエリ内の各単語により注意を払い、クエリ全体…が考慮されるようにしている。特定の単語ではなく。」* Googleはこれが検索の90%に影響したと述べています。(現在はランキングシステムガイドで廃止としてリストされており、そこから進化したシステムに取って代わられています。)

2015年 — RankBrain(前例のないクエリ)

クエリ解釈に適用される機械学習。RankBrainの役割は、Googleがこれまで見たことのない毎日のクエリの約15%を処理することです。未知のクエリを数学的なベクトルに変換し、理解している概念的に類似したクエリを見つけ出します。これを確認したGoogleの科学者グレッグ・コラード(Googleのブログ投稿ではなくBloomberg経由)は、これを「膨大な量の書かれた言語を、コンピュータが理解できる数学的実体——ベクトルと呼ばれる——に埋め込む」と説明しました。2016年までにすべてのクエリを処理しました。境界に注意してください:RankBrainは未知のクエリを既知の概念にマッピングします。BERTと同じではありません。

2018年 — ニューラルマッチング(概念レベルの同義語)

RankBrainがクエリを概念に関連付けたのに対し、ニューラルマッチングは概念マッチングをドキュメント側に拡張しました。クエリの概念とページの概念を、語彙が共有されていない場合でも接続します。ダニー・サリバンの平易な説明が最も優れています:「ここ数ヶ月、Googleはニューラルマッチングを使用しています。[これは]言葉を概念により良く結びつけるAI手法です。ある意味でスーパー同義語であり、クエリの30%に影響を与えています。」 典型的な例:「なぜ私のテレビは奇妙に見えるのか」というクエリが、「ソープオペラ効果」に関する結果を表示できることです。これはどちらのフレーズも名前を挙げていない概念です。(内部的には、2023年のDOJ証言でこの系統がRankEmbed / RankEmbedBERTとして明らかにされました。)

2019年 — BERT(文脈に応じた単語の意味)

大きなNLPの進歩。BERT(Bidirectional Encoder Representations from Transformers)は、単語を文脈の中で読み取ります。単語のの両方を見るのです。左から右へ一度に一つずつではなく。これにより、「2019 brazil traveler to usa need a visa」における「to」が意味を変えることを捉えられます(米国旅行するブラジル人。古いシステムはこれを逆に理解していました)。パンドゥ・ナヤックはこれを*「過去5年間で最大の飛躍であり、検索の歴史の中で最大の飛躍の一つ」と呼び、ローンチ時には米国英語クエリの10件に1件、現在ではほぼすべてに影響を与えています。これはまた、SEO担当者が最も誤解しがちなアップデートでもあります。ダニー・サリバンの回答は率直でした——「BERTに関して最適化すべきものは何もありません。」*

2021年 — MUM(マルチモーダル、多言語)

Multitask Unified Model — T5フレームワーク上に構築され、75言語でトレーニングされ、テキストと画像にわたる情報を理解できます。GoogleはBERTの1 000倍強力であり、BERTとは異なり、言語を理解し生成することができると述べています。重要な注意点:MUMは特定の高複雑性ケース(複雑な多段階の質問、特定の注目スニペット、ショッピング)に使用されます。Googleの一般的なランキングエンジンでは決してなく、BERTを「置き換えた」わけでもありません。

2023年以降 — LLMとAI検索

意味的検索は現在、生成的回答を供給しています。AI OverviewsとAI Modeは同じ意味ベースの検索を使用して関連するパッセージを見つけ、その後LLMが回答を合成します——RAGを参照してください。意味レイヤーが何が取得され引用されるかを決定します。モデルはそれを書き上げるだけです。

意味的検索とベクトル検索

これらは常に混同されるので、正確にしましょう:

  • 意味的検索目標です——意味と意図によって検索します。
  • ベクトル検索実装の一つです——クエリとドキュメントを密なベクトルとして表現し、コサイン距離によって最近傍を見つけます。

ベクトル検索は最も一般的な現代の実装ですが、意味的検索への唯一の道ではありません。クエリ拡張、同義語ルール、Knowledge Graphルックアップ、エンティティ認識はすべて、単一の埋め込みを計算せずにそこに到達できます。意味的検索を目的地と考え、ベクトル検索をその(高速でスケーラブルな)乗り物の一つと考えてください。乗り物の仕組み——埋め込み、コサイン類似度、最近傍検索——は埋め込みベクトル検索の記事でカバーされています。ここでは再導出しません。

実際の内部動作

4つの可動部分、おおよそ順に:

  1. クエリ理解 — 意図の分類(情報、ナビゲーション、 トランザクション、コマーシャル)、エンティティ抽出、類義語・概念の拡張。これは RankBrainとBERTの領域です。
  2. エンティティ認識+ナレッジグラフ — クエリと文書がについている現実世界の事物を 特定し、曖昧性を解消すること。英語の単語の約40%は複数の意味を持ちます。 文脈がどちらの意味かを判断します。
  3. 埋め込みと意味的類似性 — 意味をベクトルとしてエンコードし、「fix a leaky faucet」と「repairing a dripping tap」が近くに配置されるようにします(類似度約0,89、 ほとんど単語を共有していないにもかかわらず)。詳細は埋め込みで解説します。
  4. パッセージランキングとニューラル再ランキング — 2020年以降、ページ全体が完全に ターゲットに合っていなくても、ページの個々のパッセージがクエリでランク付けされることがあり、 ニューラル再ランカーがキーワードで取得したセットを意味的適合度で並べ替えます。これが、 各セクションが単独で成立する必要がある理由です。

LSIキーワードの神話

これは多くの悪いアドバイスを生むため重要です。「LSIキーワード」(潜在意味 インデックス)は1988年の情報検索技術であり、Googleがランキング入力として使用していることを 決して確認していません。John Muellerは率直に述べています:「LSIキーワードなどというものは存在しません。そう言う人は誰でも間違っています、すみません。」 Googleが 実際に使用しているのは、はるかに洗練されたものです — ニューラルマッチング、BERT、単語 埋め込み、エンティティ認識。したがって、ツールが「LSIキーワード」のリストを渡してきたとき、 有用なのはLSIの部分ではなく、それらの用語がトピックの語彙を反映していることです。 トピックを自然にカバーすれば、それは無料で得られます。

意味的検索がSEOに与える意味

主要な意味的アップデートはすべて同じ方向に進んでおり、そのためプレイブックは 異常なほど安定しています:

  • トピックカバレッジはキーワード密度に勝る。 Googleはページがトピックを 徹底的にカバーしているかを判断し、キーワードをn回使用しているかではありません。深いカバレッジは、 個別にターゲットにしていない数十の関連クエリでランク付けされます。
  • エンティティ最適化。 エンティティを明確に名前付けして説明し、構造化データ (sameAs@id)を使用してWikipedia/Wikidataに対して曖昧性を解消します。これが エンティティSEOの分野です。
  • 意図の一致は必須です。 Googleはクエリの意図を分類し、それでフィルタリングします。 クエリと異なる意図に答えるページは、キーワードがどれだけ一致してもランク付けされません。
  • 自然に書く。 BERTが文脈を読むため、前置詞や文構造が意味を持ちます。 Gary IllyesのRankBrainに関するアドバイスは今も有効です:「機械のように書こうとすると、RankBrainは混乱して、おそらくあなたを押し戻すでしょう。」
  • 類義語は自動で処理されます。 すべてのバリエーションは必要ありません。 トピックの自然な語彙をカバーすることで、詰め込みなしに深さを示せます。
  • パッセージレベルの品質。 各H2/セクションは、クリーンで自己完結した回答として 単独で成立する必要があります — それがパッセージランキングとAI Overviewsが取得するものです。

意味的SEOが重要でない場合

正直な確認:単一サービスのローカルビジネスや薄いサイトでは、大規模なエンティティや トピックオーソリティの作業は報われないかもしれません。ROIが現れるのは、トピック全体で 情報の深さを競っているときです。Sally Millsが述べたように、「SEOを適切に行えば、 自動的に意味的SEOを行っていることになります。ただ、ほとんどの人が適切に行っていないだけです。」 そしてGoogleはすぐに純粋に意味的なものにはならないでしょう — 完全な意味的 検索はコストがかかり、完全一致は依然として一般的なユーザー行動であり、純粋に意味的な 結果は信頼性が低いままです。キーワード検索と意味的理解は共存します。

AI検索がこれを基盤に構築する方法

AI Overviews、AI Mode、AIアシスタントは、意味検索プラス生成です。意味によってパッセージを取得し(通常は高密度検索 — RAGベクトル検索 を参照)、その後LLMが回答を書きます。Bingのこの変化の捉え方は鋭いものです。彼らの言葉を借りれば、グラウンディングインデックスは「AIシステムが何を言うべきかを決めるのを助けるために構築されている」のです。実際的な結果として、パッセージが上位にランクされるのを助けるもの — 明確なエンティティ、自己完結型のセクション、トピックの深さ — が、AI回答で引用される可能性を高めるものなのです。特別なトリックはありません。

Add an expert note

Pin an expert quote

New person? Create their unclaimed profile at /admin/experts/ → Pin a quote first.