埋め込み
テキストの意味を密な数値ベクトルとして表す埋め込み、意味検索、Googleのランキング、RAGでコンテンツを意味で対応付ける仕組みを解説します。
言語
埋め込みは、語、文、文書の意味を高次元空間の密なベクトルとして表します。意味が近いテキストは近くに配置され、意味検索、クラスタリング、RAGの取得層で使われます。encoderモデルが生成し、コサイン類似度で比較します。Googleの検索ではキーワード索引を補完する埋め込みベースの取得も使われますが、BERTのために直接最適化する設定はありません。トピックを一貫して十分に扱うコンテンツを書くことが要点です。
要点 — embeddingはtextを数値のlist、つまり巨大な空間内のcoordinateへ変換します。意味が似ているものは近くに置かれるため、AI searchと現代の検索エンジンはkeyword一致だけでなく意味によってcontentとqueryを対応付けます。pageへembeddingを「追加」することはできません。embeddingは、機械がpage上にすでにあるものを読む方法です。
埋め込みとは
embeddingは、semantic similarityなどのtaskに有用な関係を保つことを意図し、入力を数値vectorとして表します。 Evidence for this claim Embeddings represent inputs as numerical vectors that can be compared for relatedness and used for search, clustering, and classification. Scope: OpenAI embedding models and documented uses; vector dimensions and behavior vary by model. Confidence: high · Verified: OpenAI: Embeddings guide geometryと次元数はmodel固有であり、各coordinateに普遍的な意味が割り当てられているわけではありません。 Evidence for this claim Learned vector representations can encode useful distributional relationships between words. Scope: Word2vec-era language representations; observed vector relationships are model- and training-data-specific, not ground truth. Confidence: high · Verified: Mikolov et al.: Efficient Estimation of Word Representations
コンピューターは言葉ではなく数値を扱います。埋め込みは、モデルがテキストを読み、意味を表す数値のリスト、つまりベクトルへ変換する橋渡しです。意味が近いテキストは近くに置かれ、関係のないテキストは遠くに置かれます。
そのため、“laptop for gaming”(日本語訳:gaming用laptop)と”high-performance laptop for games”(日本語訳:game用の高性能laptop)は、共通する単語がほとんどなくても近くに置かれます。“Banana bread recipe”(日本語訳:banana breadのrecipe)はまったく別の場所に置かれます。modelは大量のtextを読み、似た文脈に現れる単語やphraseを見つけることで、この関係を学習しました。
検索で埋め込みが重要な理由
従来の検索はキーワードを一致させました。埋め込みを使うと検索は意味を一致させられます。そのためGoogleは、最適なページが質問と同じ語を使っていなくても長い会話型の質問に答えられ、AI検索ツールは関連性の高い段落を選べます。
AI回答を支える処理の短い流れです。
- コンテンツを段落などのチャンクに分割する。
- 各チャンクを埋め込み(ベクトル)に変換する。
- 質問も埋め込みに変換する。
- 質問のベクトルに最も近いチャンクを探す。
- そのチャンクをAI回答の根拠にする。
コンテンツにとっての意味
誇張されがちな点なので明確にします。Googleへ送信する「embedding optimization」(日本語訳:embedding最適化)はありません。 GoogleのDanny Sullivanは、Googleのembedding-based systemの1つであるBERTについて、“There’s nothing to optimize for.”(日本語訳:最適化するものは何もない)と明言しました。
役立つことは従来の助言と同じですが、理由を説明しやすくなります。トピックを本当に十分に扱う、まとまりのある内容を書いてください。焦点の合った内容は、答えるべき質問の近くに安定した埋め込みを作ります。キーワードを詰め込み、散らかった内容は信号を濁らせます。
次元数、コサイン類似度、word2vecからBERTへの歴史、Googleがランキングで埋め込みを使う方法まで確認するには、Advancedタブへ切り替えてください。
要点 — embeddingは意味を符号化する浮動小数点数のdense vectorで、通常は数百から数千次元です。生成LLMではなくencoder modelが作ります。意味が似ていればvectorも近くなり、cosine similarityで測定します。この分野は、word2vecやGloVeの静的word embeddingから、BERTの文脈的embedding、sentence-level embedding、現代のAPI embeddingへ進みました。Googleはkeyword indexを置き換えるのではなく、Neural Matching/RankEmbedやRankEmbedBERTによるembedding-based retrievalを併用します。embeddingはRAGのretrieval backboneでもあります。操作するembedding dialはありません。topicの一貫性が、contentを適切なqueryの近くへclusterさせます。
埋め込みの実態
embeddingはsimilarityとretrievalを支えますが、truth、quality、ranking valueを直接測るものではありません。 Evidence for this claim Embeddings represent inputs as numerical vectors that can be compared for relatedness and used for search, clustering, and classification. Scope: OpenAI embedding models and documented uses; vector dimensions and behavior vary by model. Confidence: high · Verified: OpenAI: Embeddings guide research resultは、学習済みmodelとevaluation settingに依存します。 Evidence for this claim Learned vector representations can encode useful distributional relationships between words. Scope: Word2vec-era language representations; observed vector relationships are model- and training-data-specific, not ground truth. Confidence: high · Verified: Mikolov et al.: Efficient Estimation of Word Representations
埋め込みとは、text(またはimage、audio、video)を高次元空間の点として表す、浮動小数点数のlistである密な数値vectorです。OpenAIのdocumentationは明確にこう述べています: “An embedding is a vector (list) of floating point numbers.” _(翻訳)_日本語訳:embeddingとは浮動小数点数のvector(list)である
定義上の性質は幾何学です。 意味的に似たコンテンツは似たベクトルを持ちます。 おおむね同じ意味のテキストはおおむね同じ方向を指し、無関係なテキストは別の方向を指します。これは偶然ではありません。似た文脈で使われる単語やフレーズが似たベクトルになるよう、モデルが 学習 されているからです。意味が位置になります。
A conceptual semantic space places the query reset my password near documents titled Forgot-password guide, Account recovery steps, and Cannot log in. The unrelated document Enterprise pricing sits farther away. Near means more semantically similar; far means less similar. Actual embedding spaces have many more dimensions and model-specific geometry.
© Patrick Stox LLC · CC BY 4.0 ·
正確に分けて考えるべき点があります。encoderとgeneratorの違い、コサイン類似度、モデルの次元数、正規化、検索での利用範囲を確認します。
- generatorではなくencoder。 embeddingは、意味を固定長vectorへ圧縮するencoder modelから作られます。next tokenを予測する生成LLMとはarchitectureも目的も異なります。内部表現とAPIの違いは後で説明します。
- sparseではなくdense。 one-hotやbag-of-words表現は大部分が0で、vocabularyの単語ごとにslotがありますが、embeddingはすべての次元へ意味を詰めます。GoogleのML glossaryは、one-hot encodingでは表せない関係を扱える低次元でdenseな表現と説明しています。これによりmodelは、“hot dogs and shawarmas are more related than hot dogs and salads.” _(翻訳)_日本語訳:hot dogとshawarmaは、hot dogとsaladより関連が深い、と認識できます。
- 次元が多いほど常に良いわけではない。 次元を増やせば細かな差を捉えられますが、storageとcomputeのcostが増え、効果はtask次第です。「大きいほど良い」というdialではなくtrade-offです。
類似性の測定:コサイン類似度
2つの埋め込みを比較するときは距離、より正確にはベクトル間の角度を測ります。標準的な指標はcosine similarityです。ベクトルの長さに関係なく角度を測り、−1(反対)から0(無関係/直交)、1(同じ方向)までのscoreを返します。距離が小さいほど関連性が高くなります。
多くの埋め込みAPIはベクトルを単位長に正規化します。その場合、コサイン類似度と内積は同じ順位を返します。OpenAIは、コサイン類似度が一般的で計算コストもわずかに低い選択肢だと説明しています。Anthropicが推奨する埋め込みプロバイダーのVoyage AIは、この直感を*“the cosine similarity between two embeddings captures the semantic relatedness of the corresponding original passages.”* (翻訳) 「2つの埋め込み間のコサイン類似度は、元の各文章が意味的にどれほど関連するかを捉える」と端的に表現しています。この最近傍比較を大規模に行う仕組みがvector searchです。
ここに至るまでの進化
歴史は単語から段落へ、固定された意味から文脈を考慮した意味へ進みました。
- word2vec(Google、2013年)。 Mikolovらは、大規模corpusから密な単語vectorを学習する2つのarchitecture(CBOWとSkip-Gram)を導入しました。有名な結果では、vector演算 “King” − “Man” + “Woman” (日本語訳:「王」−「男」+「女」)が “Queen” (日本語訳:「女王」)に最も近くなり、vector演算が意味関係を捉える証拠になりました。ただし、このanalogyは説明用で、毎回保証されるものではありません。modelによっては”kings”や”monarch”になる場合があります。これは静的embeddingで、単語ごとに固定vectorが1つだけなので、“river bank”と”bank account”の”bank”は同じvectorになります。
- GloVe(Stanford、2014年)。 predictive networkではなく、global co-occurrence statisticsに基づくcount-basedの代替手法です。目的関数は異なりますが、同様に有用なembeddingを作ります。これも静的です。
- Universal Sentence Encoder(Google、2018年)。 単語だけでなく文全体のembeddingです。中心となる考え方は、“Sentences are semantically similar if they have a similar distribution of responses”(日本語訳:応答の分布が似ていれば、文は意味的に似ている)というものです。“How old are you?”と”What is your age?”は同じ答えを引き出すため、近くに埋め込まれます。
- BERT(Google、2018年。Searchへの導入は2019年10月)。 大きな転換は文脈的embeddingです。BERTは双方向で、tokenの前後の単語を読んで意味を定めるため、同じ単語でも周囲の文によって異なるvectorになります。その結果、“river bank”と”bank account”の”bank”は異なるvectorになります。
- Sentence-BERT(2019年)。 similarity searchにおけるBERTのscaling問題を解決しました。通常のBERTは2文を一緒に入力する必要があり、大規模処理では計算量が非常に大きくなります。SBERTはcosine similarityで比較できる固定長のsentence embeddingを作り、大規模corpusで最も似た組を探す時間を数時間から数秒へ短縮しました。
- 現代のembedding API(2024年〜現在)。 OpenAIのtext-embedding-3 family、GoogleのGemini embeddings、Voyage、Cohereのembed-v4.0は、多言語対応で、text、image、audio、videoを1つの空間で扱うmultimodal化も進んでいます。さらにMatryoshka Representation Learningにより、再学習せずvectorを少ない次元へ切り詰め、精度を少し譲る代わりにstorageとspeedを改善できます。
Google検索での埋め込みの利用方法
Googleのranking pipelineは純粋にsemantic または 純粋にkeywordというものではなく、hybridです。embeddingを使う部分は従来のinverted indexを置き換えず、補完します。Google自身のranking-system documentationと、Pandu NayakによるDOJ antitrust testimonyから、名称が明らかなsystemには次のものがあります。
- BERT — 文脈内の単語を理解するGoogleのsystemです。公開時には、特に”for”や”to”のような前置詞が意味を変える長い会話型queryを中心に、Searchが*“better understand one in 10 searches in the U.S. in English”*(日本語訳:米国の英語検索10件に1件をよりよく理解する)うえで役立ちました。
- Neural Matching/RankEmbed — queryとdocumentを同じvector空間に変換し、共通keywordがなくても概念的に一致する結果を見つけるembedding-based retrievalです。Nayakは補完的な仕組みとして、“RankEmbed identifies a few more documents to add to those identified by the traditional retrieval.”(日本語訳:RankEmbedは従来の検索で特定されたdocumentに加える、さらにいくつかのdocumentを見つける)と説明しました。ここでのretrievalはembedding空間のdot product/distance measureに基づきます。
- RankEmbedBERT — RankEmbedのretrievalとBERTのlanguage understandingを組み合わせた後続systemです。quality raterのscoreとsearch logで学習され、複雑なlong-tail queryで特に高い性能を示しました。
実務上、keywordの存在は今も重要です。lexical retrieval(inverted index、BM25型)が最初の絞り込みを担うからです。embedding systemは概念的に関連する候補を追加し、re-rankします。両方のsignalが働きます。だからこそ、“BERT killed keywords”(日本語訳:BERTがkeywordを終わらせた)という主張は誤りです。
AI検索での埋め込み(RAGパイプライン)
embeddingがAI OverviewsやAI search assistantに最も直接関わるのがここです。 Retrieval-Augmented Generation(RAG) はembeddingをretrieval layerとして使います:
- index: contentをpassageへ chunk化 し、各passageをembedding化して、vectorを vector database へ保存します。
- retrieve: ユーザーのqueryをembedding化し、nearest-neighbor searchで最も近いchunkを vector search により見つけ、上位K個をcontextとしてLLMへ渡します。
- generate: LLMが、取得したchunkを 根拠として answerを書きます。
ここでは、各chunkが単独で取得されるため構造が重要です。Dan Petrovicのresearch(Ahrefsの LLM Search最適化について実際に分かっていること で引用)によると、Chromeがembedding用に処理するのはpage先頭の約30 passageで、それぞれを約200語のpassageへ分け、chunkをまたぐ文脈を保つため重複させます。pageから切り出したときにsection単独で意味が通らなければ、contentを適切に表現できません。
トークン埋め込みとテキスト埋め込みAPI
混同されやすい重要な違いがあります。LLMの内部にあるembeddingと、APIから得るembeddingは同じものではありません。
- Token embeddingはmodel内部の表現です。各tokenは、生成中にlayerごとに変換されるvectorを持ち、next tokenを作るための仕組みとして働きます。
- Text embedding API(OpenAI、Google、Voyage、Cohere)は、入力文字列全体に対して固定長vectorを1つ作り、retrievalとsimilarityに使えるよう設計されています。多くの場合、生成modelとはtraining objectiveが異なる別modelです。
SEO担当者が「ページを埋め込む」や、内部リンクやキーワードクラスタリングでコサイン類似度を使うと言う場合、通常はAPI型の埋め込みを指します。
SEOにとっての意味
- keyword densityよりsemantic coherence。 modelは文脈を理解するため、“laptop for gaming”と”high-performance laptop”はすでに近くにあります。keyword stuffingは役に立たず、topicが散ってembeddingが曖昧なcontentになります。
- chunk retrievalに適した構造。 passageは個別にembedding化され、個別に取得されます。重要なcontentは早めに置き、sectionを自己完結させ、明確なsemantic HTMLを使います。
- topicの包括性。 topicを本当に網羅するcontentは、vector空間でより多くの関連queryの近くに位置します。これが”build topical authority”(日本語訳:topic authorityを築く)の仕組みです。
- embeddingを操作するdialはありません。 Danny SullivanはBERTについて、 “There’s nothing to optimize for… The fundamentals of us seeking to reward great content remain unchanged.”(日本語訳:最適化するものは何もない。優れたcontentを評価しようとする基本方針は変わらない) と述べました。toolが出すcosine similarity scoreは分析の補助であり、Googleへ送る入力ではありません。
embeddingはこのclusterの多くをつなぐ基盤です。semantic searchが動く土台であり、vector searchが比較する対象であり、chunkingがtextを準備する先であり、RAGのretrieval backboneでもあります。そして、どのsystemもcontentをembedding化する前に取得しなければならないため、crawlingが最初に重要である理由でもあります。
AI要約
Advanced版の要点をまとめます。
- embeddingとは、意味を符号化する浮動小数点数のdense vectorです。意味が似ていればvectorも近くなります。OpenAIは”An embedding is a vector (list) of floating point numbers.”(日本語訳:embeddingとは浮動小数点数のvector(list)である)と説明しています。
- 生成LLMではなくencoder modelが作ります。architectureと目的が異なり、sparseではなくdenseです。
- similarityはcosine similarityで測ります。vector間の角度を−1から1で表します。正規化したvectorでは、rankingにおけるcosineとdot productは等価です。
- 進化: word2vec(2013年)とGloVe(2014年)は静的word vectorを作り、USE(2018年)は文全体をembedding化し、BERT(2018年)は同じ単語でも文脈によって異なる文脈的embeddingを実現し、Sentence-BERT(2019年)はsimilarity searchを高速化しました。その後、2024年以降はmultimodalで次元変更可能なAPI modelへ進みました。
- Googleはhybrid pipelineでembeddingを使います。 文脈内の単語を扱うBERT、keyword indexを補完するembedding retrievalであるNeural Matching/RankEmbed、RankEmbedBERTがあります。keywordが最初のretrievalを担い、embeddingが候補を追加してre-rankします。
- RAG pipeline: chunk化 → embedding → vector DBへ保存 → queryをembedding化 → 最も近いchunkを取得 → LLMが根拠付きanswerを生成、という流れです。各chunkは単独で取得されるため、構造が重要です。
- SEO上の結論: “embedding optimization”(日本語訳:embedding最適化)は存在しません。Danny SullivanはBERTについて”There’s nothing to optimize for”(日本語訳:最適化するものは何もない)と述べています。topicが一貫し、自己完結し、十分に詳しいcontentは、答えるべきqueryの近くにclusterします。
公式ドキュメント
Googleと主要な埋め込みプロバイダーによる一次資料です。
- Machine Learning Glossary — Embeddings — denseとsparseの定義、およびone-hot encodingで関連性を表せない理由です。
- Google Search ranking systemガイド — BERT、Neural Matching、RankBrain、Passage Ranking、MUMをGoogle自身の言葉で説明しています。
- 検索をこれまで以上によく理解する(BERT) — 2019年10月にBERTをSearchへ導入したときの発表です。
- Semantic Textual Similarityの進歩 — Universal Sentence Encoder(2018年)と、“similar distribution of responses”(日本語訳:応答の分布が似ている)という考え方です。
- Gemini API — Embeddings — Googleの現在のmultimodal embedding model、次元数、RAG、semantic search、reranking、clusteringなどのuse caseです。
OpenAI
- Vector embeddings guide — “An embedding is a vector (list) of floating point numbers”(日本語訳:embeddingとは浮動小数点数のvector(list)である)という定義と、cosine similarityの指針です。
- 新しいembedding modelとAPI update — text-embedding-3 familyとMatryoshkaによる次元短縮(2024年1月)です。
その他のprovider
- Cohere — Embeddings — 多言語のembed-v4.0、query/document別のinput type、圧縮optionを説明しています。
- Voyage AI — Quickstart — Anthropicが推奨するproviderです。“the cosine similarity between two embeddings captures the semantic relatedness of the corresponding original passages.” _(翻訳)_日本語訳:2つのembeddingのcosine similarityは、対応する元のpassage同士の意味的関連性を捉える、と説明しています。
基礎論文
- word2vec — Mikolovら、2013年 — 初期の密なword vectorとking−man+woman analogyです。
- GloVe — Pennington, Socher, Manning, 2014 — global co-occurrenceに基づくword vectorです。
- BERT — Devlin et al., 2018 — 双方向の文脈的embeddingです。
- Sentence-BERT — Reimers & Gurevych, 2019 — similarity search用の高速なsentence embeddingです。
出典からの引用
Googleと埋め込みプロバイダーによる記録済みの発言です。各リンクは出典ページの引用箇所へ移動します。引用文は原文を保持し、日本語の意味を添えます。
埋め込みとは
- “An embedding is a vector (list) of floating point numbers.” _(翻訳)_日本語訳:embeddingとは浮動小数点数のvector(list)である — OpenAI、Vector embeddings guide。 引用箇所へ移動
Google — BERTと言語理解
- “At its core, Search is about understanding language.” _(翻訳)_日本語訳:Searchの核心は言語を理解することにある — Pandu Nayak、Google Search担当VP(BERT発表、2019年10月)。 引用箇所へ移動
- “BERT will help Search better understand one in 10 searches in the U.S. in English.” _(翻訳)_日本語訳:BERTは、米国の英語検索10件に1件をSearchがよりよく理解する助けになる — Google Search Blog、2019年10月。 引用箇所へ移動
Google — BERTの最適化について
- “There’s nothing to optimize for with BERT… The fundamentals of us seeking to reward great content remain unchanged.” _(翻訳)_日本語訳:BERT向けに最適化するものはない。優れたcontentを評価しようとする基本方針は変わらない — Danny Sullivan、Google Search Liaison。 引用箇所へ移動
Google — 意味的類似性(Universal Sentence Encoder)
- “Sentences are semantically similar if they have a similar distribution of responses.” _(翻訳)_日本語訳:応答の分布が似ていれば、文は意味的に似ている — Google Research、“Advances in Semantic Textual Similarity”(2018年5月)。出典を読む
Voyage AI — コサイン類似度
- “The cosine similarity between two embeddings captures the semantic relatedness of the corresponding original passages.” _(翻訳)_日本語訳:2つのembedding間のcosine similarityは、対応する元のpassageの意味的関連性を捉える — Voyage AI Quickstart。 出典を読む
Pandu Nayak — RankEmbed
- “RankEmbed identifies a few more documents to add to those identified by the traditional retrieval.” _(翻訳)_日本語訳:RankEmbedは、従来のretrievalで特定されたdocumentに加える、さらにいくつかのdocumentを見つける — Pandu Nayakのtestimony、DOJ v. Googleの報道。 報道を読む
メンタルモデル
1. 意味が位置になる: 埋め込みはテキストを座標へ変換します。近ければ意味が似ており、遠ければ無関係です。意味検索、クラスタリング、RAG取得はこの上に成り立ちます。
2. 静的と文脈的。 word2vecとGloVeは各単語に固定vectorを1つ与えます(“bank”は常に同じです)。BERTとその後続modelは、出現ごとに文脈に応じたvectorを与えます(“river bank” ≠ “bank account”)。word2vecを使う古いkeyword similarity toolでは両者を区別できませんが、BERT-based toolなら区別できます。
3. トークン埋め込みとテキスト埋め込みAPIは異なる: LLM内部のトークン埋め込みは次のトークンを生成する仕組みで、APIのテキスト埋め込みは文字列ごとの凝縮ベクトルです。
4. 置き換えではなくhybrid retrieval。 Googleはlexical retrieval(keyword inverted index)と embedding-based retrieval(Neural Matching/RankEmbed)を動かします。まずkeywordで絞り、embeddingで概念的に関連する候補を追加してre-rankします。どちらか一方だけがsystem全体ではありません。
5. RAGループ: チャンク化、埋め込み、保存、クエリの埋め込み、近傍取得、根拠付き回答の生成です。各チャンクが単独で取得されるため、自己完結した段落を書きます。
6. コンテンツの判断基準。 最適化するembeddingはありません。代わりに、このpassageは、扱うと主張している対象を明確かつ十分に説明しているかと問います。一貫したcontentは適切なqueryの近くにclusterしますが、散漫でkeywordを詰め込んだcontentはそうなりません。
埋め込みチートシート
一行でいうと: 意味を符号化する密なベクトルで、意味が近いほどベクトルも近くなり、コサイン類似度で比較します。
コサイン類似度の尺度
| スコア | 意味 |
|---|---|
| 1 | 同じ方向で非常に類似 |
| ~0 | 直交していて無関係 |
| −1 | 反対方向 |
正規化された単位長ベクトルでは、コサイン類似度と内積が同じランキングになります。
進化の概要
| 時代 | model | 変化したこと |
|---|---|---|
| 2013〜2014年 | word2vec、GloVe | 密な単語vector。ただし単語ごとに1つの静的vector |
| 2018年 | Universal Sentence Encoder | 文全体の sentence embedding |
| 2018年(Searchは2019年) | BERT | 文脈的。単語のvectorが文に依存する |
| 2019年 | Sentence-BERT | 大規模similarity search向けの高速なsentence embedding |
| 2024年〜現在 | OpenAI/Gemini/Voyage/Cohere | 多言語、multimodal、Matryoshkaによる次元変更 |
Googleが名前を付けた埋め込みシステム
| system | 役割 |
|---|---|
| BERT | 文脈内の単語を理解する(query interpretation) |
| Neural Matching/RankEmbed | keyword indexを補完するembedding-based retrieval |
| RankEmbedBERT | RankEmbedとBERTを組み合わせ、複雑なlong-tail queryに強い |
| Passage Ranking | page内の関連する個別passageを表示する |
RAGのretrieval loop
- contentをpassageへchunk化する
- 各chunkをembeddingに変換 → vector
- vectorをvector databaseへ保存する
- 受信queryをembeddingに変換する
- nearest-neighbor(vector)search → 上位K個のchunk
- LLMがそのchunkを根拠としてanswerを生成する
要点
- 次元数は通常数百から数千です。多いほど細かな差を表せますが、storageとcomputeが増え、常に良いとは限りません。
- 生成LLMではなくencoder modelが作ります。
- Matryoshkaにより、再学習せず少ない次元へ切り詰められます。
- embedding modelを切り替えるならすべてを再embeddingする必要があります。異なるmodelの空間には互換性がありません。
- “embedding optimization”(日本語訳:embedding最適化)というものをGoogleへ送信することはできません。Danny SullivanはBERTについて、“There’s nothing to optimize for”(日本語訳:最適化するものは何もない)と述べています。
自分で確認する:埋め込み
時間を使う価値のあるリソース
関連する執筆・講演
- LLM検索最適化について実際に分かっていること — 私の研究と、Chromeがページのpassageをチャンク化して埋め込む方法についてのDan Petrovicの知見(約30件まで、およそ200語のチャンク)を紹介したAhrefsの記事です。
- GEO?AEO?LLMO?— AI検索ウェビナー — 検索パイプラインと埋め込みがAI検索のどこに位置するかを解説します。
基礎論文(歴史)
- word2vec — Mikolovら、2013年 — 密なword vectorとvector arithmeticです。
- GloVe — Pennington, Socher, Manning, 2014 — global co-occurrenceに基づくword vectorです。
- BERT — Devlin et al., 2018 — 文脈的で双方向のembeddingです。
- Sentence-BERT — Reimers & Gurevych, 2019 — 高速なsentence-level similarityです。
その他の資料
- Semantic SEOへの移行: vectorが戦略へ与える意味 — Ann RobisonによるSearch Engine Landの記事です。“Vectors are to AI what structured data is to search engines.”(日本語訳:AIにとってのvectorは、検索エンジンにとっての構造化データに相当する)と説明します。
- ecommerce SEOでcosine similarityを活用する方法 — cosine similarityを実際のSEO workflowへ適用するSearch Engine Landの実務ガイドです。
- Vector Database入門とSEOでのAI活用 — vector databaseとSEOのつながりを説明するSearch Engine Journalの概説です。
- Screaming FrogでWebをvector化するSEO use case — SEOにembeddingを使うiPullRankの実務的な手順です。
- Semantic Search解説: 現代SEOへのvector modelの影響 — dense/sparse、cosine similarity、hybrid searchを扱うLumarの記事です。
- Embedding解説: SEOの未来を開く — keyword clusteringとinternal linkingの実用例を扱うEdd DawsonのSEO向け解説です。
- Google Searchの仕組み(inverted index、RankBrain、RankEmbed、DeepRank) — DOJ testimonyから見たGoogleのembedding systemです。
- sbert.net — 自分でembeddingを生成する場合に使えるSentence Transformers libraryです。
変更履歴
2026年8月22日に更新。
編集概要と記録された変更の詳細。変更の詳細
-
変更の詳細な注記は現在英語でのみ提供されています。
完全な比較は利用できません — この改訂の以前のスナップショットがアーカイブされていません。