Panduan Embeddings
Embeddings adalah dense numerical vectors itu encode meaning dari text — how semantic search, Google's peringkat, dan RAG match konten oleh meaning alih-alih keywords.
Bahasa
Embedding adalah daftar angka—vektor padat—yang mengodekan makna kata, kalimat, atau dokumen dalam ruang berdimensi tinggi, sehingga teks yang secara semantik serupa berada berdekatan. Model encoder, bukan LLM generatif, menghasilkannya; kesamaan diukur dengan cosine similarity. Embedding mendukung pencarian semantik, pengelompokan, dan lapisan pengambilan dalam RAG, sementara Google menggunakan pengambilan berbasis embedding (Neural Matching / RankEmbed, RankEmbedBERT) di samping indeks kata kuncinya. Inti SEO-nya bukan kenop yang bisa diputar—Danny Sullivan mengatakan tentang BERT 'there's nothing to optimize for' _(terjemahan)_ “tidak ada yang perlu dioptimalkan”—melainkan konten yang koheren secara topikal berkelompok rapi di dekat kueri yang seharusnya dijawabnya.
TL;DR — Embedding mengubah teks menjadi daftar angka—koordinat di ruang besar—sehingga hal-hal yang maknanya serupa berdekatan. Begitulah penelusuran AI dan mesin pencari modern mencocokkan konten dengan kueri berdasarkan makna, bukan sekadar kata kunci. Anda tidak dapat “menambahkan” embedding ke halaman; embedding adalah cara mesin membaca isi yang sudah ada.
What sebuah embedding adalah
sebuah embedding mewakili input sebagai sebuah numeric vector intended untuk pertahankan berguna relationships untuk tasks such sebagai semantic similarity. Evidence for this claim Embeddings represent inputs as numerical vectors that can be compared for relatedness and used for search, clustering, and classification. Scope: OpenAI embedding models and documented uses; vector dimensions and behavior vary by model. Confidence: high · Verified: OpenAI: Embeddings guide Geometry dan dimensionality adalah model-spesifik alih-alih universal meanings attached untuk setiap coordinate. Evidence for this claim Learned vector representations can encode useful distributional relationships between words. Scope: Word2vec-era language representations; observed vector relationships are model- and training-data-specific, not ground truth. Confidence: high · Verified: Mikolov et al.: Efficient Estimation of Word Representations
Computers don’t memahami kata — mereka memahami angka. sebuah embedding adalah bridge: sebuah model reads sebuah piece dari text dan turns ini ke sebuah list dari angka (called sebuah vector) itu captures -nya meaning. Think dari ini like sebuah location pada sebuah map. Two pieces dari text itu berarti similar things get placed close together; unrelated text ends up far apart.
So “laptop for gaming” (terjemahan) “laptop untuk gaming” dan “high-performance laptop for games” (terjemahan) “tinggi-performa laptop untuk games” land near setiap lainnya, bahkan though mereka barely share kata. “Banana bread recipe” (terjemahan) “Banana bread recipe” lands somewhere else entirely. model learned ini oleh reading enormous amounts dari text dan noticing which kata dan phrases tampilkan up di similar contexts.
Mengapa ini penting untuk penelusuran
Pencarian model lama mencocokkan kata kunci: Anda mengetik sebuah kata, lalu mesin menemukan halaman yang memuat kata itu. Embedding memungkinkan pencarian mencocokkan makna. Itulah sebabnya Google dapat menjawab pertanyaan panjang dan bersifat percakapan meskipun halaman terbaik tidak menggunakan kata persis Anda—dan begitulah alat pencarian AI (yang membaca sumber lalu menulis jawaban) menentukan bagian mana yang cukup relevan untuk disertakan.
pendek versi dari pipeline behind AI jawaban:
- konten gets broken ke chunks (passages).
- setiap chunk gets turned ke sebuah embedding (sebuah vector).
- Anda pertanyaan gets turned ke sebuah embedding too.
- sistem menemukan chunks whose vectors adalah closest untuk Anda pertanyaan’s vector.
- itu chunks become source material AI writes -nya jawaban dari.
What ini berarti untuk Anda konten
Inilah bagian yang sering dibesar-besarkan, jadi mari kita jelaskan: tidak ada “optimasi embedding” yang Anda kirimkan ke Google. Danny Sullivan dari Google menyatakan hal itu persis tentang BERT (salah satu sistem Google berbasis embedding): “There’s nothing to optimize for.” (terjemahan) “Tidak ada yang perlu dioptimalkan.”
Yang benar-benar membantu adalah nasihat yang sama seperti sebelumnya, tetapi kini alasannya lebih jelas. Tulis konten yang sungguh-sungguh dan menyeluruh membahas suatu topik. Konten yang koheren dan fokus menghasilkan embedding yang bersih serta konsisten, yang berada dekat dengan pertanyaan yang seharusnya dijawabnya. Konten yang dipenuhi kata kunci dan terpencar menghasilkan sinyal yang lebih keruh. Anda tidak sedang memasukkan formula—Anda menulis sesuatu yang dapat dipahami dengan jelas oleh model maupun manusia.
ingin nyata mechanics — dimensions, cosine similarity, word2vec-untuk-BERT history, dan how Google actually menggunakan embeddings di peringkat? Switch untuk Advanced tab.
TL;DR — Embedding adalah vektor padat berisi angka floating-point (biasanya ratusan hingga beberapa ribu dimensi) yang mengodekan makna, dihasilkan oleh model encoder—bukan LLM generatif. Makna serupa → vektor berdekatan, diukur dengan cosine similarity. Bidang ini beralih dari embedding kata statis (word2vec, GloVe) ke embedding kontekstual (BERT), lalu ke embedding tingkat kalimat dan API modern. Google menggunakan pengambilan berbasis embedding (Neural Matching / RankEmbed, RankEmbedBERT) di samping indeks kata kuncinya—pendekatan hibrida, bukan pengganti. Embedding juga menjadi tulang punggung pengambilan RAG. Tidak ada kenop embedding untuk diputar; koherensi topik membuat konten berkelompok di sekitar kueri yang tepat.
What sebuah embedding actually adalah
Embeddings mendukung similarity dan retrieval, tetapi mereka adalah not sebuah direct mengukur dari truth, quality, atau peringkat nilai. Evidence for this claim Embeddings represent inputs as numerical vectors that can be compared for relatedness and used for search, clustering, and classification. Scope: OpenAI embedding models and documented uses; vector dimensions and behavior vary by model. Confidence: high · Verified: OpenAI: Embeddings guide Research hasil depend pada trained model dan evaluation setting. Evidence for this claim Learned vector representations can encode useful distributional relationships between words. Scope: Word2vec-era language representations; observed vector relationships are model- and training-data-specific, not ground truth. Confidence: high · Verified: Mikolov et al.: Efficient Estimation of Word Representations
sebuah embedding adalah sebuah dense numerical vector — sebuah list dari floating-poin angka — itu mewakili text (atau images, audio, video) sebagai sebuah poin di sebuah tinggi-dimensional space. OpenAI’s documentation states ini plainly: “An embedding is a vector (list) of floating point numbers.” (terjemahan) “sebuah embedding adalah sebuah vector (list) dari floating poin angka.”
defining property adalah geometric: semantically similar konten memiliki similar vectors. Text itu berarti roughly yang sama thing poin di roughly yang sama direction; unrelated text poin elsewhere. itu’s not sebuah happy accident — model adalah trained so itu kata dan phrases digunakan di similar contexts end up dengan similar vectors. Meaning becomes position.
A conceptual semantic space places the query reset my password near documents titled Forgot-password guide, Account recovery steps, and Cannot log in. The unrelated document Enterprise pricing sits farther away. Near means more semantically similar; far means less similar. Actual embedding spaces have many more dimensions and model-specific geometry.
© Patrick Stox LLC · CC BY 4.0 ·
sebuah few things worth getting precise:
- Encoder, bukan generator. Embedding berasal dari model encoder yang tugasnya memadatkan makna menjadi vektor berukuran tetap. Ini arsitektur dan tujuan yang berbeda dari LLM generatif, yang memprediksi token berikutnya. (Lihat pembedaan internal-vs-API di bawah.)
- Padat, bukan renggang. Berbeda dari representasi one-hot atau bag-of-words (sebagian besar nol, satu slot per kata dalam kosakata), embedding memuat makna di setiap dimensi. Glosarium ML Google menggambarkannya sebagai representasi padat berdimensi lebih rendah yang mengatasi hal-hal yang tidak dapat diungkapkan one-hot—model dapat mengenali bahwa “hot dogs and shawarmas are more related than hot dogs and salads.” (terjemahan) “hot dog dan shawarma lebih berkaitan daripada hot dog dan salad.”
- Dimensi lebih tinggi ≠ selalu lebih baik. Dimensi tambahan dapat menangkap lebih banyak nuansa, tetapi membutuhkan lebih banyak penyimpanan dan komputasi, sementara keuntungannya bergantung pada tugas. Ini pertukaran, bukan kenop “bigger is better” (terjemahan) “semakin besar semakin baik”.
Measuring similarity: cosine similarity
untuk compare two embeddings Anda mengukur distance — atau really angle — antara them. standard metric adalah cosine similarity: ini measures angle antara two vectors regardless dari mereka length, scoring dari −1 (opposite) melalui 0 (unrelated/orthogonal) untuk 1 (identical direction). Smaller distance = more related.
Banyak API embeddings menormalisasi vektor menjadi panjang satuan, sehingga cosine similarity dan dot product menghasilkan peringkat yang sama—OpenAI menyebut cosine sebagai pilihan konvensional yang sedikit lebih murah. Voyage AI (penyedia embeddings yang direkomendasikan Anthropic) menjelaskan intuisinya dengan ringkas: “the cosine similarity between two embeddings captures the semantic relatedness of the corresponding original passages.” (terjemahan) “Kemiripan kosinus antara dua embeddings menangkap keterkaitan semantik dari bagian-bagian asli yang bersesuaian.” Menjalankan perbandingan nearest-neighbor itu dalam skala besar merupakan masalah tersendiri—itulah tugas pencarian vektor.
How kami got here: evolution
story runs dari single kata untuk whole passages, dan dari fixed meanings untuk context-aware ones.
- word2vec (Google, 2013). Mikolov dkk. memperkenalkan dua arsitektur (CBOW dan Skip-Gram) untuk mempelajari vektor kata padat dari korpus besar. Hasil terkenalnya: vektor “King” − “Man” + “Woman” (terjemahan) “raja − pria + wanita” paling dekat dengan “Queen” (terjemahan) “ratu”—bukti bahwa aritmetika vektor menangkap hubungan semantik. (Catatan: analogi itu ilustratif dan tidak selalu dijamin; bergantung pada model, hasilnya dapat berupa “kings” (terjemahan) “para raja” atau “monarch.” (terjemahan) “penguasa.”) Ini adalah embedding statis—satu vektor tetap per kata, sehingga “bank” (terjemahan) “bank (lembaga keuangan)” mendapat vektor yang sama dalam “river bank” (terjemahan) “tepi sungai” dan “bank account.” (terjemahan) “rekening bank.”
- GloVe (Stanford, 2014). Alternatif berbasis hitungan yang dibangun dari statistik kemunculan bersama global, bukan jaringan prediktif—tujuannya berbeda, tetapi embedding sama berguna. Juga statis.
- Universal Sentence Encoder (Google, 2018). Embedding untuk seluruh kalimat, bukan hanya kata. Gagasan intinya: “Sentences are semantically similar if they have a similar distribution of responses” (terjemahan) “Kalimat secara semantik serupa jika memiliki distribusi respons yang serupa”—“How old are you?” (terjemahan) “Berapa usia Anda?” dan “What is your age?” (terjemahan) “Berapa usia Anda?” mengundang jawaban yang sama, sehingga embedding-nya berdekatan.
- BERT (Google, 2018; diterapkan di Search pada Oktober 2019). Perubahan besar: embedding kontekstual. Kata yang sama mendapat vektor berbeda bergantung pada kalimat di sekitarnya, karena BERT bersifat dua arah—membaca kata sebelum dan sesudah token untuk menetapkan maknanya. Jadi “bank” (terjemahan) “bank (tepi sungai)” dalam “river bank” (terjemahan) “tepi sungai” dan “bank account” (terjemahan) “rekening bank” akhirnya mendapat vektor berbeda.
- Sentence-BERT (2019). Memecahkan masalah skala BERT untuk pencarian kesamaan. BERT biasa perlu menerima kedua kalimat bersama-sama, yang sangat berat secara komputasi pada skala besar; SBERT menghasilkan embedding kalimat berukuran tetap yang dapat dibandingkan dengan cosine similarity, sehingga biaya menemukan pasangan paling mirip dalam korpus besar turun dari berjam-jam menjadi beberapa detik.
- API embedding modern (2024–sekarang). Keluarga text-embedding-3 dari OpenAI, embedding Gemini dari Google, Voyage, dan embed-v4.0 dari Cohere—multibahasa, makin multimodal (teks, gambar, audio, video dalam satu ruang), dan ukurannya dapat diubah melalui Matryoshka Representation Learning (memotong vektor menjadi lebih sedikit dimensi tanpa pelatihan ulang, menukar sedikit akurasi dengan penyimpanan dan kecepatan).
How Google menggunakan embeddings di Search
Google’s peringkat pipeline isn’t purely semantic atau purely keyword — ini adalah hybrid, dan embedding pieces supplement classic inverted indeks alih-alih replacing ini. dari Google’s own peringkat-sistem documentation dan Pandu Nayak’s DOJ antitrust testimony, named sistem sertakan:
- BERT — sistem Google untuk memahami kata dalam konteks. Saat diluncurkan, sistem ini membantu Search “better understand one in 10 searches in the U.S. in English,” (terjemahan) “memahami dengan lebih baik satu dari sepuluh penelusuran di AS dalam bahasa Inggris”, terutama kueri percakapan yang lebih panjang, ketika kata depan seperti “for” (terjemahan) “untuk” dan “to” (terjemahan) “ke” mengubah makna.
- Neural Matching / RankEmbed — pengambilan berbasis embedding yang menerjemahkan kueri dan dokumen ke ruang vektor yang sama untuk menampilkan hasil yang cocok secara konseptual meskipun tidak memiliki kata kunci yang sama. Nayak menjelaskannya sebagai pelengkap: “RankEmbed identifies a few more documents to add to those identified by the traditional retrieval.” (terjemahan) “RankEmbed mengidentifikasi beberapa dokumen tambahan untuk melengkapi dokumen yang ditemukan melalui pengambilan tradisional.” Pengambilan tersebut didasarkan pada ukuran hasil kali titik atau jarak di ruang embedding.
- RankEmbedBERT — evolusi berikutnya yang menggabungkan pengambilan RankEmbed dengan pemahaman bahasa BERT, dilatih menggunakan skor penilai kualitas dan log penelusuran, serta secara khusus lebih baik pada kueri kompleks berekor panjang.
Bacaan praktisnya: keberadaan kata kunci tetap penting karena pengambilan leksikal (indeks terbalik, gaya BM25) masih melakukan penyempitan tahap pertama. Sistem embedding menambahkan kandidat yang secara konseptual terkait lalu memeringkat ulang. Kedua sinyal ikut berperan—itulah alasan “BERT killed keywords” (terjemahan) “BERT membunuh kata kunci” keliru.
Embeddings di AI search ( RAG pipeline)
ini adalah where embeddings touch AI Overviews dan AI search assistants sebagian besar directly. Retrieval-Augmented Generation (RAG) menggunakan embeddings sebagai -nya retrieval layer:
- indeks: konten adalah chunked ke passages, setiap passage adalah embedded, dan vectors go ke sebuah vector database.
- Retrieve: pengguna’s kueri adalah embedded, sebuah nearest-neighbor search menemukan closest chunks (via pencarian vektor), dan top-K chunks adalah handed untuk LLM sebagai context.
- Generate: LLM writes sebuah jawaban grounded di itu retrieved chunks.
Struktur penting karena setiap potongan diambil secara terpisah. Riset Dan Petrovic (dikutip dalam Yang Sebenarnya Kita Ketahui tentang Optimasi untuk Penelusuran LLM Search) menemukan bahwa Chrome hanya memproses sekitar 30 bagian pertama halaman untuk embedding, lalu memotongnya menjadi bagian sekitar 200 kata dengan tumpang tindih agar konteks antarpotongan tetap terjaga. Jika suatu bagian tidak dapat berdiri sendiri setelah dipisahkan dari halaman, bagian itu merepresentasikan konten Anda dengan buruk.
Embedding token dan API embedding teks
Satu perbedaan yang sering membingungkan: embeddings di dalam LLM dan embeddings yang Anda peroleh dari API bukanlah hal yang sama.
- Embedding token adalah representasi internal model—setiap token mendapat vektor yang diubah lapis demi lapis selama generasi. Inilah mekanisme untuk menghasilkan token berikutnya.
- API embedding teks (OpenAI, Google, Voyage, Cohere) menghasilkan satu vektor berukuran tetap untuk seluruh string input, yang dirancang khusus untuk pengambilan dan kesamaan. Sering kali API ini menggunakan model terpisah dengan tujuan pelatihan yang berbeda.
Saat praktisi SEO membicarakan “embedding halaman” atau menjalankan cosine similarity untuk penautan internal atau pengelompokan kata kunci, yang dimaksud adalah jenis API.
What ini berarti untuk SEO
- Koherensi semantik mengalahkan kepadatan kata kunci. Karena model memahami konteks, “laptop for gaming” (terjemahan) “laptop untuk bermain gim” dan “high-performance laptop” (terjemahan) “laptop berperforma tinggi” sudah berdekatan. Penjejalan kata kunci tidak membantu—justru menghasilkan konten yang topiknya terpencar dengan embedding yang lebih keruh.
- Susun untuk pengambilan berbasis chunk. Bagian teks di-embedding dan diambil secara mandiri. Letakkan konten penting di awal, jaga setiap bagian tetap utuh, dan gunakan HTML semantik yang jelas.
- Kelengkapan topik. Konten yang benar-benar mencakup suatu subjek akan berada dekat dengan lebih banyak kueri terkait di ruang vektor. Itulah mekanisme di balik “build topical authority.” (terjemahan) “bangun otoritas topikal.”
- Tidak ada kenop embedding. Danny Sullivan, tentang BERT: “There’s nothing to optimize for… The fundamentals of us seeking to reward great content remain unchanged.” (terjemahan) “Tidak ada yang perlu dioptimalkan… dasar-dasar kami dalam memberi penghargaan pada konten hebat tetap tidak berubah.” Skor cosine-similarity dari alat hanyalah bantuan analisis, bukan input yang Anda kirimkan ke Google.
Embeddings adalah connective tissue di bawah sebagian besar dari ini cluster: mereka’re what semantic search runs pada, what pencarian vektor compares, what chunking prepares text untuk, dan retrieval backbone dari RAG. mereka’re juga why crawling masih penting pertama — konten memiliki untuk menjadi fetched sebelum apa pun sistem dapat embed ini.
AI summary
sebuah condensed take pada Advanced versi:
- Embedding = vektor padat berisi angka floating-point yang mengodekan makna; makna serupa → vektor berdekatan. OpenAI: “An embedding is a vector (list) of floating point numbers.” (terjemahan) “Embedding adalah vektor (daftar) angka floating point.”
- Dihasilkan oleh model encoder, bukan LLM generatif—arsitektur dan tujuannya berbeda. Padat, bukan renggang.
- Kesamaan diukur dengan cosine similarity (sudut antara vektor, −1 hingga 1). Vektor ternormalisasi membuat cosine dan dot product setara untuk pemeringkatan.
- Evolusi: word2vec (2013) dan GloVe (2014) menghasilkan vektor kata statis → USE (2018) meng-embedding seluruh kalimat → BERT (2018) membuat embedding kontekstual (kata sama, vektor berbeda menurut konteks) → Sentence-BERT (2019) mempercepat pencarian kesamaan → model API modern yang multimodal dan ukurannya dapat diubah (2024–sekarang).
- Google menggunakan embedding dalam pipeline hibrida: BERT (kata dalam konteks), Neural Matching / RankEmbed (pengambilan embedding yang melengkapi indeks kata kunci), dan RankEmbedBERT. Kata kunci tetap melakukan pengambilan tahap pertama—embedding menambahkan kandidat dan memeringkat ulang.
- Pipeline RAG: chunk → embed → simpan di DB vektor → embed kueri → ambil chunk terdekat → LLM menghasilkan jawaban berlandaskan sumber. Setiap chunk diambil secara terpisah, jadi struktur penting.
- Inti SEO: tidak ada “embedding optimization” (terjemahan) “optimisasi embedding” yang tersedia—Danny Sullivan: “There’s nothing to optimize for” (terjemahan) “tidak ada yang perlu dioptimalkan” tentang BERT. Konten yang koheren secara topikal, utuh, dan menyeluruh berkelompok dekat dengan kueri yang seharusnya dijawab.
Official documentation
Primary-source documentation pada embeddings dari Google dan major embedding providers.
- pembelajaran mesin Glossary — Embeddings — dense-vs-sparse definition dan why one-hot encoding dapat’t express relatedness.
- sebuah guide untuk Google Search peringkat sistem — BERT, Neural Matching, RankBrain, Passage peringkat, dan MUM described di Google’s own kata.
- Understanding searches better daripada ever sebelum (BERT) — October 2019 announcement dari BERT di Search.
- Advances di Semantic Textual Similarity — Universal kalimat Encoder (2018) dan “similar distribution of responses” (terjemahan) “similar distribution dari respons” idea.
- Gemini API — Embeddings — Google’s saat ini multimodal embedding model, dimensions, dan gunakan cases (RAG, semantic search, reranking, clustering).
OpenAI
- Vector embeddings guide — “An embedding is a vector (list) of floating point numbers” (terjemahan) “sebuah embedding adalah sebuah vector (list) dari floating poin angka”; cosine similarity guidance.
- baru embedding models dan API updates — text-embedding-3 family dan Matryoshka dimension shortening (Jan 2024).
lainnya providers
- Cohere — Embeddings — multilingual embed-v4.0, separate kueri/document input jenis, compression options.
- Voyage AI — Quickstart — Anthropic’s recommended provider; “the cosine similarity between two embeddings captures the semantic relatedness of the corresponding original passages.” (terjemahan) “ cosine similarity antara two embeddings captures semantic relatedness dari corresponding original passages.”
Foundational papers
- word2vec — Mikolov et al., 2013 — original dense kata vectors dan king−man+woman analogy.
- GloVe — Pennington, Socher, Manning, 2014 — global co-occurrence kata vectors.
- BERT — Devlin et al., 2018 — bidirectional, contextual embeddings.
- kalimat-BERT — Reimers & Gurevych, 2019 — fast kalimat embeddings untuk similarity search.
Quotes dari source
pada—record statements dari Google dan embedding providers. setiap tautan adalah sebuah deep tautan itu jumps untuk quoted passage pada source halaman.
What sebuah embedding adalah
- “An embedding is a vector (list) of floating point numbers.” (terjemahan) “sebuah embedding adalah sebuah vector (list) dari floating poin angka.” — OpenAI, Vector embeddings guide. Jump untuk quote
Google — BERT dan language understanding
- “At its core, Search is about understanding language.” (terjemahan) “di -nya core, Search adalah tentang understanding language.” — Pandu Nayak, VP dari Search, Google (BERT announcement, October 2019). Jump untuk quote
- “BERT will help Search better understand one in 10 searches in the U.S. in English.” (terjemahan) “BERT akan help Search better memahami one di 10 searches di U.S. di English.” — Google Search Blog, October 2019. Jump untuk quote
Google — pada optimizing untuk BERT
- “There’s nothing to optimize for with BERT… The fundamentals of us seeking to reward great content remain unchanged.” (terjemahan) “There’s nothing untuk mengoptimalkan untuk dengan BERT… fundamentals dari us seeking untuk reward great konten remain unchanged.” — Danny Sullivan, Google Search Liaison. Jump untuk quote
Google — semantic similarity (Universal kalimat Encoder)
- “Sentences are semantically similar if they have a similar distribution of responses.” (terjemahan) “Sentences adalah semantically similar jika mereka memiliki sebuah similar distribution dari respons.” — Google Research, “Advances in Semantic Textual Similarity” (terjemahan) “Advances di Semantic Textual Similarity” (dapat 2018). Read source
Voyage AI (penyedia yang direkomendasikan Anthropic) — cosine similarity
- “The cosine similarity between two embeddings captures the semantic relatedness of the corresponding original passages.” (terjemahan) “ cosine similarity antara two embeddings captures semantic relatedness dari corresponding original passages.” — Voyage AI Quickstart. Read source
Pandu Nayak (kesaksian antimonopoli DOJ) — RankEmbed
- “RankEmbed identifies a few more documents to add to those identified by the traditional retrieval.” (terjemahan) “RankEmbed identifies sebuah few more documents untuk tambahkan untuk itu identified oleh traditional retrieval.” — coverage dari Pandu Nayak’s testimony, DOJ v. Google. Read coverage
mental models
1. Meaning becomes position. sebuah embedding turns text ke coordinates. Close together = similar meaning; far apart = unrelated. Everything else — semantic search, clustering, RAG retrieval — adalah hanya measuring distance di itu space.
2. Statis vs. kontekstual. word2vec dan GloVe memberi setiap kata satu vektor tetap (kata bank selalu sama). BERT dan turunannya memberi setiap kemunculan vektor yang bergantung pada konteks (tepi sungai ≠ rekening bank). Alat kemiripan kata kunci yang dibangun di atas word2vec tidak dapat membedakan keduanya; alat berbasis BERT bisa.
3. Token embeddings ≠ text embedding APIs. Inside sebuah LLM, token embeddings adalah berfungsi machinery untuk generating next token. Text embedding APIs output one condensed vector per string, dibangun untuk retrieval dan similarity. berbeda models, berbeda jobs. When SEOs “embed a page,” (terjemahan) “embed sebuah halaman,” mereka berarti API jenis.
4. Pengambilan hibrida, bukan pengganti. Google menjalankan pengambilan leksikal (indeks terbalik kata kunci) dan pengambilan berbasis embedding (Neural Matching / RankEmbed). Kata kunci menyaring lebih dulu; embedding menambahkan kandidat yang saling terkait secara konseptual dan memeringkat ulang. Tidak satu pun berdiri sendiri sebagai keseluruhan sistem.
5. RAG loop. Chunk → embed → store → embed kueri → retrieve nearest chunks → generate sebuah grounded jawaban. Because setiap chunk adalah retrieved di isolation, write self-berisi passages dan front-muat what penting.
6. decision aturan untuk konten. There’s no embedding untuk mengoptimalkan. tanyakan instead: melakukan ini passage clearly dan thoroughly cover thing ini claims untuk? Coherent konten clusters near right kueri; scattered, stuffed konten doesn’t.
Embeddings — cheat sheet
What ini adalah di one line sebuah dense vector (list dari floating-poin angka) encoding meaning; similar meaning → nearby vectors; dibandingkan dengan cosine similarity.
Cosine similarity scale
| Skor | Makna |
|---|---|
| 1 | Arah identik — sangat mirip |
| ~0 | Ortogonal — tidak berkaitan |
| −1 | Arah berlawanan |
Normalized (unit-length) vectors → cosine similarity dan dot product give yang sama peringkat.
** evolution, di sebuah glance**
| Era | Model(s) | What changed |
|---|---|---|
| 2013–2014 | word2vec, GloVe | Dense kata vectors — tetapi static (one vector per kata) |
| 2018 | Universal kalimat Encoder | Whole-kalimat embeddings |
| 2018 (Search: 2019) | BERT | Contextual — kata’s vector depends pada -nya kalimat |
| 2019 | kalimat-BERT | Fast kalimat embeddings untuk besar-scale similarity search |
| 2024–present | OpenAI / Gemini / Voyage / Cohere | Multilingual, multimodal, resizable (Matryoshka) |
Google’s named embedding sistem
| sistem | Role |
|---|---|
| BERT | Understands kata di context (kueri interpretation) |
| Neural Matching / RankEmbed | Embedding-based retrieval itu supplements keyword indeks |
| RankEmbedBERT | RankEmbed + BERT; strong pada kompleks, panjang-tail kueri |
| Passage peringkat | Surfaces relevant individual passages dari sebuah halaman |
** RAG retrieval loop**
- Chunk konten ke passages
- Embed setiap chunk → vector
- Store vectors di sebuah vector database
- Embed incoming kueri
- Nearest-neighbor (vector) search → top-K chunks
- LLM generates sebuah jawaban grounded di itu chunks
Fakta singkat
- Dimensi: biasanya ratusan hingga beberapa ribu—lebih banyak nuansa, lebih banyak penyimpanan/komputasi; tidak selalu lebih baik.
- Dihasilkan oleh model encoder, bukan LLM generatif.
- Matryoshka memungkinkan Anda memotong menjadi lebih sedikit dimensi tanpa pelatihan ulang.
- Mengganti model embedding berarti menanamkan ulang semuanya—ruang model yang berbeda tidak kompatibel.
- Tidak ada “embedding optimization” (terjemahan) “optimisasi embedding” yang dapat dikirim ke Google—Danny Sullivan: “There’s nothing to optimize for” (terjemahan) “tidak ada yang perlu dioptimalkan” (BERT).
Test yourself: Embeddings
Resources worth Anda time
Tulisan dan presentasi terkait
- Yang Sebenarnya Kita Ketahui tentang Optimasi untuk Penelusuran LLM — tulisan Ahrefs yang mengutip riset saya dan temuan Dan Petrovic tentang cara Chrome memotong dan membuat embedding dari bagian halaman (batas sekitar 30 bagian, potongan 200 kata).
- GEO? AEO? LLMO? — webinar penelusuran AI saya — tempat pipeline pengambilan dan embedding masuk ke penelusuran AI.
Foundational papers ( history)
- word2vec — Mikolov et al., 2013 — dense kata vectors dan vector arithmetic.
- GloVe — Pennington, Socher, Manning, 2014 — global co-occurrence kata vectors.
- BERT — Devlin et al., 2018 — contextual, bidirectional embeddings.
- kalimat-BERT — Reimers & Gurevych, 2019 — fast kalimat-tingkat similarity.
dari others
- shift untuk semantic SEO: What vectors berarti untuk Anda strategy — Ann Robison, mesin pencari Land: “Vectors are to AI what structured data is to search engines.” (terjemahan) “Vectors adalah untuk AI what data terstruktur adalah untuk mesin pencari.”
- cara leverage cosine similarity untuk ecommerce SEO — mesin pencari Land practitioner guide untuk applying cosine similarity di nyata SEO workflows.
- Introduction untuk Vector Databases dan cara gunakan AI untuk SEO — mesin pencari Journal overview dari how vector databases connect untuk SEO.
- SEO gunakan Cases untuk Vectorizing Web dengan Screaming Frog — iPullRank’s practitioner walkthrough dari embeddings untuk SEO.
- Semantic Search dijelaskan: Vector Models’ Impact pada SEO Today — Lumar pada dense vs. sparse, cosine similarity, dan hybrid search.
- Embeddings dijelaskan: Unlocking Future dari SEO — Edd Dawson’s SEO-focused explainer covering practical gunakan cases untuk keyword clustering dan internal linking.
- How Google Search berfungsi (inverted indeks, RankBrain, RankEmbed, DeepRank) — DOJ-testimony view dari Google’s embedding sistem.
- sbert.net — kalimat Transformers library, jika Anda ingin generate embeddings yourself.
Log perubahan
Diperbarui 22 Agu 2026.
Ringkasan editorial dan detail perubahan yang tercatat.Detail perubahan
-
Catatan perubahan terperinci saat ini tersedia dalam bahasa Inggris.
Perbandingan lengkap tidak tersedia — tidak ada cuplikan sebelumnya yang diarsipkan untuk revisi ini.
Diperbarui 7 Agu 2026.
Ringkasan editorial dan detail perubahan yang tercatat.Detail perubahan
- all
Catatan perubahan terperinci saat ini tersedia dalam bahasa Inggris.
Perbandingan lengkap tidak tersedia — tidak ada cuplikan sebelumnya yang diarsipkan untuk revisi ini.
Diperbarui 7 Agu 2026.
Ringkasan editorial dan detail perubahan yang tercatat.Detail perubahan
- Advanced
Catatan perubahan terperinci saat ini tersedia dalam bahasa Inggris.
Perbandingan lengkap tidak tersedia — tidak ada cuplikan sebelumnya yang diarsipkan untuk revisi ini.
Diperbarui 6 Agu 2026.
Ringkasan editorial dan detail perubahan yang tercatat.Detail perubahan
- all
Catatan perubahan terperinci saat ini tersedia dalam bahasa Inggris.
Perbandingan lengkap tidak tersedia — tidak ada cuplikan sebelumnya yang diarsipkan untuk revisi ini.