Embedding'ler
Embedding'lerin ne olduğu, metni nasıl sayısal vektörlere dönüştürdüğü, anlamsal arama ve AI aramasında nasıl kullanıldığı ve neden gönderilecek bir embedding optimizasyonu olmadığı.
Diller
Bir embedding, anlamı koruyacak şekilde metni sayısal bir vektöre dönüştürür; benzer anlamlar embedding uzayında birbirine yakınlaşır. Bu, anlamsal aramanın ve RAG'in temelidir. Alan, word2vec ve GloVe'un statik kelime vektörlerinden BERT'in bağlamsal embedding'lerine, oradan modern çok modlu API embedding'lerine ilerledi. Google, embedding tabanlı sistemleri anahtar kelime diziniyle birlikte hibrit bir hatta kullanır; embedding'ler anahtar kelimelerin yerini almaz. Web yayıncılarının ekleyebileceği bir Google embedding'i veya gönderilecek bir "embedding optimizasyonu" yoktur: konu bakımından tutarlı, açık ve kapsamlı içerik yazın. Her parça tek başına erişilebildiği için AI araması ve RAG'de yapı önemlidir.
Kısaca — Bir embedding, metni dev bir uzayda koordinatlara karşılık gelen bir sayı listesine dönüştürür; anlamı benzer olan öğeler bu uzayda birbirine yakın konumlanır. AI araması ve modern arama motorları, içeriğinizi yalnızca anahtar kelimeleri eşleştirerek değil, anlamına göre bir sorguyla böyle eşleştirir. Bir sayfaya embedding’leri “ekleyemezsiniz”; bunlar makinenin zaten orada olanı okuma biçimidir.
Embedding nedir?
Bir embedding, anlamsal benzerlik gibi görevlerde yararlı ilişkileri koruyacak şekilde girdiyi sayısal bir vektör olarak temsil eder. Evidence for this claim Embeddings represent inputs as numerical vectors that can be compared for relatedness and used for search, clustering, and classification. Scope: OpenAI embedding models and documented uses; vector dimensions and behavior vary by model. Confidence: high · Verified: OpenAI: Embeddings guide Geometri ve boyutluluk modele özgüdür; her koordinata atfedilen evrensel anlamlar değildir. Evidence for this claim Learned vector representations can encode useful distributional relationships between words. Scope: Word2vec-era language representations; observed vector relationships are model- and training-data-specific, not ground truth. Confidence: high · Verified: Mikolov et al.: Efficient Estimation of Word Representations
Bilgisayarlar kelimeleri değil, sayıları anlar. Bir embedding bir köprüdür: Bir model bir metin parçasını okur ve onu anlamını yakalayan, vektör adı verilen bir sayı listesine dönüştürür. Bunu bir haritadaki konum gibi düşünün. Anlamı benzer iki metin parçası birbirine yakın konumlandırılır; ilgisiz metinler ise birbirinden uzakta kalır.
Bu nedenle “oyun için dizüstü bilgisayar” ile “oyunlar için yüksek performanslı dizüstü bilgisayar”, neredeyse hiç ortak kelime paylaşmasalar da birbirine yakın konumlanır. “Muzlu ekmek tarifi” ise bambaşka bir yere düşer. Model bunu, çok büyük miktarda metin okuyarak ve hangi kelime ve ifadelerin benzer bağlamlarda ortaya çıktığını fark ederek öğrendi.
Arama açısından bu neden önemli?
Eski tarz arama, anahtar kelimeleri eşleştirirdi: Bir kelime yazardınız, motor o kelimeyi içeren sayfaları bulurdu. Embedding’ler aramanın anlamı eşleştirmesini sağlar. Bu nedenle Google, en iyi sayfada kullandığınız kelimelerin aynısı geçmese bile uzun, konuşma dilindeki bir soruyu yanıtlayabilir — ayrıca AI arama araçları (kaynakları okuyup sizin için yanıt yazan araçlar), hangi pasajların yanıtlarına dahil edilecek kadar alakalı olduğuna böyle karar verir.
AI yanıtlarının arkasındaki hattın kısa özeti:
- İçerik parçalara (pasajlara) ayrılır.
- Her parça bir embedding’e (vektöre) dönüştürülür.
- Sorunuz da bir embedding’e dönüştürülür.
- Sistem, vektörleri sorunuzun vektörüne en yakın parçaları bulur.
- Bu parçalar, AI’ın yanıtını yazarken kullandığı kaynak malzeme olur.
Bu, içeriğiniz açısından ne anlama geliyor?
İnsanların abarttığı nokta şu; açık konuşayım: Google’a gönderebileceğiniz bir “embedding optimizasyonu” yoktur. Google’dan Danny Sullivan, Google’ın embedding tabanlı sistemlerinden biri olan BERT hakkında bunu açıkça şöyle ifade etti: “There’s nothing to optimize for.”
Gerçekte işe yarayan şey, arkasındaki gerekçe daha net olan her zamanki tavsiyedir. Bir konuyu gerçekten ve kapsamlı biçimde ele alan içerik yazın. Tutarlı, odaklanmış içerik, yanıtlaması gereken sorulara yakın konumlanan temiz ve tutarlı embedding’ler üretir. Anahtar kelimelerle doldurulmuş, dağınık içerik daha bulanık bir sinyal üretir. Bir formülü beslemiyorsunuz — bir modelin (ve insanın) açıkça anlayabileceği bir şey yazıyorsunuz.
Gerçek mekanizmayı — boyutları, kosinüs benzerliğini, word2vec’ten BERT’e uzanan geçmişi ve Google’ın embedding’leri sıralamada gerçekte nasıl kullandığını — görmek istiyorsanız Advanced sekmesine geçin.
Kısaca — Bir embedding, anlamı kodlayan, genellikle yüzlerce ila birkaç bin boyutlu kayan noktalı sayılardan oluşan yoğun bir vektördür ve üretken bir LLM değil, bir encoder modeli tarafından üretilir. Benzer anlam → yakın vektörler; bu benzerlik kosinüs benzerliğiyle ölçülür. Alan, statik kelime embedding’lerinden (word2vec, GloVe) bağlamsal embedding’lere (BERT), ardından cümle düzeyi ve modern API embedding’lerine evrildi. Google, embedding tabanlı erişimi (Neural Matching / RankEmbed, RankEmbedBERT) anahtar kelime diziniyle birlikte kullanır — onun yerine geçmez, hibrit bir yaklaşım oluşturur. Embedding’ler RAG’in erişim omurgasını da oluşturur. Değiştirilecek bir embedding ayarı yoktur; içeriğin doğru sorguların yakınında kümelenmesini sağlayan şey konu tutarlılığıdır.
Embedding gerçekte nedir?
Embedding’ler benzerlik ve erişimi destekler; ancak doğruluğun, kalitenin veya sıralama değerinin doğrudan ölçüsü değildir. Evidence for this claim Embeddings represent inputs as numerical vectors that can be compared for relatedness and used for search, clustering, and classification. Scope: OpenAI embedding models and documented uses; vector dimensions and behavior vary by model. Confidence: high · Verified: OpenAI: Embeddings guide Araştırma sonuçları, eğitilmiş modele ve değerlendirme koşullarına bağlıdır. Evidence for this claim Learned vector representations can encode useful distributional relationships between words. Scope: Word2vec-era language representations; observed vector relationships are model- and training-data-specific, not ground truth. Confidence: high · Verified: Mikolov et al.: Efficient Estimation of Word Representations
Bir embedding, metni (veya görüntüleri, sesi ya da videoyu) yüksek boyutlu bir uzayda bir nokta olarak temsil eden yoğun bir sayısal vektördür — kayan noktalı sayılardan oluşan bir listedir. OpenAI’nin dokümantasyonu bunu açıkça şöyle ifade eder: “An embedding is a vector (list) of floating point numbers.”
Belirleyici özellik geometriktir: anlamsal olarak benzer içerikler benzer vektörlere sahiptir. Yaklaşık aynı anlama gelen metinler yaklaşık aynı yöne işaret eder; ilgisiz metinler ise başka yönlere işaret eder. Bu bir tesadüf değildir — model, benzer bağlamlarda kullanılan kelime ve ifadelerin benzer vektörlere sahip olması için eğitilir. Anlam konuma dönüşür.
A conceptual semantic space places the query reset my password near documents titled Forgot-password guide, Account recovery steps, and Cannot log in. The unrelated document Enterprise pricing sits farther away. Near means more semantically similar; far means less similar. Actual embedding spaces have many more dimensions and model-specific geometry.
© Patrick Stox LLC · CC BY 4.0 ·
Kesinleştirilmesi gereken birkaç nokta:
- Üretici değil, encoder. Embedding’ler, anlamı sabit boyutlu bir vektöre sıkıştırmak üzere tasarlanmış encoder modellerinden gelir. Bu, sonraki token’ı tahmin eden üretken bir LLM’den farklı bir mimari ve amaçtır. (Dahili/API ayrımı aşağıda daha ayrıntılı açıklanır.)
- Seyrek değil, yoğun. One-hot veya bag-of-words temsillerinin (çoğunlukla sıfırlardan oluşan ve sözlükteki her kelimeye bir yuva ayıran) aksine embedding’ler anlamı her boyuta dağıtır. Google’ın ML sözlüğü embedding’leri, one-hot kodlamanın ifade edemediği ilişkileri yakalayan daha düşük boyutlu ve yoğun temsiller olarak tanımlar — modelin “hot dogs and shawarmas are more related than hot dogs and salads.” olduğunu fark etmesini sağlar.
- Daha yüksek boyut ≠ her zaman daha iyi. Daha fazla boyut daha çok nüans yakalayabilir; ancak saklama ve hesaplama maliyetini artırır ve kazanım göreve bağlıdır. Bu bir ödünleşimidir, “büyük daha iyidir” düğmesi değildir.
Benzerliği ölçme: kosinüs benzerliği
İki embedding’i karşılaştırmak için aralarındaki mesafeyi — aslında açıyı — ölçersiniz. Standart metrik kosinüs benzerliğidir: iki vektörün uzunluğundan bağımsız olarak aralarındaki açıyı ölçer ve −1’den (zıt) 0’a (ilgisiz/dik), oradan 1’e (aynı yön) kadar puan verir. Daha küçük mesafe = daha güçlü ilişki.
Birçok embedding API’si vektörleri birim uzunluğa normalize eder; böylece kosinüs benzerliği ile nokta çarpımı aynı sıralamayı üretir — OpenAI, kosinüs benzerliğinin geleneksel ve biraz daha düşük maliyetli seçenek olduğunu belirtir. Anthropic’in önerdiği embedding sağlayıcısı Voyage AI, sezgiyi net biçimde şöyle ifade eder: “the cosine similarity between two embeddings captures the semantic relatedness of the corresponding original passages.” Bu en yakın komşu karşılaştırmasını büyük ölçekte yapmak başlı başına bir sorundur — bunun için vektör araması kullanılır.
Buraya nasıl geldik: evrim
Hikâye tek kelimelerden bütün pasajlara, sabit anlamlardan bağlamı dikkate alan anlamlara uzanır.
- word2vec (Google, 2013). Mikolov ve çalışma arkadaşları, büyük derlemlerden yoğun kelime vektörleri öğrenmek için iki mimariyi (CBOW ve Skip-Gram) tanıttı. Ünlü sonuç şudur: “King” − “Man” + “Woman” vektörü “Queen“‘e en yakın konuma gelir — bu, vektör aritmetiğinin anlamsal ilişkileri yakalayabildiğini gösterir. (Uyarı: Bu benzetme her seferinde garanti edilmez; modele bağlı olarak “kings” veya “monarch” sonucuna varabilir.) Bunlar statik embedding’lerdir — her kelime için tek bir sabit vektör vardır; dolayısıyla “river bank” ve “bank account” ifadelerindeki “bank” aynı vektörü alır.
- GloVe (Stanford, 2014). Tahmin ağı yerine küresel birlikte oluşma istatistikleri üzerine kurulu, sayım tabanlı bir alternatiftir — farklı bir amaçla, benzer ölçüde kullanışlı embedding’ler üretir. Bu da statiktir.
- Universal Sentence Encoder (Google, 2018). Yalnızca kelimeler için değil, bütün cümleler için embedding’ler. Temel fikir şudur: “Sentences are semantically similar if they have a similar distribution of responses” — “How old are you?” ile “What is your age?” aynı yanıtları davet eder; bu nedenle embedding’leri birbirine yakın olur.
- BERT (Google, 2018; deployed in Search Oct 2019). Büyük değişim: bağlamsal embedding’ler. Aynı kelime, çevresindeki cümleye bağlı olarak farklı bir vektör alır; çünkü BERT çift yönlüdür ve bir token’ın anlamını belirlemek için öncesindeki ve sonrasındaki kelimeleri okur. Böylece “river bank” ile “bank account” içindeki “bank” nihayet farklı vektörler alır.
- Sentence-BERT (2019). Benzerlik araması için BERT’in ölçekleme sorununu çözdü. Standart BERT, iki cümlenin birlikte beslenmesini gerektirir; bu, büyük ölçekte hesaplama açısından çok ağırdır. SBERT, kosinüs benzerliğiyle karşılaştırabileceğiniz sabit boyutlu cümle embedding’leri üretir ve büyük bir derlemde en benzer çifti bulma maliyetini saatlerden saniyelere indirir.
- Modern embedding API’leri (2024–günümüz). OpenAI’nin text-embedding-3 ailesi, Google’ın Gemini embedding’leri, Voyage ve Cohere’nin embed-v4.0’ı — çok dilli, giderek daha çok modlu (tek bir uzayda metin, görüntü, ses ve video) ve Matryoshka Representation Learning ile yeniden boyutlandırılabilir. Vektör, yeniden eğitim olmadan daha az boyuta kısaltılabilir; bunun karşılığında depolama ve hız için biraz doğruluk feda edilir.
Google’ın Search’te embedding’leri nasıl kullandığı
Google’ın sıralama hattı ne yalnızca anlamsaldır ne de yalnızca anahtar kelimeye dayanır — hibrittir; embedding tabanlı bileşenler klasik ters dizinin yerini almak yerine onu tamamlar. Google’ın kendi sıralama sistemleri dokümantasyonu ve Pandu Nayak’ın DOJ antitröst tanıklığına göre adı geçen sistemler şunlardır:
- BERT — Google’ın kelimeleri bağlam içinde anlama sistemi. İlk kullanıma sunulduğunda Search’ün ABD’de İngilizce yapılan 10 aramadan birini daha iyi anlamasına yardımcı oldu (“better understand one in 10 searches in the U.S. in English,”); özellikle “for” ve “to” gibi edatların anlamı değiştirdiği daha uzun, konuşma dilindeki sorgularda.
- Neural Matching / RankEmbed — sorguları ve belgeleri aynı vektör uzayına çevirerek ortak anahtar kelimeleri olmasa bile kavramsal olarak eşleşen sonuçları öne çıkaran embedding tabanlı erişim. Nayak bunu bir tamamlayıcı olarak şöyle açıkladı: “RankEmbed identifies a few more documents to add to those identified by the traditional retrieval.” Buradaki erişim, embedding uzayında bir nokta çarpımı/mesafe ölçümüne dayanır.
- RankEmbedBERT — RankEmbed’in erişimini BERT’in dil anlayışıyla birleştiren daha sonraki evrimdir; kalite değerlendiricisi puanları ve arama günlükleriyle eğitilmiş, karmaşık ve uzun kuyruklu sorgularda dikkate değer ölçüde daha iyidir.
Pratik sonuç şu: Ters dizin ve BM25 tarzı sözlüksel erişim ilk daraltmayı hâlâ yaptığı için anahtar kelimelerin varlığı önemini korur. Embedding sistemleri kavramsal olarak ilişkili adaylar ekler ve yeniden sıralar. Her iki sinyal de devrede — tam da bu nedenle “BERT killed keywords” ifadesi yanlıştır.
AI aramasındaki embedding’ler (RAG hattı)
Embedding’lerin AI Overviews ve AI arama asistanlarıyla en doğrudan temas ettiği yer burasıdır. Retrieval-Augmented Generation (RAG), embedding’leri erişim katmanı olarak kullanır:
- Dizine ekleme: İçerik pasajlara bölümlenir, her pasaj embedding’e dönüştürülür ve vektörler bir vektör veritabanına aktarılır.
- Erişim: Kullanıcının sorgusu embedding’e dönüştürülür, en yakın komşu araması (vektör araması yoluyla) en yakın parçaları bulur ve top-K parçalar bağlam olarak LLM’e verilir.
- Üretim: LLM, alınan bu parçalara dayalı bir yanıt yazar.
Burada yapı önemlidir; çünkü her parça tek başına alınır. Dan Petrovic’in (Ahrefs’in What We Actually Know About Optimizing for LLM Search yazısında atıf yapılan) araştırması, Chrome’un embedding’ler için bir sayfanın yalnızca ilk ~30 pasajını işlediğini ve parçalar arası bağlamı korumak için bunları yaklaşık 200 kelimelik, örtüşen pasajlara böldüğünü ortaya koydu. Bir bölüm sayfadan çıkarıldığında kendi başına ayakta duramıyorsa içeriğinizi iyi temsil edemez.
Token embedding’leri ile metin embedding API’leri
İnsanların karıştırdığı bir ayrım var: Bir LLM’in içindeki embedding’ler ile bir API’den aldığınız embedding’ler aynı şey değildir.
- Token embedding’leri, modelin dahili temsilleridir — her token, üretim sırasında katman katman dönüştürülen bir vektörle temsil edilir. Bunlar sonraki token’ı üretmeye yarayan mekanizmadır.
- Metin embedding API’leri (OpenAI, Google, Voyage, Cohere), tüm bir girdi dizesi için erişim ve benzerlik amacıyla özel olarak tasarlanmış tek bir sabit boyutlu vektör üretir. Çoğu zaman farklı bir eğitim amacı olan ayrı bir model kullanırlar.
SEO uzmanları “bir sayfayı embed etmekten” veya dahili bağlantı kurma ya da anahtar kelime kümeleme amacıyla kosinüs benzerliği çalıştırmaktan söz ettiğinde API türünü kasteder.
SEO açısından bu ne anlama geliyor?
- Anlamsal tutarlılık, anahtar kelime yoğunluğundan üstündür. Modeller bağlamı anladığından, “oyun için dizüstü bilgisayar” ile “yüksek performanslı dizüstü bilgisayar” zaten birbirine yakın konumlanır. Anahtar kelime doldurmak yardımcı olmaz — konu bakımından dağınık ve embedding’i daha bulanık içerik üretir.
- Parçalı erişim için yapı. Pasajlar kendi başlarına embedding’e dönüştürülür ve alınır. Önemli içeriği erkenden verin, bölümleri kendi içinde bütünlüklü tutun, açık ve anlamsal HTML kullanın.
- Konu kapsamı. Bir konuyu gerçekten kapsamlı biçimde ele alan içerik, vektör uzayında ilgili sorguların daha çoğuna yakın konumlanır. “topical authority” oluşturmanın arkasındaki mekanizma budur.
- Embedding ayarı yoktur. Danny Sullivan, BERT hakkında şöyle der: “There’s nothing to optimize for… The fundamentals of us seeking to reward great content remain unchanged.” Bir araçtan elde ettiğiniz kosinüs benzerliği puanları analiz yardımcılarıdır; Google’a göndereceğiniz girdiler değildir.
Embedding’ler bu kümenin çoğunun altında yatan bağ dokusudur: semantic search’ün üzerinde çalıştığı, vector search’ün karşılaştırdığı, chunking’in metni hazırladığı ve RAG’in erişim omurgasını oluşturduğu şey onlardır. Tarama hâlâ ilk adımdır; herhangi bir sistem içeriği embedding’e dönüştürmeden önce onu almalıdır.
AI özeti
Advanced sürümünün özlü özeti:
- Embedding = anlamı kodlayan yoğun kayan noktalı sayılardan oluşan bir vektör; benzer anlam → yakın vektörler. OpenAI: “An embedding is a vector (list) of floating point numbers.”
- Üretken LLM’ler değil, encoder modelleri üretir — mimari ve amaç farklıdır. Yoğun, seyrek değil.
- Benzerlik kosinüs benzerliğiyle ölçülür (vektörler arasındaki açı, −1 ile 1 arasında). Normalize edilmiş vektörler, sıralama açısından kosinüs benzerliğiyle nokta çarpımını eşdeğer kılar.
- Evrim: word2vec (2013) ve GloVe (2014) statik kelime vektörleri verdi → USE (2018) bütün cümleleri embedding’e dönüştürdü → BERT (2018) embedding’leri bağlamsal yaptı (aynı kelime, bağlama göre farklı vektör) → Sentence-BERT (2019) benzerlik aramasını hızlandırdı → modern çok modlu, yeniden boyutlandırılabilir API modelleri (2024–günümüz).
- Google embedding’leri hibrit bir hatta kullanır: BERT (bağlam içindeki kelimeler), Neural Matching / RankEmbed (anahtar kelime dizinini tamamlayan embedding erişimi) ve RankEmbedBERT. Anahtar kelimeler ilk aşamada erişimi hâlâ sağlar — embedding’ler aday ekler ve yeniden sıralar.
- RAG hattı: parçala → embedding’e dönüştür → vektör veritabanında sakla → sorguyu embedding’e dönüştür → en yakın parçaları al → LLM kaynak parçalara dayalı bir yanıt üretir. Her parça tek başına alındığı için yapı önemlidir.
- SEO sonucu: “embedding optimizasyonu” yoktur — Danny Sullivan, BERT için “There’s nothing to optimize for” der. Konu bakımından tutarlı, kendi içinde tamamlanan ve kapsamlı içerik, yanıtlaması gereken sorguların yakınında kümelenir.
Resmî dokümantasyon
Google ve başlıca embedding sağlayıcılarının embedding’lere ilişkin birincil kaynak dokümantasyonu.
- Machine Learning Glossary — Embeddings — yoğun ve seyrek temsillerin tanımı ve one-hot kodlamanın ilişkiyi neden ifade edemediği.
- A guide to Google Search ranking systems — BERT, Neural Matching, RankBrain, Passage Ranking ve MUM’un Google’ın kendi ifadeleriyle açıklaması.
- Understanding searches better than ever before (BERT) — BERT’in Search’te kullanıma sunulduğunu duyuran Ekim 2019 tarihli yazı.
- Advances in Semantic Textual Similarity — Universal Sentence Encoder (2018) ve “similar distribution of responses” fikri.
- Gemini API — Embeddings — Google’ın güncel çok modlu embedding modeli, boyutları ve kullanım alanları (RAG, anlamsal arama, yeniden sıralama, kümelendirme).
OpenAI
- Vector embeddings guide — “An embedding is a vector (list) of floating point numbers” ve kosinüs benzerliği rehberliği.
- New embedding models and API updates — text-embedding-3 ailesi ve Matryoshka boyut kısaltması (Ocak 2024).
Diğer sağlayıcılar
- Cohere — Embeddings — çok dilli embed-v4.0, ayrı sorgu/belge girdi türleri ve sıkıştırma seçenekleri.
- Voyage AI — Quickstart — Anthropic’in önerdiği sağlayıcı; “the cosine similarity between two embeddings captures the semantic relatedness of the corresponding original passages.”
Temel makaleler
- word2vec — Mikolov et al., 2013 — özgün yoğun kelime vektörleri ve king−man+woman benzetmesi.
- GloVe — Pennington, Socher, Manning, 2014 — küresel birlikte oluşma kelime vektörleri.
- BERT — Devlin et al., 2018 — çift yönlü, bağlamsal embedding’ler.
- Sentence-BERT — Reimers & Gurevych, 2019 — benzerlik araması için hızlı cümle embedding’leri.
Kaynaklardan alıntılar
Google ve embedding sağlayıcılarının kayda geçmiş ifadeleri. Her bağlantı, kaynak sayfadaki alıntılanan bölüme doğrudan atlayan bir derin bağlantıdır.
Embedding nedir?
- “An embedding is a vector (list) of floating point numbers.” — OpenAI’nin Vector embeddings guide adlı rehberi. Alıntıya git
Google — BERT ve dili anlama
- “At its core, Search is about understanding language.” — Google Arama Başkan Yardımcısı Pandu Nayak (BERT duyurusu, Ekim 2019). Alıntıya git
- “BERT will help Search better understand one in 10 searches in the U.S. in English.” — Google Search Blog, Ekim 2019. Alıntıya git
Google — BERT için optimizasyon konusunda
- “There’s nothing to optimize for with BERT… The fundamentals of us seeking to reward great content remain unchanged.” — Google Arama İrtibat Sorumlusu Danny Sullivan. Alıntıya git
Google — anlamsal benzerlik (Universal Sentence Encoder)
- “Sentences are semantically similar if they have a similar distribution of responses.” — Google Research, “Advances in Semantic Textual Similarity” (Mayıs 2018). Kaynağı okuyun
Voyage AI (Anthropic’in önerdiği sağlayıcı) — kosinüs benzerliği
- “The cosine similarity between two embeddings captures the semantic relatedness of the corresponding original passages.” — Voyage AI Quickstart. Kaynağı okuyun
Pandu Nayak (DOJ antitröst tanıklığı) — RankEmbed
- “RankEmbed identifies a few more documents to add to those identified by the traditional retrieval.” — Pandu Nayak’ın tanıklığına ilişkin, DOJ v. Google kapsamındaki aktarım. Aktarımı okuyun
Zihinsel modeller
1. Anlam konuma dönüşür. Bir embedding, metni koordinatlara dönüştürür. Yakın = benzer anlam; uzak = ilgisiz. Diğer her şey — anlamsal arama, kümelendirme, RAG erişimi — yalnızca bu uzaydaki mesafeyi ölçer.
2. Statik ve bağlamsal. word2vec ve GloVe her kelimeye tek bir sabit vektör verir (“bank” her zaman aynıdır). BERT ve türevleri her kullanıma, bağlama bağlı bir vektör verir (“river bank” ≠ “bank account”). word2vec üzerine kurulu eski anahtar kelime benzerliği araçları bu ayrımı yapamaz; BERT tabanlı araçlar yapabilir.
3. Token embedding’leri ≠ metin embedding API’leri. Bir LLM’in içinde token embedding’leri sonraki token’ı üretmek için kullanılan çalışma mekanizmasıdır. Metin embedding API’leri, erişim ve benzerlik için tasarlanmış, her dize için tek bir yoğunlaştırılmış vektör üretir. Modeller farklı, görevler farklıdır. SEO uzmanları “bir sayfayı embed ettiğinde” API türünü kasteder.
4. Yerine geçme değil, hibrit erişim. Google, sözlüksel erişimi (anahtar kelime ters dizini) ve embedding tabanlı erişimi (Neural Matching / RankEmbed) çalıştırır. Anahtar kelimeler önce daraltır; embedding’ler kavramsal olarak ilişkili adaylar ekler ve yeniden sıralar. Tek başına hiçbiri bütün sistem değildir.
5. RAG döngüsü. Parçala → embedding’e dönüştür → sakla → sorguyu embedding’e dönüştür → en yakın parçaları al → temellendirilmiş bir yanıt üret. Her parça tek başına alındığı için kendi içinde tamamlanan pasajlar yazın ve önemli olanı öne alın.
6. İçerik için karar kuralı. Optimize edilecek bir embedding yoktur. Bunun yerine şu soruyu sorun: Bu pasaj, iddia ettiği şeyi açık ve kapsamlı biçimde ele alıyor mu? Tutarlı içerik doğru sorguların yakınında kümelenir; dağınık ve anahtar kelimelerle doldurulmuş içerik kümelenmez.
Embedding’ler — hızlı başvuru
Tek satırda nedir? Anlamı kodlayan yoğun bir vektör (kayan noktalı sayılar listesi); benzer anlam → yakın vektörler; kosinüs benzerliğiyle karşılaştırılır.
Kosinüs benzerliği ölçeği
| Puan | Anlamı |
|---|---|
| 1 | Aynı yön — çok benzer |
| ~0 | Dik — ilgisiz |
| −1 | Zıt yön |
Normalize edilmiş (birim uzunluğundaki) vektörler → kosinüs benzerliği ve nokta çarpımı aynı sıralamayı verir.
Evrime bir bakış
| Dönem | Model(ler) | Ne değişti? |
|---|---|---|
| 2013–2014 | word2vec, GloVe | Yoğun kelime vektörleri — ancak statik (kelime başına bir vektör) |
| 2018 | Universal Sentence Encoder | Bütün cümle embedding’leri |
| 2018 (Search: 2019) | BERT | Bağlamsal — kelimenin vektörü, bulunduğu cümleye bağlıdır |
| 2019 | Sentence-BERT | Büyük ölçekli benzerlik araması için hızlı cümle embedding’leri |
| 2024–günümüz | OpenAI / Gemini / Voyage / Cohere | Çok dilli, çok modlu, yeniden boyutlandırılabilir (Matryoshka) |
Google’ın adı geçen embedding sistemleri
| Sistem | Rol |
|---|---|
| BERT | Bağlam içindeki kelimeleri anlar (sorgu yorumlama) |
| Neural Matching / RankEmbed | Anahtar kelime dizinini tamamlayan embedding tabanlı erişim |
| RankEmbedBERT | RankEmbed + BERT; karmaşık, uzun kuyruklu sorgularda güçlü |
| Passage Ranking | Bir sayfanın ilgili tekil pasajlarını öne çıkarır |
RAG erişim döngüsü
- İçeriği pasajlara böl
- Her parçayı embedding’e dönüştür → vektör
- Vektörleri bir vektör veritabanında sakla
- Gelen sorguyu embedding’e dönüştür
- En yakın komşu (vektör) araması → top-K parçalar
- LLM bu parçalara dayalı bir yanıt üretir
Hızlı gerçekler
- Boyutlar: genellikle yüzlerce ila birkaç bin — daha fazla nüans, daha fazla depolama/hesaplama maliyeti; her zaman daha iyi değil.
- Üretken LLM’ler değil, encoder modelleri üretir.
- Matryoshka, yeniden eğitim olmadan daha az boyuta kısaltmayı mümkün kılar.
- Embedding modelini değiştirmek, her şeyi yeniden embedding’e dönüştürmeyi gerektirir — farklı modellerin uzayları birbiriyle uyumlu değildir.
- Google’a gönderilecek bir “embedding optimizasyonu” yoktur — Danny Sullivan: “There’s nothing to optimize for” (BERT).
Kendinizi test edin: Embedding’ler
Vakit ayırmaya değer kaynaklar
İlgili yazılarım ve konuşmalarım
- What We Actually Know About Optimizing for LLM Search — Chrome’un sayfa pasajlarını nasıl parçalara ayırıp embedding’e dönüştürdüğüne dair araştırmamı ve Dan Petrovic’in bulgularını aktaran Ahrefs yazısı (~30 pasaj sınırı, 200 kelimelik parçalar).
- GEO? AEO? LLMO? — my AI search webinar — erişim hatlarının ve embedding’lerin AI aramasındaki yerini anlattığım web semineri.
Temel makaleler (geçmiş)
- word2vec — Mikolov et al., 2013 — yoğun kelime vektörleri ve vektör aritmetiği.
- GloVe — Pennington, Socher, Manning, 2014 — küresel birlikte oluşma kelime vektörleri.
- BERT — Devlin et al., 2018 — bağlamsal, çift yönlü embedding’ler.
- Sentence-BERT — Reimers & Gurevych, 2019 — hızlı cümle düzeyinde benzerlik.
Diğer kaynaklardan
- The shift to semantic SEO: What vectors mean for your strategy — Search Engine Land’den Ann Robison: “Vectors are to AI what structured data is to search engines.”
- How to leverage cosine similarity for ecommerce SEO — gerçek SEO iş akışlarında kosinüs benzerliğinin uygulanmasına ilişkin Search Engine Land uygulama rehberi.
- Introduction to Vector Databases and How to Use AI for SEO — vektör veritabanlarının SEO’ya nasıl bağlandığına dair Search Engine Journal özeti.
- SEO Use Cases for Vectorizing the Web with Screaming Frog — iPullRank’in SEO için embedding kullanımına ilişkin uygulama anlatımı.
- Semantic Search Explained: Vector Models’ Impact on SEO Today — Lumar’ın yoğun ve seyrek temsiller, kosinüs benzerliği ve hibrit arama hakkındaki yazısı.
- Embeddings Explained: Unlocking the Future of SEO — Edd Dawson’ın anahtar kelime kümelendirme ve dahili bağlantı için pratik kullanım alanlarını ele alan SEO odaklı açıklaması.
- How Google Search Works (inverted index, RankBrain, RankEmbed, DeepRank) — Google’ın embedding sistemlerine ilişkin DOJ tanıklığı perspektifi.
- sbert.net — embedding’leri kendiniz üretmek istiyorsanız Sentence Transformers kütüphanesi.
Değişiklik günlüğü
11 Ağu 2026 tarihinde güncellendi.
Editoryal özet ve kaydedilen değişiklik ayrıntıları.Değişiklik ayrıntıları
-
Ayrıntılı değişiklik notları şu anda İngilizce olarak mevcut.
Tam karşılaştırma kullanılamıyor — bu sürüm için önceki anlık görüntü arşivlenmemiş.
8 Ağu 2026 tarihinde güncellendi.
Editoryal özet ve kaydedilen değişiklik ayrıntıları.Değişiklik ayrıntıları
-
Ayrıntılı değişiklik notları şu anda İngilizce olarak mevcut.
Tam karşılaştırma kullanılamıyor — bu sürüm için önceki anlık görüntü arşivlenmemiş.
6 Ağu 2026 tarihinde güncellendi.
Editoryal özet ve kaydedilen değişiklik ayrıntıları.Değişiklik ayrıntıları
-
Ayrıntılı değişiklik notları şu anda İngilizce olarak mevcut.
Tam karşılaştırma kullanılamıyor — bu sürüm için önceki anlık görüntü arşivlenmemiş.