Embedding'ler

Embedding'lerin ne olduğu, metni nasıl sayısal vektörlere dönüştürdüğü, anlamsal arama ve AI aramasında nasıl kullanıldığı ve neden gönderilecek bir embedding optimizasyonu olmadığı.

İlk yayın tarihi: 24 Haz 2026 · Son güncelleme: 11 Ağu 2026 · İleri düzey

Bir embedding, anlamı koruyacak şekilde metni sayısal bir vektöre dönüştürür; benzer anlamlar embedding uzayında birbirine yakınlaşır. Bu, anlamsal aramanın ve RAG'in temelidir. Alan, word2vec ve GloVe'un statik kelime vektörlerinden BERT'in bağlamsal embedding'lerine, oradan modern çok modlu API embedding'lerine ilerledi. Google, embedding tabanlı sistemleri anahtar kelime diziniyle birlikte hibrit bir hatta kullanır; embedding'ler anahtar kelimelerin yerini almaz. Web yayıncılarının ekleyebileceği bir Google embedding'i veya gönderilecek bir "embedding optimizasyonu" yoktur: konu bakımından tutarlı, açık ve kapsamlı içerik yazın. Her parça tek başına erişilebildiği için AI araması ve RAG'de yapı önemlidir.

Kısaca — Bir embedding, anlamı kodlayan, genellikle yüzlerce ila birkaç bin boyutlu kayan noktalı sayılardan oluşan yoğun bir vektördür ve üretken bir LLM değil, bir kodlayıcı modeli tarafından üretilir. Benzer anlam → yakın vektörler; bu benzerlik kosinüs benzerliğiyle ölçülür. Alan, statik kelime embedding’lerinden (word2vec, GloVe) bağlamsal embedding’lere (BERT), ardından cümle düzeyi ve modern API embedding’lerine evrildi. Google, embedding tabanlı erişimi (Neural Matching / RankEmbed, RankEmbedBERT) anahtar kelime diziniyle birlikte kullanır — onun yerine geçmez, hibrit bir yaklaşım oluşturur. Embedding’ler RAG’in erişim omurgasını da oluşturur. Değiştirilecek bir embedding ayarı yoktur; içeriğin doğru sorguların yakınında kümelenmesini sağlayan şey konu tutarlılığıdır.

Embedding gerçekte nedir?

Embedding’ler benzerlik ve erişimi destekler; ancak doğruluğun, kalitenin veya sıralama değerinin doğrudan ölçüsü değildir. Bu iddiaya ilişkin kanıt Embeddings represent inputs as numerical vectors that can be compared for relatedness and used for search, clustering, and classification. Kapsam: OpenAI embedding models and documented uses; vector dimensions and behavior vary by model. Güven düzeyi: yüksek · Doğrulandı: OpenAI: Embeddings guide Araştırma sonuçları, eğitilmiş modele ve değerlendirme koşullarına bağlıdır. Bu iddiaya ilişkin kanıt Learned vector representations can encode useful distributional relationships between words. Kapsam: Word2vec-era language representations; observed vector relationships are model- and training-data-specific, not ground truth. Güven düzeyi: yüksek · Doğrulandı: Mikolov et al.: Efficient Estimation of Word Representations

Bir embedding, metni (veya görüntüleri, sesi ya da videoyu) yüksek boyutlu bir uzayda bir nokta olarak temsil eden yoğun bir sayısal vektördür — kayan noktalı sayılardan oluşan bir listedir. OpenAI’nin dokümantasyonu bunu açıkça şöyle ifade eder: “An embedding is a vector (list) of floating point numbers.”

Belirleyici özellik geometriktir: anlamsal olarak benzer içerikler benzer vektörlere sahiptir. Yaklaşık aynı anlama gelen metinler yaklaşık aynı yöne işaret eder; ilgisiz metinler ise başka yönlere işaret eder. Bu bir tesadüf değildir — model, benzer bağlamlarda kullanılan kelime ve ifadelerin benzer vektörlere sahip olması için eğitilir. Anlam konuma dönüşür.

Embedding'ler anlamsal benzerliği mesafeye dönüştürür: tam ifade farklı olsa bile ilişkili anlamlar birbirine yakın konumlanır. Kaynak: /ai-search/how-search-works/embeddings/

Kavramsal bir anlamsal uzay, reset my password sorgusunu Forgot-password guide, Account recovery steps ve Cannot log in başlıklı belgelerin yakınına yerleştirir. İlgisiz Enterprise pricing belgesi daha uzakta durur. Yakın, anlamsal olarak daha benzer anlamına gelir; uzak ise daha az benzer anlamına gelir. Gerçek embedding uzayları çok daha fazla boyuta ve modele özgü bir geometriye sahiptir.

© Patrick Stox LLC · CC BY 4.0 ·

Kesinleştirilmesi gereken birkaç nokta:

  • Üretici değil, kodlayıcı. Embedding’ler, anlamı sabit boyutlu bir vektöre sıkıştırmak üzere tasarlanmış kodlayıcı modellerden gelir. Bu, sonraki belirteci tahmin eden üretken bir LLM’den farklı bir mimari ve amaçtır. (Dahili/API ayrımı aşağıda daha ayrıntılı açıklanır.)
  • Seyrek değil, yoğun. Tek etkinli veya kelime torbası temsillerinin (çoğunlukla sıfırlardan oluşan ve sözlükteki her kelimeye bir yuva ayıran) aksine embedding’ler anlamı her boyuta dağıtır. Google’ın makine öğrenimi sözlüğü embedding’leri, tek etkinli kodlamanın ifade edemediği ilişkileri yakalayan daha düşük boyutlu ve yoğun temsiller olarak tanımlar — modelin “hot dogs and shawarmas are more related than hot dogs and salads.” (Türkçe çeviri) “sosisli sandviçlerle şavurmaların, sosisli sandviçlerle salatalardan daha ilişkili olduğunu” fark etmesini sağlar.
  • Daha yüksek boyut ≠ her zaman daha iyi. Daha fazla boyut daha çok nüans yakalayabilir; ancak saklama ve hesaplama maliyetini artırır ve kazanım göreve bağlıdır. Bu bir ödünleşimidir, “büyük daha iyidir” düğmesi değildir.

Benzerliği ölçme: kosinüs benzerliği

İki embedding’i karşılaştırmak için aralarındaki mesafeyi — aslında açıyı — ölçersiniz. Standart metrik kosinüs benzerliğidir: iki vektörün uzunluğundan bağımsız olarak aralarındaki açıyı ölçer ve −1’den (zıt) 0’a (ilgisiz/dik), oradan 1’e (aynı yön) kadar puan verir. Daha küçük mesafe = daha güçlü ilişki.

Birçok embedding API’si vektörleri birim uzunluğa normalize eder; böylece kosinüs benzerliği ile nokta çarpımı aynı sıralamayı üretir — OpenAI, kosinüs benzerliğinin geleneksel ve biraz daha düşük maliyetli seçenek olduğunu belirtir. Anthropic’in önerdiği embedding sağlayıcısı Voyage AI, sezgiyi net biçimde şöyle ifade eder: “the cosine similarity between two embeddings captures the semantic relatedness of the corresponding original passages.” (Türkçe çeviri) “İki embedding arasındaki kosinüs benzerliği, bunlara karşılık gelen özgün pasajların anlamsal ilişkisini yakalar.” Bu en yakın komşu karşılaştırmasını büyük ölçekte yapmak başlı başına bir sorundur — bunun için vektör araması kullanılır.

Buraya nasıl geldik: evrim

Hikâye tek kelimelerden bütün pasajlara, sabit anlamlardan bağlamı dikkate alan anlamlara uzanır.

  • word2vec (Google, 2013). Mikolov ve çalışma arkadaşları, büyük derlemlerden yoğun kelime vektörleri öğrenmek için iki mimariyi (CBOW ve Skip-Gram) tanıttı. Ünlü sonuç şudur: “King” − “Man” + “Woman” (Türkçe çeviri) “Kral − Erkek + Kadın” vektörü “Queen” (Türkçe çeviri) “Kraliçe” ifadesine en yakın konuma gelir — bu, vektör aritmetiğinin anlamsal ilişkileri yakalayabildiğini gösterir. (Uyarı: Bu benzetme her seferinde garanti edilmez; modele bağlı olarak “krallar” veya “hükümdar” sonucuna varabilir.) Bunlar statik embedding’lerdir — her kelime için tek bir sabit vektör vardır; dolayısıyla “nehir kıyısı” ve “banka hesabı” ifadelerindeki “banka/kıyı” anlamları İngilizcede aynı bank vektörünü alır.
  • GloVe (Stanford, 2014). Tahmin ağı yerine küresel birlikte oluşma istatistikleri üzerine kurulu, sayım tabanlı bir alternatiftir — farklı bir amaçla, benzer ölçüde kullanışlı embedding’ler üretir. Bu da statiktir.
  • Universal Sentence Encoder (Google, 2018). Yalnızca kelimeler için değil, bütün cümleler için embedding’ler. Temel fikir şudur: “Sentences are semantically similar if they have a similar distribution of responses” (Türkçe çeviri) “Cümleler benzer bir yanıt dağılımına sahipse anlamsal olarak benzerdir” — “Kaç yaşındasınız?” ile “Yaşınız nedir?” aynı yanıtları davet eder; bu nedenle embedding’leri birbirine yakın olur.
  • BERT (Google, 2018; Arama’da Ekim 2019’da kullanıma sunuldu). Büyük değişim: bağlamsal embedding’ler. Aynı kelime, çevresindeki cümleye bağlı olarak farklı bir vektör alır; çünkü BERT çift yönlüdür ve bir belirtecin anlamını belirlemek için öncesindeki ve sonrasındaki kelimeleri okur. Böylece İngilizcedeki “nehir kıyısı” ve “banka hesabı” bağlamlarında kullanılan bank sözcüğü nihayet farklı vektörler alır.
  • Sentence-BERT (2019). Benzerlik araması için BERT’in ölçekleme sorununu çözdü. Standart BERT, iki cümlenin birlikte beslenmesini gerektirir; bu, büyük ölçekte hesaplama açısından çok ağırdır. SBERT, kosinüs benzerliğiyle karşılaştırabileceğiniz sabit boyutlu cümle embedding’leri üretir ve büyük bir derlemde en benzer çifti bulma maliyetini saatlerden saniyelere indirir.
  • Modern embedding API’leri (2024–günümüz). OpenAI’nin text-embedding-3 ailesi, Google’ın Gemini embedding’leri, Voyage ve Cohere’nin embed-v4.0’ı — çok dilli, giderek daha çok modlu (tek bir uzayda metin, görüntü, ses ve video) ve Matryoshka Representation Learning ile yeniden boyutlandırılabilir. Vektör, yeniden eğitim olmadan daha az boyuta kısaltılabilir; bunun karşılığında depolama ve hız için biraz doğruluk feda edilir.

Google’ın Search’te embedding’leri nasıl kullandığı

Google’ın sıralama hattı ne yalnızca anlamsaldır ne de yalnızca anahtar kelimeye dayanır — hibrittir; embedding tabanlı bileşenler klasik ters dizinin yerini almak yerine onu tamamlar. Google’ın kendi sıralama sistemleri dokümantasyonu ve Pandu Nayak’ın DOJ antitröst tanıklığına göre adı geçen sistemler şunlardır:

  • BERT — Google’ın kelimeleri bağlam içinde anlama sistemi. İlk kullanıma sunulduğunda Arama’nın ABD’de İngilizce yapılan 10 aramadan birini daha iyi anlamasına yardımcı oldu (“better understand one in 10 searches in the U.S. in English,” (Türkçe çeviri) “ABD’de İngilizce yapılan her 10 aramadan birini daha iyi anlamak”); özellikle for ve to gibi edatların anlamı değiştirdiği daha uzun, konuşma dilindeki sorgularda.
  • Neural Matching / RankEmbed — sorguları ve belgeleri aynı vektör uzayına çevirerek ortak anahtar kelimeleri olmasa bile kavramsal olarak eşleşen sonuçları öne çıkaran embedding tabanlı erişim. Nayak bunu bir tamamlayıcı olarak şöyle açıkladı: “RankEmbed identifies a few more documents to add to those identified by the traditional retrieval.” (Türkçe çeviri) “RankEmbed, geleneksel erişimin belirlediği belgelere eklemek üzere birkaç belge daha belirler.” Buradaki erişim, embedding uzayında bir nokta çarpımı/mesafe ölçümüne dayanır.
  • RankEmbedBERT — RankEmbed’in erişimini BERT’in dil anlayışıyla birleştiren daha sonraki evrimdir; kalite değerlendiricisi puanları ve arama günlükleriyle eğitilmiş, karmaşık ve uzun kuyruklu sorgularda dikkate değer ölçüde daha iyidir.

Pratik sonuç şu: Ters dizin ve BM25 tarzı sözlüksel erişim ilk daraltmayı hâlâ yaptığı için anahtar kelimelerin varlığı önemini korur. Embedding sistemleri kavramsal olarak ilişkili adaylar ekler ve yeniden sıralar. Her iki sinyal de devrede — tam da bu nedenle “BERT killed keywords” ifadesi yanlıştır.

AI aramasındaki embedding’ler (RAG hattı)

Embedding’lerin AI Overviews ve AI arama asistanlarıyla en doğrudan temas ettiği yer burasıdır. Retrieval-Augmented Generation (RAG), embedding’leri erişim katmanı olarak kullanır:

  1. Dizine ekleme: İçerik pasajlara bölümlenir, her pasaj embedding’e dönüştürülür ve vektörler bir vektör veritabanına aktarılır.
  2. Erişim: Kullanıcının sorgusu embedding’e dönüştürülür, en yakın komşu araması (vektör araması yoluyla) en yakın parçaları bulur ve top-K parçalar bağlam olarak LLM’e verilir.
  3. Üretim: LLM, alınan bu parçalara dayalı bir yanıt yazar.

Burada yapı önemlidir; çünkü her parça tek başına alınır. Dan Petrovic’in (Ahrefs’in LLM Araması İçin Optimizasyon Hakkında Gerçekte Bildiklerimiz yazısında atıf yapılan) araştırması, Chrome’un embedding’ler için bir sayfanın yalnızca ilk ~30 pasajını işlediğini ve parçalar arası bağlamı korumak için bunları yaklaşık 200 kelimelik, örtüşen pasajlara böldüğünü ortaya koydu. Bir bölüm sayfadan çıkarıldığında kendi başına ayakta duramıyorsa içeriğinizi iyi temsil edemez.

Token embedding’leri ile metin embedding API’leri

İnsanların karıştırdığı bir ayrım var: Bir LLM’in içindeki embedding’ler ile bir API’den aldığınız embedding’ler aynı şey değildir.

  • Belirteç embedding’leri, modelin dahili temsilleridir — her belirteç, üretim sırasında katmanlar boyunca dönüştürülen bir vektörle temsil edilir. Bunlar sonraki belirteci üretmeye yarayan mekanizmadır.
  • Metin embedding API’leri (OpenAI, Google, Voyage, Cohere), tüm bir girdi dizesi için erişim ve benzerlik amacıyla özel olarak tasarlanmış tek bir sabit boyutlu vektör üretir. Çoğu zaman farklı bir eğitim amacı olan ayrı bir model kullanırlar.

SEO uzmanları “bir sayfayı embed etmekten” veya dahili bağlantı kurma ya da anahtar kelime kümeleme amacıyla kosinüs benzerliği çalıştırmaktan söz ettiğinde API türünü kasteder.

SEO açısından bu ne anlama geliyor?

  • Anlamsal tutarlılık, anahtar kelime yoğunluğundan üstündür. Modeller bağlamı anladığından, “oyun için dizüstü bilgisayar” ile “yüksek performanslı dizüstü bilgisayar” zaten birbirine yakın konumlanır. Anahtar kelime doldurmak yardımcı olmaz — konu bakımından dağınık ve embedding’i daha bulanık içerik üretir.
  • Parçalı erişim için yapı. Pasajlar kendi başlarına embedding’e dönüştürülür ve alınır. Önemli içeriği erkenden verin, bölümleri kendi içinde bütünlüklü tutun, açık ve anlamsal HTML kullanın.
  • Konu kapsamı. Bir konuyu gerçekten kapsamlı biçimde ele alan içerik, vektör uzayında ilgili sorguların daha çoğuna yakın konumlanır. Konu otoritesi oluşturmanın arkasındaki mekanizma budur.
  • Embedding ayarı yoktur. Danny Sullivan, BERT hakkında şöyle der: “There’s nothing to optimize for… The fundamentals of us seeking to reward great content remain unchanged.” (Türkçe çeviri) “Optimize edilecek hiçbir şey yok… İyi içeriği ödüllendirmeye yönelik temel yaklaşımımız değişmedi.” Bir araçtan elde ettiğiniz kosinüs benzerliği puanları analiz yardımcılarıdır; Google’a göndereceğiniz girdiler değildir.

Embedding’ler bu kümenin çoğunun altında yatan bağ dokusudur: anlamsal aramanın üzerinde çalıştığı, vektör aramasının karşılaştırdığı, parçalamanın metni hazırladığı ve RAG’in erişim omurgasını oluşturduğu şey onlardır. Tarama hâlâ ilk adımdır; herhangi bir sistem içeriği embedding’e dönüştürmeden önce onu almalıdır.

Uzman notu ekle

Uzman alıntısını sabitle

Yeni biri mi? Sahipsiz profilini şu bağlantıdan oluşturun: /admin/experts/ → Uzman alıntısını sabitle Bu işlemi önce tamamlayın.