RAG (Getirmeyle Zenginleştirilmiş Üretim)

RAG’nin nasıl çalıştığını — Google AI Overviews, ChatGPT Search ve Perplexity’nin arkasındaki getir-sonra-üret kalıbını — ve içeriğinizin alıntılanması için bunun ne anlama geldiğini açıklayan rehber.

İlk yayın tarihi: 24 Haz 2026 · Son güncelleme: 8 Ağu 2026 · Advanced
Diller

RAG (Retrieval-Augmented Generation), AI aramasının arkasındaki getir-sonra-üret kalıbıdır. Sorgu zamanında iki aşamada çalışır: getirme (harici bir dizinden ilgili pasajları bulma) ve zenginleştirilmiş üretim (temellendirilmiş, alıntılı bir yanıt yazması için bu pasajları LLM’e verme); modelin ağırlıklarını hiçbir zaman değiştirmez. AI yanıtlarının bir modelin eğitim kesilme tarihinden sonraki bilgileri kapsaması böyle mümkün olur. Getirme aşaması chunking → embeddings → vector search → yeniden sıralama → top-k pasajları zinciridir. RAG halüsinasyonları azaltır ancak ortadan kaldırmaz; yetersiz getirilen bağlam bunları daha da kötüleştirebilir. SEO açısından ayrı bir AI dizini yoktur: taranabilir, dizine eklenmiş ve açık, kendi kendine yeten pasajlar hâlinde yapılandırılmış olmak, getirilip alıntılanmanın ön koşuludur.

Lewis ve arkadaşlarının 2020 sistemi, dizi üretimini parametrik olmayan bir dizinden yoğun getirmeyle birleştirdi. Evidence for this claim The original RAG paper combined a pretrained sequence-to-sequence model with a non-parametric dense-vector index retrieved during generation. Scope: Lewis et al.'s 2020 RAG architecture and experiments, not every modern retrieval system. Confidence: high · Verified: Lewis et al.: Retrieval-Augmented Generation Google Cloud’un güncel özeti RAG’yi, getirilen harici bilginin bir modele sağlanması olarak daha geniş biçimde tanımlar. Evidence for this claim Google Cloud describes RAG as retrieving relevant information from external knowledge sources and providing it to a model to improve generated responses. Scope: General RAG architecture in Google Cloud documentation; quality depends on retrieval, source quality, and generation. Confidence: high · Verified: Google Cloud: RAG overview

TL;DR — RAG, çıkarım zamanında çalışan iki aşamalı bir kalıptır: harici bir külliyatta ilgili pasajları getirme, ardından temellendirilmiş ve alıntılı bir yanıt üretmesi için bu pasajları LLM’e zenginleştirilmiş üretim olarak verme. Ağırlıklar hiç değişmez — modelin parametrik belleğini canlı getirilen parametrik olmayan belleğe bağlar. Getirme aşaması chunking → embeddings → vector search → yeniden sıralama → top-k zinciridir. “Naive” RAG getirip üretir; gelişmiş RAG sorgu yeniden yazımı ve yeniden sıralama ekler; agentic RAG yinelemeli, çok atlamalı getirme ekler. Getirme yanıtları temellendirebilir ancak doğruluğu garanti etmez; bir Gemma değerlendirmesinde yetersiz bağlam daha fazla yanlış yanıtla birlikte görüldü. SEO için ayrı bir AI dizini yoktur; taranabilirlik, dizine ekleme ve pasaj düzeyinde açıklık getirilmenin ön koşullarıdır.

İki aşama (ve “inference time”ın asıl mesele olması)

Retrieval is a pipeline: chunk, embed, search, re-rank, then hand the survivors to the model. Kaynak: /ai-search/how-search-works/rag/

Five stages run left to right at inference time. Chunking splits documents into retrievable passages. Embeddings represent each passage as a dense vector. Vector search retrieves candidates and some systems combine it with BM25 keyword search. Re-ranking re-scores and narrows the candidate set. The top surviving passages enter the model context. The model's weights do not change.

© Patrick Stox LLC · CC BY 4.0 ·

RAG combines trained model memory with retrieved context at query time — without changing the weights. Kaynak: /ai-search/how-search-works/rag/

Two sources feed one generation step. Parametric memory is knowledge encoded in the model weights during training and is limited by the training data and cutoff. Non-parametric memory consists of passages retrieved from an external index at query time. Generation uses both while the weights remain unchanged, producing an answer that can be grounded in and cite the retrieved sources; this does not guarantee correctness.

© Patrick Stox LLC · CC BY 4.0 ·

Kısaltmayı açtığınızda modeli görürsünüz: Retrieval ve Augmented Generation. Bir sorgu gelir; sistem harici bir külliyattan en ilgili pasajları getirir; bu pasajları LLM’in bağlam penceresine yerleştirir; LLM de bunlara dayanan bir yanıt üretir.

Herkesin yanlış anladığı ayrıntı şudur: bu işlem çıkarım zamanında gerçekleşir ve modelin ağırlıklarına hiç dokunulmaz. RAG eğitim değildir, fine-tuning de değildir. Patrick Lewis ve Facebook AI Research’teki arkadaşlarının 2020 tarihli özgün makalesi bunu iki bellek türünü birleştirmek olarak çerçeveler — parametrik bellek (eğitim sırasında ağırlıklara işlenen bilgi) ve parametrik olmayan bellek (bir dizinden canlı getirilen bilgi). RAG ikisini aynı anda kullanır. AWS pratik durumu açıkça ifade eder: yeni veya alana özgü bilgi için bir temel modeli yeniden eğitmek pahalıdır ve “RAG is a more cost-effective approach to introducing new data to the LLM.” (Türkçesi: RAG, LLM’e yeni veri sunmak için daha uygun maliyetli bir yaklaşımdır.)

(Adlandırma, yeri gelmişken, bir kazaydı. Lewis daha sonra şöyle itiraf etti: “We definitely would have put more thought into the name had we known our work would become so widespread… We always planned to have a nicer sounding name, but when it came time to write the paper, no one had a better idea.” (Türkçesi: Çalışmamızın bu kadar yaygınlaşacağını bilseydik isme kesinlikle daha fazla kafa yorardık… Her zaman daha hoş seslenen bir isim planlamıştık, ancak makaleyi yazma zamanı geldiğinde kimsenin daha iyi bir fikri yoktu.) )

Getirme aşamasının içi

“İlgili pasajları getir” cümlesi çok iş yapıyor. Gerçek bir sistemde bu bir işlem hattıdır:

  1. Chunking. Belgeler getirilebilir parçalara ayrılır. Parça boyutu gerçek bir dengedir — çok küçük olursa pasaj bağlamını kaybeder; çok büyük olursa token bütçesini ilgisiz bilgilerle doldurur. Stratejiler sabit token sayılarından (100/256/512), recursive/sliding window yöntemlerine ve “Small2Big” yaklaşımına (küçük bir cümleyi getirip üretim için üst parçasını döndürme) uzanır.
  2. Embeddings. Her parça, anlamının sayısal bir temsili olan yoğun bir vektöre dönüştürülür; böylece benzerlik anahtar kelime eşleşmesiyle değil anlamsal olarak hesaplanır. Bu yüzden bir konu hakkındaki içerik, sorgunun tam ifadesini kullanmasa bile getirilir.
  3. Vector search. Sorgu da embed edilir ve sistem vektörleri ona en yakın parçaları bulur. Üretim yığınlarının çoğu hibrit arama çalıştırır — yoğun vektör getirmeye BM25 anahtar kelime araması eklenir — çünkü her biri diğerinin kaçırdığı geri çağırmayı yakalar.
  4. Yeniden sıralama. Ayrı bir model adayları sorguyla ilgilerine göre yeniden puanlar ve sıralar; “effectively reducing the overall document pool.” (Türkçesi: genel belge havuzunu etkin biçimde küçültür.) Yalnızca üstte kalanlar bağlama girer.
  5. İsteme top-k ekleme. En iyi pasajlar kullanıcının sorgusuyla birleştirilir ve üreticiye verilir.

Chunking kırılgan halkadır. Anthropic, “traditional RAG solutions remove context when encoding information” (Türkçesi: geleneksel RAG çözümleri bilgiyi kodlarken bağlamı kaldırır.) diye belirledi — belgesinden çekilen bir parça, onu anlamlı yapan çevresindeki bağlamı kaybeder. Contextual Retrieval tekniği (dizine eklemeden önce parçaya özgü bağlamı öne ekleme), başarısız getirmeleri %49 azalttı; yeniden sıralamayla birlikte bu oran %67 oldu. Bu, chunking sorununun gerçek olduğuna ve kendi kendine yeten, bağlamı zengin pasajların doğru getirilmesinin daha kolay olduğuna dair güçlü bir sinyaldir.

Naive, advanced ve agentic RAG

Araştırma literatürü (Gao ve ark., 2023), RAG’yi yararlı bir taksonomiye ayırır:

  • Naive RAG“a traditional process that includes indexing, retrieval, and generation.” (Türkçesi: dizine ekleme, getirme ve üretim içeren geleneksel bir süreç.) Top-k’yi bir kez getirir, bir kez üretir. “struggles with precision and recall, leading to the selection of misaligned or irrelevant chunks.” (Türkçesi: kesinlik ve geri çağırmada zorlanır; uyumsuz veya ilgisiz parçalar seçilir.)
  • Advanced RAG“pre-retrieval and post-retrieval strategies” (Türkçesi: getirme öncesi ve sonrası stratejiler) ekler. Getirme öncesi: sorgu yeniden yazımı ve daha iyi dizine ekleme (HyDE dahil; model varsayımsal bir yanıt üretir, onu embed eder ve soru yerine yanıta benzeyen belgeleri getirir). Getirme sonrası: yeniden sıralama ve bağlam sıkıştırma.
  • Modüler / agentic RAG — model getirir, eksik kalan şey üzerine akıl yürütür ve birden çok atlama boyunca yineleyerek yeniden getirir. AI aramanın güncel durumu budur. Michael King’in ifadesiyle: “The retrieve-once-then-generate pattern that defined the first wave is obsolete… Agentic RAG is now the default.” (Türkçesi: ilk dalgayı tanımlayan bir kez getir-sonra-üret kalıbı artık geçersiz… Agentic RAG artık varsayılandır.)

Bu, SEO için önemlidir; çünkü içerik artık tek bir getirme geçişinden değil, birden çok getirme turundan ve çelişki kontrolünden geçmek zorundadır.

RAG halüsinasyonları ortadan kaldırır mı? Hayır.

In one evaluation, Gemma answered incorrectly on 10.2% of questions with no context and 66.1% with insufficient context; this is not a universal model effect. Kaynak: Data: Google Research

Two bars report Gemma's incorrect-answer rate in one Google Research evaluation. With no context, the rate is 10.2 percent. With insufficient context, the rate is 66.1 percent. The comparison comes from Google Research's ICLR 2025 sufficient-context study and should not be generalized to every model, dataset, or retrieval system.

RAG yanıtları getirilen kaynaklara dayandırabilir, ancak LLM getirdiği şeyi yine yanlış okuyabilir veya fazla yorumlayabilir. Google Research (ICLR 2025), bir değerlendirmede sezgiye aykırı bir sonuç belgeledi: Gemma, bağlam olmadan soruların %10,2’sinde; yetersiz bağlamla ise %66,1’inde yanlış yanıt üretti. Araştırmacılar, modellerin “excel with sufficient context but fail to recognize when context is insufficient.” (Türkçesi: yeterli bağlamla başarılı olurken bağlamın yetersiz olduğunu fark edemeyebildiğini) bildirdi. Bunu model ve değerlendirmeye özgü bir uyarı olarak ele alın; getirmenin evrensel olarak daha kötü yanıtlar doğurduğunun kanıtı değildir. Pratik ders daha dardır: getirme kalitesi ile bağlam yeterliliği varsayılmamalı, değerlendirilmelidir. Google bu bulguyu Vertex AI RAG Engine’de bir LLM yeniden sıralayıcısı olarak uyguladı.

RAG ve fine-tuning karşılaştırması

Bunlar sürekli birbirine karıştırılır, ancak temelden farklıdır:

  • RAG, sorgu zamanında harici bilgiyi getirir. Ağırlıklar değişmez. Güncel/değişen bilgi, alıntı gereksinimi ve maliyet için uygundur. Araştırma, “RAG consistently outperforms [unsupervised fine-tuning], for both existing knowledge encountered during training and entirely new knowledge.” (Türkçesi: RAG, hem eğitim sırasında karşılaşılan mevcut bilgi hem de tamamen yeni bilgi için denetimsiz fine-tuning’den sürekli daha iyi performans gösterir.) sonucunu buldu.
  • Fine-tuning, ayrı bir eğitim çalışmasında modelin ağırlıklarını değiştirir. Tarz ve davranışı değiştirmek veya değişmeyen kararlı alan bilgisini öğretmek için uygundur.

En yeni gerçekleri bir modelin bilmesini sağlamak için RAG’ye; nasıl konuştuğunu değiştirmek için fine-tuning’e başvurursunuz.

Gerçek dünyada RAG: Google, ChatGPT, Perplexity

  • Google AI Overviews. Google RAG’yi “a technique (also known as grounding)… relying on our core Search ranking systems to retrieve relevant, up-to-date web pages from our Search index.” (Türkçesi: ilgili ve güncel web sayfalarını Search dizinimizden getirmek için temel Search sıralama sistemlerimize dayanan bir teknik, grounding olarak da bilinir.) diye adlandırır. İki sonuç çıkar. Birincisi, ayrı bir AI dizini yoktur“our generative AI features on Google Search are rooted in our core Search ranking and quality systems.” (Türkçesi: Google Search’teki üretken AI özelliklerimiz temel Search sıralama ve kalite sistemlerimize dayanır.) İkincisi, Google query fan-out çalıştırır: “concurrent, related queries generated by the model to request more information.” (Türkçesi: daha fazla bilgi istemek için modelin ürettiği eş zamanlı, ilişkili sorgular.) Tek bir soru birden çok alt sorgu üretebilir ve her biri farklı içerik getirebilir — bu nedenle içeriğiniz yalnızca ana sorguyu değil, ima edilen alt soruları da karşılamalıdır.
  • ChatGPT Search. Ekim 2024’te veri ortağı Bing ile başlatıldı; OpenAI’nin kendi tarayıcı belgeleri, OAI-SearchBot’un arama alıntıları için GPTBot’un eğitim taramasından ayrı olarak bağımsız getirme ve dizine ekleme yaptığını doğrular. OpenAI, Bing ile kendi dizini arasındaki güncel getirme karışımını yayımlamadı ve ChatGPT Search’ü Bing’in üzerine kurulmuş bir arayüzden çok bağımsız rakip olarak konumlandırdı — bu yüzden “temelde Bing” ifadesini basitleştirme olarak ele alın. Belgelenmiş, uygulanabilir kaldıraç daha dardır ve daha kalıcıdır: OAI-SearchBot’u robots.txt içinde engellemeyin; OpenAI’nin arama alıntıları için içeriği dizine ekleyen tarayıcı olarak adlandırdığı bot budur.
  • Perplexity. Özel embedding modelleri ve katı bir yeniden sıralama eşiğiyle hibrit getirme (Vespa.ai — BM25 + yoğun) üzerine kuruludur: üçüncü taraf analize göre getirilen 60’tan fazla kaynağın yalnızca yaklaşık üst %30’u üretim aşamasına kalır ve “citations are not retrofitted post-generation — they are structurally assigned during context assembly.” (Türkçesi: alıntılar üretimden sonra eklenmez; bağlam oluşturulurken yapısal olarak atanır.) Deep Research, agentic döngüyü düzinelerce arama boyunca çalıştırır.

RAG SEO için ne anlama gelir?

Jargonu kaldırınca oyun planı somuttur:

  • Dizinde olmak ön koşuldur — nokta. Ayrı bir AI dizini olmadığı için tarama → dizine ekleme → getirme zinciri sağlam olmalıdır. Bir sayfa taranamıyor veya dizine eklenemiyorsa AI yanıtına getirilemez. Kendi havuzlarını oluşturan AI motorları için de aynısı geçerlidir: OAI-SearchBot ve PerplexityBot gibi AI tarayıcılarının sizi getirmesine izin verilmelidir; yoksa bu yanıtlar için görünmezsiniz.
  • Kendi kendine yeten pasajlar yazın. RAG bütün sayfaları değil parçaları getirir. iPullRank’ten Francine Monahan’ın ifadesiyle AI sistemleri “fragments of pages rather than the page as a whole” (Türkçesi: sayfanın bütünü yerine sayfa parçalarını) inceler; bu nedenle tek başına belirli bir soruyu yanıtlayan “stand-out passages and phrases” (Türkçesi: öne çıkan pasajlar ve ifadeler) oluşturun. İyi SEO’nun zaten ödüllendirdiği H2/H3 yapısı ve açık konu cümleleri tam olarak budur. Google, AI için içeriği küçük parçalara ayırmamanızı açıkça söyler — iyi yapılandırılmış içerik kendi başına iyi parçalanır.
  • Alt konuları kapsayın. Query fan-out, tek bir sorunun birçok getirmeyi tetikleyebileceği anlamına gelir. İlişkili alt sorulardaki derinlik, tek bir anahtar kelimenin çevresine doldurulmuş tek sayfadan daha değerlidir.
  • Otorite, sıralama konumundan daha çok alıntı getirir. 8 000 alıntılık bir analizden: “Strong organic search presence and broad web visibility leads to AI citations, not the other way around” (Türkçesi: güçlü organik arama varlığı ve geniş web görünürlüğü AI alıntılarına yol açar; tersi değil) ve “highly authoritative content from a lower-ranking page” (Türkçesi: daha düşük sıralı bir sayfadaki son derece otoriter içerik) bazen daha az güvenilir üst sıralı bir sayfa yerine alıntılanır. Kendi verilerim de uyumlu (AI Overview alıntı araştırmam): yoğun bağlantı verilen sayfalardaki bahsedilmeler AI Overview’a dahil olmanın en güçlü tahmincisidir (ρ ≈ 0,70) ve markalı web bahsetmeleri 75 000 marka genelinde yaklaşık 0,66 ile ilişkilidir.
  • Güncel içeriğin avantajı vardır. AI alıntıları organik sonuçlardan anlamlı biçimde daha güncel olma eğilimindedir; dolayısıyla güncellik önemlidir.

Tek cümlelik sürüm isterseniz: RAG SEO’nun yerini almadı — SEO’nun her zaman bulunabilir ve açık olmakla ilgili olan bölümlerindeki çıtayı yükseltti.

Add an expert note

Pin an expert quote

New person? Create their unclaimed profile at /admin/experts/ → Pin a quote first.