التوليد المعزز بالاسترجاع (RAG)

كيف يعمل RAG — نمط الاسترجاع ثم التوليد وراء Google AI Overviews وChatGPT Search وPerplexity — وما يعنيه ذلك لاستشهاد الأنظمة بمحتواك.

نُشر أول مرة: 24 يونيو 2026 · آخر تحديث: 13 أغسطس 2026 · Advanced
اللغات

RAG (التوليد المعزز بالاسترجاع) هو نمط الاسترجاع ثم التوليد وراء بحث الذكاء الاصطناعي. ينفذ مرحلتين وقت الاستعلام: الاسترجاع للعثور على مقاطع ذات صلة من فهرس خارجي، ثم التوليد المعزز لتمريرها إلى نموذج لغوي كبير كي يكتب إجابة مستندة إلى الأدلة ومصحوبة باستشهادات، من دون تغيير أوزان النموذج. وتتسلسل مرحلة الاسترجاع هكذا: التقطيع → التضمينات → البحث المتجهي → إعادة الترتيب → أعلى k. يقلل RAG الهلوسات لكنه لا يقضي عليها، وقد يزيدها السياق غير الكافي. وفي SEO لا يوجد فهرس ذكاء اصطناعي منفصل؛ فقابلية الزحف والفهرسة وبناء مقاطع واضحة مكتفية بذاتها شروط مسبقة للاسترجاع والاستشهاد.

جمع نظام Lewis وزملائه لعام 2020 بين توليد التسلسل والاسترجاع الكثيف من فهرس غير معلمي. Evidence for this claim The original RAG paper combined a pretrained sequence-to-sequence model with a non-parametric dense-vector index retrieved during generation. Scope: Lewis et al.'s 2020 RAG architecture and experiments, not every modern retrieval system. Confidence: high · Verified: Lewis et al.: Retrieval-Augmented Generation ويعرّف العرض الحالي من Google Cloud ‏RAG على نحو أوسع بأنه تزويد النموذج بمعرفة خارجية مسترجعة. Evidence for this claim Google Cloud describes RAG as retrieving relevant information from external knowledge sources and providing it to a model to improve generated responses. Scope: General RAG architecture in Google Cloud documentation; quality depends on retrieval, source quality, and generation. Confidence: high · Verified: Google Cloud: RAG overview

الخلاصة — ‏RAG نمط ذو مرحلتين يعمل وقت الاستدلال: الاسترجاع (العثور على مقاطع ذات صلة في مجموعة خارجية)، ثم التوليد المعزز (تمرير تلك المقاطع إلى نموذج لغوي كبير لإنتاج إجابة مؤسَّسة على الأدلة ومصحوبة باستشهادات). لا تتغير الأوزان أبداً؛ فهو يجمع ذاكرة النموذج المعلمية مع ذاكرة غير معلمية مسترجعة مباشرة. وتتسلسل مرحلة الاسترجاع هكذا: التقطيع → التضمينات → البحث المتجهي → إعادة الترتيب → أعلى k. ينفذ RAG «الساذج» الاسترجاع ثم التوليد؛ ويضيف RAG المتقدم إعادة كتابة الاستعلام وإعادة الترتيب؛ بينما يضيف RAG الوكيلي استرجاعاً تكرارياً متعدد القفزات. يمكن للاسترجاع إسناد الإجابات إلى الأدلة، لكنه لا يضمن صحتها؛ ففي أحد تقييمات Gemma، تزامن السياق غير الكافي مع مزيد من الإجابات الخاطئة. وبالنسبة إلى SEO، لا يوجد فهرس ذكاء اصطناعي منفصل؛ فقابلية الزحف والفهرسة ووضوح المقاطع هي شروط الاسترجاع.

المرحلتان (ولماذا يمثل «وقت الاستدلال» جوهر الفكرة)

Retrieval is a pipeline: chunk, embed, search, re-rank, then hand the survivors to the model. المصدر: /ai-search/how-search-works/rag/

Five stages run left to right at inference time. Chunking splits documents into retrievable passages. Embeddings represent each passage as a dense vector. Vector search retrieves candidates and some systems combine it with BM25 keyword search. Re-ranking re-scores and narrows the candidate set. The top surviving passages enter the model context. The model's weights do not change.

© Patrick Stox LLC · CC BY 4.0 ·

RAG combines trained model memory with retrieved context at query time — without changing the weights. المصدر: /ai-search/how-search-works/rag/

Two sources feed one generation step. Parametric memory is knowledge encoded in the model weights during training and is limited by the training data and cutoff. Non-parametric memory consists of passages retrieved from an external index at query time. Generation uses both while the weights remain unchanged, producing an answer that can be grounded in and cite the retrieved sources; this does not guarantee correctness.

© Patrick Stox LLC · CC BY 4.0 ·

إذا فككت الاختصار حصلت على النموذج: الاسترجاع والتوليد المعزز. يصل استعلام؛ فيسترجع النظام أكثر المقاطع صلة من مجموعة خارجية؛ ويدخلها في نافذة سياق النموذج اللغوي الكبير؛ ثم يولّد النموذج إجابة مستندة إليها.

التفصيل الذي يخطئ فيه الجميع: يحدث هذا وقت الاستدلال، ولا تُمس أوزان النموذج. RAG ليس تدريباً ولا ضبطاً دقيقاً. صاغت ورقة 2020 الأصلية لباتريك Lewis وزملائه في Facebook AI Research الفكرة على أنها جمع بين نوعين من الذاكرة: ذاكرة معلمية (معرفة مضمّنة في الأوزان أثناء التدريب)، وذاكرة غير معلمية (معرفة تُسترجع مباشرة من فهرس). يستخدم RAG النوعين معاً. وتلخص AWS الجدوى العملية بوضوح: إعادة تدريب نموذج تأسيسي على معرفة حديثة أو خاصة بمجال معين مكلفة، و*“RAG is a more cost-effective approach to introducing new data to the LLM.”* (ترجمة) «يُعد RAG نهجاً أقل تكلفة لإدخال بيانات جديدة إلى النموذج اللغوي الكبير.»

(أما التسمية فكانت، في الواقع، مصادفة. فقد أقر Lewis لاحقاً: “We definitely would have put more thought into the name had we known our work would become so widespread… We always planned to have a nicer sounding name, but when it came time to write the paper, no one had a better idea.” (ترجمة) «كنا بالتأكيد سنفكر أكثر في الاسم لو عرفنا أن عملنا سيصبح واسع الانتشار إلى هذا الحد… خططنا دائماً لاختيار اسم أجمل، لكن عندما حان وقت كتابة الورقة لم تكن لدى أحد فكرة أفضل.»)

داخل مرحلة الاسترجاع

تختصر عبارة «استرجاع المقاطع ذات الصلة» عملاً كثيراً. ففي النظام الفعلي تكون العملية مسار معالجة متتابع:

  1. التقطيع. تُقسّم المستندات إلى أجزاء قابلة للاسترجاع. وحجم الجزء مقايضة حقيقية: إذا كان صغيراً جداً فقد المقطع سياقه، وإذا كان كبيراً جداً أغرق ميزانية الرموز بمعلومات غير ذات صلة. وتتراوح الاستراتيجيات من أعداد رموز ثابتة (100/256/512)، إلى نوافذ تكرارية/منزلقة، إلى “Small2Big” (استرجاع جملة صغيرة وإعادة الجزء الأب للتوليد).
  2. التضمينات. يتحول كل جزء إلى متجه كثيف — تمثيل رقمي لمعناه — كي يُحسب التشابه دلالياً لا بمطابقة الكلمات المفتاحية. ولهذا يُسترجع محتوى عن موضوع حتى إن لم يستخدم صياغة الاستعلام نفسها.
  3. البحث المتجهي. يُضمّن الاستعلام أيضاً، ثم يعثر النظام على الأجزاء الأقرب إليه متجهياً. وتشغّل معظم البيئات الإنتاجية بحثاً هجينا — استرجاعاً بمتجهات كثيفة إضافة إلى بحث الكلمات المفتاحية BM25 — لأن كلاً منهما يستدرك ما يفوته الآخر.
  4. إعادة الترتيب. يعيد نموذج منفصل تقييم المرشحين حسب صلتهم بالاستعلام ويرتبهم، “effectively reducing the overall document pool.” (ترجمة) «وبذلك يقلّص مجموعة المستندات الإجمالية فعلياً». ولا يدخل السياق إلا أفضل المقاطع بعد إعادة ترتيبها.
  5. إدخال أعلى k في الموجّه. تُضم المقاطع الأفضل إلى استعلام المستخدم وتُمرر إلى المولّد.

التقطيع هو الحلقة الهشة. فقد وجدت Anthropic أن “traditional RAG solutions remove context when encoding information” (ترجمة) «حلول RAG التقليدية تزيل السياق عند ترميز المعلومات» — فالجزء المنتزع من مستنده يفقد السياق المحيط الذي منحه معناه. وخفضت تقنية الاسترجاع السياقي لديها (إضافة سياق خاص بكل جزء قبل الفهرسة) حالات فشل الاسترجاع بنسبة 49 %، وبنسبة 67 % عند جمعها مع إعادة الترتيب. وهذه إشارة قوية إلى أن مشكلة التقطيع حقيقية، وأن المقاطع المستقلة الغنية بالسياق أسهل استرجاعاً على نحو صحيح.

‏RAG الساذج والمتقدم والوكيلي

تقسم أدبيات المسح (Gao وآخرون، 2023) ‏RAG إلى تصنيف مفيد:

  • RAG الساذج“a traditional process that includes indexing, retrieval, and generation.” (ترجمة) «عملية تقليدية تشمل الفهرسة والاسترجاع والتوليد.» يسترجع أعلى k مرة واحدة ويولّد مرة واحدة. وهو “struggles with precision and recall, leading to the selection of misaligned or irrelevant chunks.” (ترجمة) «يعاني في الدقة والاستدعاء، مما يؤدي إلى اختيار أجزاء غير متوافقة أو غير ذات صلة.»
  • RAG المتقدم — يضيف “pre-retrieval and post-retrieval strategies.” (ترجمة) «استراتيجيات ما قبل الاسترجاع وما بعد الاسترجاع.» قبل الاسترجاع: إعادة كتابة الاستعلام وتحسين الفهرسة (ومن ذلك HyDE، حيث يولّد النموذج إجابة افتراضية ويضمّن تلك الإجابة ثم يسترجع مستندات تشبه الإجابات لا الأسئلة). وبعد الاسترجاع: إعادة الترتيب وضغط السياق.
  • RAG الوحداتي/الوكيلي — يسترجع النموذج ثم يستدل بشأن ما لا يزال مفقوداً، ويسترجع من جديد عبر قفزات متعددة. وهذه هي الحالة الراهنة لبحث الذكاء الاصطناعي. وكما قال Michael King: “The retrieve-once-then- generate pattern that defined the first wave is obsolete… Agentic RAG is now the default.” (ترجمة) «أصبح نمط الاسترجاع مرة واحدة ثم التوليد، الذي ميّز الموجة الأولى، متقادماً… وRAG الوكيلي هو الوضع الافتراضي الآن.»

يهم ذلك SEO لأن المحتوى مطالب الآن باجتياز جولات استرجاع متعددة وفحص التناقضات، لا مجرد اجتياز استرجاع واحد.

هل يقضي RAG على الهلوسات؟ لا.

In one evaluation, Gemma answered incorrectly on 10.2% of questions with no context and 66.1% with insufficient context; this is not a universal model effect. المصدر: Data: Google Research

Two bars report Gemma's incorrect-answer rate in one Google Research evaluation. With no context, the rate is 10.2 percent. With insufficient context, the rate is 66.1 percent. The comparison comes from Google Research's ICLR 2025 sufficient-context study and should not be generalized to every model, dataset, or retrieval system.

يمكن لـ RAG إسناد الإجابات إلى المصادر المسترجعة، لكن النموذج اللغوي الكبير قد يسيء قراءة ما استرجعه أو يفرط في تفسيره. وثّقت Google Research ‏(ICLR 2025) نتيجة مخالفة للتوقعات في تقييم واحد: قدّمت Gemma إجابات خاطئة عن 10,2 % من الأسئلة من دون سياق، و66,1 % مع سياق غير كافٍ. وذكر الباحثون أن النماذج قد “excel with sufficient context but fail to recognize when context is insufficient.” (ترجمة) «تتفوق مع السياق الكافي لكنها تفشل في إدراك أن السياق غير كافٍ.» تعامل مع ذلك بوصفه تحذيراً خاصاً بالنموذج والتقييم، لا دليلاً على أن الاسترجاع يسبب إجابات أسوأ دائماً. والدرس العملي أضيق: يجب تقييم جودة الاسترجاع وكفاية السياق بدلاً من افتراضهما. وقد حوّلت Google النتيجة إلى أداة إعادة ترتيب بنموذج لغوي كبير في Vertex AI RAG Engine.

‏RAG مقابل الضبط الدقيق

يخلط الناس بينهما باستمرار، مع أنهما مختلفان جذرياً:

  • RAG يسترجع معلومات خارجية وقت الاستعلام. ولا يغير الأوزان. وهو الأنسب للمعلومات الحديثة/المتغيرة، ومتطلبات الاستشهاد، والتكلفة. ووجد المسح أن “RAG consistently outperforms [unsupervised fine-tuning], for both existing knowledge encountered during training and entirely new knowledge.” (ترجمة) «يتفوق RAG باستمرار على [الضبط الدقيق غير الخاضع للإشراف]، سواء للمعرفة القائمة التي صودفت أثناء التدريب أم للمعرفة الجديدة كلياً.»
  • الضبط الدقيق يعدّل أوزان النموذج في جولة تدريب منفصلة. وهو الأنسب لتغيير الأسلوب والسلوك أو لتعليم معرفة مستقرة بمجال لا تتغير.

تستخدم RAG لجعل النموذج يعرف أحدث الحقائق، وتستخدم الضبط الدقيق لتغيير كيفية حديثه.

‏RAG في الواقع: Google وChatGPT وPerplexity

  • Google AI Overviews. تسمي Google ‏RAG “a technique (also known as grounding)… relying on our core Search ranking systems to retrieve relevant, up-to-date web pages from our Search index.” (ترجمة) «تقنية (تُعرف أيضاً بالتأسيس)… تعتمد على أنظمة ترتيب البحث الأساسية لدينا لاسترجاع صفحات ويب حديثة وذات صلة من فهرس البحث لدينا.» ويترتب على ذلك أمران. أولاً، لا يوجد فهرس ذكاء اصطناعي منفصل“our generative AI features on Google Search are rooted in our core Search ranking and quality systems.” (ترجمة) «ترتكز ميزات الذكاء الاصطناعي التوليدي في بحث Google على أنظمة ترتيب البحث والجودة الأساسية لدينا.» ثانياً، تنفذ Google توسيع الاستعلام: “concurrent, related queries generated by the model to request more information.” (ترجمة) «استعلامات متزامنة ومترابطة يولدها النموذج لطلب مزيد من المعلومات.» يمكن لسؤال واحد أن يولّد عدة استعلامات فرعية، يسترجع كل منها محتوى مختلفاً؛ لذلك يجب أن يلبي محتواك الأسئلة الفرعية الضمنية، لا الاستعلام الرئيسي وحده.
  • ChatGPT Search. أُطلق (أكتوبر 2024) مع Bing شريكاً للبيانات، وتؤكد وثائق الزاحف الخاصة بـ OpenAI أن OAI-SearchBot ينفذ الجلب والفهرسة بصورة مستقلة لاستشهادات البحث، بعيداً عن زحف GPTBot للتدريب. ولم تنشر OpenAI مزيج الاسترجاع الحالي بين Bing وفهرسها الخاص، ثم قدّمت ChatGPT Search بوصفه منافساً مستقلاً لـ Bing لا مجرد غلاف له؛ لذا فإن القول إنه «Bing في الأساس» تبسيط مخل. الإجراء الموثق والأكثر دواماً أضيق: لا تحظر OAI-SearchBot في robots.txt، لأنه الزاحف الذي تسميه OpenAI نفسها بوصفه مفهرس المحتوى لاستشهادات البحث.
  • Perplexity. مبني على الاسترجاع الهجين (Vespa.ai — ‏BM25 + كثيف) مع نماذج تضمين مخصصة وعتبة صارمة لإعادة الترتيب. ووفق تحليل طرف ثالث، لا ينتقل إلى مرحلة التوليد سوى نحو أعلى 30 % من أكثر من 60 مصدراً مسترجعاً، كما أن “citations are not retrofitted post-generation — they are structurally assigned during context assembly.” (ترجمة) «الاستشهادات لا تضاف بأثر رجعي بعد التوليد؛ بل تُسند بنيوياً أثناء تجميع السياق.» وينفذ Deep Research الحلقة الوكيلية عبر عشرات عمليات البحث.

ما الذي يعنيه RAG لـ SEO؟

إذا نزعت المصطلحات التقنية، أصبح الدليل العملي واضحاً:

  • الوجود في الفهرس شرط مسبق — بلا استثناء. يعني عدم وجود فهرس ذكاء اصطناعي منفصل ضرورة سلامة سلسلة الزحف → الفهرسة → الاسترجاع. فإذا تعذر الزحف إلى صفحة وفهرستها، تعذر استرجاعها في إجابة ذكاء اصطناعي. وينطبق ذلك أيضاً على محركات الذكاء الاصطناعي التي تبني مجموعاتها الخاصة: يجب السماح لـ زواحف الذكاء الاصطناعي مثل OAI-SearchBot وPerplexityBot بجلب محتواك، وإلا فلن يظهر في تلك الإجابات.
  • اكتب مقاطع مستقلة مكتفية بذاتها. يسترجع RAG مقتطفات لا صفحات كاملة. وكما قالت Francine Monahan من iPullRank، تفحص أنظمة الذكاء الاصطناعي “fragments of pages rather than the page as a whole” (ترجمة) «مقتطفات من الصفحات بدلاً من الصفحة ككل»؛ لذا أنشئ “stand-out passages and phrases” (ترجمة) «مقاطع وعبارات بارزة» تجيب عن سؤال محدد بذاتها. وهذا هو تحديداً بناء H2/H3 والجمل الموضوعية الواضحة الذي يكافئه SEO الجيد أصلاً. وتقول Google صراحةً ألا تقطع المحتوى إلى أجزاء ضئيلة للذكاء الاصطناعي؛ فالمحتوى جيد التنظيم يتقطع جيداً من تلقاء نفسه.
  • غطِّ الموضوعات الفرعية. يعني توسيع الاستعلام أن سؤالاً واحداً قد يطلق عمليات استرجاع عديدة. والعمق عبر الأسئلة الفرعية المرتبطة أفضل من صفحة محشوة حول كلمة مفتاحية واحدة.
  • السلطة تحفز الاستشهاد أكثر من موضع الترتيب. خلص تحليل 8 000 استشهاد إلى أن “Strong organic search presence and broad web visibility leads to AI citations, not the other way around” (ترجمة) «الحضور القوي في البحث المجاني والظهور الواسع على الويب يؤديان إلى استشهادات الذكاء الاصطناعي، لا العكس»، وأن “highly authoritative content from a lower-ranking page” (ترجمة) «محتوى عالي الموثوقية من صفحة أقل ترتيباً» يُستشهد به أحياناً بدلاً من صفحة متصدرة أقل مصداقية. وتنسجم بياناتي مع ذلك (من بحثي عن استشهادات AI Overview): فالذكر في صفحات كثيرة الروابط هو أقوى مؤشر على الظهور في AI Overview ‏(ρ ≈ 0,70)، وارتبط ذكر العلامة التجارية على الويب بنحو 0,66 عبر 75 000 علامة تجارية.
  • للمحتوى الحديث أفضلية. تميل استشهادات الذكاء الاصطناعي إلى أن تكون أحدث بوضوح من النتائج المجانية، لذا تهم حداثة المحتوى.

إن أردت الخلاصة في جملة واحدة: لم يستبدل RAG ‏SEO، بل رفع أهمية الأجزاء من SEO التي تعلقت دائماً بسهولة العثور على المحتوى ووضوحه.

Add an expert note

Pin an expert quote

New person? Create their unclaimed profile at /admin/experts/ → Pin a quote first.