التوليد المعزز بالاسترجاع (RAG)

كيف يعمل RAG — نمط الاسترجاع ثم التوليد وراء Google AI Overviews وChatGPT Search وPerplexity — وما يعنيه ذلك لاستشهاد الأنظمة بمحتواك.

نُشر أول مرة: 24 يونيو 2026 · آخر تحديث: 13 أغسطس 2026 · متقدم

RAG (التوليد المعزز بالاسترجاع) هو نمط الاسترجاع ثم التوليد وراء بحث الذكاء الاصطناعي. ينفذ مرحلتين وقت الاستعلام: الاسترجاع للعثور على مقاطع ذات صلة من فهرس خارجي، ثم التوليد المعزز لتمريرها إلى نموذج لغوي كبير كي يكتب إجابة مستندة إلى الأدلة ومصحوبة باستشهادات، من دون تغيير أوزان النموذج. وتتسلسل مرحلة الاسترجاع هكذا: التقطيع → التضمينات → البحث المتجهي → إعادة الترتيب → أعلى k. يقلل RAG الهلوسات لكنه لا يقضي عليها، وقد يزيدها السياق غير الكافي. وفي SEO لا يوجد فهرس ذكاء اصطناعي منفصل؛ فقابلية الزحف والفهرسة وبناء مقاطع واضحة مكتفية بذاتها شروط مسبقة للاسترجاع والاستشهاد.

جمع نظام Lewis وزملائه لعام 2020 بين توليد التسلسل والاسترجاع الكثيف من فهرس غير معلمي. دليل على هذا الادعاء The original RAG paper combined a pretrained sequence-to-sequence model with a non-parametric dense-vector index retrieved during generation. النطاق: Lewis et al.'s 2020 RAG architecture and experiments, not every modern retrieval system. مستوى الثقة: مرتفع · تم التحقق: Lewis et al.: Retrieval-Augmented Generation ويعرّف العرض الحالي من Google Cloud ‏RAG على نحو أوسع بأنه تزويد النموذج بمعرفة خارجية مسترجعة. دليل على هذا الادعاء Google Cloud describes RAG as retrieving relevant information from external knowledge sources and providing it to a model to improve generated responses. النطاق: General RAG architecture in Google Cloud documentation; quality depends on retrieval, source quality, and generation. مستوى الثقة: مرتفع · تم التحقق: Google Cloud: RAG overview

الخلاصة — ‏RAG نمط ذو مرحلتين يعمل وقت الاستدلال: الاسترجاع (العثور على مقاطع ذات صلة في مجموعة خارجية)، ثم التوليد المعزز (تمرير تلك المقاطع إلى نموذج لغوي كبير لإنتاج إجابة مؤسَّسة على الأدلة ومصحوبة باستشهادات). لا تتغير الأوزان أبداً؛ فهو يجمع ذاكرة النموذج المعلمية مع ذاكرة غير معلمية مسترجعة مباشرة. وتتسلسل مرحلة الاسترجاع هكذا: التقطيع → التضمينات → البحث المتجهي → إعادة الترتيب → أعلى k. ينفذ RAG «الساذج» الاسترجاع ثم التوليد؛ ويضيف RAG المتقدم إعادة كتابة الاستعلام وإعادة الترتيب؛ بينما يضيف RAG الوكيلي استرجاعاً تكرارياً متعدد القفزات. يمكن للاسترجاع إسناد الإجابات إلى الأدلة، لكنه لا يضمن صحتها؛ ففي أحد تقييمات Gemma، تزامن السياق غير الكافي مع مزيد من الإجابات الخاطئة. وبالنسبة إلى SEO، لا يوجد فهرس ذكاء اصطناعي منفصل؛ فقابلية الزحف والفهرسة ووضوح المقاطع هي شروط الاسترجاع.

المرحلتان (ولماذا يمثل «وقت الاستدلال» جوهر الفكرة)

الاسترجاع مسار متتابع: قطّع، وضمّن، وابحث، وأعد الترتيب، ثم مرر أفضل المقاطع إلى النموذج. المصدر: /ai-search/how-search-works/rag/

تعمل خمس مراحل من اليسار إلى اليمين وقت الاستدلال. يقسم التقطيع المستندات إلى مقاطع قابلة للاسترجاع. تمثل التضمينات كل مقطع بمتجه كثيف. يسترجع البحث المتجهي المرشحين، وتجمعه بعض الأنظمة مع بحث الكلمات المفتاحية BM25. تعيد مرحلة الترتيب تقييم المرشحين وتقلص عددهم. ثم تدخل المقاطع الأعلى ترتيباً في سياق النموذج، من دون أن تتغير أوزانه.

© Patrick Stox LLC · CC BY 4.0 ·

يجمع RAG بين ذاكرة النموذج المدربة والسياق المسترجع وقت الاستعلام — من دون تغيير الأوزان. المصدر: /ai-search/how-search-works/rag/

يغذي مصدران خطوة توليد واحدة. الذاكرة المعلمية هي المعرفة المشفرة في أوزان النموذج أثناء التدريب، وتحدها بيانات التدريب وتاريخ توقفها. وتتكون الذاكرة غير المعلمية من مقاطع مسترجعة من فهرس خارجي وقت الاستعلام. يستخدم التوليد كليهما مع بقاء الأوزان بلا تغيير، فينتج إجابة يمكن إسنادها إلى المصادر المسترجعة والاستشهاد بها؛ لكن ذلك لا يضمن صحتها.

© Patrick Stox LLC · CC BY 4.0 ·

إذا فككت الاختصار حصلت على النموذج: الاسترجاع والتوليد المعزز. يصل استعلام؛ فيسترجع النظام أكثر المقاطع صلة من مجموعة خارجية؛ ويدخلها في نافذة سياق النموذج اللغوي الكبير؛ ثم يولّد النموذج إجابة مستندة إليها.

التفصيل الذي يخطئ فيه الجميع: يحدث هذا وقت الاستدلال، ولا تُمس أوزان النموذج. RAG ليس تدريباً ولا ضبطاً دقيقاً. صاغت ورقة 2020 الأصلية لباتريك Lewis وزملائه في Facebook AI Research الفكرة على أنها جمع بين نوعين من الذاكرة: ذاكرة معلمية (معرفة مضمّنة في الأوزان أثناء التدريب)، وذاكرة غير معلمية (معرفة تُسترجع مباشرة من فهرس). يستخدم RAG النوعين معاً. وتلخص AWS الجدوى العملية بوضوح: إعادة تدريب نموذج تأسيسي على معرفة حديثة أو خاصة بمجال معين مكلفة، و*“RAG is a more cost-effective approach to introducing new data to the LLM.”* (ترجمة) «يُعد RAG نهجاً أقل تكلفة لإدخال بيانات جديدة إلى النموذج اللغوي الكبير.»

(أما التسمية فكانت، في الواقع، مصادفة. فقد أقر Lewis لاحقاً: “We definitely would have put more thought into the name had we known our work would become so widespread… We always planned to have a nicer sounding name, but when it came time to write the paper, no one had a better idea.” (ترجمة) «كنا بالتأكيد سنفكر أكثر في الاسم لو عرفنا أن عملنا سيصبح واسع الانتشار إلى هذا الحد… خططنا دائماً لاختيار اسم أجمل، لكن عندما حان وقت كتابة الورقة لم تكن لدى أحد فكرة أفضل.»)

داخل مرحلة الاسترجاع

تختصر عبارة «استرجاع المقاطع ذات الصلة» عملاً كثيراً. ففي النظام الفعلي تكون العملية مسار معالجة متتابع:

  1. التقطيع. تُقسّم المستندات إلى أجزاء قابلة للاسترجاع. وحجم الجزء مقايضة حقيقية: إذا كان صغيراً جداً فقد المقطع سياقه، وإذا كان كبيراً جداً أغرق ميزانية الرموز بمعلومات غير ذات صلة. وتتراوح الاستراتيجيات من أعداد رموز ثابتة (100/256/512)، إلى نوافذ تكرارية/منزلقة، إلى “Small2Big” (استرجاع جملة صغيرة وإعادة الجزء الأب للتوليد).
  2. التضمينات. يتحول كل جزء إلى متجه كثيف — تمثيل رقمي لمعناه — كي يُحسب التشابه دلالياً لا بمطابقة الكلمات المفتاحية. ولهذا يُسترجع محتوى عن موضوع حتى إن لم يستخدم صياغة الاستعلام نفسها.
  3. البحث المتجهي. يُضمّن الاستعلام أيضاً، ثم يعثر النظام على الأجزاء الأقرب إليه متجهياً. وتشغّل معظم البيئات الإنتاجية بحثاً هجينا — استرجاعاً بمتجهات كثيفة إضافة إلى بحث الكلمات المفتاحية BM25 — لأن كلاً منهما يستدرك ما يفوته الآخر.
  4. إعادة الترتيب. يعيد نموذج منفصل تقييم المرشحين حسب صلتهم بالاستعلام ويرتبهم، “effectively reducing the overall document pool.” (ترجمة) «وبذلك يقلّص مجموعة المستندات الإجمالية فعلياً». ولا يدخل السياق إلا أفضل المقاطع بعد إعادة ترتيبها.
  5. إدخال أعلى k في الموجّه. تُضم المقاطع الأفضل إلى استعلام المستخدم وتُمرر إلى المولّد.

التقطيع هو الحلقة الهشة. فقد وجدت Anthropic أن “traditional RAG solutions remove context when encoding information” (ترجمة) «حلول RAG التقليدية تزيل السياق عند ترميز المعلومات» — فالجزء المنتزع من مستنده يفقد السياق المحيط الذي منحه معناه. وخفضت تقنية الاسترجاع السياقي لديها (إضافة سياق خاص بكل جزء قبل الفهرسة) حالات فشل الاسترجاع بنسبة 49 %، وبنسبة 67 % عند جمعها مع إعادة الترتيب. وهذه إشارة قوية إلى أن مشكلة التقطيع حقيقية، وأن المقاطع المستقلة الغنية بالسياق أسهل استرجاعاً على نحو صحيح.

‏RAG الساذج والمتقدم والوكيلي

تقسم أدبيات المسح (Gao وآخرون، 2023) ‏RAG إلى تصنيف مفيد:

  • RAG الساذج“a traditional process that includes indexing, retrieval, and generation.” (ترجمة) «عملية تقليدية تشمل الفهرسة والاسترجاع والتوليد.» يسترجع أعلى k مرة واحدة ويولّد مرة واحدة. وهو “struggles with precision and recall, leading to the selection of misaligned or irrelevant chunks.” (ترجمة) «يعاني في الدقة والاستدعاء، مما يؤدي إلى اختيار أجزاء غير متوافقة أو غير ذات صلة.»
  • RAG المتقدم — يضيف “pre-retrieval and post-retrieval strategies.” (ترجمة) «استراتيجيات ما قبل الاسترجاع وما بعد الاسترجاع.» قبل الاسترجاع: إعادة كتابة الاستعلام وتحسين الفهرسة (ومن ذلك HyDE، حيث يولّد النموذج إجابة افتراضية ويضمّن تلك الإجابة ثم يسترجع مستندات تشبه الإجابات لا الأسئلة). وبعد الاسترجاع: إعادة الترتيب وضغط السياق.
  • RAG الوحداتي/الوكيلي — يسترجع النموذج ثم يستدل بشأن ما لا يزال مفقوداً، ويسترجع من جديد عبر قفزات متعددة. وهذه هي الحالة الراهنة لبحث الذكاء الاصطناعي. وكما قال Michael King: “The retrieve-once-then- generate pattern that defined the first wave is obsolete… Agentic RAG is now the default.” (ترجمة) «أصبح نمط الاسترجاع مرة واحدة ثم التوليد، الذي ميّز الموجة الأولى، متقادماً… وRAG الوكيلي هو الوضع الافتراضي الآن.»

يهم ذلك SEO لأن المحتوى مطالب الآن باجتياز جولات استرجاع متعددة وفحص التناقضات، لا مجرد اجتياز استرجاع واحد.

هل يقضي RAG على الهلوسات؟ لا.

في تقييم واحد، أجابت Gemma خطأً عن 10,2 % من الأسئلة من دون سياق وعن 66,1 % مع سياق غير كافٍ؛ وليست هذه نتيجة عامة لكل النماذج. المصدر: البيانات: Google Research

يعرض عمودان معدل إجابات Gemma الخاطئة في تقييم واحد من Google Research. بلغ المعدل 10,2 % من دون سياق و66,1 % مع سياق غير كافٍ. تأتي المقارنة من دراسة Google Research عن كفاية السياق في ICLR 2025، ولا ينبغي تعميمها على كل نموذج أو مجموعة بيانات أو نظام استرجاع.

يمكن لـ RAG إسناد الإجابات إلى المصادر المسترجعة، لكن النموذج اللغوي الكبير قد يسيء قراءة ما استرجعه أو يفرط في تفسيره. وثّقت Google Research ‏(ICLR 2025) نتيجة مخالفة للتوقعات في تقييم واحد: قدّمت Gemma إجابات خاطئة عن 10,2 % من الأسئلة من دون سياق، و66,1 % مع سياق غير كافٍ. وذكر الباحثون أن النماذج قد “excel with sufficient context but fail to recognize when context is insufficient.” (ترجمة) «تتفوق مع السياق الكافي لكنها تفشل في إدراك أن السياق غير كافٍ.» تعامل مع ذلك بوصفه تحذيراً خاصاً بالنموذج والتقييم، لا دليلاً على أن الاسترجاع يسبب إجابات أسوأ دائماً. والدرس العملي أضيق: يجب تقييم جودة الاسترجاع وكفاية السياق بدلاً من افتراضهما. وقد حوّلت Google النتيجة إلى أداة إعادة ترتيب بنموذج لغوي كبير في Vertex AI RAG Engine.

‏RAG مقابل الضبط الدقيق

يخلط الناس بينهما باستمرار، مع أنهما مختلفان جذرياً:

  • RAG يسترجع معلومات خارجية وقت الاستعلام. ولا يغير الأوزان. وهو الأنسب للمعلومات الحديثة/المتغيرة، ومتطلبات الاستشهاد، والتكلفة. ووجد المسح أن “RAG consistently outperforms [unsupervised fine-tuning], for both existing knowledge encountered during training and entirely new knowledge.” (ترجمة) «يتفوق RAG باستمرار على [الضبط الدقيق غير الخاضع للإشراف]، سواء للمعرفة القائمة التي صودفت أثناء التدريب أم للمعرفة الجديدة كلياً.»
  • الضبط الدقيق يعدّل أوزان النموذج في جولة تدريب منفصلة. وهو الأنسب لتغيير الأسلوب والسلوك أو لتعليم معرفة مستقرة بمجال لا تتغير.

تستخدم RAG لجعل النموذج يعرف أحدث الحقائق، وتستخدم الضبط الدقيق لتغيير كيفية حديثه.

‏RAG في الواقع: Google وChatGPT وPerplexity

  • Google AI Overviews. تسمي Google ‏RAG “a technique (also known as grounding)… relying on our core Search ranking systems to retrieve relevant, up-to-date web pages from our Search index.” (ترجمة) «تقنية (تُعرف أيضاً بالتأسيس)… تعتمد على أنظمة ترتيب البحث الأساسية لدينا لاسترجاع صفحات ويب حديثة وذات صلة من فهرس البحث لدينا.» ويترتب على ذلك أمران. أولاً، لا يوجد فهرس ذكاء اصطناعي منفصل“our generative AI features on Google Search are rooted in our core Search ranking and quality systems.” (ترجمة) «ترتكز ميزات الذكاء الاصطناعي التوليدي في بحث Google على أنظمة ترتيب البحث والجودة الأساسية لدينا.» ثانياً، تنفذ Google توسيع الاستعلام: “concurrent, related queries generated by the model to request more information.” (ترجمة) «استعلامات متزامنة ومترابطة يولدها النموذج لطلب مزيد من المعلومات.» يمكن لسؤال واحد أن يولّد عدة استعلامات فرعية، يسترجع كل منها محتوى مختلفاً؛ لذلك يجب أن يلبي محتواك الأسئلة الفرعية الضمنية، لا الاستعلام الرئيسي وحده.
  • ChatGPT Search. أُطلق (أكتوبر 2024) مع Bing شريكاً للبيانات، وتؤكد وثائق الزاحف الخاصة بـ OpenAI أن OAI-SearchBot ينفذ الجلب والفهرسة بصورة مستقلة لاستشهادات البحث، بعيداً عن زحف GPTBot للتدريب. ولم تنشر OpenAI مزيج الاسترجاع الحالي بين Bing وفهرسها الخاص، ثم قدّمت ChatGPT Search بوصفه منافساً مستقلاً لـ Bing لا مجرد غلاف له؛ لذا فإن القول إنه «Bing في الأساس» تبسيط مخل. الإجراء الموثق والأكثر دواماً أضيق: لا تحظر OAI-SearchBot في robots.txt، لأنه الزاحف الذي تسميه OpenAI نفسها بوصفه مفهرس المحتوى لاستشهادات البحث.
  • Perplexity. مبني على الاسترجاع الهجين (Vespa.ai — ‏BM25 + كثيف) مع نماذج تضمين مخصصة وعتبة صارمة لإعادة الترتيب. ووفق تحليل طرف ثالث، لا ينتقل إلى مرحلة التوليد سوى نحو أعلى 30 % من أكثر من 60 مصدراً مسترجعاً، كما أن “citations are not retrofitted post-generation — they are structurally assigned during context assembly.” (ترجمة) «الاستشهادات لا تضاف بأثر رجعي بعد التوليد؛ بل تُسند بنيوياً أثناء تجميع السياق.» وينفذ Deep Research الحلقة الوكيلية عبر عشرات عمليات البحث.

ما الذي يعنيه RAG لـ SEO؟

إذا نزعت المصطلحات التقنية، أصبح الدليل العملي واضحاً:

  • الوجود في الفهرس شرط مسبق — بلا استثناء. يعني عدم وجود فهرس ذكاء اصطناعي منفصل ضرورة سلامة سلسلة الزحف → الفهرسة → الاسترجاع. فإذا تعذر الزحف إلى صفحة وفهرستها، تعذر استرجاعها في إجابة ذكاء اصطناعي. وينطبق ذلك أيضاً على محركات الذكاء الاصطناعي التي تبني مجموعاتها الخاصة: يجب السماح لـ زواحف الذكاء الاصطناعي مثل OAI-SearchBot وPerplexityBot بجلب محتواك، وإلا فلن يظهر في تلك الإجابات.
  • اكتب مقاطع مستقلة مكتفية بذاتها. يسترجع RAG مقتطفات لا صفحات كاملة. وكما قالت Francine Monahan من iPullRank، تفحص أنظمة الذكاء الاصطناعي “fragments of pages rather than the page as a whole” (ترجمة) «مقتطفات من الصفحات بدلاً من الصفحة ككل»؛ لذا أنشئ “stand-out passages and phrases” (ترجمة) «مقاطع وعبارات بارزة» تجيب عن سؤال محدد بذاتها. وهذا هو تحديداً بناء H2/H3 والجمل الموضوعية الواضحة الذي يكافئه SEO الجيد أصلاً. وتقول Google صراحةً ألا تقطع المحتوى إلى أجزاء ضئيلة للذكاء الاصطناعي؛ فالمحتوى جيد التنظيم يتقطع جيداً من تلقاء نفسه.
  • غطِّ الموضوعات الفرعية. يعني توسيع الاستعلام أن سؤالاً واحداً قد يطلق عمليات استرجاع عديدة. والعمق عبر الأسئلة الفرعية المرتبطة أفضل من صفحة محشوة حول كلمة مفتاحية واحدة.
  • السلطة تحفز الاستشهاد أكثر من موضع الترتيب. خلص تحليل 8 000 استشهاد إلى أن “Strong organic search presence and broad web visibility leads to AI citations, not the other way around” (ترجمة) «الحضور القوي في البحث المجاني والظهور الواسع على الويب يؤديان إلى استشهادات الذكاء الاصطناعي، لا العكس»، وأن “highly authoritative content from a lower-ranking page” (ترجمة) «محتوى عالي الموثوقية من صفحة أقل ترتيباً» يُستشهد به أحياناً بدلاً من صفحة متصدرة أقل مصداقية. وتنسجم بياناتي مع ذلك (من بحثي عن استشهادات AI Overview): فالذكر في صفحات كثيرة الروابط هو أقوى مؤشر على الظهور في AI Overview ‏(ρ ≈ 0,70)، وارتبط ذكر العلامة التجارية على الويب بنحو 0,66 عبر 75 000 علامة تجارية.
  • للمحتوى الحديث أفضلية. تميل استشهادات الذكاء الاصطناعي إلى أن تكون أحدث بوضوح من النتائج المجانية، لذا تهم حداثة المحتوى.

إن أردت الخلاصة في جملة واحدة: لم يستبدل RAG ‏SEO، بل رفع أهمية الأجزاء من SEO التي تعلقت دائماً بسهولة العثور على المحتوى ووضوحه.

إضافة ملاحظة خبير

تثبيت اقتباس خبير

شخص جديد؟ أنشئ ملفه الشخصي غير المُطالَب بملكيته على /admin/experts/ → تثبيت اقتباس خبير أولًا.