النماذج اللغوية الكبيرة (LLMs)
النموذج اللغوي الكبير يتنبأ بالرمز التالي عبر أنماط تعلمها من نصوص ضخمة، وتستخدمه أدوات البحث لقراءة الصفحات وكتابة إجابات الذكاء الاصطناعي.
اللغات
تعامل مع LLM كمحرك احتمالي للتوليد، لا كقاعدة حقائق. في البحث، تظل قابلية الزحف والفهرسة والاسترجاع شروطاً مسبقة قبل التوليد، وتساعد RAG على تأسيس الإجابة في مصادر حديثة.
الخلاصة — النموذج اللغوي الكبير (LLM) هو التقنية وراء أدوات مثل ChatGPT وAI Overviews من Google وBing Copilot. يعمل عبر التنبؤ بالكلمة التالية مراراً، بناءً على أنماط تعلّمها من كمية هائلة من النصوص. وهو لا «يعرف» أو «يفهم» الأشياء بالطريقة التي تفهمها أنت — بل يقدم تخمينات إحصائية جيدة جداً. وفي البحث، تقرأ LLMs صفحات الويب وتكتب إجابات الذكاء الاصطناعي التي تراها أعلى النتائج.
ما هو LLM
تتعلم النماذج اللغوية الكبيرة أنماطاً إحصائية عبر سلاسل الرموز، وتولّد النص بالتنبؤ بالاستمرارات. Evidence for this claim Large autoregressive language models are trained to predict tokens from preceding context and can perform varied language tasks through prompting. Scope: GPT-3 research findings; later models, training methods, and product systems differ. Confidence: high · Verified: Brown et al.: Language Models are Few-Shot Learners كما يعتمد سلوك المنتج على التوجيه والاسترجاع والأدوات والسياسات وإصدار النموذج. Evidence for this claim Applications can give a language model tools for web search, file search, code execution, or external functions. Scope: OpenAI API tool capabilities; tool access is configured separately and should not be conflated with the base model's stored knowledge. Confidence: high · Verified: OpenAI: Tools guide
النموذج اللغوي الكبير برنامج حاسوبي دُرّب على كمية هائلة من النصوص — الكتب والمقالات والمواقع — حتى أصبح جيداً جداً في مهمة واحدة: تخمين الكلمة (أو جزء الكلمة) التالي.
هذا هو معظم السحر فعلاً. عندما تكتب سؤالاً، يأخذ النموذج كلماتك ويتنبأ بالجزء التالي الأكثر احتمالاً، ثم التالي، ثم التالي، ويبني إجابة قطعةً بعد قطعة. وتعني «كبير» أنه ضخم — دُرّب على مليارات الأمثلة وبمليارات الإعدادات الداخلية.
الفكرة التي ينبغي أن تبقى في ذهنك: إن LLM يتنبأ، ولا يفكر. وينتج نصاً يبدو صحيحاً لأنه تعلّم أنماط تدفق اللغة المعتادة. ويتوافق ذلك مع الحقيقة معظم الوقت. لكنه لا يتوافق معها أحياناً — وعندما يختلق النموذج شيئاً بثقة، يسمى ذلك هلوسة.
كيف تظهر LLMs في البحث
عندما تبحث وترى ملخصاً كتبه الذكاء الاصطناعي في الأعلى — يسميه Google AI Overview — يكون LLM قد كتبه. وهذا هو المسار التقريبي:
- تكتب سؤالاً.
- يعثر محرك البحث على صفحات الويب المرتبطة (خطوة البحث العادية).
- يسلّم تلك الصفحات إلى LLM.
- يقرأها LLM ويكتب إجابة قصيرة، عادةً مع روابط إلى مصادرها.
الخلاصة المهمة لأي شخص لديه موقع: يلخص LLM في الغالب الصفحات التي عثر عليها محرك البحث مسبقاً. فإذا تعذر العثور على صفحتك وفهرستها بالطريقة العادية، فلن تظهر في إجابة الذكاء الاصطناعي أيضاً. والتقنية التي تغذي النموذج بصفحات ويب جديدة تسمى التوليد المعزز بالاسترجاع (RAG)، وهي الطريقة التي تحافظ بها هذه الأدوات على حداثتها رغم تدريبها على بيانات أقدم.
أي LLM يشغّل أي بحث
- Google يستخدم عائلة نماذجه الخاصة المسماة Gemini لـAI Overviews وAI Mode.
- Bing / Microsoft Copilot يستخدم GPT-4 من OpenAI (مخصصاً للبحث).
- Perplexity وChatGPT Search أداتان شائعتان أخريان للبحث بالذكاء الاصطناعي.
- Claude من Anthropic وLlama من Meta (نموذج مفتوح المصدر) نموذجان كبيران آخران ستسمع باسميهما.
أكثر ما يخطئ فيه الناس
لا يوجد «SEO خاص بـLLM» سري يستبدل SEO العادي. وقد قال العاملون في Google إن طريقة الظهور في AI Overviews هي استخدام ممارسات SEO العادية والفهرسة. ولا يزال العثور عليك وفهرستك شرطاً مسبقاً — فطبقة الذكاء الاصطناعي فوق البحث ولا تتجاوزه.
هل تريد النسخة التقنية — بنية Transformer ومواضع توقف المعرفة ونوافذ السياق وما أظهره بحث علامتي التجارية فعلاً مما يرتبط بالظهور في الذكاء الاصطناعي؟ انتقل إلى علامة التبويب Advanced.
الخلاصة — يقدّر LLM احتمال الرمز التالي ويولّد النص ذاتياً — وهذا هو المحرك كله. ويعمل على بنية Transformer التي تعالج تسلسلاً كاملاً بالتوازي عبر الانتباه، لا رمزاً بعد رمز مثل RNNs. وفي البحث توجد مهمتان مختلفتان: الفهم (مُرمِّزات على نمط BERT تساعد في الترتيب) والتوليد (Gemini وGPT-4 يكتبان إجابات الذكاء الاصطناعي). وتقيّد LLMs مواضع توقف المعرفة ونافذة سياق محدودة والهلوسة — ولهذا بالضبط يوجد RAG والتأسيس. وبالنسبة إلى SEO، تظل الفهرسة شرطاً مسبقاً، وفي دراسة Ahrefs لـ75 000 علامةتجارية من Louise Linehan وXibeijia Guan ارتبطت الإشارات النصية مثل الإشارات إلى العلامة التجارية بالظهور في AI Overview بقوة أكبر بنحو 3× من الروابط الخلفية.
ما هو LLM فعلياً
LLM ليس قاعدة بيانات لحقائق مضمونة، والمخرجات الفصيحة ليست دليلاً على الدقة. Evidence for this claim Large autoregressive language models are trained to predict tokens from preceding context and can perform varied language tasks through prompting. Scope: GPT-3 research findings; later models, training methods, and product systems differ. Confidence: high · Verified: Brown et al.: Language Models are Few-Shot Learners وقد تجمع منتجات البحث التي تستخدم LLMs بينها وبين أنظمة استرجاع وترتيب خارجية. Evidence for this claim Applications can give a language model tools for web search, file search, code execution, or external functions. Scope: OpenAI API tool capabilities; tool access is configured separately and should not be conflated with the base model's stored knowledge. Confidence: high · Verified: OpenAI: Tools guide
يقول Google عن النموذج اللغوي: “estimates the probability of a token or sequence of tokens occurring within a longer sequence of tokens.” (ترجمة) «يقدّر احتمال ظهور رمز أو سلسلة رموز ضمن سلسلة أطول من الرموز.» هذا هو الأساس. وLLM نسخة كبيرة جداً من ذلك: نموذج تعلم عميق بمليارات المعاملات دُرّب للتنبؤ بالرمز التالي عبر نصوص على نطاق الويب.
هناك شيئان يجعلان النموذج «كبيراً» وقادراً:
- الحجم. مليارات المعاملات، مدرَّبة على مجموعات نصية ضخمة. ومع نمو النماذج، تبدأ قدرات مثل التلخيص والاستدلال وإنشاء التعليمات البرمجية في الظهور من دون برمجتها صراحةً.
- بنية Transformer. قُدّمت في ورقة Google لعام 2017 الانتباه هو كل ما تحتاجه، وتعالج Transformers التسلسل كله مرة واحدة وتستخدم آلية انتباه بحيث يستطيع كل رمز «النظر» إلى كل رمز آخر. ويعرض ML Crash Course من Google الفرق مباشرةً: تستطيع النماذج اللغوية الكبيرة “can evaluate the whole context at once,” (ترجمة) «تقييم السياق كله دفعة واحدة»، بخلاف الشبكات العصبية المتكررة الأقدم التي عالجت “token by token” (ترجمة) «رمزًا بعد رمز» وعانت من “vanishing gradient problem.” (ترجمة) «مشكلة تلاشي التدرج».
يُدرَّب النموذج بالتنبؤ بالرمز التالي على نص خام، ثم يُصقل عادةً عبر RLHF (التعلم المعزز من الملاحظات البشرية) ليصبح أكثر فائدة وأماناً. وعند الاستدلال يولّد بصورة ذاتية الانحدار — رمزاً واحداً في كل مرة، مع إعادة إدخال كل تنبؤ كمدخل للتالي. ويتحكم إعداد يسمى temperature في عشوائية أخذ العينات.
من المفيد إبقاء المراحل منفصلة، لأن الناس يخلطون بينها باستمرار. Evidence for this claim Pretraining learns broad statistical representations, post-training changes model behavior toward instructions or preferences, and inference applies the resulting model to supplied context; prompt context does not by itself update model weights. Scope: General pipeline description across instruction-tuned LLMs; the exact post-training method (RLHF, DPO, or other) and how a given product layer handles session memory vary by provider and are not covered here. Confidence: high · Verified: Ouyang et al.: Training language models to follow instructions with human feedback ففي التدريب المسبق تُضبط الأوزان فعلياً — ويتعلم النموذج أنماطاً إحصائية عامة من التنبؤ بالرمز التالي عبر مجموعة ضخمة. ويعدّل ما بعد التدريب (RLHF وخطوات ضبط التفضيلات المشابهة) الأوزان نفسها مرة أخرى باتجاه التعليمات وسلوك السلامة. أما الاستدلال — ما يحدث عندما ترسل prompt — فلا يحدّث الأوزان إطلاقاً؛ بل يطبق النموذج ما تعلمه في مرحلتي التدريب على النص الذي تقدمه له. ولهذا أيضاً لا تعني نافذة السياق الطويلة أن النموذج «يتعلم» عنك: فالنص الإضافي مدخل لذلك الطلب الواحد، لا تحديث تدريب، ويختفي بانتهاء الجلسة ما لم تحفظه ميزة منتج منفصلة وتعيد تقديمه كذاكرة.
حافظ على نموذج ذهني صادق: هذه عملية احتمالية. ينتج النموذج إكمالات معقولة، لا حقائق تم التحقق منها.
الفهم مقابل التوليد: مهمتان مختلفتان
هذا هو التمييز الذي يوضح معظم الالتباس حول LLM في البحث.
- BERT (2019) نموذج ثنائي الاتجاه لا يعتمد على المُولِّد. يقول Google إنه ينظر إلى “the full context of a word by looking at the words that come before and after it.” (ترجمة) «السياق الكامل للكلمة بالنظر إلى الكلمات التي تسبقها وتليها.» وظيفة BERT هي الفهم — تفسير الاستعلامات والوثائق لتحسين الترتيب. وهو لا يولّد إجابات. وقال Google إن BERT سيساعد «البحث على فهم أفضل لواحد من كل 10 عمليات بحث في الولايات المتحدة باللغة الإنجليزية»، ووصفه Pandu Nayak بأنه “the biggest leap forward in the past five years.” (ترجمة) «أكبر قفزة إلى الأمام في السنوات الخمس الماضية.»
- Gemini / GPT-4 نموذجان توليديان (على نمط فك الترميز، ذاتيا الانحدار). ووظيفتهما التوليد — تركيب نص إجابة AI Overview أو Copilot من المقاطع المسترجعة.
لذلك عندما يسأل مختص SEO «هل يرتب LLM صفحتي؟» تكون الإجابة الصادقة: لقد أثر نموذج فهم على نمط BERT طويلاً في الترتيب؛ أما نموذج توليدي مثل Gemini فيكتب ملخص الذكاء الاصطناعي فوق ما أظهرته خطوة الاسترجاع. نماذج مختلفة، ومراحل مختلفة.
تطور LLM في بحث Google
خط زمني تقريبي، لأن السلالة مهمة:
- 2017 — الانتباه هو كل ما تحتاجه (Google Research): ورقة Transformer التي بُني عليها كل ما جاء بعدها.
- 2019 — BERT: أول LLM قائم على Transformer في ترتيب Google؛ «واحد من كل 10 عمليات بحث».
- 2021 — MUM: نموذج قائم على T5 بنحو 110 مليار معلمة، وصفه Google بأنه “1,000 times more powerful than BERT,” (ترجمة) «أقوى بألف مرة من BERT»، ومتعدد الوسائط ومدرَّب على أكثر من 75 لغة.
- 2023 — Gemini: “built from the ground up to be multimodal,” (ترجمة) «بُني من الأساس ليكون متعدد الوسائط»، ومدرَّب مسبقاً منذ البداية على وسائط متعددة؛ أُطلق في نسخ Ultra وPro وNano. وأبلغ Google أنه أول نموذج “outperform human experts on MMLU” (ترجمة) «يتفوق على الخبراء البشر في MMLU» (90,0%). (ترتبط أرقام المعايير مثل هذه بإصدار النموذج المحدد ومجموعة الاختبار وتاريخ التقييم الذي استخدمه المختبر؛ ولا تنتقل تلقائياً إلى تحديثات لاحقة من العائلة نفسها.)
- 2024 — AI Overviews (بعد تخرجها من SGE): تصل الطبقة التوليدية إلى صفحة النتائج.
- 2025 — AI Mode + Gemini 3: وصفت Elizabeth Reid Gemini 3 في Search بأنه يجلب “state-of-the-art reasoning, deep multimodal understanding and powerful agentic capabilities,” (ترجمة) «استدلالًا من أحدث طراز وفهمًا عميقًا متعدد الوسائط وقدرات وكيلية قوية»، مع توجيه النظام الأسئلة المعقدة بذكاء إلى Gemini 3 والمهام الأبسط إلى نماذج أسرع.
- 2026 — يصبح Gemini 3 الافتراضي لـAI Overviews. وفق Robby Stein: “Gemini 3 is now the default model for AI Overviews.” (ترجمة) «Gemini 3 هو الآن النموذج الافتراضي لـAI Overviews.»
Bing Copilot: GPT-4 + Prometheus + فهرس Bing
أكدت Microsoft في مارس 2023 أن “the new Bing is running on GPT-4, which we’ve customized for search,” (ترجمة) «Bing الجديدة تعمل على GPT-4، الذي خصصناه للبحث»، وأنه “as OpenAI makes updates to GPT-4 and beyond, Bing benefits from those improvements.” (ترجمة) «مع تحديث OpenAI لـGPT-4 وما بعده، تستفيد Bing من تلك التحسينات.»
القطعة التي تصل LLM مجمداً بالويب الحي هي نموذج Prometheus من Microsoft — الموصوف بأنه نموذج يجمع فهرس Bing الحديث مع قدرة GPT على الاستدلال. يعيد مسار Copilot صياغة استعلامك إلى سلاسل بحث، ويسترجع من فهرس Bing، ويجعل GPT يركّب إجابة مؤسسة ومستشهداً بالمصادر. (ملاحظة: يأتي هذا التفصيل عن المسار من تحليل تقني من طرف ثالث، لا من مواصفة Microsoft أولية — فتعامل مع الخطوات باعتبارها مبلّغاً عنها في المجال.)
كيف تنشئ AI Overviews إجابة فعلياً (مسار RAG)
السبب الذي يمكّن هذه الأنظمة من الإجابة عن أخبار اليوم رغم قِدم موضع توقف التدريب هو التوليد المعزز بالاسترجاع. وتعريف Google Cloud الخاص هو أن RAG “combines the strengths of traditional information retrieval systems with the capabilities of generative large language models.” (ترجمة) «يجمع RAG بين نقاط قوة أنظمة استرجاع المعلومات التقليدية وقدرات النماذج اللغوية الكبيرة التوليدية.» ومفاهيمياً:
- ترسل استعلاماً.
- تُفكك الاستعلامات المعقدة — عبر توسيع الاستعلام في Google — إلى استعلامات فرعية.
- يسترجع كل استعلام فرعي مقاطع مرشحة من الفهرس.
- تُحقن تلك المقاطع في نافذة سياق LLM — وهذا هو التأسيس، أي تثبيت الإجابة على المصادر المسترجعة لا على بيانات التدريب وحدها.
- يولّد LLM إجابة مركبة مع استشهادات.
- تُجرى فحوص السلامة والجودة، ثم تُعاد الإجابة.
الأثر على SEO هو سلسلة من البوابات. يجب أن يكون محتواك (أ) قابلاً للزحف بواسطة روبوتات الذكاء الاصطناعي، و(ب) مفهرساً، و(ج) ظاهراً عبر الاسترجاع، و(د) مختاراً على حساب المقاطع المنافسة، و(هـ) ممثلاً بدقة في المخرَج. والخروج من أي مرحلة يعني أنك لست في الإجابة.
القيود المهمة لمختصي SEO
| القيد | ماذا يعني لك |
|---|---|
| موضع توقف المعرفة | لا يعرف النموذج شيئاً بعد تاريخ تدريبه ما لم يزوده RAG بمحتوى حديث. وموضع التوقف لا يساوي تاريخ الإصدار — فقد يختلفان بأشهر. ويُبلّغ عن أن موضع توقف تدريب GPT-5 هو سبتمبر 2024. |
| نافذة السياق | لا يستطيع LLM معالجة إلا كمية محدودة من النص دفعة واحدة، مقاسة بالرموز. وهذا يحد كمية المحتوى المسترجع التي يمكن إدخالها — ولهذا يهم تقسيم المقاطع في الاسترجاع. |
| الهلوسة | يولّد النموذج إكمالات تبدو معقولة لكنها قد تكون خاطئة. إنها أثر إحصائي وليست كذباً. ووجد بحث Ahrefs أن المساعدين بالذكاء الاصطناعي يرسلون الزوار إلى صفحات 404 بمعدل 2,87× أكثر من Google Search. |
| خطر تغطية JavaScript | يختلف عرض زاحف الذكاء الاصطناعي حسب المزود، لذلك قد يفوّت المحتوى المعتمد على JS عندما يستخدم الجالب HTML الأولي فقط. |
| تقسيم المقاطع | تقسم أنظمة الاسترجاع الصفحات إلى مقاطع. وأشارت أبحاثي عن معالجة Chrome إلى مقاطع من نحو 200 كلمة وتحليل أول نحو 30 مقطعاً فقط من الصفحة — وقد لا يُسترجع المحتوى المدفون بعمق. |
ما يعنيه هذا لاستراتيجية المحتوى
هناك أمور قليلة أشعر بالراحة في قولها، منفصلة عن الأمور التي لا يعرفها فعلياً أحد خارج محركات البحث:
- الفهرسة لا تزال شرطاً مسبقاً. كان Gary Illyes صريحاً: “To get your content to appear in AI Overview, simply use normal SEO practices.” (ترجمة) «لكي يظهر محتواك في AI Overview، استخدم ممارسات SEO العادية فحسب.» ولا توجد إشارة مؤكدة تستهدف LLMs تحديداً. وبخصوص ملف llms.txt الذي حظي بضجة كبيرة، قال Illyes “Google doesn’t support LLMs.txt and isn’t planning to,” (ترجمة) «Google لا تدعم LLMs.txt ولا تخطط لذلك»، وشبّهه John Mueller بوسم الكلمات المفتاحية القديم.
- الإشارات إلى العلامة تتفوق على الروابط الخلفية في الظهور بالذكاء الاصطناعي. في دراستنا لـ75 000 علامة كانت الإشارات إلى العلامة في الويب أقوى ارتباطاً بظهور AI Overview (نحو 0,66) مقابل نحو 0,22 للروابط الخلفية — وارتبطت الإشارات النصية بقوة أكبر بنحو 3× من مقاييس الروابط. وكما قلنا، فإن LLMs “derive their understanding of a brand’s authority from words on the page, from the prevalence of particular words, the co-occurrence of different terms and topics, and the context in which those words are used.” (ترجمة) «تستمد فهمها لسلطة العلامة من الكلمات في الصفحة، وشيوع كلمات معينة، والتشارك في ظهور مصطلحات وموضوعات مختلفة، والسياق الذي تُستخدم فيه تلك الكلمات.»
- الفائز يأخذ كل شيء. حققت العلامات في الربع الأعلى من حيث إشارات الويب 169 إشارة AI Overview في المتوسط مقابل 14 للربع التالي — وكانت 26% من العلامات المدروسة بلا أي إشارة. وتراكم المواضع ذات السلطة والزيارات المرتفعة ظهورك في الذكاء الاصطناعي.
- الحداثة مفيدة. عبر تحليل لـ17 مليون استشهاد، فضّل المساعدون بالذكاء الاصطناعي الاستشهاد بمحتوى أحدث بشكل ذي معنى مما يظهر عادةً في النتائج العضوية.
- لا تحجب زواحف الذكاء الاصطناعي بشكل انعكاسي. قد يؤدي الحجب إلى خسارة الظهور في الذكاء الاصطناعي من دون مكسب SEO. وتذكر نقطة عمياء JavaScript أعلاه — إذا احتاج المحتوى إلى JavaScript ليظهر، فلن تراه معظم زواحف الذكاء الاصطناعي.
والتحفظ الصادق هو أن المحركات تتجنب باستمرار كشف كيفية عمل جانب الترتيب في AI Overviews. والقصة المؤكدة هي «افهرس المحتوى واستخدم SEO العادي». وكل ما بعد ذلك استنتاج — بما في ذلك استنتاجي.
ملخص الذكاء الاصطناعي
خلاصة مكثفة للنسخة المتقدمة:
- يتنبأ LLM بالرمز التالي ويولّد النص ذاتياً — عملية احتمالية وليست استدلالاً بشرياً. ويعمل على بنية Transformer (ورقة الانتباه هو كل ما تحتاجه لعام 2017)، التي تستخدم الانتباه لمعالجة تسلسل كامل بالتوازي بدلاً من رمز بعد رمز مثل RNNs.
- مهمتان في البحث: الفهم (BERT — مُرمِّز فقط، ثنائي الاتجاه، يساعد في الترتيب ولا يولّد) مقابل التوليد (Gemini وGPT-4 — يكتبان إجابات الذكاء الاصطناعي).
- التدريب مقابل الاستدلال: التدريب المسبق وما بعد التدريب (RLHF) هما موضع ضبط أوزان النموذج فعلياً؛ ولا يؤدي إرسال prompt عند الاستدلال إلى تحديث تلك الأوزان — فنافذة السياق الكبيرة مدخل لذلك الطلب، وليست ذاكرة أو تحديث تدريب.
- سلالة Google: BERT (2019) ← MUM (2021، نحو 110B معلمة، «أقوى 1,000× من BERT») ← Gemini (2023، متعدد الوسائط) ← AI Overviews (2024) ← Gemini 3 كافتراضي لـAI Overviews (2026).
- Bing Copilot يعمل على GPT-4 «المخصص للبحث»، وتوصله بالـBing الحي نموذج Prometheus.
- تستخدم AI Overviews RAG: توسعة الاستعلام ← استرجاع المقاطع ← تأسيسها في نافذة سياق LLM ← توليد إجابة مستشهد بها. يجب أن يكون محتواك قابلاً للزحف ومفهرساً ومسترجعاً ومختاراً وممثلاً بدقة.
- القيود الرئيسية: موضع توقف المعرفة (≠ تاريخ الإصدار)، ونافذة سياق محدودة، والهلوسة (تصيب أدوات الذكاء الاصطناعي صفحات غير موجودة بمعدل 2,87× أكثر من Google)، وعدم عرض JS، وتقسيم المقاطع (نحو 200 كلمة، وتحليل أول نحو 30 مقطعاً).
- لـSEO: الفهرسة شرط مسبق («استخدم ممارسات SEO العادية» ببساطة)؛ ارتبطت الإشارات إلى العلامة بقوة أكبر بنحو 3× من الروابط الخلفية بظهور AI Overview في دراسة 75 ألف علامة؛ والظهور في الذكاء الاصطناعي لعبة يفوز فيها طرف واحد؛ والحداثة مفيدة؛ ولا تحجب زواحف الذكاء الاصطناعي بصورة انعكاسية.
الوثائق الرسمية
وثائق المصادر الأولية عن LLMs في البحث.
- Google ML Crash Course — Large Language Models — تعريف Google الخاص بالنموذج اللغوي وشرح احتمال الرمز.
- Understanding searches better than ever before (BERT) — منشور Pandu Nayak لعام 2019 الذي يقدّم BERT إلى الترتيب.
- تقديم Gemini: أكبر نماذج الذكاء الاصطناعي وأكثرها قدرة — إعلان بنية الوسائط المتعددة في ديسمبر 2023.
- Gemini 3 in Search and AI Mode — Elizabeth Reid عن الاستدلال وتعدد الوسائط وتوسعة الاستعلام (نوفمبر 2025).
- AI Mode and AI Overviews updates — تأكيد Robby Stein أن Gemini 3 الافتراضي لـAI Overviews (يناير 2026).
- Retrieval-Augmented Generation (RAG) on Google Cloud — إطار RAG الرسمي وكيفية تأسيس Gemini لإجاباته.
Bing / Microsoft
- تأكيد: يعمل Bing الجديد على GPT-4 من OpenAI — تأكيد Microsoft أن GPT-4 مخصص للبحث (مارس 2023).
اقتباسات من المصدر
عبارات مسجلة من Google وMicrosoft. كل رابط هو رابط عميق يقفز إلى المقطع المقتبس في صفحة المصدر.
Google — ما هو النموذج اللغوي
- “BERT models can therefore consider the full context of a word by looking at the words that come before and after it.” (ترجمة) «يمكن لنماذج BERT أن تراعي السياق الكامل للكلمة بالنظر إلى الكلمات التي تسبقها وتليها.» — Pandu Nayak، زميل Google ونائب رئيس البحث. الانتقال إلى الاقتباس
Google — Gemini
- “built from the ground up to be multimodal” (ترجمة) «بُني من الأساس ليكون متعدد الوسائط» — أي إن Gemini كان “pre-trained from the start on different modalities.” (ترجمة) «مدرَّبًا مسبقًا منذ البداية على وسائط متعددة». — إعلان Gemini من Google. الانتقال إلى الاقتباس
Google — Gemini 3 كافتراضي لـAI Overviews
- “Gemini 3 is now the default model for AI Overviews, giving you better AI responses.” (ترجمة) «Gemini 3 هو الآن النموذج الافتراضي لـAI Overviews، ما يمنحك إجابات ذكاء اصطناعي أفضل.» — Robby Stein، نائب رئيس المنتج في Google Search (يناير 2026). الانتقال إلى الاقتباس
Google — RAG والتأسيس
- “RAG is an AI framework that combines the strengths of traditional information retrieval systems with the capabilities of generative large language models.” (ترجمة) «RAG إطار ذكاء اصطناعي يجمع نقاط قوة أنظمة استرجاع المعلومات التقليدية بقدرات النماذج اللغوية الكبيرة التوليدية.» — Google Cloud، التوليد المعزز بالاسترجاع. الانتقال إلى الاقتباس
Google — SEO العادي لـAI Overviews
- “To get your content to appear in AI Overview, simply use normal SEO practices.” (ترجمة) «لكي يظهر محتواك في AI Overview، استخدم ممارسات SEO العادية فحسب.» — Gary Illyes، علاقات بحث Google (بحسب تقرير Search Engine Land، يوليو 2025). اقرأ التغطية
Microsoft — Bing على GPT-4
- “the new Bing is running on GPT-4, which we’ve customized for search.” (ترجمة) «Bing الجديدة تعمل على GPT-4، الذي خصصناه للبحث.» — مدونة Microsoft Bing (مارس 2023). الانتقال إلى الاقتباس
LLMs في البحث — ورقة غش
أي نموذج يفعل ماذا
| النموذج | الجهة | الدور في البحث | النوع |
|---|---|---|---|
| BERT | فهم الاستعلامات/الوثائق للترتيب | مُرمِّز فقط، ثنائي الاتجاه | |
| Gemini | إنشاء إجابات AI Overviews وAI Mode | توليدي (متعدد الوسائط) | |
| GPT-4 | OpenAI | تشغيل Bing Copilot (مخصص للبحث) | توليدي، ذاتي الانحدار |
| Claude | Anthropic | مساعد AI عام / بحث محادثي | توليدي، ذاتي الانحدار |
| Llama | Meta | نموذج مفتوح المصدر مستخدم على نطاق واسع خارج المنصات | توليدي، ذاتي الانحدار |
المفاهيم الأساسية
- الرمز — قطعة النص التي يتنبأ بها النموذج (غالباً جزء من كلمة).
- التنبؤ بالرمز التالي — محرك التوليد كله؛ يعمل ذاتياً.
- Transformer / الانتباه — يعالج تسلسلاً كاملاً بالتوازي؛ واستبدل RNNs.
- موضع توقف المعرفة — تاريخ التدريب الأخير؛ لا يساوي تاريخ الإصدار.
- نافذة السياق — الحد الأقصى للرموز القابلة للمعالجة دفعة واحدة؛ ويحد أحجام مقاطع RAG.
- Temperature — يتحكم في عشوائية أخذ عينات الرمز التالي.
- RAG / التأسيس — يدخل محتوى ويب حديثاً مسترجعاً إلى نافذة السياق.
- الهلوسة — إكمال واثق ومعقول لكنه خاطئ (أثر إحصائي).
حقائق SEO سريعة
- الفهرسة شرط مسبق — «استخدم ممارسات SEO العادية ببساطة».
- لا يدعم Google ملف llms.txt ولا يخطط لدعمه.
- ارتبطت الإشارات إلى العلامة في الويب بقوة أكبر بنحو 3× من الروابط الخلفية (دراسة 75 ألف علامة).
- يختلف عرض زاحف الذكاء الاصطناعي حسب المزود — ويعظم HTML الخام التغطية.
النماذج الذهنية
1. يتنبأ LLM ولا يفكر. كل مخرج هو الرمز التالي الأكثر احتمالاً بالنظر إلى السياق حتى تلك اللحظة. و«المعقول» هو الهدف، لا «الحقيقي». والهلوسة ليست عيباً أضيف إلى الآلة — إنها الآلية نفسها التي تنتج إكمالاً خاطئاً لكنه فصيح.
2. وظيفتان: الفهم مقابل التوليد. تفهم المرمِّزات على نمط BERT الاستعلامات والوثائق (للترتيب). وتكتب النماذج التوليدية على نمط Gemini/GPT الإجابة فوق المقاطع المسترجعة. وعندما تسأل «كيف يتعامل LLM مع صفحتي؟» اسأل أولاً: أي LLM وأي مرحلة؟
3. النموذج المجمد + الويب الحي. معرفة النموذج مجمدة عند موضع توقفه. ويضيف RAG والتأسيس خطوة استرجاع حية حتى تعكس الإجابة صفحات اليوم. ومن دون الاسترجاع، أنت تسأل نموذجاً عن عالم لم يره قط.
4. سلسلة بوابات إجابة الذكاء الاصطناعي. للظهور في AI Overview يجب أن يجتاز محتواك خمس بوابات بالترتيب: قابل للزحف ← مفهرس ← مسترجع ← مختار ← ممثل بدقة. شخّص المشكلة بالعثور على أول بوابة تفشل فيها، لا بالتخمين.
5. الإشارات تتفوق على الروابط في الظهور بالذكاء الاصطناعي. يبني النموذج إحساسه بسلطة العلامة من الكلمات الموجودة على الصفحات — الانتشار والتشارك والسياق. ولهذا ارتبطت الإشارات إلى العلامة بقوة أكبر بنحو 3× من الروابط الخلفية في دراسة 75 ألف علامة. اكسب أن يتحدث الناس عنك، لا أن يربطوا بك فقط.
افتراضات LLM التي تقود إلى قرارات SEO سيئة
اعتبار المخرج الفصيح استدلالاً تم التحقق منه
يتنبأ LLM بسلسلة من الرموز، والثقة في النثر ليست دليلاً على صحة الادعاء. تحقق من الادعاءات المهمة وافحص المصادر التي قدمها الاسترجاع.
افتراض أن كل نموذج يؤدي الدور نفسه في البحث
قد تساعد نماذج الفهم في تفسير الاستعلامات وترتيبها، بينما تركّب النماذج التوليدية الإجابات. حدّد مرحلة النظام قبل تحويل قدرة نموذج عامة إلى توصية تحسين.
استبدال قابلية الزحف بتكتيكات التوجيه
لا تزال الأنظمة المؤسسة على البحث تحتاج إلى مادة مصدرية متاحة وقابلة للفهرسة. ولا تستطيع التوجيهات الواضحة جعل صفحة غير متاحة تدخل مجموعة المرشحين في الاسترجاع.
اختبر نفسك: النماذج اللغوية الكبيرة
موارد تستحق وقتك
كتاباتي ذات الصلة
- ما نعرفه فعليًا عن تحسين البحث لنماذج LLM — دراسة 75 ألف علامة وأبحاث تقسيم Chrome وبيانات الحداثة.
- تحليل عوامل ظهور العلامة في AI Overview (دراسة 75 ألف علامة) — جدول الارتباط الكامل وراء «الإشارات تتفوق على الروابط الخلفية».
- ظهور LLM: ما هو وكيف تحسنه — تحليل حداثة 17 مليون استشهاد والنقطة العمياء لعرض JavaScript.
- الدليل الكامل للظهور في الذكاء الاصطناعي لمختصي SEO والمسوقين ومالكي المواقع — صيغ المحتوى التي يميل مساعدو الذكاء الاصطناعي إلى تفضيلها.
- ما هو llms.txt، وهل ينبغي أن تهتم به؟ — سبب عدم وجود دليل على أن llms.txt يحسن استرجاع الذكاء الاصطناعي.
من آخرين
- دورة Google ML التعليمية السريعة — LLM — أوضح تمهيد رسمي لماهية النموذج اللغوي.
- الانتباه هو كل ما تحتاجه (Google Research، 2017) — ورقة Transformer الأصلية التي بُني عليها BERT وGemini وGPT.
- Google تستعرض MUM — أقوى بألف مرة من BERT (Search Engine Land) — إعلان مايو 2021 عن نموذج Google متعدد الوسائط القائم على T5 ذي 110B معلمة.
- Google تقول إن SEO العادي يعمل للترتيب في AI Overviews (Search Engine Land) — اقتباسات Gary Illyes وJohn Mueller من Deep Dive لـSearch Central في يوليو 2025.
- كيف يعمل بحث Microsoft Copilot: الغوص في البنية (Rankly) — تفصيل لمسار Prometheus ومراحل RAG الأربع وكيف يصل Bing GPT-4 بالفهرس الحي.
- تواريخ توقف معرفة LLM (allmo.ai) — جدول محدث دورياً لمواضع توقف التدريب عبر عائلات GPT وClaude وGemini وLlama.
- r/TechSEO — مجتمع لتصحيح أخطاء البحث بالذكاء الاصطناعي والفهرسة.
إحصاءات تستحق الاستشهاد
- الإشارات تتفوق على الروابط الخلفية في الظهور بالذكاء الاصطناعي. في دراسة 75 000 علامة، ارتبطت الإشارات إلى العلامة في الويب بنحو 0,66 بظهورها في AI Overview، مقابل نحو 0,22 للروابط الخلفية — وكانت الإشارات النصية أقوى بنحو 3× من مقاييس الروابط. المصدر
- الفائز يأخذ كل شيء. حققت علامات الربع الأعلى من حيث الإشارات 169 إشارة AI Overview في المتوسط مقابل 14 للربع التالي؛ وكانت 26% من العلامات المدروسة بلا أي إشارة. المصدر
- تصيب أدوات الذكاء الاصطناعي نهايات مسدودة أكثر. عبر نحو 16 مليون عنوان URL، أرسل المساعدون الزوار إلى صفحات 404 بمعدل 2,87× أكثر من Google Search — وهو أثر جانبي للهلوسة. المصدر
- يفضل الذكاء الاصطناعي المحتوى الأحدث. عبر نحو 17 مليون استشهاد، فضّل المساعدون الاستشهاد بمحتوى أحدث ذي معنى مما يظهر عادةً في النتائج العضوية. المصدر
- يختلف عرض زاحف الذكاء الاصطناعي حسب المزود — وقد يفوّت المحتوى المعتمد على JS أثناء الاسترجاع، لذلك يعظم HTML الخام التغطية. المصدر
سجل التغييرات
تم التحديث في 22 أغسطس 2026.
ملخص تحريري وتفاصيل التغيير المسجلة.تفاصيل التغيير
-
تفاصيل التغيير متاحة حاليًا باللغة الإنجليزية.
المقارنة الكاملة غير متاحة — لم تُؤرشف لقطة سابقة لهذه المراجعة.
تم التحديث في 6 أغسطس 2026.
ملخص تحريري وتفاصيل التغيير المسجلة.تفاصيل التغيير
-
تفاصيل التغيير متاحة حاليًا باللغة الإنجليزية.
المقارنة الكاملة غير متاحة — لم تُؤرشف لقطة سابقة لهذه المراجعة.
تم التحديث في 6 أغسطس 2026.
ملخص تحريري وتفاصيل التغيير المسجلة.تفاصيل التغيير
-
تفاصيل التغيير متاحة حاليًا باللغة الإنجليزية.
-
تفاصيل التغيير متاحة حاليًا باللغة الإنجليزية.
المقارنة الكاملة غير متاحة — لم تُؤرشف لقطة سابقة لهذه المراجعة.
تم التحديث في 22 يوليو 2026.
ملخص تحريري وتفاصيل التغيير المسجلة.تفاصيل التغيير
-
تفاصيل التغيير متاحة حاليًا باللغة الإنجليزية.
المقارنة الكاملة غير متاحة — لم تُؤرشف لقطة سابقة لهذه المراجعة.
تم التحديث في 18 يوليو 2026.
ملخص تحريري وتفاصيل التغيير المسجلة.تفاصيل التغيير
-
تفاصيل التغيير متاحة حاليًا باللغة الإنجليزية.
-
تفاصيل التغيير متاحة حاليًا باللغة الإنجليزية.
المقارنة الكاملة غير متاحة — لم تُؤرشف لقطة سابقة لهذه المراجعة.