التضمينات (Embeddings)
التضمينات متجهات عددية كثيفة ترمّز معنى النص — وهذا ما يجعل البحث الدلالي وترتيب Google وRAG يطابقون المحتوى بالمعنى بدلاً من الكلمات المفتاحية.
اللغات
التضمين قائمة من الأرقام — متجه كثيف — يرمّز معنى كلمة أو جملة أو وثيقة في فضاء عالي الأبعاد، بحيث يستقر النص المتشابه دلالياً متقارباً. تنتجها نماذج الترميز، لا LLM التوليدية؛ ويُقاس التشابه بالتشابه الجيبي. تشغّل التضمينات البحث الدلالي والتجميع وطبقة الاسترجاع في RAG، ويستخدم Google الاسترجاع القائم على التضمين (Neural Matching / RankEmbed وRankEmbedBERT) إلى جانب فهرسه للكلمات المفتاحية. وخلاصة SEO ليست مقبضاً لتحريكه — قال Danny Sullivan عن BERT "there's nothing to optimize for" — بل إن المحتوى المتماسك موضوعياً يتجمع بوضوح بالقرب من الاستعلامات التي ينبغي أن يجيب عنها.
الخلاصة — يحوّل التضمين النص إلى قائمة من الأرقام — إحداثيات في فضاء هائل — حيث تنتهي الأشياء التي تعني معاني متشابهة متقاربةً من بعضها. هكذا يطابق البحث بالذكاء الاصطناعي ومحركات البحث الحديثة محتواك مع الاستعلام بالمعنى بدلاً من مجرد مطابقة الكلمات المفتاحية. لا يمكنك «إضافة» التضمينات إلى صفحة؛ فهي الطريقة التي تقرأ بها الآلة ما هو موجود فيها أصلاً.
ما هو التضمين
يمثّل التضمين المدخلات على هيئة متجه عددي مصمم للحفاظ على العلاقات المفيدة لمهام مثل التشابه الدلالي. Evidence for this claim Embeddings represent inputs as numerical vectors that can be compared for relatedness and used for search, clustering, and classification. Scope: OpenAI embedding models and documented uses; vector dimensions and behavior vary by model. Confidence: high · Verified: OpenAI: Embeddings guide أما الهندسة وعدد الأبعاد فخاصان بالنموذج، وليسا معاني عامة مرتبطة بكل إحداثي. Evidence for this claim Learned vector representations can encode useful distributional relationships between words. Scope: Word2vec-era language representations; observed vector relationships are model- and training-data-specific, not ground truth. Confidence: high · Verified: Mikolov et al.: Efficient Estimation of Word Representations
لا تفهم الحواسيب الكلمات — بل تفهم الأرقام. التضمين هو الجسر: يقرأ النموذج جزءاً من النص ويحوّله إلى قائمة من الأرقام (تسمى متجهاً) تلتقط معناه. فكّر فيه كموقع على خريطة. توضع قطعتان من النص ذواتا المعنى المتشابه متقاربتين؛ وينتهي النص غير المرتبط بعيداً عنهما.
لذلك يستقر «laptop for gaming» و«high-performance laptop for games» بالقرب من بعضهما، رغم أنهما لا يشتركان إلا قليلاً في الكلمات. أما «Banana bread recipe» فيستقر في مكان مختلف تماماً. تعلّم النموذج ذلك بقراءة كميات هائلة من النصوص وملاحظة الكلمات والعبارات التي تظهر في سياقات متشابهة.
لماذا يهم هذا للبحث
طابق البحث القديم الكلمات المفتاحية: تكتب كلمة، فيعثر المحرك على صفحات تحتوي تلك الكلمة. أما التضمينات فتتيح للبحث مطابقة المعنى. لذلك يستطيع Google الإجابة عن سؤال طويل بصيغة محادثة حتى عندما لا تستخدم أفضل صفحة كلماتك نفسها — وهذه هي الطريقة التي تقرر بها أدوات البحث بالذكاء الاصطناعي (التي تقرأ المصادر وتكتب لك إجابة) أي المقاطع وثيقة الصلة بما يكفي لاسترجاعها.
هذه هي النسخة المختصرة من المسار الذي يقف وراء إجابات الذكاء الاصطناعي:
- يُقسّم المحتوى إلى مقاطع (فقرات).
- يتحول كل مقطع إلى تضمين (متجه).
- يتحول سؤالك أيضاً إلى تضمين.
- يعثر النظام على المقاطع التي تكون متجهاتها أقرب إلى متجه سؤالك.
- تصبح تلك المقاطع المادة المصدرية التي يكتب الذكاء الاصطناعي إجابته منها.
ما الذي يعنيه هذا لمحتواك
هذا هو الجزء الذي يبالغ الناس في تقديره، لذا دعني أوضحه: لا يوجد «تحسين للتضمينات» تقدمه إلى Google. قال Danny Sullivan من Google ذلك حرفياً عن BERT (أحد أنظمة Google القائمة على التضمينات): “There’s nothing to optimize for.”
ما يفيد فعلاً هو النصيحة المعتادة نفسها، لكن مع سبب أوضح وراءها. اكتب محتوى يغطي موضوعاً بصدق وشمول. ينتج المحتوى المتماسك والمركز تضمينات نظيفة ومتسقة تستقر بالقرب من الأسئلة التي ينبغي أن يجيب عنها. أما المحتوى المحشو بالكلمات المفتاحية والمبعثر فينتج إشارة أكثر ضبابية. أنت لا تغذي صيغةً حسابية — بل تكتب شيئاً يستطيع نموذج (وإنسان) فهمه بوضوح.
هل تريد الآلية الحقيقية — الأبعاد، والتشابه الجيبي، وتاريخ word2vec إلى BERT، وكيف يستخدم Google التضمينات فعلياً في الترتيب؟ انتقل إلى علامة التبويب Advanced.
الخلاصة — التضمين متجه كثيف من أرقام الفاصلة العائمة (عادةً من مئات إلى بضعة آلاف من الأبعاد) يرمّز المعنى، وينتجه نموذج ترميز — لا نموذج LLM توليدي. المعنى المتشابه ← متجهات متقاربة، ويُقاس ذلك بالتشابه الجيبي. انتقل المجال من تضمينات الكلمات الثابتة (word2vec وGloVe) إلى التضمينات السياقية (BERT)، ثم إلى تضمينات على مستوى الجملة وتضمينات واجهات البرمجة الحديثة. يستخدم Google الاسترجاع القائم على التضمينات (Neural Matching / RankEmbed وRankEmbedBERT) إلى جانب فهرسه للكلمات المفتاحية — إنه نظام هجين وليس بديلاً. والتضمينات هي أيضاً العمود الفقري للاسترجاع في RAG. لا يوجد مقبض لتحسين التضمين؛ فالاتساق الموضوعي هو ما يجعل المحتوى يتجمع بالقرب من الاستعلامات الصحيحة.
ما هو التضمين فعلياً
تدعم التضمينات التشابه والاسترجاع، لكنها ليست مقياساً مباشراً للحقيقة أو الجودة أو قيمة الترتيب. Evidence for this claim Embeddings represent inputs as numerical vectors that can be compared for relatedness and used for search, clustering, and classification. Scope: OpenAI embedding models and documented uses; vector dimensions and behavior vary by model. Confidence: high · Verified: OpenAI: Embeddings guide وتعتمد نتائج البحث على النموذج المدرَّب وإعداد التقييم. Evidence for this claim Learned vector representations can encode useful distributional relationships between words. Scope: Word2vec-era language representations; observed vector relationships are model- and training-data-specific, not ground truth. Confidence: high · Verified: Mikolov et al.: Efficient Estimation of Word Representations
التضمين متجه عددي كثيف — قائمة من أرقام الفاصلة العائمة — يمثّل النص (أو الصور أو الصوت أو الفيديو) كنقطة في فضاء عالي الأبعاد. توضح وثائق OpenAI ذلك بجلاء: “An embedding is a vector (list) of floating point numbers.”
الخاصية التعريفية هندسية: للمحتوى المتشابه دلالياً متجهات متشابهة. يشير النص الذي يعني تقريباً الشيء نفسه إلى الاتجاه نفسه تقريباً؛ بينما يشير النص غير المرتبط إلى مكان آخر. وليست هذه مصادفة سعيدة — فالنموذج يدرَّب بحيث تنتهي الكلمات والعبارات المستخدمة في سياقات متشابهة إلى متجهات متشابهة. يتحول المعنى إلى موضع.
A conceptual semantic space places the query reset my password near documents titled Forgot-password guide, Account recovery steps, and Cannot log in. The unrelated document Enterprise pricing sits farther away. Near means more semantically similar; far means less similar. Actual embedding spaces have many more dimensions and model-specific geometry.
© Patrick Stox LLC · CC BY 4.0 ·
أمور قليلة تستحق أن نحددها بدقة:
- مُرمِّز، لا مُولِّد. تأتي التضمينات من نماذج ترميز مهمتها ضغط المعنى في متجه ثابت الحجم. وهذه بنية وغرض مختلفان عن LLM توليدي يتنبأ بالرمز التالي. (مزيد عن الفرق بين الداخلي والقائم على API أدناه.)
- كثيفة، لا متناثرة. بخلاف تمثيلات one-hot أو حقيبة الكلمات (معظمها أصفار، وموضع واحد لكل كلمة في المفردات)، تعبّئ التضمينات المعنى في كل بُعد. يصف قاموس Google لتعلم الآلة التضمينات بأنها تمثيلات كثيفة منخفضة الأبعاد تصلح ما لا يستطيع ترميز one-hot التعبير عنه — فهي تتيح للنموذج إدراك أن «hot dogs and shawarmas are more related than hot dogs and salads» (ترجمة) «الكلاب الساخنة والشاورما أكثر ترابطًا من الكلاب الساخنة والسلطات».
- الأبعاد الأعلى لا تعني الأفضل دائماً. قد تلتقط الأبعاد الأكثر مزيداً من التفاصيل، لكنها تكلف أكثر في التخزين والحساب، وتعتمد الفائدة على المهمة. إنها مفاضلة، وليست قرصاً يقول «الأكبر أفضل».
قياس التشابه: التشابه الجيبي
لمقارنة تضمينين، تقيس المسافة — أو بالأحرى الزاوية — بينهما. المقياس القياسي هو التشابه الجيبي: فهو يقيس الزاوية بين متجهين بصرف النظر عن طولهما، ويعطي درجة من −1 (متعاكسان) مروراً بـ0 (غير مرتبطين/متعامدين) إلى 1 (الاتجاه نفسه). تعني المسافة الأصغر ارتباطاً أكبر.
تطبّع كثير من واجهات برمجة التضمينات المتجهات إلى طول وحدي، ما يجعل التشابه الجيبي والجداء النقطي ينتجان الترتيب نفسه — ويشير OpenAI إلى أن الجيب هو الاختيار التقليدي والأقل تكلفة بقليل. ويعرض Voyage AI (مزود التضمينات الذي توصي به Anthropic) الفكرة بوضوح: “the cosine similarity between two embeddings captures the semantic relatedness of the corresponding original passages.” (ترجمة) «يلتقط التشابه الجيبي بين تضمينين الترابط الدلالي للمقاطع الأصلية المقابلة.» إن إجراء مقارنة أقرب الجيران هذه على نطاق واسع مشكلة مستقلة — وهذا هو عمل البحث المتجهي.
كيف وصلنا إلى هنا: التطور
تمتد القصة من كلمات مفردة إلى مقاطع كاملة، ومن معانٍ ثابتة إلى معانٍ تراعي السياق.
- word2vec (Google، 2013). قدّم Mikolov وزملاؤه بنيتين (CBOW وSkip-Gram) لتعلّم متجهات كلمات كثيفة من مجموعات نصية ضخمة. والنتيجة الشهيرة: يصل المتجه “King” − “Man” + “Woman” إلى أقرب نقطة من “Queen” — دليل على أن الحساب المتجهي يلتقط العلاقات الدلالية. (تنبيه: ذلك القياس توضيحي وليس مضموناً في كل مرة؛ فقد يصل، حسب النموذج، إلى «kings» أو «monarch».) هذه تضمينات ثابتة — متجه ثابت واحد لكل كلمة، لذلك تحصل كلمة «bank» على المتجه نفسه في «river bank» و«bank account».
- GloVe (Stanford، 2014). بديل قائم على العدّ، بُني على إحصاءات التشارك العالمي في الظهور بدلاً من شبكة تنبؤية — هدف مختلف وتضمينات مفيدة بصورة مماثلة. وهو ثابت أيضاً.
- Universal Sentence Encoder (Google، 2018). تضمينات للجمل الكاملة، لا للكلمات فقط. الفكرة الأساسية: “Sentences are semantically similar if they have a similar distribution of responses” (الترجمة العربية) «تتشابه الجمل دلالياً إذا كان لها توزيع متشابه من الاستجابات» — فسؤال «How old are you?» وسؤال «What is your age?» يستدعيان الإجابات نفسها، ولذلك تُضمَّنان قريباً من بعضهما.
- BERT (Google، 2018؛ نُشر في البحث في أكتوبر 2019). التحول الكبير: تضمينات سياقية. تحصل الكلمة نفسها على متجه مختلف حسب الجملة المحيطة، لأن BERT ثنائي الاتجاه — يقرأ الكلمات قبل الرمز وبعده لتثبيت معناه. لذلك تحصل «bank» في «river bank» و«bank account» أخيراً على متجهين مختلفين.
- Sentence-BERT (2019). حل مشكلة توسعة BERT في البحث عن التشابه. يحتاج BERT العادي إلى إدخال الجملتين معاً، وهو أمر مكلف حسابياً بصورة قاسية على نطاق واسع؛ أما SBERT فينتج تضمينات جمل ثابتة الحجم يمكنك مقارنتها بالتشابه الجيبي، فيخفض تكلفة العثور على الزوج الأكثر تشابهاً في مجموعة كبيرة من ساعات إلى ثوانٍ.
- واجهات برمجة التضمينات الحديثة (2024–حتى الآن). عائلة text-embedding-3 من OpenAI، وتضمينات Gemini من Google، وVoyage، وembed-v4.0 من Cohere — متعددة اللغات، ومتعددة الوسائط بصورة متزايدة (نص وصورة وصوت وفيديو في فضاء واحد)، وقابلة لتغيير الحجم عبر Matryoshka Representation Learning (اقتطع المتجه إلى أبعاد أقل من دون إعادة تدريب، مقايضاً قليلاً من الدقة بالتخزين والسرعة).
كيف يستخدم Google التضمينات في البحث
مسار ترتيب Google ليس دلالياً خالصاً ولا قائماً على الكلمات المفتاحية خالصاً — بل هو هجين، وتكمّل أجزاء التضمين الفهرس المعكوس التقليدي بدلاً من استبداله. ووفق وثائق Google الخاصة بأنظمة الترتيب وشهادة Pandu Nayak في قضية مكافحة الاحتكار التابعة لوزارة العدل الأمريكية، تشمل الأنظمة المسماة ما يلي:
- BERT — نظام Google للكلمات في سياقها. عند إطلاقه ساعد البحث على «فهم أفضل لواحد من كل 10 عمليات بحث في الولايات المتحدة باللغة الإنجليزية»، ولا سيما الاستعلامات المحادثية الأطول التي تغيّر فيها حروف الجر مثل «for» و«to» المعنى.
- Neural Matching / RankEmbed — استرجاع قائم على التضمينات يترجم الاستعلامات والوثائق إلى فضاء متجهي واحد لإظهار النتائج المتطابقة مفهومياً حتى من دون كلمات مفتاحية مشتركة. وصف Nayak هذا بأنه إضافة: “RankEmbed identifies a few more documents to add to those identified by the traditional retrieval.” ويعتمد الاسترجاع هناك على مقياس الجداء النقطي/المسافة في فضاء التضمين.
- RankEmbedBERT — تطور لاحق يجمع استرجاع RankEmbed مع فهم BERT للغة، وتدرّب على درجات مقيمي الجودة وسجلات البحث، وهو أفضل بوضوح في الاستعلامات المعقدة والطويلة ذات الذيل الطويل.
القراءة العملية هي أن وجود الكلمات المفتاحية لا يزال مهماً لأن الاسترجاع المعجمي (الفهرس المعكوس بأسلوب BM25) يضيّق النطاق أولاً. تضيف أنظمة التضمين مرشحين مرتبطين مفهومياً وتعيد ترتيبهم. الإشارتان حاضرتان — ولهذا فإن قول «BERT قتل الكلمات المفتاحية» خطأ.
التضمينات في البحث بالذكاء الاصطناعي (مسار RAG)
هنا تلامس التضمينات ملخصات الذكاء الاصطناعي ومساعدات البحث بالذكاء الاصطناعي بصورة مباشرة أكثر. يستخدم التوليد المعزَّز بالاسترجاع (RAG) التضمينات طبقةً للاسترجاع:
- الفهرسة: يُقسّم المحتوى إلى مقاطع، ويُضمَّن كل مقطع، وتوضع المتجهات في قاعدة بيانات متجهية.
- الاسترجاع: يُضمَّن استعلام المستخدم، ويعثر بحث أقرب الجيران على أقرب المقاطع (عبر البحث المتجهي)، وتُسلَّم المقاطع الأعلى K إلى LLM كسياق.
- التوليد: يكتب LLM إجابة مؤسَّسة على تلك المقاطع المسترجعة.
تهم البنية هنا لأن كل مقطع يُسترجع بمعزل عن غيره. وجدت أبحاث Dan Petrovic (المستشهد بها في مقال Ahrefs ما نعرفه فعلاً عن تحسين البحث للنماذج اللغوية الكبيرة) أن Chrome يعالج أول نحو 30 مقطعاً من الصفحة فقط للتضمينات، ويقسّمها إلى مقاطع من نحو 200 كلمة مع تداخل للحفاظ على سياق ما بين المقاطع. إذا لم يستطع قسم أن يقف وحده بعد سحبه من الصفحة، فإنه يمثّل محتواك تمثيلاً ضعيفاً.
تضمينات الرموز مقابل واجهات برمجة تضمين النص
هناك تمييز يوقع الناس في الالتباس: التضمينات داخل LLM والتضمينات التي تحصل عليها من واجهة API ليستا الشيء نفسه.
- تضمينات الرموز هي التمثيلات الداخلية للنموذج — يحصل كل رمز على متجه يتحول طبقة بعد طبقة أثناء التوليد. وهي آلية إنتاج الرمز التالي.
- واجهات برمجة تضمين النص (OpenAI وGoogle وVoyage وCohere) تنتج متجهاً واحداً ثابت الحجم لسلسلة إدخال كاملة، مخصصاً للاسترجاع والتشابه. وغالباً ما يكون ذلك عبر نموذج منفصل ذي هدف تدريبي مختلف.
عندما يتحدث مختصو SEO عن «تضمين صفحة» أو تشغيل التشابه الجيبي للربط الداخلي أو تجميع الكلمات المفتاحية، فإنهم يقصدون نوع واجهة API.
ما الذي يعنيه هذا لتحسين محركات البحث
- الاتساق الدلالي يتفوق على كثافة الكلمات المفتاحية. لأن النماذج تفهم السياق، يستقر «laptop for gaming» و«high-performance laptop» متقاربين أصلاً. لا يفيد الحشو — بل ينتج محتوى مبعثراً موضوعياً بتضمين أكثر ضبابية.
- هيكلة المحتوى للاسترجاع المقسّم إلى مقاطع. تُضمَّن المقاطع وتُسترجع منفردة. ضع المحتوى المهم مبكراً، واجعل الأقسام مكتفية ذاتياً، واستخدم HTML دلالياً واضحاً.
- الشمول الموضوعي. ينتهي المحتوى الذي يغطي موضوعاً بصدق بالقرب من عدد أكبر من الاستعلامات المرتبطة في الفضاء المتجهي. وهذه هي الآلية وراء «بناء السلطة الموضوعية».
- لا يوجد مقبض للتضمين. قال Danny Sullivan عن BERT: “There’s nothing to optimize for… The fundamentals of us seeking to reward great content remain unchanged.” ودرجات التشابه الجيبي التي تحصل عليها من أداة ما هي وسائل مساعدة للتحليل، وليست مدخلات تقدمها إلى Google.
التضمينات هي النسيج الرابط تحت معظم هذا التجمع: عليها يعمل البحث الدلالي، ويقارن البحث المتجهي، ويهيئ التقسيم إلى مقاطع النص، وتشكّل العمود الفقري للاسترجاع في RAG. وهي أيضاً سبب أهمية الزحف أولاً — إذ يجب جلب المحتوى قبل أن يستطيع أي نظام تضمينه.
ملخص الذكاء الاصطناعي
خلاصة مكثفة للنسخة المتقدمة:
- التضمين = متجه كثيف من أرقام الفاصلة العائمة يرمّز المعنى؛ المعنى المتشابه ← متجهات متقاربة. OpenAI: “An embedding is a vector (list) of floating point numbers.”
- تنتجه نماذج الترميز، لا LLM التوليدية — بنية وغرض مختلفان. كثيف، لا متناثر.
- يُقاس التشابه بالتشابه الجيبي (الزاوية بين المتجهات، من −1 إلى 1). تجعل المتجهات المطبَّعة التشابه الجيبي والجداء النقطي متكافئين في الترتيب.
- التطور: أعطى word2vec (2013) وGloVe (2014) متجهات كلمات ثابتة ← ضمّن USE (2018) الجمل الكاملة ← جعل BERT (2018) التضمينات سياقية (الكلمة نفسها، ومتجه مختلف حسب السياق) ← جعل Sentence-BERT (2019) البحث عن التشابه سريعاً ← نماذج API حديثة متعددة الوسائط وقابلة لتغيير الحجم (2024–حتى الآن).
- يستخدم Google التضمينات في مسار هجين: BERT (الكلمات في سياقها)، وNeural Matching / RankEmbed (استرجاع بالتضمين يكمّل فهرس الكلمات المفتاحية)، وRankEmbedBERT. لا تزال الكلمات المفتاحية تنفذ الاسترجاع الأولي — وتضيف التضمينات وتعيد الترتيب.
- مسار RAG: قسّم ← ضمّن ← خزّن في قاعدة متجهات ← ضمّن الاستعلام ← استرجع أقرب المقاطع ← ينشئ LLM إجابة مؤسسة. يُسترجع كل مقطع بمعزل، لذا تهم البنية.
- خلاصة SEO: لا يوجد «تحسين للتضمينات» — يقول Danny Sullivan: “There’s nothing to optimize for” مع BERT. يتجمع المحتوى المتماسك موضوعياً والمكتفي ذاتياً والشامل بالقرب من الاستعلامات التي ينبغي أن يجيب عنها.
الوثائق الرسمية
وثائق المصادر الأولية عن التضمينات من Google وكبرى مزودي التضمينات.
- Machine Learning Glossary — Embeddings — تعريف الكثيف مقابل المتناثر، وسبب عجز ترميز one-hot عن التعبير عن الترابط.
- A guide to Google Search ranking systems — وصف BERT وNeural Matching وRankBrain وPassage Ranking وMUM بكلمات Google نفسها.
- Understanding searches better than ever before (BERT) — إعلان أكتوبر 2019 عن BERT في البحث.
- Advances in Semantic Textual Similarity — Universal Sentence Encoder (2018) وفكرة «التوزيع المتشابه للاستجابات».
- Gemini API — Embeddings — نموذج التضمين المتعدد الوسائط الحالي من Google، وأبعاده وحالات استخدامه (RAG والبحث الدلالي وإعادة الترتيب والتجميع).
OpenAI
- Vector embeddings guide — «التضمين متجه (قائمة) من أرقام الفاصلة العائمة»؛ وإرشادات التشابه الجيبي.
- نماذج التضمين الجديدة وتحديثات API — عائلة text-embedding-3 واختصار أبعاد Matryoshka (يناير 2024).
مزودون آخرون
- Cohere — Embeddings — embed-v4.0 متعدد اللغات، وأنواع إدخال منفصلة للاستعلام/الوثيقة، وخيارات الضغط.
- Voyage AI — Quickstart — المزود الذي توصي به Anthropic؛ «التشابه الجيبي بين تضمينين يلتقط الترابط الدلالي للمقاطع الأصلية المناظرة».
الأوراق التأسيسية
- word2vec — Mikolov et al., 2013 — متجهات الكلمات الكثيفة الأصلية وقياس king−man+woman.
- GloVe — Pennington, Socher, Manning, 2014 — متجهات الكلمات القائمة على التشارك العالمي في الظهور.
- BERT — Devlin et al., 2018 — التضمينات السياقية ثنائية الاتجاه.
- Sentence-BERT — Reimers & Gurevych, 2019 — تضمينات جمل سريعة للبحث عن التشابه.
اقتباسات من المصدر
عبارات مسجلة من Google ومزودي التضمينات. كل رابط هو رابط عميق يقفز إلى المقطع المقتبس في صفحة المصدر.
ما هو التضمين
- “An embedding is a vector (list) of floating point numbers.” — OpenAI، دليل التضمينات المتجهية. الانتقال إلى الاقتباس
Google — BERT وفهم اللغة
- “At its core, Search is about understanding language.” (ترجمة) «في جوهره، يدور البحث حول فهم اللغة.» — Pandu Nayak، نائب رئيس البحث في Google (إعلان BERT، أكتوبر 2019). الانتقال إلى الاقتباس
- “BERT will help Search better understand one in 10 searches in the U.S. in English.” (ترجمة) «سيساعد BERT البحث على فهم واحد من كل عشرة استعلامات في الولايات المتحدة باللغة الإنجليزية على نحو أفضل.» — مدونة Google Search، أكتوبر 2019. الانتقال إلى الاقتباس
Google — حول التحسين لـBERT
- “There’s nothing to optimize for with BERT… The fundamentals of us seeking to reward great content remain unchanged.” (ترجمة) «لا يوجد شيء لتحسينه من أجل BERT… تظل أساسيات سعينا إلى مكافأة المحتوى الرائع بلا تغيير.» — Danny Sullivan، مسؤول التواصل مع بحث Google. الانتقال إلى الاقتباس
Google — التشابه الدلالي (Universal Sentence Encoder)
- “Sentences are semantically similar if they have a similar distribution of responses.” (الترجمة العربية) «تتشابه الجمل دلالياً إذا كان لها توزيع متشابه من الاستجابات». — Google Research، «Advances in Semantic Textual Similarity» (مايو 2018). اقرأ المصدر
Voyage AI (المزود الذي توصي به Anthropic) — التشابه الجيبي
- “The cosine similarity between two embeddings captures the semantic relatedness of the corresponding original passages.” (ترجمة) «يلتقط التشابه الجيبي بين تضمينين الترابط الدلالي للمقاطع الأصلية المقابلة.» — دليل البدء السريع من Voyage AI. اقرأ المصدر
Pandu Nayak (شهادة مكافحة الاحتكار أمام وزارة العدل) — RankEmbed
- “RankEmbed identifies a few more documents to add to those identified by the traditional retrieval.” — تغطية شهادة Pandu Nayak، قضية وزارة العدل الأمريكية ضد Google. اقرأ التغطية
النماذج الذهنية
1. يتحول المعنى إلى موضع. يحوّل التضمين النص إلى إحداثيات. التقارب = معنى متشابه؛ والبعد = عدم الارتباط. وكل ما عدا ذلك — البحث الدلالي والتجميع واسترجاع RAG — ليس إلا قياساً للمسافة في ذلك الفضاء.
2. ثابت مقابل سياقي. يعطي word2vec وGloVe كل كلمة متجهاً ثابتاً واحداً («bank» دائماً هي نفسها). أما BERT وخلفاؤه فيعطون كل ظهور متجهاً يعتمد على السياق («river bank» ≠ «bank account»). ولا تستطيع أدوات تشابه الكلمات المفتاحية الأقدم المبنية على word2vec التمييز بينهما؛ بينما تستطيع الأدوات القائمة على BERT ذلك.
3. تضمينات الرموز ≠ واجهات برمجة تضمين النص. داخل LLM، تضمينات الرموز آلية عمل لإنتاج الرمز التالي. أما واجهات برمجة تضمين النص فتخرج متجهاً مكثفاً واحداً لكل سلسلة، مبنياً للاسترجاع والتشابه. نماذج مختلفة، ومهمات مختلفة. وعندما يقول مختصو SEO «ضمّن صفحة»، فهم يقصدون نوع API.
4. استرجاع هجين، لا استبدال. يشغّل Google الاسترجاع المعجمي (فهرس الكلمات المفتاحية المعكوس) والاسترجاع القائم على التضمين (Neural Matching / RankEmbed). تضيق الكلمات المفتاحية النطاق أولاً؛ ثم تضيف التضمينات مرشحين مرتبطين مفهومياً وتعيد ترتيبهم. لا يكفي أي منهما وحده لتمثيل النظام بأكمله.
5. حلقة RAG. قسّم ← ضمّن ← خزّن ← ضمّن الاستعلام ← استرجع أقرب المقاطع ← أنشئ إجابة مؤسسة. ولأن كل مقطع يُسترجع بمعزل، اكتب مقاطع مكتفية ذاتياً وقدّم ما يهم في البداية.
6. قاعدة القرار للمحتوى. لا يوجد تضمين ينبغي تحسينه. اسأل بدلاً من ذلك: هل يغطي هذا المقطع الشيء الذي يدّعي تغطيته بوضوح وشمول؟ يتجمع المحتوى المتماسك بالقرب من الاستعلامات الصحيحة؛ أما المحتوى المبعثر والمحشو فلا يفعل ذلك.
التضمينات — ورقة الغش
ما هو في سطر واحد متجه كثيف (قائمة من أرقام الفاصلة العائمة) يرمّز المعنى؛ المعنى المتشابه ← متجهات متقاربة؛ ويُقارن بالتشابه الجيبي.
مقياس التشابه الجيبي
| الدرجة | المعنى |
|---|---|
| 1 | الاتجاه نفسه — تشابه مرتفع جداً |
| ~0 | متعامدان — غير مرتبطين |
| −1 | اتجاهان متعاكسان |
المتجهات المطبَّعة (ذات الطول الوحدي) → يعطي التشابه الجيبي والجداء النقطي الترتيب نفسه.
التطور، في لمحة
| الحقبة | النموذج (النماذج) | ما الذي تغيّر |
|---|---|---|
| 2013–2014 | word2vec وGloVe | متجهات كلمات كثيفة — لكنها ثابتة (متجه واحد لكل كلمة) |
| 2018 | Universal Sentence Encoder | تضمينات جمل كاملة |
| 2018 (البحث: 2019) | BERT | سياقية — يعتمد متجه الكلمة على جملتها |
| 2019 | Sentence-BERT | تضمينات جمل سريعة للبحث عن التشابه على نطاق واسع |
| 2024–حتى الآن | OpenAI وGemini وVoyage وCohere | متعددة اللغات والوسائط، وقابلة لتغيير الحجم (Matryoshka) |
أنظمة التضمين التي سمّاها Google
| النظام | الدور |
|---|---|
| BERT | يفهم الكلمات في سياقها (تفسير الاستعلام) |
| Neural Matching / RankEmbed | استرجاع قائم على التضمين يكمّل فهرس الكلمات المفتاحية |
| RankEmbedBERT | RankEmbed + BERT؛ قوي في الاستعلامات المعقدة والطويلة ذات الذيل الطويل |
| Passage Ranking | يُظهر المقاطع الفردية ذات الصلة من الصفحة |
حلقة استرجاع RAG
- قسّم المحتوى إلى مقاطع
- ضمّن كل مقطع ← متجه
- خزّن المتجهات في قاعدة بيانات متجهية
- ضمّن الاستعلام الوارد
- بحث أقرب الجيران (بحث متجهي) ← المقاطع الأعلى K
- ينشئ LLM إجابة مؤسسة على تلك المقاطع
حقائق سريعة
- الأبعاد: عادةً مئات إلى بضعة آلاف — مزيد من التفاصيل، ومزيد من التخزين والحساب؛ وليست أفضل دائماً.
- تنتجها نماذج الترميز، لا LLM التوليدية.
- تتيح Matryoshka اقتطاع أبعاد أقل من دون إعادة تدريب.
- يعني تبديل نماذج التضمين إعادة تضمين كل شيء — ففضاءات النماذج المختلفة غير متوافقة.
- لا يوجد «تحسين للتضمينات» تقدمه إلى Google — يقول Danny Sullivan: “There’s nothing to optimize for” (BERT).
اختبر نفسك: التضمينات
موارد تستحق وقتك
كتاباتي وندواتي ذات الصلة
- ما نعرفه فعلاً عن تحسين البحث للنماذج اللغوية الكبيرة — مقال Ahrefs الذي يستشهد بأبحاثي وبنتائج Dan Petrovic حول كيفية تقسيم Chrome لمقاطع الصفحة وتضمينها (حد يقارب 30 مقطعاً، ومقاطع من 200 كلمة).
- ندوتي عن البحث بالذكاء الاصطناعي: GEO وAEO وLLMO — حيث تندرج مسارات الاسترجاع والتضمينات في البحث بالذكاء الاصطناعي.
الأوراق التأسيسية (التاريخ)
- word2vec — Mikolov et al., 2013 — متجهات الكلمات الكثيفة والحساب المتجهي.
- GloVe — Pennington, Socher, Manning, 2014 — متجهات الكلمات القائمة على التشارك العالمي في الظهور.
- BERT — Devlin et al., 2018 — تضمينات سياقية ثنائية الاتجاه.
- Sentence-BERT — Reimers & Gurevych, 2019 — تشابه سريع على مستوى الجملة.
من آخرين
- التحول إلى SEO الدلالي: ما الذي تعنيه المتجهات لاستراتيجيتك — Ann Robison، Search Engine Land: “Vectors are to AI what structured data is to search engines.” (ترجمة) «المتجهات للذكاء الاصطناعي مثل البيانات المنظَّمة لمحركات البحث».
- كيفية الاستفادة من التشابه الجيبي في SEO للتجارة الإلكترونية — دليل عملي من Search Engine Land لتطبيق التشابه الجيبي في سير عمل SEO للتجارة الإلكترونية.
- Introduction to Vector Databases and How to Use AI for SEO — نظرة عامة من Search Engine Journal على صلة قواعد البيانات المتجهية بـSEO.
- حالات استخدام SEO لتمثيل الويب بالمتجهات مع Screaming Frog — شرح عملي من iPullRank لتطبيقات التضمينات في SEO.
- Semantic Search Explained: Vector Models’ Impact on SEO Today — Lumar عن البحث الكثيف مقابل المتناثر، والتشابه الجيبي، والبحث الهجين.
- شرح التضمينات: فتح مستقبل SEO — شرح يركز على SEO من Edd Dawson، ويغطي حالات الاستخدام العملية لتجميع الكلمات المفتاحية والربط الداخلي.
- How Google Search Works (inverted index, RankBrain, RankEmbed, DeepRank) — منظور شهادة وزارة العدل لأنظمة التضمين في Google.
- sbert.net — مكتبة Sentence Transformers، إذا أردت إنشاء التضمينات بنفسك.
سجل التغييرات
تم التحديث في 6 أغسطس 2026.
ملخص تحريري وتفاصيل التغيير المسجلة.تفاصيل التغيير
-
تفاصيل التغيير متاحة حاليًا باللغة الإنجليزية.
المقارنة الكاملة غير متاحة — لم تُؤرشف لقطة سابقة لهذه المراجعة.
تم التحديث في 6 أغسطس 2026.
ملخص تحريري وتفاصيل التغيير المسجلة.تفاصيل التغيير
-
تفاصيل التغيير متاحة حاليًا باللغة الإنجليزية.
المقارنة الكاملة غير متاحة — لم تُؤرشف لقطة سابقة لهذه المراجعة.