البحث متعدد الوسائط
كيف يعمل البحث عبر النصوص والصور والفيديو والصوت — Google Lens وCircle to Search وAI Mode متعدد الوسائط وMUM — وما أكدته محركات البحث فعلياً بشأن تحسين المحتوى له.
اللغات
البحث متعدد الوسائط يعني الاستعلام والاسترجاع عبر أكثر من وسيط — النص والصورة والفيديو والصوت معاً — بدلاً من كتابة كلمات وتلقي روابط فقط. وهو التحول الذي يقف وراء Google Lens وCircle to Search والبحث الصوتي وAI Mode متعدد الوسائط. ويتيح ذلك فضاء تضمين مشترك تُطابق فيه الوسائط بحسب المعنى. وما تؤكده المصادر الرسمية يتعلق في الغالب بفهم الاستعلام عبر الوسائط؛ أما الادعاءات الشاملة عن «تحسين ترتيب متعدد الوسائط» فهي نظرية غير مؤكدة. وتظل الممارسات المتينة مألوفة: نص بديل وصفي، وأسماء ملفات مفيدة، ونصوص مكتوبة وترجمات مصاحبة حقيقية، وبيانات منظمة نظيفة، ومحتوى يجيب عن السؤال الذي يوحي به الاستعلام المرئي أو الصوتي.
الخلاصة — يعني البحث متعدد الوسائط أنك لست مضطراً إلى الكتابة كي تبحث. يمكنك توجيه الكاميرا إلى شيء ما (Google Lens)، أو رسم دائرة حول عنصر على الشاشة (Circle to Search)، أو نطق سؤال — ثم جمع ذلك مع الكلمات. يفهم المحرك الصورة والصوت والنص معاً ثم يجيب. إنها فكرة «المطابقة بحسب المعنى» نفسها في البحث الحديث، لكنها لم تعد مقتصرة على الكلمات المكتوبة.
ما البحث متعدد الوسائط؟
تعالج الأنظمة متعددة الوسائط أكثر من وسيط واحد أو تربط بينها، مثل النصوص والصور. Evidence for this claim CLIP learns joint image-and-text representations from paired internet data and supports zero-shot image classification. Scope: CLIP research results; multimodal search products may use different models, training data, and ranking pipelines. Confidence: high · Verified: Radford et al.: Learning Transferable Visual Models وتختلف قدرات المنتجات، ولذلك ينبغي التحقق من دعم الصور والفيديو والصوت والنص لكل نظام على حدة. Evidence for this claim Google Multisearch lets users combine an image with text to refine a search. Scope: Google's documented consumer search feature; it does not define all multimodal retrieval systems. Confidence: high · Verified: Google: Multisearch
طوال معظم تاريخ البحث، كانت هناك طريقة واحدة للدخول: تكتب كلمات فتحصل على قائمة روابط. يفتح البحث متعدد الوسائط هذا القيد. والوسيط هو ببساطة نوع من المدخلات أو المخرجات — نص أو صورة أو فيديو أو صوت. ويعني البحث متعدد الوسائط أن المحرك يستطيع استقبال أكثر من نوع في الوقت نفسه وفهمها معاً.
إليك أمثلة يومية ربما استخدمتها بالفعل:
- وجّه كاميرتك إلى نبات أو معلم أو حذاء واسأل «ما هذا؟» — هذا هو Google Lens.
- ارسم دائرة حول شيء على شاشة هاتفك — سترة في صورة أو كلمة في مقال — للبحث عنه من دون مغادرة التطبيق. هذا هو Circle to Search.
- تحدث إلى هاتفك بدلاً من الكتابة — هذا هو البحث الصوتي.
- اجمع صورة وسؤالاً: اعرض صورة كرسي واسأل «أين يمكنني شراؤه باللون الأزرق؟». الصورة والكلمات استعلام واحد.
لماذا يعمل: المطابقة بحسب المعنى
لا تتعامل الأنظمة الحديثة مع الصورة والجملة بوصفهما شيئين منفصلين تماماً. فهي تحوّلهما إلى «لغة» داخلية واحدة — قائمة أرقام تمثل المعنى (انظر التضمينات). تنتهي صورة كلب golden retriever وعبارة “golden retriever” متقاربتين في ذلك الفضاء، فيستطيع المحرك مطابقتهما رغم أن إحداهما بكسلات والأخرى حروف. إنها المطابقة المعنوية نفسها وراء البحث الدلالي الحديث، وقد امتدت إلى الصور والصوت والفيديو.
ماذا يعني ذلك لك؟
هذه هي الصورة الصريحة، لأن الموضوع مليء بالمبالغات: لا يوجد «عامل ترتيب متعدد الوسائط» سري يمكنك تشغيله. ما يفيد فعلاً هو ما تفعله المواقع الجيدة أصلاً، لكن لسبب أوضح:
- صِف صورك. يخبر النص البديل الحقيقي وأسماء الملفات المعقولة المحرك بما تعرضه الصورة.
- امنح الصوت والفيديو نصاً حقيقياً. تتيح النصوص المكتوبة والترجمات المصاحبة للمحرك فهم ما قيل واقتباسه.
- أجب عن السؤال الواضح. إذا صوّر شخص منتجك فسيسأل: «ما هذا؟ أين أجده؟ كم سعره؟». اجعل الإجابة سهلة العثور عليها في الصفحة.
هل تريد الآليات الفعلية — كيف ينسجم MUM وAI Mode، وما أكدته Google فعلياً وما يظل مجرد نظرية، والدليل الكامل؟ انتقل إلى علامة التبويب Advanced.
الخلاصة — البحث متعدد الوسائط هو الاستعلام والاسترجاع عبر النص والصورة والفيديو والصوت في تفاعل واحد. يتيحه فضاء تضمين مشترك: تُشفَّر الوسائط المختلفة في الفضاء المتجهي نفسه كي تُطابق بحسب المعنى — أي فكرة الاسترجاع في البحث الدلالي بعد تعميمها خارج النص. يمتد المسار العلني لدى Google من البحث الصوتي وبحث الصور إلى MUM (عام 2021، متعدد الوسائط، وُصف بأنه “1,000 times more powerful than BERT” (ترجمة) «أقوى من BERT بألف مرة»، واستُخدم لحالات ضيقة عالية التعقيد) ثم Google Lens وCircle to Search وAI Mode المدعوم بـGemini، حيث تصبح الصورة وسؤال المتابعة استعلاماً واحداً يتفرع إلى إجابة مركبة. أما المؤكد رسمياً فيتعلق غالباً بفهم الاستعلام عبر الوسائط؛ والقول إن Google يرتب صورك المنفردة أو إطارات الفيديو باعتبارها «إشارة متعددة الوسائط» مستقلة ليس سوى نظرية في الصناعة. والدليل المتين: نص بديل وصفي وأسماء ملفات مفيدة، ونصوص مكتوبة وترجمات مصاحبة حقيقية، وبيانات منظمة نظيفة، ومحتوى يجيب عن السؤال الضمني وراء الاستعلام المرئي أو المنطوق.
ما الذي تعنيه «متعدد الوسائط» فعلياً؟
يبين بحث التمثيل المشترك منهجاً واحداً للاسترجاع عبر الوسائط، لا بنية إنتاجية عامة. Evidence for this claim CLIP learns joint image-and-text representations from paired internet data and supports zero-shot image classification. Scope: CLIP research results; multimodal search products may use different models, training data, and ranking pipelines. Confidence: high · Verified: Radford et al.: Learning Transferable Visual Models وتوثق أوصاف منتجات البحث الميزات لا آليات الترتيب الكاملة. Evidence for this claim Google Multisearch lets users combine an image with text to refine a search. Scope: Google's documented consumer search feature; it does not define all multimodal retrieval systems. Confidence: high · Verified: Google: Multisearch
الوسيط قناة للمعلومات — نص مكتوب أو صورة أو صوت منطوق أو فيديو. يتعامل النظام أحادي الوسيط مع قناة واحدة؛ أما النظام متعدد الوسائط فيستقبل أكثر من قناة أو ينتج أكثر من نوع من المخرجات، والأهم أنه يستدل عليها معاً بدلاً من إلصاق خطوط معالجة منفصلة.
البحث متعدد الوسائط أوسع من «بحث الصور»، والفرق مهم:
- بحث الصور يعثر على صور تريدها.
- البحث متعدد الوسائط يستخدم صورة (أو صوتاً أو فيديو) كجزء من استعلام يمكن أن يعيد أي نوع من النتائج — قائمة تسوق أو شرحاً عملياً أو تعريفاً أو دبوساً على خريطة. الكاميرا جهاز إدخال وليست الشيء المطلوب.
لذلك فإن «وجّه الكاميرا إلى قطعة مكسورة واسأل كيف تصلحها» بحث متعدد الوسائط؛ أما «اعثر لي على صور لهذه القطعة» فهو بحث صور. يفعل Google Lens كليهما، ولهذا يلتبس الحد الفاصل.
من المفيد أيضاً فصل ثلاثة أسئلة، لأن وصف منتج واحد قد يخلط بينها: ما وسيط الاستعلام المقبول (نص فقط أم نص مع صورة أو صوت أو فيديو)؟ ما وسيط المحتوى المرشح المسترجع (صفحة نصية أم صورة أم فيديو)؟ وما وسيط المخرج المولّد (قائمة روابط أم شبكة صور أم إجابة نصية مركبة)؟ قبول صورة لا يعني تلقائياً استرجاع صور أو إنتاج صورة؛ فقد تسترجع صورة قطعة مكسورة صفحة نصية وتنتج إجابة نصية. وتأكيد أحد الأبعاد الثلاثة لا يؤكد البعدين الآخرين؛ تحقّق من كل واحد وفق ما وثقه المورّد للميزة المحددة.
الممكّن التقني: فضاء مشترك واحد
Text queries, image queries, and audio or video queries are encoded into a shared semantic embedding space. Meaningfully similar items land near one another, allowing a nearest-neighbor search to retrieve relevant content across input types. The diagram is a conceptual model, not a claim about a specific Google ranking formula.
© Patrick Stox LLC · CC BY 4.0 ·
يمكن مقارنة صورة وعبارة بسبب التمثيل المشترك. ترسم نماذج الترميز النصوص والصور والصوت والفيديو في فضاء تضمين واحد عالي الأبعاد، حيث يصبح التشابه الدلالي قرباً هندسياً. تقع صورة نبات وعبارة «كيف أعتني بهذا النبات؟» متقاربتين، فيربطهما بحث أقرب جار.
هذه هي آلية البحث الدلالي ومرحلة الاسترجاع في RAG بعد تعميمها خارج النص، وهي تنقسم إلى مراحل مستقلة، فلا يثبت تفوق النظام في مرحلة أنه يتفوق في غيرها:
- فهم المدخلات. يُحلل الاستعلام (صورة مع نص مثلاً، أو سؤال منطوق) إلى التمثيل الذي تحتاجه المرحلة التالية.
- التضمين. يُشفّر ذلك التمثيل وكل جزء مرشح من المحتوى في الفضاء المتجهي المشترك.
- الاسترجاع. يعثر البحث المتجهي على أقرب التطابقات بالمسافة الهندسية.
- إعادة الترتيب. تعيد مرحلة منفصلة ترتيب المرشحين بإشارات تتجاوز مسافة التضمين الخام.
- التوليد. في واجهات الذكاء الاصطناعي، تُستخدم أفضل النتائج لتأسيس إجابة مركبة.
إذا فهمت التضمينات والتقسيم إلى مقاطع والبحث المتجهي والتأسيس، فأنت تفهم بنية البحث متعدد الوسائط؛ الجديد الوحيد أن برامج الترميز تتحدث أكثر من وسيط.
أنظمة بحثية مسمّاة، لا مخطط إنتاج مؤكد. فكرة التضمين المشترك ليست افتراضية؛ فقد درّب CLIP من OpenAI وALIGN من Google مرمّزات الصور والنصوص في فضاء واحد باستخدام أزواج الصور والنصوص، ومدّ ImageBind من Meta النهج إلى ستة وسائط (الصورة والنص والصوت والعمق والحرارة والحركة). وهذه بُنى بحثية منشورة لها بياناتها وتقييماتها — مفيدة لفهم كيفية بناء فضاء مشترك، وليست دليلاً على أن محرك بحث تجارياً بعينه يستخدم التصميم نفسه. ولا يكشف سلوك مخرجات المورّد وحده إن كان يستخدم فضاء تضمين مشتركاً أو طريقة دمج أخرى أو كيف يزن كل وسيط؛ فهذا شأن داخلي لا يستطيع أحد خارج المورّد فحصه.
المسار العلني لدى Google
فيما يلي خطوات Google المؤكدة نحو البحث متعدد الوسائط، بالترتيب التقريبي:
- البحث الصوتي وبحث الصور (عقد 2010). كانت الاستعلامات المنطوقة والبحث العكسي بالصور أول المدخلات غير النصية واسعة الاستخدام.
- MUM — Multitask Unified Model (2021). العلامة العلنية لدى Google للتحول متعدد الوسائط. وصفت Google نموذج MUM بأنه متعدد الوسائط وقادر على “understand information across text and images” (ترجمة) «فهم المعلومات عبر النصوص والصور» — وبأنه “1,000 times more powerful than BERT,” (ترجمة) «أقوى من BERT بألف مرة» — ومدرّب عبر 75 لغة وقادر على فهم اللغة وتوليدها. والتنبيه المهم من تاريخ البحث الدلالي: لم يكن MUM قط محرك الترتيب العام لدى Google. استُخدم في حالات ضيقة عالية التعقيد (أسئلة مركبة متعددة الخطوات وبعض المقتطفات المميزة والتسوق)، ولم «يستبدل» BERT.
- Google Lens. الكاميرا بوصفها استعلاماً على نطاق واسع — تحديد الأشياء وترجمة نص داخل صورة والتسوق مما تراه وحل مشكلة تصوّرها.
- Circle to Search. ارسم دائرة أو ظلل أو انقر أي شيء على شاشة Android للبحث عنه في موضعه من دون تبديل التطبيق.
- AI Mode (عصر Gemini). الواجهة الحالية: يصبح الاستعلام متعدد الوسائط (صورة مع متابعة منطوقة أو مكتوبة) تفاعلاً واحداً يتفرع إلى استعلامات فرعية كثيرة ويعيد إجابة مركبة مستشهدة بالمصادر. هنا تلتقي المدخلات متعددة الوسائط بالاسترجاع الوكيلي على غرار RAG الموصوف في هذه المجموعة.
لدى Microsoft مسارها أيضاً — Bing Visual Search وCopilot Vision — ويؤدي وظيفة مشابهة في Bing، ولذلك لا يقتصر البحث متعدد الوسائط على Google.
أين يمكن أن يفشل قبل بدء الاسترجاع؟
يجب أن يمر كل وسيط غير النص النظيف بخطوة تحويل قبل المطابقة في الفضاء المشترك، وقد تُدخل هذه الخطوة أخطاء لا تراها مرحلة الاسترجاع. وتصف وثائق المورّدين التقنية للنماذج متعددة الوسائط هذه الفئة من القيود:
- أخطاء OCR — قد تُقرأ النصوص داخل صورة (لافتة أو لقطة شاشة أو ملصق) خطأً، خصوصاً مع الدقة المنخفضة أو الخط غير المألوف.
- أخطاء التعرف على الكلام — تنتقل الكلمة المنسوخة خطأً من الصوت أو الفيديو إلى ما يُضمَّن ويُسترجع.
- أخذ عينات الإطارات — لا يُفهم الفيديو إطاراً بإطار؛ تأخذ الأنظمة عينة من الإطارات، وقد يفوتها محتوى لا يظهر إلا بينها.
- الاقتصاص والدقة — يملك النظام الذي يعمل على صورة منخفضة الدقة أو شديدة الاقتصاص معلومات أقل من المشهد الأصلي.
- اللغة — لا تثبت الدقة في لغة الدقة في أخرى؛ ويختلف أداء OCR والتعرف على الكلام حسب اللغة.
- السياق المفقود — تمنح الصورة أو المقطع المنفصل عن سياق الصفحة (التعليق والنص البديل والنص المكتوب) النظام ركائز أقل للفهم.
لا يختص أي من ذلك بمورّد واحد، وهو سبب للتعامل بحذر مع ادعاءات «يستطيع النموذج رؤية/سماع X»؛ فالقدرة التي تعمل في مثال اختباري نظيف وجيد الإضاءة وعالي الدقة لا تثبت عملها في النسخة الواقعية الأكثر فوضى.
ما المؤكد وما النظري؟
هنا تهم الكتابة الحذرة، لأن الموضوع يجذب المبالغة.
مؤكد بدرجة معقولة:
- تقبل محركات البحث الاستعلامات متعددة الوسائط وتفهمها — فالصور والصوت ورسم الدائرة على الشاشة منتجات حقيقية متاحة.
- يقوم الاسترجاع خلف إجابات الذكاء الاصطناعي على المعنى (التضمينات/الاسترجاع الدلالي)، ويكون في AI Mode مؤسساً في فهرس Search الأساسي — فلا يوجد «فهرس ذكاء اصطناعي» منفصل.
- تقول Google صراحة إن ميزات الذكاء الاصطناعي تعتمد على أنظمة الترتيب والجودة الأساسية في Search، ولذلك تظل سلسلة الزحف ← الفهرسة ← الاسترجاع هي التي تحكم إمكان ظهور المحتوى.
نظرية في الصناعة — صِفها كذلك:
- أن Google يرتب صورك المنفردة أو إطارات الفيديو بوصفها «إشارة ترتيب متعددة الوسائط» مستقلة يمكنك تحسينها بمعزل. لم تنشر Google «عامل ترتيب متعدد الوسائط». ومدى فهم المحتوى المرئي/الصوتي على مستوى الصفحة إطاراً بإطار على نطاق الويب موثق جزئياً فقط.
- الادعاءات الدقيقة عن مقدار الوزن الذي يمنحه الاستعلام متعدد الوسائط للصورة مقارنة بالنص المصاحب. تعامل مع النسب المحددة بوصفها تخميناً.
القراءة الآمنة: حسّن المحتوى كي يُفهم ويُسترجع عبر الوسائط، لا لآلية لم تؤكدها Google.
ماذا يعني ذلك لـSEO؟
بعد إزالة المبالغة يصبح الدليل ملموساً ومألوفاً:
- اجعل الصور مقروءة آلياً. استخدم نصاً بديلاً وصفياً وأسماء ملفات ذات معنى، وبيانات منظمة للصور عند الملاءمة. يخبر النص البديل محرك البحث بما تعرضه الصورة من دون «رؤيتها»، ويظل مفيداً مع تحسن الفهم المرئي.
- امنح الصوت والفيديو نصاً حقيقياً. تجعل النصوص المكتوبة والترجمات المصاحبة والسياق الواضح على الصفحة المحتوى المنطوق قابلاً للاسترجاع والاقتباس. يصعب تأسيس إجابة على فيديو بلا نص مكتوب.
- استخدم البيانات المنظمة حيث تلائم. تمنح ترميزات
ProductوImageObjectوVideoObjectوأنواعRecipeالآلات حقائق لا لبس فيها لربطها باستعلام مرئي أو منطوق. - أجب عن السؤال الضمني. يحمل الاستعلام المرئي نية — «ما هذا؟»، «أين أشتريه؟»، «كيف أصلحه؟». ويُسترجع المحتوى الذي يجيب مباشرة عن تلك النية في مقطع مستقل. وهذا هو الوضوح على مستوى المقطع الذي يكافئه ترتيب المقاطع وRAG.
- لا تتغير المتطلبات السابقة. ما تزال الإجابات متعددة الوسائط تسترجع من الفهرس الأساسي، فتأتي قابلية الزحف والفهرسة أولاً — وهي السلسلة نفسها التي يغطيها الزحف والتأسيس وRAG.
لا يضمن أي من ذلك نتيجة. تصف وثائق Google للصور والفيديو النص البديل والنصوص المكتوبة والبيانات المنظمة بأنها وسائل مساعدة على الأهلية والفهم — تساعد محرك البحث على اكتشاف المحتوى وفهمه وربطه بالاستعلام الصحيح — لا مدخلات في صيغة ترتيب موثقة. يجعل ذلك محتواك قابلاً للاسترجاع والاستشهاد، لكنه لا يضمن الاسترجاع أو الاستشهاد أو موضع الترتيب أو دقة وصف الإجابة المولدة له.
الخلاصة في جملة: وسّع البحث متعدد الوسائط الباب الأمامي، لكنه لم يغير ما وراءه. كن قابلاً للعثور عليك، ووضّح ما تصوره وسائطك، وأجب عن السؤال الذي يوحي به الاستعلام.
ملخص الذكاء الاصطناعي
خلاصة مركزة من النسخة المتقدمة:
- البحث متعدد الوسائط = الاستعلام والاسترجاع عبر النص والصورة والفيديو والصوت في تفاعل واحد. وهو أوسع من بحث الصور؛ إذ يستخدم الصورة أو الصوت أو الفيديو مدخلاً لإعادة أي نوع من النتائج، لا الصور وحدها.
- ثلاثة أبعاد مستقلة. وسيط الاستعلام المقبول، ووسيط المحتوى المسترجع، ووسيط المخرج أسئلة مختلفة؛ وتأكيد أحدها لا يؤكد البقية.
- الممكّن هو فضاء تضمين مشترك عبر خمس مراحل مستقلة (فهم المدخلات، والتضمين، والاسترجاع، وإعادة الترتيب، والتوليد). تثبت الأنظمة البحثية المسماة (CLIP وALIGN وImageBind) وجود فضاءات تضمين مشتركة ونجاحها، لكنها لا تثبت بنية الإنتاج لدى مورّد بعينه، ولا يكشف سلوك المخرجات وحده تلك البنية.
- مسار Google: البحث الصوتي والصوري ← MUM (عام 2021، متعدد الوسائط، “1,000 times more powerful than BERT” (ترجمة) «أقوى من BERT بألف مرة»، و75 لغة، لكنه أداة ضيقة للحالات عالية التعقيد لا محرك الترتيب العام) ← Google Lens ← Circle to Search ← AI Mode في عصر Gemini، حيث تتفرع الصورة والمتابعة إلى إجابة مؤسسة ومستشهدة. ويوازيه لدى Microsoft: Bing Visual Search وCopilot Vision.
- الفشل قبل الاسترجاع: قد تفسد أخطاء OCR والتعرف على الكلام وفجوات أخذ عينات الفيديو وحدود الاقتصاص والدقة وتباين اللغات والسياق المحيط المفقود الفهم قبل بدء المطابقة.
- المؤكد: الاستعلامات متعددة الوسائط حقيقية؛ واسترجاع الذكاء الاصطناعي قائم على المعنى ومؤسس في فهرس Search الأساسي (لا فهرس AI منفصل)؛ وتظل سلسلة الزحف ← الفهرسة ← الاسترجاع تحكم الأهلية.
- نظرية الصناعة: «إشارة ترتيب متعددة الوسائط» مستقلة لصورك/إطاراتك، والأوزان الدقيقة للصورة مقابل النص. لم تؤكد Google ذلك.
- دليل SEO: نص بديل وصفي وأسماء ملفات مفيدة، ونصوص مكتوبة وترجمات مصاحبة حقيقية، وبيانات منظمة
Product/ImageObject/VideoObject، ومحتوى مستقل يجيب عن النية الضمنية للاستعلام المرئي أو الصوتي. تظل قابلية الزحف والفهرسة شرطاً، ولا يضمن شيء منها الاسترجاع أو الترتيب أو الاستشهاد؛ فهي وسائل مساعدة على الأهلية والفهم وليست مدخلات ترتيب موثقة.
الوثائق الرسمية
مواد أولية من محركات البحث عن واجهات البحث متعددة الوسائط والأنظمة التي تقف وراءها.
- MUM: A new AI milestone for understanding information — إعلان عام 2021 عن Multitask Unified Model متعدد الوسائط واللغات.
- How AI powers great search results — كيف تتكامل RankBrain والمطابقة العصبية وBERT وMUM وفق كلمات Google نفسها.
- Google’s Guide to Optimizing for Generative AI Features — تعتمد AI Overviews وAI Mode على ترتيب Search الأساسي؛ والتأسيس/RAG وتفرع الاستعلام.
- AI Mode and AI Overviews updates — تجربة AI Mode متعددة الوسائط المتطورة.
- Visual search with Lens on Shopping — تطبيق الكاميرا بوصفها استعلاماً على التسوق.
- Image SEO best practices — النص البديل الوصفي وأسماء الملفات والبيانات المنظمة للصور.
- Video SEO best practices —
VideoObjectوالنصوص المكتوبة وكيف تفهم Google الفيديو.
Microsoft / Bing
- Bing Visual Search — واجهة Bing التي تستخدم الصورة استعلاماً.
- Copilot Vision — مساعد Microsoft متعدد الوسائط الذي يستطيع «رؤية» ما على الشاشة والاستدلال عليه عبر تطبيق Copilot في Windows.
اقتباسات من المصدر
تصريحات مسجلة من Google عن التحول متعدد الوسائط. تنقلك الروابط العميقة إلى المقطع المقتبس حيث تدعمه الصفحة.
Google — MUM متعدد الوسائط
- MUM “multimodal, so it understands information across text and images and, in the future, can expand to more modalities like video and audio.” (ترجمة) «MUM متعدد الوسائط، ولذلك يفهم المعلومات عبر النصوص والصور، ويمكنه مستقبلاً التوسع إلى وسائط أخرى مثل الفيديو والصوت». — Pandu Nayak من Google، في إعلان MUM. اقرأ الإعلان — Pandu Nayak من Google، في إعلان MUM. اقرأ الإعلان
- MUM “1,000 times more powerful than BERT” (ترجمة) «MUM أقوى من BERT بألف مرة»، ويمكنه بخلاف BERT فهم اللغة وتوليدها عبر 75 لغة. اقرأ الإعلان (ترجمة) MUM «أقوى من BERT بألف مرة»، ويمكنه، بخلاف BERT، فهم اللغة وتوليدها عبر 75 لغة. اقرأ الإعلان
Google — ميزات الذكاء الاصطناعي تعمل على فهرس Search الأساسي
- “Our generative AI features on Google Search are rooted in our core Search ranking and quality systems.” (ترجمة) «ترتكز ميزات الذكاء الاصطناعي التوليدي في Google Search على أنظمة الترتيب والجودة الأساسية في Search». — دليل تحسين الذكاء الاصطناعي من Google Search Central. (لهذا تظل سلسلة الزحف ← الفهرسة ← الاسترجاع تحكم أهلية الذكاء الاصطناعي متعدد الوسائط.) اقرأ الدليل (ترجمة) دليل Google Search Central لتحسين الذكاء الاصطناعي؛ ولهذا تظل سلسلة الزحف ← الفهرسة ← الاسترجاع تحكم أهلية الذكاء الاصطناعي متعدد الوسائط. اقرأ الدليل
لأي واجهة متعددة الوسائط أحسّن فعلياً؟
لا يوجد مقبض واحد لـ«SEO متعدد الوسائط»؛ فالعمل المفيد يتوقف على كيفية وصول الناس إلى محتواك. اتبع الفرع المناسب.
1. هل يصوّر الناس منتجات مادية للعثور عليها أو شرائها؟
→ أنت في نطاق Google Lens / التسوق المرئي. أعط الأولوية لصور المنتجات النظيفة، وبيانات Product + ImageObject المنظمة، والنص البديل وأسماء الملفات الوصفية، وخلاصة تاجر/منتج دقيقة. نية الاستعلام هي «ما هذا؟ / أين أشتريه؟ / كم سعره؟».
2. هل يرسم الناس دائرة حول أشياء أو يلتقطون صوراً لها داخل محتواك لمعرفة المزيد؟ → فكّر في Circle to Search / الاستعلامات على الشاشة. الرافعة هي وضوح الصفحة: سمِّ المخططات والصور، واجعل التعليقات وصفية، وتأكد من أن النص المحيط يجيب عن المتابعة الواضحة كي يصل المصطلح المحدد إلى شرحك.
3. هل محتواك منطوق أو فيديو أساساً؟
→ أنت تحسّن لـالاستعلامات الصوتية وفهم الفيديو. انشر نصوصاً مكتوبة وترجمات مصاحبة حقيقية، وأضف ترميز VideoObject، وضع ملخصاً نصياً بسيطاً قرب الوسائط. لا يستطيع محرك البحث استرجاع واقتباس ما لا يستطيع قراءته.
4. هل تريد الظهور في إجابات AI Mode / AI Overview للاستعلامات المرئية أو الصوتية؟ → هذا تأسيس / RAG، لا قناة منفصلة متعددة الوسائط. كن قابلاً للزحف والفهرسة أولاً، ثم اكتب مقاطع مستقلة تجيب عن الأسئلة الفرعية الضمنية التي يطرحها استعلام متعدد الوسائط متفرع (انظر ترتيب المقاطع وRAG والتأسيس).
5. هل يُطلب منك «التحسين لخوارزمية الترتيب متعددة الوسائط»؟ → توقف. لم تنشر Google عامل ترتيب متعدد الوسائط مستقلاً لصورك أو إطاراتك — هذه نظرية صناعية. نفّذ الأساسيات المؤكدة أعلاه ولا تطارد آلية غير مؤكدة.
النماذج الذهنية
1. الوسيط مجرد قناة. نص وصورة وصوت وفيديو. أحادي الوسيط = قناة واحدة؛ متعدد الوسائط = أكثر من قناة يُستدل عليها معاً. تبدو الكلمة غريبة، أما الفكرة فلا.
2. البحث متعدد الوسائط ≠ بحث الصور. يعيد بحث الصور صوراً. ويستخدم البحث متعدد الوسائط صورة (أو صوتاً أو فيديو) مدخلاً لإعادة أي نوع من النتائج. الكاميرا جهاز إدخال وليست الوجهة.
3. الفضاء المشترك هو الحيلة كلها. تُشفّر الوسائط المختلفة في فضاء التضمين نفسه، فتُقارن الصورة والعبارة بحسب المعنى. إذا كنت تعرف البحث الدلالي والمتجهي فأنت تعرف البحث متعدد الوسائط؛ فالمرمّزات تتحدث وسائط أكثر فحسب.
4. استعلام مؤكد مقابل ترتيب نظري. الاستعلامات متعددة الوسائط مؤكدة ومتاحة. أما إشارة ترتيب مستقلة متعددة الوسائط لوسائطك فغير مؤكدة. حسّن لكي تُفهم وتُسترجع، لا لآلية غير مؤكدة.
5. سلسلة المتطلبات السابقة لم تتغير. تسترجع إجابات الذكاء الاصطناعي متعددة الوسائط من الفهرس الأساسي. وتظل الزحف ← الفهرسة ← الاسترجاع بوابة كل شيء، فتسبق الأساسيات (قابل للزحف ومفهرس وواضح) أي شيء «خاص بمتعدد الوسائط».
6. المقروئية الآلية هي الرافعة. لا يمكنك تسليم المحرك بكسلات والأمل. النص البديل وأسماء الملفات والنصوص المكتوبة والترجمات المصاحبة والبيانات المنظمة هي ما يجعل الشيء المرئي أو المنطوق قابلاً للمطابقة والاستشهاد.
البحث متعدد الوسائط — ورقة غش
تعريف في سطر واحد الاستعلام والاسترجاع عبر النص والصورة والفيديو والصوت في تفاعل واحد — يتيحه فضاء تضمين مشترك، وهو الاسترجاع بحسب المعنى نفسه في البحث الدلالي بعد امتداده خارج النص.
الواجهات
| الواجهة | المدخل | المالك |
|---|---|---|
| Google Lens | كاميرا / صورة | |
| Circle to Search | دائرة/تظليل على الشاشة | Google (Android) |
| البحث الصوتي | استعلام منطوق | Google وغيرها |
| AI Mode | صورة + نص/صوت، مع تفرع | Google (Gemini) |
| Bing Visual Search | صورة | Microsoft |
| Copilot Vision | شاشة / كاميرا + دردشة | Microsoft |
البحث متعدد الوسائط مقابل بحث الصور
| بحث الصور | البحث متعدد الوسائط | |
|---|---|---|
| المدخل | نص أو صورة | صورة / صوت / فيديو (+ نص) |
| المخرج | صور | أي نوع من النتائج |
| الصورة هي… | ما تريده | جزء من الاستعلام |
المؤكد مقابل النظري
| الادعاء | الحالة |
|---|---|
| يقبل البحث استعلامات الصور والصوت والشاشة | مؤكد |
| تسترجع إجابات الذكاء الاصطناعي من الفهرس الأساسي | مؤكد |
| «إشارة ترتيب متعددة الوسائط» مستقلة لصورك/إطاراتك | نظرية صناعية |
| الوزن الدقيق للصورة مقابل النص في استعلام | تخمين |
الدليل المؤكد
- نص بديل وصفي + أسماء ملفات ذات معنى.
- نصوص مكتوبة وترجمات مصاحبة حقيقية للصوت/الفيديو.
- بيانات منظمة
Product/ImageObject/VideoObject. - مقاطع مستقلة تجيب عن نية الاستعلام الضمنية.
- قابل للزحف + مفهرس أولاً — لا فهرس AI منفصل.
قائمة تحقق الجاهزية لمتعدد الوسائط
مراجعة للتأكد من إمكان فهم محتواك واسترجاعه عبر الوسائط:
- لكل صورة ذات معنى نص بديل وصفي (لا حشو كلمات مفتاحية ولا قيمة فارغة لصور المحتوى).
- تصف أسماء الملفات الموضوع (
blue-wingback-chair.jpgلاIMG_4821.jpg). - تحمل صفحات المنتجات/المرئيات بيانات منظمة مناسبة (
ProductوImageObjectوRecipeوغيرها). - للفيديوهات نص مكتوب و/أو ترجمات مصاحبة، إضافة إلى ترميز
VideoObjectوملخص نصي في الصفحة. - يأتي محتوى الصوت/البودكاست مع نص مكتوب قابل للقراءة.
- للمخططات ولقطات الشاشة تعليقات وصفية ونص محيط يجيب عن سؤال المتابعة الواضح.
- تجيب الصفحات التي يصل إليها استعلام مرئي مباشرة عن النية الضمنية («ما هذا؟ / أين أشتريه؟ / كيف أصلحه؟») في مقطع مستقل.
- لا تُحجب الصور والوسائط عن الزحف، والصفحات المضيفة قابلة للفهرسة (سلسلة الاسترجاع سليمة).
- أنت لا تعتمد على «عامل ترتيب متعدد الوسائط» غير مؤكد — فالخطة تقوم على الأساسيات المؤكدة أعلاه.
جرد سياق الصور في المتصفح
شغّل هذا في Chrome DevTools Console على صفحة ممثلة. يسرد مصدر كل صورة وأبعادها ونصها البديل وأقرب عنوان:
console.table([...document.images].map(img => ({ src: img.currentSrc || img.src, width: img.naturalWidth, height: img.naturalHeight, alt: img.getAttribute('alt'), heading: img.closest('section, article, main')?.querySelector('h1,h2,h3')?.textContent?.trim() || '' })));يُعد غياب alt وضعف القسم المحيط علامتي مراجعة، لا إخفاقي SEO تلقائيين. ويمكن للصور الزخرفية استخدام نص بديل فارغ بصورة صحيحة.
اعثر على الصور التي تتطلب تفاعلاً للحصول على عنوان URL
شغّل هذا قبل النقر في المعارض أو دوارات الصور:
const urls = new Set([...document.images].map(i => i.currentSrc || i.src));
console.table([...document.querySelectorAll('[data-src], [data-lazy-src]')].map(el => ({ pending: el.dataset.src || el.dataset.lazySrc, alreadyRendered: urls.has(el.dataset.src || el.dataset.lazySrc) })));لا يعني انتظار الصورة بالضرورة تعذر الوصول إليها، لكن النتيجة تحدد الأصول التي تحتاج إلى زحف صفحة معروضة ومراجعة تفاعل.
تحقق من أصول الصور وسياقها بعد النشر
الاختبار: اجلب الصفحة بزاحف يعرض JavaScript وصدّر عناوين URL للصور ورموز الحالة والنصوص البديلة وعناوين الصفحة المُحيلة. النتيجة المتوقعة: تعود الصور المهمة بنجاح وتظهر في HTML المعروض مع سياق دقيق للصفحة. تفسير الفشل: الأصل معطل أو لا يُحمّل إلا بعد تفاعل غير مدعوم أو منفصل عن النص الذي يشرحه. نافذة المراقبة: فور النشر. محفز التراجع: يزيل الإصدار صور المنتجات أو التعليمات أو المحتوى الأساسي المهمة أو يعطلها.
تحقق من ارتباطات الصور المنظمة
الاختبار: افحص أي بيانات منظمة ذات صلة وعناوين URL للصور المشار إليها عبر سير عمل التحقق الملائم للمخطط. النتيجة المتوقعة: تُحل الصور المشار إليها وتنتمي إلى الكيان الموصوف في الصفحة. تفسير الفشل: يشير الترميز إلى أصل مفقود أو محجوب أو غير ذي صلة. نافذة المراقبة: فوراً للترميز وفحوص HTTP؛ ولمظهر البحث بعد إعادة الزحف فقط. محفز التراجع: ينشئ التغيير ترميزاً غير صالح أو يربط الصورة الخطأ بالكيان.
اختبر نفسك: Multimodal Search
خمسة أسئلة سريعة عن كيفية عمل البحث عبر النص والصور والفيديو والصوت. اختر إجابة لكل سؤال ثم تحقق.
موارد تستحق وقتك
كتاباتي ذات الصلة
- Google AI Overviews: All You Need to Know — كيف تسترجع إجابات الذكاء الاصطناعي من الفهرس الأساسي، وهو شرط الظهور في النتائج متعددة الوسائط.
- ما نعرفه فعلياً عن تحسين البحث بنماذج اللغة الكبيرة — نظرة قائمة على الأدلة إلى ما يؤثر وما لا يؤثر في استشهادات الذكاء الاصطناعي، ومفيدة لفصل الآليات المؤكدة عن المبالغة.
محاضراتي
- كيف يعمل البحث (SlideShare) — شرحي للزحف والعرض والفهرسة والترتيب؛ وهو خط المعالجة الذي ما يزال الاسترجاع متعدد الوسائط يعمل عليه. (ينطبق تنبيهي الدائم: “This is my understanding of systems… not going to be 100% complete or accurate.” (ترجمة) «هذا هو فهمي للأنظمة… ولن يكون كاملاً أو دقيقاً بنسبة 100%».)
من أنحاء الصناعة
- MUM: A new AI milestone for understanding information — إعلان Google عن MUM (متعدد الوسائط واللغات وأقوى من BERT بألف مرة).
- How AI powers great search results — Google عن تكامل أنظمة الذكاء الاصطناعي ومنها MUM.
- Google’s Guide to Optimizing for Generative AI Features — الموقف الرسمي بأن ميزات الذكاء الاصطناعي تعمل على ترتيب Search الأساسي (لا فهرس AI منفصل).
- Google Images SEO best practices — أساسيات مقروئية الصور المؤكدة (النص البديل وأسماء الملفات والبيانات المنظمة).
- Video SEO best practices — كيف تفهم Google الفيديو وأساسيات
VideoObjectوالنصوص المكتوبة. - Bing Visual Search — واجهة Microsoft التي تستخدم الصورة استعلاماً، وتذكير بأن البحث متعدد الوسائط لا يقتصر على Google.
فيديوهات
- Google Search Central (YouTube) — سلسلة How Google Search Works وشروحات Martin Splitt عن كيفية فهم Google للصور والفيديو ومحتوى الصفحة — جانب الفهم الآلي في البحث متعدد الوسائط. القناة
سجل التغييرات
تم التحديث في 10 أغسطس 2026.
ملخص تحريري وتفاصيل التغيير المسجلة.تفاصيل التغيير
-
تفاصيل التغيير متاحة حاليًا باللغة الإنجليزية.
المقارنة الكاملة غير متاحة — لم تُؤرشف لقطة سابقة لهذه المراجعة.
تم التحديث في 19 يوليو 2026.
ملخص تحريري وتفاصيل التغيير المسجلة.تفاصيل التغيير
-
تفاصيل التغيير متاحة حاليًا باللغة الإنجليزية.
-
تفاصيل التغيير متاحة حاليًا باللغة الإنجليزية.
-
تفاصيل التغيير متاحة حاليًا باللغة الإنجليزية.
-
تفاصيل التغيير متاحة حاليًا باللغة الإنجليزية.
-
تفاصيل التغيير متاحة حاليًا باللغة الإنجليزية.
-
تفاصيل التغيير متاحة حاليًا باللغة الإنجليزية.
-
تفاصيل التغيير متاحة حاليًا باللغة الإنجليزية.
المقارنة الكاملة غير متاحة — لم تُؤرشف لقطة سابقة لهذه المراجعة.