البحث متعدد الوسائط

كيف يعمل البحث عبر النصوص والصور والفيديو والصوت — Google Lens وCircle to Search وAI Mode متعدد الوسائط وMUM — وما أكدته محركات البحث فعلياً بشأن تحسين المحتوى له.

نُشر أول مرة: 3 يوليو 2026 · آخر تحديث: 10 أغسطس 2026 · Advanced
اللغات

البحث متعدد الوسائط يعني الاستعلام والاسترجاع عبر أكثر من وسيط — النص والصورة والفيديو والصوت معاً — بدلاً من كتابة كلمات وتلقي روابط فقط. وهو التحول الذي يقف وراء Google Lens وCircle to Search والبحث الصوتي وAI Mode متعدد الوسائط. ويتيح ذلك فضاء تضمين مشترك تُطابق فيه الوسائط بحسب المعنى. وما تؤكده المصادر الرسمية يتعلق في الغالب بفهم الاستعلام عبر الوسائط؛ أما الادعاءات الشاملة عن «تحسين ترتيب متعدد الوسائط» فهي نظرية غير مؤكدة. وتظل الممارسات المتينة مألوفة: نص بديل وصفي، وأسماء ملفات مفيدة، ونصوص مكتوبة وترجمات مصاحبة حقيقية، وبيانات منظمة نظيفة، ومحتوى يجيب عن السؤال الذي يوحي به الاستعلام المرئي أو الصوتي.

الخلاصة — البحث متعدد الوسائط هو الاستعلام والاسترجاع عبر النص والصورة والفيديو والصوت في تفاعل واحد. يتيحه فضاء تضمين مشترك: تُشفَّر الوسائط المختلفة في الفضاء المتجهي نفسه كي تُطابق بحسب المعنى — أي فكرة الاسترجاع في البحث الدلالي بعد تعميمها خارج النص. يمتد المسار العلني لدى Google من البحث الصوتي وبحث الصور إلى MUM (عام 2021، متعدد الوسائط، وُصف بأنه “1,000 times more powerful than BERT” (ترجمة) «أقوى من BERT بألف مرة»، واستُخدم لحالات ضيقة عالية التعقيد) ثم Google Lens وCircle to Search وAI Mode المدعوم بـGemini، حيث تصبح الصورة وسؤال المتابعة استعلاماً واحداً يتفرع إلى إجابة مركبة. أما المؤكد رسمياً فيتعلق غالباً بفهم الاستعلام عبر الوسائط؛ والقول إن Google يرتب صورك المنفردة أو إطارات الفيديو باعتبارها «إشارة متعددة الوسائط» مستقلة ليس سوى نظرية في الصناعة. والدليل المتين: نص بديل وصفي وأسماء ملفات مفيدة، ونصوص مكتوبة وترجمات مصاحبة حقيقية، وبيانات منظمة نظيفة، ومحتوى يجيب عن السؤال الضمني وراء الاستعلام المرئي أو المنطوق.

ما الذي تعنيه «متعدد الوسائط» فعلياً؟

يبين بحث التمثيل المشترك منهجاً واحداً للاسترجاع عبر الوسائط، لا بنية إنتاجية عامة. Evidence for this claim CLIP learns joint image-and-text representations from paired internet data and supports zero-shot image classification. Scope: CLIP research results; multimodal search products may use different models, training data, and ranking pipelines. Confidence: high · Verified: Radford et al.: Learning Transferable Visual Models وتوثق أوصاف منتجات البحث الميزات لا آليات الترتيب الكاملة. Evidence for this claim Google Multisearch lets users combine an image with text to refine a search. Scope: Google's documented consumer search feature; it does not define all multimodal retrieval systems. Confidence: high · Verified: Google: Multisearch

الوسيط قناة للمعلومات — نص مكتوب أو صورة أو صوت منطوق أو فيديو. يتعامل النظام أحادي الوسيط مع قناة واحدة؛ أما النظام متعدد الوسائط فيستقبل أكثر من قناة أو ينتج أكثر من نوع من المخرجات، والأهم أنه يستدل عليها معاً بدلاً من إلصاق خطوط معالجة منفصلة.

البحث متعدد الوسائط أوسع من «بحث الصور»، والفرق مهم:

  • بحث الصور يعثر على صور تريدها.
  • البحث متعدد الوسائط يستخدم صورة (أو صوتاً أو فيديو) كجزء من استعلام يمكن أن يعيد أي نوع من النتائج — قائمة تسوق أو شرحاً عملياً أو تعريفاً أو دبوساً على خريطة. الكاميرا جهاز إدخال وليست الشيء المطلوب.

لذلك فإن «وجّه الكاميرا إلى قطعة مكسورة واسأل كيف تصلحها» بحث متعدد الوسائط؛ أما «اعثر لي على صور لهذه القطعة» فهو بحث صور. يفعل Google Lens كليهما، ولهذا يلتبس الحد الفاصل.

من المفيد أيضاً فصل ثلاثة أسئلة، لأن وصف منتج واحد قد يخلط بينها: ما وسيط الاستعلام المقبول (نص فقط أم نص مع صورة أو صوت أو فيديو)؟ ما وسيط المحتوى المرشح المسترجع (صفحة نصية أم صورة أم فيديو)؟ وما وسيط المخرج المولّد (قائمة روابط أم شبكة صور أم إجابة نصية مركبة)؟ قبول صورة لا يعني تلقائياً استرجاع صور أو إنتاج صورة؛ فقد تسترجع صورة قطعة مكسورة صفحة نصية وتنتج إجابة نصية. وتأكيد أحد الأبعاد الثلاثة لا يؤكد البعدين الآخرين؛ تحقّق من كل واحد وفق ما وثقه المورّد للميزة المحددة.

الممكّن التقني: فضاء مشترك واحد

Multimodal retrieval works when different input types can be compared by meaning in one shared space. المصدر: /ai-search/how-search-works/embeddings/

Text queries, image queries, and audio or video queries are encoded into a shared semantic embedding space. Meaningfully similar items land near one another, allowing a nearest-neighbor search to retrieve relevant content across input types. The diagram is a conceptual model, not a claim about a specific Google ranking formula.

© Patrick Stox LLC · CC BY 4.0 ·

يمكن مقارنة صورة وعبارة بسبب التمثيل المشترك. ترسم نماذج الترميز النصوص والصور والصوت والفيديو في فضاء تضمين واحد عالي الأبعاد، حيث يصبح التشابه الدلالي قرباً هندسياً. تقع صورة نبات وعبارة «كيف أعتني بهذا النبات؟» متقاربتين، فيربطهما بحث أقرب جار.

هذه هي آلية البحث الدلالي ومرحلة الاسترجاع في RAG بعد تعميمها خارج النص، وهي تنقسم إلى مراحل مستقلة، فلا يثبت تفوق النظام في مرحلة أنه يتفوق في غيرها:

  1. فهم المدخلات. يُحلل الاستعلام (صورة مع نص مثلاً، أو سؤال منطوق) إلى التمثيل الذي تحتاجه المرحلة التالية.
  2. التضمين. يُشفّر ذلك التمثيل وكل جزء مرشح من المحتوى في الفضاء المتجهي المشترك.
  3. الاسترجاع. يعثر البحث المتجهي على أقرب التطابقات بالمسافة الهندسية.
  4. إعادة الترتيب. تعيد مرحلة منفصلة ترتيب المرشحين بإشارات تتجاوز مسافة التضمين الخام.
  5. التوليد. في واجهات الذكاء الاصطناعي، تُستخدم أفضل النتائج لتأسيس إجابة مركبة.

إذا فهمت التضمينات والتقسيم إلى مقاطع والبحث المتجهي والتأسيس، فأنت تفهم بنية البحث متعدد الوسائط؛ الجديد الوحيد أن برامج الترميز تتحدث أكثر من وسيط.

أنظمة بحثية مسمّاة، لا مخطط إنتاج مؤكد. فكرة التضمين المشترك ليست افتراضية؛ فقد درّب CLIP من OpenAI وALIGN من Google مرمّزات الصور والنصوص في فضاء واحد باستخدام أزواج الصور والنصوص، ومدّ ImageBind من Meta النهج إلى ستة وسائط (الصورة والنص والصوت والعمق والحرارة والحركة). وهذه بُنى بحثية منشورة لها بياناتها وتقييماتها — مفيدة لفهم كيفية بناء فضاء مشترك، وليست دليلاً على أن محرك بحث تجارياً بعينه يستخدم التصميم نفسه. ولا يكشف سلوك مخرجات المورّد وحده إن كان يستخدم فضاء تضمين مشتركاً أو طريقة دمج أخرى أو كيف يزن كل وسيط؛ فهذا شأن داخلي لا يستطيع أحد خارج المورّد فحصه.

المسار العلني لدى Google

فيما يلي خطوات Google المؤكدة نحو البحث متعدد الوسائط، بالترتيب التقريبي:

  • البحث الصوتي وبحث الصور (عقد 2010). كانت الاستعلامات المنطوقة والبحث العكسي بالصور أول المدخلات غير النصية واسعة الاستخدام.
  • MUM — Multitask Unified Model (2021). العلامة العلنية لدى Google للتحول متعدد الوسائط. وصفت Google نموذج MUM بأنه متعدد الوسائط وقادر على “understand information across text and images” (ترجمة) «فهم المعلومات عبر النصوص والصور» — وبأنه “1,000 times more powerful than BERT,” (ترجمة) «أقوى من BERT بألف مرة» — ومدرّب عبر 75 لغة وقادر على فهم اللغة وتوليدها. والتنبيه المهم من تاريخ البحث الدلالي: لم يكن MUM قط محرك الترتيب العام لدى Google. استُخدم في حالات ضيقة عالية التعقيد (أسئلة مركبة متعددة الخطوات وبعض المقتطفات المميزة والتسوق)، ولم «يستبدل» BERT.
  • Google Lens. الكاميرا بوصفها استعلاماً على نطاق واسع — تحديد الأشياء وترجمة نص داخل صورة والتسوق مما تراه وحل مشكلة تصوّرها.
  • Circle to Search. ارسم دائرة أو ظلل أو انقر أي شيء على شاشة Android للبحث عنه في موضعه من دون تبديل التطبيق.
  • AI Mode (عصر Gemini). الواجهة الحالية: يصبح الاستعلام متعدد الوسائط (صورة مع متابعة منطوقة أو مكتوبة) تفاعلاً واحداً يتفرع إلى استعلامات فرعية كثيرة ويعيد إجابة مركبة مستشهدة بالمصادر. هنا تلتقي المدخلات متعددة الوسائط بالاسترجاع الوكيلي على غرار RAG الموصوف في هذه المجموعة.

لدى Microsoft مسارها أيضاً — Bing Visual Search وCopilot Vision — ويؤدي وظيفة مشابهة في Bing، ولذلك لا يقتصر البحث متعدد الوسائط على Google.

أين يمكن أن يفشل قبل بدء الاسترجاع؟

يجب أن يمر كل وسيط غير النص النظيف بخطوة تحويل قبل المطابقة في الفضاء المشترك، وقد تُدخل هذه الخطوة أخطاء لا تراها مرحلة الاسترجاع. وتصف وثائق المورّدين التقنية للنماذج متعددة الوسائط هذه الفئة من القيود:

  • أخطاء OCR — قد تُقرأ النصوص داخل صورة (لافتة أو لقطة شاشة أو ملصق) خطأً، خصوصاً مع الدقة المنخفضة أو الخط غير المألوف.
  • أخطاء التعرف على الكلام — تنتقل الكلمة المنسوخة خطأً من الصوت أو الفيديو إلى ما يُضمَّن ويُسترجع.
  • أخذ عينات الإطارات — لا يُفهم الفيديو إطاراً بإطار؛ تأخذ الأنظمة عينة من الإطارات، وقد يفوتها محتوى لا يظهر إلا بينها.
  • الاقتصاص والدقة — يملك النظام الذي يعمل على صورة منخفضة الدقة أو شديدة الاقتصاص معلومات أقل من المشهد الأصلي.
  • اللغة — لا تثبت الدقة في لغة الدقة في أخرى؛ ويختلف أداء OCR والتعرف على الكلام حسب اللغة.
  • السياق المفقود — تمنح الصورة أو المقطع المنفصل عن سياق الصفحة (التعليق والنص البديل والنص المكتوب) النظام ركائز أقل للفهم.

لا يختص أي من ذلك بمورّد واحد، وهو سبب للتعامل بحذر مع ادعاءات «يستطيع النموذج رؤية/سماع X»؛ فالقدرة التي تعمل في مثال اختباري نظيف وجيد الإضاءة وعالي الدقة لا تثبت عملها في النسخة الواقعية الأكثر فوضى.

ما المؤكد وما النظري؟

هنا تهم الكتابة الحذرة، لأن الموضوع يجذب المبالغة.

مؤكد بدرجة معقولة:

  • تقبل محركات البحث الاستعلامات متعددة الوسائط وتفهمها — فالصور والصوت ورسم الدائرة على الشاشة منتجات حقيقية متاحة.
  • يقوم الاسترجاع خلف إجابات الذكاء الاصطناعي على المعنى (التضمينات/الاسترجاع الدلالي)، ويكون في AI Mode مؤسساً في فهرس Search الأساسي — فلا يوجد «فهرس ذكاء اصطناعي» منفصل.
  • تقول Google صراحة إن ميزات الذكاء الاصطناعي تعتمد على أنظمة الترتيب والجودة الأساسية في Search، ولذلك تظل سلسلة الزحف ← الفهرسة ← الاسترجاع هي التي تحكم إمكان ظهور المحتوى.

نظرية في الصناعة — صِفها كذلك:

  • أن Google يرتب صورك المنفردة أو إطارات الفيديو بوصفها «إشارة ترتيب متعددة الوسائط» مستقلة يمكنك تحسينها بمعزل. لم تنشر Google «عامل ترتيب متعدد الوسائط». ومدى فهم المحتوى المرئي/الصوتي على مستوى الصفحة إطاراً بإطار على نطاق الويب موثق جزئياً فقط.
  • الادعاءات الدقيقة عن مقدار الوزن الذي يمنحه الاستعلام متعدد الوسائط للصورة مقارنة بالنص المصاحب. تعامل مع النسب المحددة بوصفها تخميناً.

القراءة الآمنة: حسّن المحتوى كي يُفهم ويُسترجع عبر الوسائط، لا لآلية لم تؤكدها Google.

ماذا يعني ذلك لـSEO؟

بعد إزالة المبالغة يصبح الدليل ملموساً ومألوفاً:

  • اجعل الصور مقروءة آلياً. استخدم نصاً بديلاً وصفياً وأسماء ملفات ذات معنى، وبيانات منظمة للصور عند الملاءمة. يخبر النص البديل محرك البحث بما تعرضه الصورة من دون «رؤيتها»، ويظل مفيداً مع تحسن الفهم المرئي.
  • امنح الصوت والفيديو نصاً حقيقياً. تجعل النصوص المكتوبة والترجمات المصاحبة والسياق الواضح على الصفحة المحتوى المنطوق قابلاً للاسترجاع والاقتباس. يصعب تأسيس إجابة على فيديو بلا نص مكتوب.
  • استخدم البيانات المنظمة حيث تلائم. تمنح ترميزات Product وImageObject وVideoObject وأنواع Recipe الآلات حقائق لا لبس فيها لربطها باستعلام مرئي أو منطوق.
  • أجب عن السؤال الضمني. يحمل الاستعلام المرئي نية — «ما هذا؟»، «أين أشتريه؟»، «كيف أصلحه؟». ويُسترجع المحتوى الذي يجيب مباشرة عن تلك النية في مقطع مستقل. وهذا هو الوضوح على مستوى المقطع الذي يكافئه ترتيب المقاطع وRAG.
  • لا تتغير المتطلبات السابقة. ما تزال الإجابات متعددة الوسائط تسترجع من الفهرس الأساسي، فتأتي قابلية الزحف والفهرسة أولاً — وهي السلسلة نفسها التي يغطيها الزحف والتأسيس وRAG.

لا يضمن أي من ذلك نتيجة. تصف وثائق Google للصور والفيديو النص البديل والنصوص المكتوبة والبيانات المنظمة بأنها وسائل مساعدة على الأهلية والفهم — تساعد محرك البحث على اكتشاف المحتوى وفهمه وربطه بالاستعلام الصحيح — لا مدخلات في صيغة ترتيب موثقة. يجعل ذلك محتواك قابلاً للاسترجاع والاستشهاد، لكنه لا يضمن الاسترجاع أو الاستشهاد أو موضع الترتيب أو دقة وصف الإجابة المولدة له.

الخلاصة في جملة: وسّع البحث متعدد الوسائط الباب الأمامي، لكنه لم يغير ما وراءه. كن قابلاً للعثور عليك، ووضّح ما تصوره وسائطك، وأجب عن السؤال الذي يوحي به الاستعلام.

Add an expert note

Pin an expert quote

New person? Create their unclaimed profile at /admin/experts/ → Pin a quote first.