Búsqueda multimodal

Cómo funciona la búsqueda mediante texto, imágenes, vídeo y audio —Google Lens, Circle to Search, AI Mode multimodal y MUM— y qué han confirmado realmente los buscadores sobre su optimización.

Publicado por primera vez: 3 jul 2026 · Última actualización: 22 ago 2026 · Avanzado
Idiomas

La búsqueda multimodal permite consultar y recuperar información mediante texto, imágenes, vídeo y audio en una misma interacción. Es el cambio que sustenta Google Lens, Circle to Search, la búsqueda por voz y AI Mode multimodal. La base técnica son los embeddings compartidos, que proyectan distintas modalidades en un mismo espacio para compararlas por significado. MUM marcó públicamente esta evolución en 2021 y AI Mode la amplía en la era de Gemini. Lo confirmado se refiere sobre todo a la comprensión de consultas en varias modalidades; las afirmaciones sobre un factor de posicionamiento multimodal son teoría del sector. El método duradero consiste en usar texto alternativo y nombres de archivo descriptivos, transcripciones y subtítulos reales, datos estructurados limpios y contenido que responda a la intención de una consulta visual o hablada.

EN RESUMEN — La búsqueda multimodal permite consultar y recuperar información mediante texto, imagen, vídeo y audio en una sola interacción. La hace posible un espacio de embeddings compartido: las distintas modalidades se codifican en un mismo espacio vectorial para poder compararlas por significado. Es la misma idea de recuperación que emplea la búsqueda semántica, generalizada más allá del texto. La evolución pública de Google va desde la búsqueda por voz e imágenes hasta MUM (2021, multimodal, «1000 veces más potente que BERT» y empleado en casos concretos de gran complejidad), pasando por Google Lens, Circle to Search y AI Mode con tecnología de Gemini, donde una foto y una pregunta de seguimiento forman una consulta que se despliega en una respuesta sintetizada. Lo confirmado oficialmente se refiere sobre todo a comprender la consulta en varias modalidades; afirmar que Google posiciona cada imagen o fotograma como una «señal multimodal» independiente es teoría del sector. El método duradero consiste en usar texto alternativo y nombres de archivo descriptivos, transcripciones y subtítulos reales, datos estructurados limpios y contenido que responda a la intención implícita de una consulta visual o hablada.

Qué significa realmente «multimodal»

La investigación sobre representaciones compartidas muestra una forma de realizar recuperación entre modalidades, no una arquitectura universal de producción. Evidence for this claim CLIP learns joint image-and-text representations from paired internet data and supports zero-shot image classification. Scope: CLIP research results; multimodal search products may use different models, training data, and ranking pipelines. Confidence: high · Verified: Radford et al.: Learning Transferable Visual Models Las descripciones de los productos de búsqueda documentan funciones, pero no revelan por completo sus mecanismos de posicionamiento. Evidence for this claim Google Multisearch lets users combine an image with text to refine a search. Scope: Google's documented consumer search feature; it does not define all multimodal retrieval systems. Confidence: high · Verified: Google: Multisearch

Una modalidad es un canal de información: texto escrito, imagen, audio hablado o vídeo. Un sistema unimodal maneja uno; uno multimodal recibe más de uno como entrada o produce más de uno como salida y, lo que es fundamental, razona con ellos de forma conjunta en vez de limitarse a unir canales de procesamiento independientes.

La búsqueda multimodal abarca más que la «búsqueda de imágenes», y la diferencia importa:

  • La búsqueda de imágenes encuentra imágenes (lo que quieres son fotos o ilustraciones).
  • La búsqueda multimodal utiliza una imagen —o voz o vídeo— como parte de una consulta que puede devolver cualquier tipo de resultado: una ficha de compra, una guía práctica, una definición o un punto en el mapa. La cámara es un dispositivo de entrada, no el objeto que buscas.

Por tanto, «apunta con la cámara a una pieza rota y pregunta cómo repararla» es una búsqueda multimodal; «búscame fotos de esa pieza» es una búsqueda de imágenes. Google Lens hace ambas cosas, y por eso la frontera puede parecer difusa.

También conviene separar tres preguntas, porque una sola descripción de producto puede mezclarlas sin que se note: qué modalidades admite la consulta (¿solo texto o texto más imagen, audio o vídeo?); en qué modalidad está el contenido candidato recuperado (¿una página de texto, una imagen o un vídeo?); y qué modalidad tiene la salida generada (¿una lista de enlaces, una cuadrícula de imágenes o una respuesta textual sintetizada?). Que una función acepte una imagen no implica que recupere imágenes ni que produzca una salida visual: la foto de una pieza rota puede recuperar una página de texto y generar una respuesta escrita. Confirmar una dimensión no confirma las otras dos; contrasta cada una con lo que el proveedor haya documentado para esa función concreta.

La base técnica: un espacio compartido

Multimodal retrieval works when different input types can be compared by meaning in one shared space. Fuente: /ai-search/how-search-works/embeddings/

Text queries, image queries, and audio or video queries are encoded into a shared semantic embedding space. Meaningfully similar items land near one another, allowing a nearest-neighbor search to retrieve relevant content across input types. The diagram is a conceptual model, not a claim about a specific Google ranking formula.

© Patrick Stox LLC · CC BY 4.0 ·

Una imagen y una frase se pueden comparar gracias a una representación compartida. Los modelos codificadores proyectan texto, imágenes, audio y vídeo en el mismo espacio de embeddings de alta dimensión, donde la similitud semántica se convierte en proximidad geométrica. La foto de una planta y la cadena «cómo cuido esta planta» quedan cerca, de modo que una búsqueda de vecinos próximos puede conectarlas.

Es exactamente la maquinaria que sustenta la búsqueda semántica y la fase de recuperación de RAG, generalizada más allá del texto. Se divide en etapas distintas; cada una representa una capacidad separada, por lo que demostrar que un sistema funciona bien en una no demuestra que lo haga en las demás:

  1. Comprensión de la entrada. La consulta —por ejemplo, imagen más texto o una pregunta hablada— se interpreta en la representación que necesite la etapa siguiente.
  2. Embedding. Esa representación y cada contenido candidato se codifican en el espacio vectorial compartido descrito antes.
  3. Recuperación. La búsqueda vectorial encuentra las coincidencias más cercanas según la distancia geométrica.
  4. Reordenación. Una etapa independiente vuelve a ordenar los candidatos recuperados mediante señales adicionales a la distancia bruta entre embeddings.
  5. Generación. En las superficies de IA, los mejores candidatos se utilizan como base factual de una respuesta sintetizada.

Si entiendes los embeddings, la segmentación, la búsqueda vectorial y el grounding, ya entiendes las tuberías de la búsqueda multimodal; la única novedad es que los codificadores manejan más de una modalidad.

Sistemas de investigación con nombre propio, no un plano confirmado de producción. La idea de los embeddings conjuntos no es hipotética: CLIP, de OpenAI, y ALIGN, de Google, entrenaron codificadores de imagen y texto en un espacio común mediante pares de imagen y texto; ImageBind, de Meta, amplió el método a seis modalidades —imagen, texto, audio, profundidad, térmica y movimiento— dentro de un solo espacio. Son arquitecturas de investigación publicadas, con sus propios conjuntos de datos y evaluaciones. Sirven para entender cómo se puede construir un espacio compartido, no para demostrar que el sistema de producción de un buscador comercial utilice ese diseño exacto. El comportamiento de salida de un proveedor tampoco revela si usa embeddings compartidos, otro método de fusión ni cuánto pesa cada modalidad: son detalles internos que nadie ajeno al proveedor puede inspeccionar.

La evolución pública de Google

Estos son, a grandes rasgos y en orden, los pasos confirmados de Google hacia la búsqueda multimodal:

  • Búsqueda por voz y de imágenes (década de 2010). Las consultas habladas y la búsqueda inversa de imágenes fueron las primeras entradas no textuales de uso masivo.
  • MUM — Multitask Unified Model (2021). Fue la señal pública de Google del cambio multimodal. Google describió MUM como multimodal, capaz de “understand information across text and images” (traducción) «entender información en texto e imágenes», y “1,000 times more powerful than BERT,” (traducción) «1000 veces más potente que BERT» entrenado en 75 idiomas y capaz tanto de comprender como de generar lenguaje. La salvedad importante, que ya figura en la historia de la búsqueda semántica, es que MUM nunca fue el motor general de posicionamiento de Google. Se aplicó a casos concretos de gran complejidad —preguntas complejas de varios pasos, algunos fragmentos destacados y compras— y no «sustituyó» a BERT.
  • Google Lens. La cámara como consulta a gran escala: identificar objetos, traducir texto presente en una imagen, comprar lo que ves o resolver un problema que fotografías.
  • Circle to Search. Permite rodear, resaltar o tocar cualquier elemento de la pantalla de Android para buscarlo sin cambiar de aplicación.
  • AI Mode (era de Gemini). Es la frontera actual: una consulta multimodal —una imagen más una pregunta de seguimiento hablada o escrita— se convierte en una sola interacción que se despliega en numerosas subconsultas y devuelve una respuesta sintetizada con citas. Aquí la entrada multimodal se une a la recuperación agéntica de estilo RAG descrita en este grupo de contenidos.

Microsoft tiene su propia línea de productos: Bing Visual Search y Copilot Vision desempeñan funciones análogas en el ecosistema de Bing, por lo que la búsqueda multimodal no es exclusiva de Google.

Dónde puede fallar antes incluso de la recuperación

Toda modalidad distinta de un texto limpio debe pasar por una conversión antes de que se produzca el emparejamiento en el espacio compartido. Esa conversión puede introducir errores que la etapa de recuperación no puede anticipar. La documentación técnica de los proveedores sobre modelos multimodales describe precisamente estas limitaciones:

  • Errores de OCR: el texto incluido en una imagen —un cartel, una captura o una etiqueta— puede leerse mal, sobre todo con baja resolución o una tipografía poco familiar.
  • Errores de reconocimiento de voz: una palabra mal transcrita en audio o vídeo contamina lo que se codifica y recupera después.
  • Muestreo de fotogramas: el vídeo no se interpreta fotograma a fotograma; los sistemas seleccionan una parte, así que el contenido que solo aparece entre dos fotogramas muestreados puede pasar completamente inadvertido.
  • Recorte y resolución: un sistema que recibe una imagen de baja resolución o muy recortada dispone de menos información que si tuviera la escena original.
  • Idioma: la precisión en una lengua no garantiza la misma precisión en otra; tanto el OCR como el reconocimiento de voz varían según el idioma.
  • Falta de contexto: una imagen o un fragmento separado de su página —pie de foto, texto alternativo o transcripción— ofrece menos elementos en los que apoyar la interpretación.

Nada de esto es exclusivo de un proveedor. Es una razón para tratar con cautela las afirmaciones de que «el modelo puede ver u oír X»: que una capacidad funcione con un ejemplo de prueba limpio, bien iluminado y de alta resolución no demuestra que funcione con una entrada real más imperfecta.

Qué está confirmado y qué es teoría

Aquí importa escribir con cuidado, porque el tema invita a exagerar.

Confirmado con suficiente fundamento:

  • Los buscadores aceptan y entienden consultas multimodales: las imágenes, la voz y los elementos rodeados en pantalla ya son entradas de productos disponibles.
  • La recuperación que sustenta las respuestas de IA se basa en el significado —embeddings y recuperación semántica— y, en AI Mode, se fundamenta en el índice principal de la Búsqueda; no existe un «índice de IA» independiente.
  • Google afirma expresamente que sus funciones de IA dependen de los sistemas centrales de posicionamiento y calidad de la Búsqueda. Por eso la cadena rastrear → indexar → recuperar sigue determinando si un contenido puede aparecer.

Teoría del sector —debe indicarse como tal—:

  • Que Google posicione cada imagen o fotograma de vídeo mediante una «señal de posicionamiento multimodal» independiente que pueda optimizarse de forma aislada. Google no ha publicado ningún «factor de posicionamiento multimodal». Solo está documentado en parte hasta qué punto se comprende a escala web el contenido visual o sonoro de una página fotograma a fotograma.
  • Las afirmaciones precisas sobre cuánto peso concede una consulta multimodal a la imagen frente al texto que la acompaña. Cualquier proporción concreta debe tratarse como especulación.

La interpretación prudente es optimizar para que el contenido se entienda y pueda recuperarse en distintas modalidades, no para un mecanismo que Google no ha confirmado.

Qué implica para el SEO

Al retirar la exageración, el método es concreto y conocido:

  • Haz que las imágenes sean legibles para las máquinas. Utiliza texto alternativo descriptivo, nombres de archivo significativos y, cuando corresponda, datos estructurados de imagen. El texto alternativo indica a un buscador qué representa una imagen sin necesidad de «verla», y sigue siendo útil aunque mejore la comprensión visual.
  • Acompaña el audio y el vídeo de texto real. Las transcripciones, los subtítulos y un contexto claro en la página convierten el contenido hablado en material recuperable y citable. Es mucho más difícil usar un vídeo sin transcripción como base de una respuesta.
  • Datos estructurados cuando correspondan. Product, ImageObject, VideoObject, y Recipe aportan a las máquinas hechos inequívocos que pueden asociar a una consulta visual o hablada.
  • Responde a la pregunta implícita. Una consulta visual contiene una intención: «¿qué es esto?», «¿dónde lo compro?» o «¿cómo lo arreglo?». El contenido que responde directamente a esa intención en un pasaje autónomo es el que puede recuperarse. Es la misma claridad a nivel de pasaje que ya favorecen el posicionamiento por pasajes y RAG.
  • Los requisitos previos no cambian. Las respuestas multimodales siguen recuperando información del índice principal, así que primero hay que permitir el rastreo y la indexación: es la misma cadena descrita en rastreo, grounding y RAG.

Nada de esto ofrece garantías. La propia documentación de Google sobre imágenes y vídeo presenta el texto alternativo, las transcripciones y los datos estructurados como ayudas para la elegibilidad y la comprensión: elementos que facilitan que un buscador descubra, entienda y asocie correctamente tu contenido con una consulta, no entradas de una fórmula de posicionamiento documentada. Aplicar todo lo anterior hace que el contenido sea recuperable y citable; no garantiza su recuperación, cita o posición, ni que una respuesta generada lo describa con exactitud.

En una frase: la búsqueda multimodal ensanchó la puerta de entrada, pero no cambió lo que hay detrás. Procura que el contenido se pueda encontrar, explica con claridad qué muestran tus imágenes y otros medios, y responde a la pregunta que la consulta implica.

Add an expert note

Pin an expert quote

New person? Create their unclaimed profile at /admin/experts/ → Pin a quote first.