Búsqueda multimodal
Cómo funciona la búsqueda mediante texto, imágenes, vídeo y audio —Google Lens, Circle to Search, AI Mode multimodal y MUM— y qué han confirmado realmente los buscadores sobre su optimización.
Idiomas
La búsqueda multimodal permite consultar y recuperar información mediante texto, imágenes, vídeo y audio en una misma interacción. Es el cambio que sustenta Google Lens, Circle to Search, la búsqueda por voz y AI Mode multimodal. La base técnica son los embeddings compartidos, que proyectan distintas modalidades en un mismo espacio para compararlas por significado. MUM marcó públicamente esta evolución en 2021 y AI Mode la amplía en la era de Gemini. Lo confirmado se refiere sobre todo a la comprensión de consultas en varias modalidades; las afirmaciones sobre un factor de posicionamiento multimodal son teoría del sector. El método duradero consiste en usar texto alternativo y nombres de archivo descriptivos, transcripciones y subtítulos reales, datos estructurados limpios y contenido que responda a la intención de una consulta visual o hablada.
EN RESUMEN — La búsqueda multimodal significa que no tienes que escribir para buscar. Puedes apuntar con la cámara a algo (Google Lens), rodear un elemento en la pantalla (Circle to Search) o formular una pregunta en voz alta, y combinar cualquiera de esas acciones con palabras. El sistema entiende la imagen, la voz y el texto de forma conjunta y después responde. Es la misma idea de «encontrar coincidencias por significado» que usa la búsqueda moderna, pero ya no está limitada a las palabras escritas.
Qué es la búsqueda multimodal
Los sistemas multimodales procesan o relacionan más de una modalidad, como el texto y las imágenes. Evidence for this claim CLIP learns joint image-and-text representations from paired internet data and supports zero-shot image classification. Scope: CLIP research results; multimodal search products may use different models, training data, and ranking pipelines. Confidence: high · Verified: Radford et al.: Learning Transferable Visual Models Las capacidades varían según el producto, así que conviene verificar en cada sistema qué compatibilidad ofrece con imágenes, vídeo, audio y texto. Evidence for this claim Google Multisearch lets users combine an image with text to refine a search. Scope: Google's documented consumer search feature; it does not define all multimodal retrieval systems. Confidence: high · Verified: Google: Multisearch
Durante casi toda la historia de los buscadores solo había una forma de empezar: escribías palabras y recibías una lista de enlaces. La búsqueda multimodal amplía esas posibilidades. Una modalidad no es más que un tipo de entrada o salida: texto, imagen, vídeo o audio. En una búsqueda multimodal, el sistema puede recibir varias modalidades a la vez e interpretarlas conjuntamente.
Algunos ejemplos cotidianos que probablemente ya hayas usado:
- Apuntar con la cámara a una planta, un monumento o unos zapatos y preguntar «¿qué es esto?»: eso es Google Lens.
- Rodear algo en la pantalla del teléfono —una chaqueta en una foto o una palabra en un artículo— para buscarlo sin salir de la aplicación. Eso es Circle to Search.
- Hablarle al teléfono en lugar de escribir: eso es la búsqueda por voz.
- Combinar una imagen con una pregunta: mostrar la foto de una silla y preguntar «¿dónde puedo comprarla en azul?». La imagen y las palabras forman una sola consulta.
Por qué funciona: coincidencias por significado
La clave técnica es que los sistemas modernos no tratan una imagen y una frase como elementos totalmente distintos. Convierten ambas en el mismo «idioma» interno: una lista de números que representa el significado (consulta embeddings). La foto de un golden retriever y las palabras «golden retriever» quedan cerca en ese espacio, por lo que el sistema puede relacionarlas aunque una esté formada por píxeles y las otras por letras. Es el mismo emparejamiento semántico que sustenta la búsqueda moderna habitual (búsqueda semántica), ampliado para que también funcione con imágenes, voz y vídeo.
Qué significa para ti
Esta es la versión sincera, porque el tema genera mucho ruido: no existe un «factor de posicionamiento multimodal» secreto que puedas activar. Lo que ayuda es lo que ya hacen los buenos sitios, solo que ahora el motivo resulta más claro:
- Describe las imágenes. Un texto alternativo real y nombres de archivo razonables indican al buscador qué representa una imagen.
- Acompaña el audio y el vídeo de texto real. Las transcripciones y los subtítulos permiten que el sistema entienda —y cite— lo que se dice.
- Responde a la pregunta evidente. Si alguien fotografía tu producto, preguntará «¿qué es esto?», «¿dónde se consigue?» o «¿cuánto cuesta?». Haz que esa información sea fácil de encontrar en la página.
¿Quieres conocer el funcionamiento real: cómo encajan MUM y AI Mode, qué ha confirmado Google y qué es mera teoría, además del plan completo? Pasa a la pestaña Avanzado.
EN RESUMEN — La búsqueda multimodal permite consultar y recuperar información mediante texto, imagen, vídeo y audio en una sola interacción. La hace posible un espacio de embeddings compartido: las distintas modalidades se codifican en un mismo espacio vectorial para poder compararlas por significado. Es la misma idea de recuperación que emplea la búsqueda semántica, generalizada más allá del texto. La evolución pública de Google va desde la búsqueda por voz e imágenes hasta MUM (2021, multimodal, «1000 veces más potente que BERT» y empleado en casos concretos de gran complejidad), pasando por Google Lens, Circle to Search y AI Mode con tecnología de Gemini, donde una foto y una pregunta de seguimiento forman una consulta que se despliega en una respuesta sintetizada. Lo confirmado oficialmente se refiere sobre todo a comprender la consulta en varias modalidades; afirmar que Google posiciona cada imagen o fotograma como una «señal multimodal» independiente es teoría del sector. El método duradero consiste en usar texto alternativo y nombres de archivo descriptivos, transcripciones y subtítulos reales, datos estructurados limpios y contenido que responda a la intención implícita de una consulta visual o hablada.
Qué significa realmente «multimodal»
La investigación sobre representaciones compartidas muestra una forma de realizar recuperación entre modalidades, no una arquitectura universal de producción. Evidence for this claim CLIP learns joint image-and-text representations from paired internet data and supports zero-shot image classification. Scope: CLIP research results; multimodal search products may use different models, training data, and ranking pipelines. Confidence: high · Verified: Radford et al.: Learning Transferable Visual Models Las descripciones de los productos de búsqueda documentan funciones, pero no revelan por completo sus mecanismos de posicionamiento. Evidence for this claim Google Multisearch lets users combine an image with text to refine a search. Scope: Google's documented consumer search feature; it does not define all multimodal retrieval systems. Confidence: high · Verified: Google: Multisearch
Una modalidad es un canal de información: texto escrito, imagen, audio hablado o vídeo. Un sistema unimodal maneja uno; uno multimodal recibe más de uno como entrada o produce más de uno como salida y, lo que es fundamental, razona con ellos de forma conjunta en vez de limitarse a unir canales de procesamiento independientes.
La búsqueda multimodal abarca más que la «búsqueda de imágenes», y la diferencia importa:
- La búsqueda de imágenes encuentra imágenes (lo que quieres son fotos o ilustraciones).
- La búsqueda multimodal utiliza una imagen —o voz o vídeo— como parte de una consulta que puede devolver cualquier tipo de resultado: una ficha de compra, una guía práctica, una definición o un punto en el mapa. La cámara es un dispositivo de entrada, no el objeto que buscas.
Por tanto, «apunta con la cámara a una pieza rota y pregunta cómo repararla» es una búsqueda multimodal; «búscame fotos de esa pieza» es una búsqueda de imágenes. Google Lens hace ambas cosas, y por eso la frontera puede parecer difusa.
También conviene separar tres preguntas, porque una sola descripción de producto puede mezclarlas sin que se note: qué modalidades admite la consulta (¿solo texto o texto más imagen, audio o vídeo?); en qué modalidad está el contenido candidato recuperado (¿una página de texto, una imagen o un vídeo?); y qué modalidad tiene la salida generada (¿una lista de enlaces, una cuadrícula de imágenes o una respuesta textual sintetizada?). Que una función acepte una imagen no implica que recupere imágenes ni que produzca una salida visual: la foto de una pieza rota puede recuperar una página de texto y generar una respuesta escrita. Confirmar una dimensión no confirma las otras dos; contrasta cada una con lo que el proveedor haya documentado para esa función concreta.
La base técnica: un espacio compartido
Text queries, image queries, and audio or video queries are encoded into a shared semantic embedding space. Meaningfully similar items land near one another, allowing a nearest-neighbor search to retrieve relevant content across input types. The diagram is a conceptual model, not a claim about a specific Google ranking formula.
© Patrick Stox LLC · CC BY 4.0 ·
Una imagen y una frase se pueden comparar gracias a una representación compartida. Los modelos codificadores proyectan texto, imágenes, audio y vídeo en el mismo espacio de embeddings de alta dimensión, donde la similitud semántica se convierte en proximidad geométrica. La foto de una planta y la cadena «cómo cuido esta planta» quedan cerca, de modo que una búsqueda de vecinos próximos puede conectarlas.
Es exactamente la maquinaria que sustenta la búsqueda semántica y la fase de recuperación de RAG, generalizada más allá del texto. Se divide en etapas distintas; cada una representa una capacidad separada, por lo que demostrar que un sistema funciona bien en una no demuestra que lo haga en las demás:
- Comprensión de la entrada. La consulta —por ejemplo, imagen más texto o una pregunta hablada— se interpreta en la representación que necesite la etapa siguiente.
- Embedding. Esa representación y cada contenido candidato se codifican en el espacio vectorial compartido descrito antes.
- Recuperación. La búsqueda vectorial encuentra las coincidencias más cercanas según la distancia geométrica.
- Reordenación. Una etapa independiente vuelve a ordenar los candidatos recuperados mediante señales adicionales a la distancia bruta entre embeddings.
- Generación. En las superficies de IA, los mejores candidatos se utilizan como base factual de una respuesta sintetizada.
Si entiendes los embeddings, la segmentación, la búsqueda vectorial y el grounding, ya entiendes las tuberías de la búsqueda multimodal; la única novedad es que los codificadores manejan más de una modalidad.
Sistemas de investigación con nombre propio, no un plano confirmado de producción. La idea de los embeddings conjuntos no es hipotética: CLIP, de OpenAI, y ALIGN, de Google, entrenaron codificadores de imagen y texto en un espacio común mediante pares de imagen y texto; ImageBind, de Meta, amplió el método a seis modalidades —imagen, texto, audio, profundidad, térmica y movimiento— dentro de un solo espacio. Son arquitecturas de investigación publicadas, con sus propios conjuntos de datos y evaluaciones. Sirven para entender cómo se puede construir un espacio compartido, no para demostrar que el sistema de producción de un buscador comercial utilice ese diseño exacto. El comportamiento de salida de un proveedor tampoco revela si usa embeddings compartidos, otro método de fusión ni cuánto pesa cada modalidad: son detalles internos que nadie ajeno al proveedor puede inspeccionar.
La evolución pública de Google
Estos son, a grandes rasgos y en orden, los pasos confirmados de Google hacia la búsqueda multimodal:
- Búsqueda por voz y de imágenes (década de 2010). Las consultas habladas y la búsqueda inversa de imágenes fueron las primeras entradas no textuales de uso masivo.
- MUM — Multitask Unified Model (2021). Fue la señal pública de Google del cambio multimodal. Google describió MUM como multimodal, capaz de “understand information across text and images” (traducción) «entender información en texto e imágenes», y “1,000 times more powerful than BERT,” (traducción) «1000 veces más potente que BERT» entrenado en 75 idiomas y capaz tanto de comprender como de generar lenguaje. La salvedad importante, que ya figura en la historia de la búsqueda semántica, es que MUM nunca fue el motor general de posicionamiento de Google. Se aplicó a casos concretos de gran complejidad —preguntas complejas de varios pasos, algunos fragmentos destacados y compras— y no «sustituyó» a BERT.
- Google Lens. La cámara como consulta a gran escala: identificar objetos, traducir texto presente en una imagen, comprar lo que ves o resolver un problema que fotografías.
- Circle to Search. Permite rodear, resaltar o tocar cualquier elemento de la pantalla de Android para buscarlo sin cambiar de aplicación.
- AI Mode (era de Gemini). Es la frontera actual: una consulta multimodal —una imagen más una pregunta de seguimiento hablada o escrita— se convierte en una sola interacción que se despliega en numerosas subconsultas y devuelve una respuesta sintetizada con citas. Aquí la entrada multimodal se une a la recuperación agéntica de estilo RAG descrita en este grupo de contenidos.
Microsoft tiene su propia línea de productos: Bing Visual Search y Copilot Vision desempeñan funciones análogas en el ecosistema de Bing, por lo que la búsqueda multimodal no es exclusiva de Google.
Dónde puede fallar antes incluso de la recuperación
Toda modalidad distinta de un texto limpio debe pasar por una conversión antes de que se produzca el emparejamiento en el espacio compartido. Esa conversión puede introducir errores que la etapa de recuperación no puede anticipar. La documentación técnica de los proveedores sobre modelos multimodales describe precisamente estas limitaciones:
- Errores de OCR: el texto incluido en una imagen —un cartel, una captura o una etiqueta— puede leerse mal, sobre todo con baja resolución o una tipografía poco familiar.
- Errores de reconocimiento de voz: una palabra mal transcrita en audio o vídeo contamina lo que se codifica y recupera después.
- Muestreo de fotogramas: el vídeo no se interpreta fotograma a fotograma; los sistemas seleccionan una parte, así que el contenido que solo aparece entre dos fotogramas muestreados puede pasar completamente inadvertido.
- Recorte y resolución: un sistema que recibe una imagen de baja resolución o muy recortada dispone de menos información que si tuviera la escena original.
- Idioma: la precisión en una lengua no garantiza la misma precisión en otra; tanto el OCR como el reconocimiento de voz varían según el idioma.
- Falta de contexto: una imagen o un fragmento separado de su página —pie de foto, texto alternativo o transcripción— ofrece menos elementos en los que apoyar la interpretación.
Nada de esto es exclusivo de un proveedor. Es una razón para tratar con cautela las afirmaciones de que «el modelo puede ver u oír X»: que una capacidad funcione con un ejemplo de prueba limpio, bien iluminado y de alta resolución no demuestra que funcione con una entrada real más imperfecta.
Qué está confirmado y qué es teoría
Aquí importa escribir con cuidado, porque el tema invita a exagerar.
Confirmado con suficiente fundamento:
- Los buscadores aceptan y entienden consultas multimodales: las imágenes, la voz y los elementos rodeados en pantalla ya son entradas de productos disponibles.
- La recuperación que sustenta las respuestas de IA se basa en el significado —embeddings y recuperación semántica— y, en AI Mode, se fundamenta en el índice principal de la Búsqueda; no existe un «índice de IA» independiente.
- Google afirma expresamente que sus funciones de IA dependen de los sistemas centrales de posicionamiento y calidad de la Búsqueda. Por eso la cadena rastrear → indexar → recuperar sigue determinando si un contenido puede aparecer.
Teoría del sector —debe indicarse como tal—:
- Que Google posicione cada imagen o fotograma de vídeo mediante una «señal de posicionamiento multimodal» independiente que pueda optimizarse de forma aislada. Google no ha publicado ningún «factor de posicionamiento multimodal». Solo está documentado en parte hasta qué punto se comprende a escala web el contenido visual o sonoro de una página fotograma a fotograma.
- Las afirmaciones precisas sobre cuánto peso concede una consulta multimodal a la imagen frente al texto que la acompaña. Cualquier proporción concreta debe tratarse como especulación.
La interpretación prudente es optimizar para que el contenido se entienda y pueda recuperarse en distintas modalidades, no para un mecanismo que Google no ha confirmado.
Qué implica para el SEO
Al retirar la exageración, el método es concreto y conocido:
- Haz que las imágenes sean legibles para las máquinas. Utiliza texto alternativo descriptivo, nombres de archivo significativos y, cuando corresponda, datos estructurados de imagen. El texto alternativo indica a un buscador qué representa una imagen sin necesidad de «verla», y sigue siendo útil aunque mejore la comprensión visual.
- Acompaña el audio y el vídeo de texto real. Las transcripciones, los subtítulos y un contexto claro en la página convierten el contenido hablado en material recuperable y citable. Es mucho más difícil usar un vídeo sin transcripción como base de una respuesta.
- Datos estructurados cuando correspondan.
Product,ImageObject,VideoObject, yRecipeaportan a las máquinas hechos inequívocos que pueden asociar a una consulta visual o hablada. - Responde a la pregunta implícita. Una consulta visual contiene una intención: «¿qué es esto?», «¿dónde lo compro?» o «¿cómo lo arreglo?». El contenido que responde directamente a esa intención en un pasaje autónomo es el que puede recuperarse. Es la misma claridad a nivel de pasaje que ya favorecen el posicionamiento por pasajes y RAG.
- Los requisitos previos no cambian. Las respuestas multimodales siguen recuperando información del índice principal, así que primero hay que permitir el rastreo y la indexación: es la misma cadena descrita en rastreo, grounding y RAG.
Nada de esto ofrece garantías. La propia documentación de Google sobre imágenes y vídeo presenta el texto alternativo, las transcripciones y los datos estructurados como ayudas para la elegibilidad y la comprensión: elementos que facilitan que un buscador descubra, entienda y asocie correctamente tu contenido con una consulta, no entradas de una fórmula de posicionamiento documentada. Aplicar todo lo anterior hace que el contenido sea recuperable y citable; no garantiza su recuperación, cita o posición, ni que una respuesta generada lo describa con exactitud.
En una frase: la búsqueda multimodal ensanchó la puerta de entrada, pero no cambió lo que hay detrás. Procura que el contenido se pueda encontrar, explica con claridad qué muestran tus imágenes y otros medios, y responde a la pregunta que la consulta implica.
Resumen de IA
Versión condensada del contenido avanzado:
- Búsqueda multimodal = consultar y recuperar mediante texto, imagen, vídeo y audio en una sola interacción. Es más amplia que la búsqueda de imágenes: utiliza una imagen, voz o vídeo como entrada para devolver cualquier clase de resultado, no solo imágenes.
- Tres dimensiones distintas. La modalidad admitida por la consulta, la del contenido recuperado y la de la salida son tres preguntas diferentes; confirmar una no confirma las demás.
- La base es un espacio de embeddings compartido, construido mediante cinco etapas diferentes: comprensión de la entrada, embedding, recuperación, reordenación y generación. Sistemas de investigación como CLIP, ALIGN e ImageBind demuestran que los espacios de embeddings conjuntos existen y funcionan, pero no prueban la arquitectura de producción de ningún proveedor. El comportamiento de salida, por sí solo, no permite descubrirla.
- Evolución de Google: búsqueda por voz y de imágenes → MUM (2021, multimodal, “1,000 times more powerful than BERT,” (traducción) «1000 veces más potente que BERT», 75 idiomas, pero herramienta específica para casos muy complejos y nunca motor general de posicionamiento) → Google Lens → Circle to Search → AI Mode de la era de Gemini, donde una imagen y una pregunta de seguimiento se despliegan en una respuesta fundamentada y con citas. Los equivalentes de Microsoft son Bing Visual Search y Copilot Vision.
- Fallos anteriores a la recuperación: las lecturas incorrectas de OCR, los errores de reconocimiento de voz, los huecos del muestreo de vídeo, las limitaciones de recorte o resolución, las variaciones entre idiomas y la falta de contexto pueden distorsionar la comprensión antes de que empiece el emparejamiento.
- Confirmado: las consultas multimodales existen; la recuperación de IA se basa en el significado y se apoya en el índice principal de la Búsqueda —no hay un índice de IA separado—; rastrear → indexar → recuperar sigue rigiendo la elegibilidad.
- Teoría del sector —debe indicarse—: una «señal de posicionamiento multimodal» independiente aplicada a cada imagen o fotograma, y una ponderación precisa entre imagen y texto. Google no ha confirmado ninguna de las dos.
- Método de SEO: texto alternativo y nombres de archivo descriptivos, transcripciones y subtítulos reales, datos estructurados
Product/ImageObject/VideoObjecty contenido autónomo que responda a la intención implícita de una consulta visual o hablada. Los requisitos previos —rastreable e indexado— no cambian, y nada garantiza la recuperación, el posicionamiento o la cita: Google documenta estas prácticas como ayudas para la elegibilidad y la comprensión, no como factores de posicionamiento.
Documentación oficial
Fuentes primarias de los buscadores sobre las interfaces multimodales y los sistemas que las sustentan.
- MUM: un nuevo hito de IA para comprender la información: anuncio de 2021 del Multitask Unified Model multimodal y multilingüe.
- Cómo impulsa la IA unos buenos resultados de búsqueda: explicación de Google sobre cómo encajan RankBrain, neural matching, BERT y MUM.
- Guía de Google para optimizar las funciones de IA generativa: AI Overviews y AI Mode dependen del posicionamiento principal de la Búsqueda; grounding, RAG y despliegue de consultas.
- Novedades de AI Mode y AI Overviews: evolución de la experiencia multimodal de AI Mode.
- Búsqueda visual con Lens para compras: la cámara como consulta aplicada a las compras.
- Prácticas recomendadas de SEO para imágenes: texto alternativo descriptivo, nombres de archivo y datos estructurados de imagen, los fundamentos de la legibilidad para máquinas.
- Prácticas recomendadas de SEO para vídeo:
VideoObject, transcripciones y la forma en que Google entiende el vídeo.
Microsoft / Bing
- Bing Visual Search: la interfaz de Bing que utiliza una imagen como consulta.
- Copilot Vision: el asistente multimodal de Microsoft que puede «ver» y razonar sobre lo que aparece en pantalla, disponible mediante la aplicación Copilot para Windows.
Citas de las fuentes
Declaraciones públicas de Google sobre el cambio multimodal. Los enlaces profundos llevan al pasaje citado cuando la página lo permite.
Google: MUM es multimodal
- MUM es “multimodal, so it understands information across text and images and, in the future, can expand to more modalities like video and audio.” (traducción) «multimodal, por lo que entiende información en texto e imágenes y, en el futuro, puede ampliarse a más modalidades como vídeo y audio» —Pandu Nayak, Google, en el anuncio de MUM. Leer el anuncio
- MUM es “1,000 times more powerful than BERT” (traducción) «1000 veces más potente que BERT» y, a diferencia de BERT, puede comprender y generar lenguaje en 75 idiomas. Leer el anuncio
Google: las funciones de IA se ejecutan sobre el índice principal de la Búsqueda
- “Our generative AI features on Google Search are rooted in our core Search ranking and quality systems.” (traducción) «Nuestras funciones de IA generativa en la Búsqueda de Google se sustentan en nuestros sistemas principales de posicionamiento y calidad de la Búsqueda». —Google Search Central, guía de optimización para IA. Por eso la cadena rastrear → indexar → recuperar sigue determinando la elegibilidad para la IA multimodal. Leer la guía
¿Para qué interfaz multimodal estoy optimizando realmente?
No hay un único control de «SEO multimodal»: el trabajo útil depende de cómo llega la gente a tu contenido. Sigue la rama que corresponda.
1. ¿Las personas fotografían productos físicos para encontrarlos o comprarlos?
→ Estás en el terreno de Google Lens y las compras visuales. Prioriza fotografías limpias del producto, datos estructurados Product y ImageObject, texto alternativo y nombres de archivo descriptivos, además de un feed comercial o de producto preciso. La intención es «¿qué es esto?», «¿dónde lo compro?» o «¿cuánto cuesta?».
2. ¿Las personas rodean elementos o hacen capturas dentro de tu contenido para saber más? → Piensa en Circle to Search y las consultas en pantalla. La palanca es la claridad de la página: etiqueta diagramas e imágenes, utiliza pies descriptivos y asegúrate de que el texto próximo responda a la pregunta evidente, de modo que un término rodeado conduzca a tu explicación.
3. ¿Tu contenido es principalmente hablado o está en vídeo?
→ Estás optimizando para consultas por voz y comprensión de vídeo. Publica transcripciones y subtítulos reales, añade marcado VideoObject y coloca un resumen en texto sin formato cerca del contenido multimedia. Un buscador solo puede recuperar y citar lo que puede leer.
4. ¿Quieres aparecer en respuestas de AI Mode o AI Overviews para consultas visuales o habladas? → Esto es grounding y RAG, no un canal multimodal separado. Primero debes permitir el rastreo y la indexación; después, redacta pasajes autónomos que respondan a las subpreguntas implícitas que generaría una consulta multimodal desplegada (consulta posicionamiento por pasajes, RAG y grounding).
5. ¿Alguien te dice que debes «optimizar para el algoritmo de posicionamiento multimodal»? → Detente. Google no ha publicado un factor de posicionamiento multimodal independiente para imágenes o fotogramas; eso es teoría del sector. Aplica los fundamentos confirmados anteriores y no persigas un mecanismo que nadie ha confirmado.
Modelos mentales
1. Una modalidad no es más que un canal. Texto, imagen, audio o vídeo. Unimodal = un canal; multimodal = varios canales interpretados conjuntamente. La palabra suena exótica, pero la idea no lo es.
2. Búsqueda multimodal ≠ búsqueda de imágenes. La búsqueda de imágenes devuelve imágenes. La búsqueda multimodal utiliza una imagen —o voz o vídeo— como entrada para devolver cualquier tipo de resultado. La cámara es el dispositivo de entrada, no el destino.
3. El secreto es un único espacio compartido. Las distintas modalidades se codifican en el mismo espacio de embeddings, de modo que una foto y una frase se pueden comparar por significado. Si conoces la búsqueda semántica y la búsqueda vectorial, ya comprendes la búsqueda multimodal: los codificadores sencillamente manejan más lenguajes.
4. Consulta confirmada frente a posicionamiento teórico. Las consultas multimodales están confirmadas y ya se ofrecen. No ocurre lo mismo con una señal de posicionamiento multimodal independiente aplicada a tus medios. Optimiza para que el contenido se entienda y se pueda recuperar, no para un mecanismo sin confirmar.
5. La cadena de requisitos previos no cambia. Las respuestas de IA multimodales recuperan información del índice principal. Rastrear → indexar → recuperar sigue condicionándolo todo, así que los fundamentos —rastreable, indexado y claro— preceden a cualquier medida «específica para lo multimodal».
6. La legibilidad para máquinas es la palanca. No basta con entregar píxeles al sistema y esperar. El texto alternativo, los nombres de archivo, las transcripciones, los subtítulos y los datos estructurados convierten un elemento visual o hablado en algo que un buscador puede relacionar y citar.
Búsqueda multimodal: ficha rápida
Definición en una línea Consultar y recuperar mediante texto, imagen, vídeo y audio en una sola interacción, gracias a un espacio de embeddings compartido: la misma recuperación por significado que usa la búsqueda semántica, ampliada más allá del texto.
Las interfaces
| Interfaz | Entrada | Responsable |
|---|---|---|
| Google Lens | Cámara / imagen | |
| Circle to Search | Rodear o resaltar en pantalla | Google (Android) |
| Búsqueda por voz | Consulta hablada | Google y otros |
| AI Mode | Imagen + texto o voz, con despliegue de consultas | Google (Gemini) |
| Bing Visual Search | Imagen | Microsoft |
| Copilot Vision | Pantalla o cámara + chat | Microsoft |
Búsqueda multimodal frente a búsqueda de imágenes
| Búsqueda de imágenes | Búsqueda multimodal | |
|---|---|---|
| Entrada | Texto o imagen | Imagen, voz o vídeo (+ texto) |
| Salida | Imágenes | Cualquier tipo de resultado |
| La imagen es… | Lo que buscas | Parte de la consulta |
Confirmado frente a teoría
| Afirmación | Estado |
|---|---|
| La Búsqueda admite consultas con imágenes, voz o elementos de pantalla | Confirmado |
| Las respuestas de IA recuperan información del índice principal de la Búsqueda | Confirmado |
| Una «señal de posicionamiento multimodal» independiente aplicada a tus imágenes o fotogramas | Teoría del sector |
| Ponderación exacta de imagen frente a texto en una consulta | Especulación |
El método confirmado
- Usa texto alternativo descriptivo y nombres de archivo significativos.
- Publica transcripciones y subtítulos reales para audio y vídeo.
ProductImageObject/VideoObject/ datos estructurados.- Pasajes autónomos que respondan a la intención implícita de la consulta.
- Primero, contenido rastreable e indexado; no existe un índice de IA independiente.
Lista de comprobación de preparación multimodal
Una revisión para confirmar que tu contenido se puede entender y recuperar en distintas modalidades:
- Cada imagen relevante tiene texto alternativo descriptivo, sin acumulación de palabras clave y no vacío cuando la imagen aporta contenido.
- Los nombres de archivo de las imágenes describen el tema (
blue-wingback-chair.jpg, noIMG_4821.jpg). - Las páginas de productos o de contenido visual incluyen los datos estructurados correspondientes (
Product,ImageObject,Recipe, etc.). - Los vídeos tienen transcripción o subtítulos, además de marcado
VideoObjecty un resumen textual en la página. - El contenido de audio o pódcast incluye una transcripción legible.
- Los diagramas y las capturas tienen pies descriptivos y texto próximo que responde a la pregunta de seguimiento evidente.
- Las páginas a las que llegaría directamente una consulta visual responden a la intención implícita —«qué es esto», «dónde comprarlo» o «cómo arreglarlo»— en un pasaje autónomo.
- Las imágenes y los medios no están bloqueados para el rastreo, y las páginas que los alojan se pueden indexar; la cadena de recuperación está intacta.
- Asegúrate de que no dependes de un «factor de posicionamiento multimodal» sin confirmar: el plan se apoya en los fundamentos confirmados anteriores.
Inventariar el contexto de las imágenes en el navegador
Ejecuta este código en la consola de Chrome DevTools en una página representativa. Enumera el origen, las dimensiones, el texto alternativo y el encabezado más próximo de cada imagen:
console.table([...document.images].map(img => ({ src: img.currentSrc || img.src, width: img.naturalWidth, height: img.naturalHeight, alt: img.getAttribute('alt'), heading: img.closest('section, article, main')?.querySelector('h1,h2,h3')?.textContent?.trim() || '' })));La ausencia de alt y una sección próxima poco informativa son motivos de revisión, no fallos automáticos de SEO. Las imágenes decorativas pueden utilizar correctamente un texto alternativo vacío.
Encontrar imágenes que requieren interacción para obtener una URL
Ejecuta este código antes de hacer clic en galerías o carruseles:
const urls = new Set([...document.images].map(i => i.currentSrc || i.src));
console.table([...document.querySelectorAll('[data-src], [data-lazy-src]')].map(el => ({ pending: el.dataset.src || el.dataset.lazySrc, alreadyRendered: urls.has(el.dataset.src || el.dataset.lazySrc) })));Una imagen pendiente no es necesariamente inaccesible, pero el resultado identifica recursos que requieren un rastreo de la página renderizada y una revisión de las interacciones.
Verificar los recursos de imagen y su contexto después de publicar
Prueba: obtén la página con un rastreador con renderizado y exporta las URL de imagen, los códigos de estado, el texto alternativo y los encabezados de la página de referencia. Resultado esperado: las imágenes importantes responden correctamente y aparecen en el HTML renderizado con el contexto adecuado. Interpretación del fallo: el recurso está roto, solo se carga tras una interacción no compatible o está separado del texto que lo explica.Ventana de seguimiento: inmediatamente después del despliegue. Criterio de reversión: la versión elimina o rompe imágenes importantes de productos, instrucciones o contenido principal.
Verificar las asociaciones de imágenes en datos estructurados
Prueba: inspecciona los datos estructurados pertinentes y las URL de imagen a las que hacen referencia mediante el flujo de validación de schema correspondiente. Resultado esperado: las imágenes referenciadas responden y pertenecen a la entidad descrita en la página.Interpretación del fallo: el marcado apunta a un recurso ausente, bloqueado o no relacionado.Ventana de seguimiento: inmediata para el marcado y las comprobaciones HTTP; la apariencia en la búsqueda solo se puede evaluar tras un nuevo rastreo. Criterio de reversión: el cambio crea marcado no válido o asocia una imagen incorrecta con la entidad.
Ponte a prueba: búsqueda multimodal
Cinco preguntas rápidas sobre cómo funciona la búsqueda con texto, imágenes, vídeo y audio. Elige una respuesta para cada una y después compruébalas.
Recursos que merecen tu tiempo
Mis artículos relacionados
- Google AI Overviews: todo lo que necesitas saber: cómo las respuestas de IA recuperan información del índice principal, requisito para aparecer en resultados de IA multimodales.
- Lo que sabemos realmente sobre la optimización para búsquedas con LLM: una visión basada en pruebas de lo que influye y no influye en las citas de IA, útil para separar los mecanismos confirmados de la exageración.
Mis charlas
- How Search Works (SlideShare): mi explicación del rastreo, el renderizado, la indexación y el posicionamiento, la canalización que sigue utilizando la recuperación multimodal. Se mantiene mi advertencia habitual: “This is my understanding of systems… not going to be 100% complete or accurate.” (traducción) «Así entiendo estos sistemas; la explicación no será completa ni exacta al cien por cien».
Otros recursos del sector
- MUM: un nuevo hito de IA para comprender la información: el anuncio de MUM de Google, un sistema multimodal y multilingüe 1000 veces más potente que BERT.
- Cómo impulsa la IA unos buenos resultados de búsqueda: explicación de Google sobre cómo encajan sus sistemas de IA, incluido MUM.
- Guía de Google para optimizar las funciones de IA generativa: declaración oficial de que las funciones de IA se ejecutan sobre el posicionamiento principal de la Búsqueda, sin un índice de IA independiente.
- Prácticas recomendadas de SEO para Google Imágenes: fundamentos confirmados para que las imágenes sean legibles, incluidos el texto alternativo, los nombres de archivo y los datos estructurados.
- Prácticas recomendadas de SEO para vídeo: cómo entiende Google el vídeo y los fundamentos de
VideoObjecty las transcripciones. - Bing Visual Search: la interfaz de Microsoft que usa una imagen como consulta y recuerda que la búsqueda multimodal no es exclusiva de Google.
Vídeos
- Google Search Central (YouTube): la serie How Google Search Works y las explicaciones de Martin Splitt sobre cómo entiende Google las imágenes, el vídeo y el contenido de las páginas, es decir, la parte de comprensión automática de la búsqueda multimodal. Canal
Registro de cambios
Actualizado el 22 ago 2026.
Resumen editorial y detalles registrados del cambio.Detalles del cambio
-
Los detalles del cambio están disponibles actualmente en inglés.
La comparación completa no está disponible: no se archivó una instantánea anterior para esta revisión.
Actualizado el 19 jul 2026.
Resumen editorial y detalles registrados del cambio.Detalles del cambio
-
Los detalles del cambio están disponibles actualmente en inglés.
-
Los detalles del cambio están disponibles actualmente en inglés.
-
Los detalles del cambio están disponibles actualmente en inglés.
-
Los detalles del cambio están disponibles actualmente en inglés.
-
Los detalles del cambio están disponibles actualmente en inglés.
-
Los detalles del cambio están disponibles actualmente en inglés.
-
Los detalles del cambio están disponibles actualmente en inglés.
La comparación completa no está disponible: no se archivó una instantánea anterior para esta revisión.