Búsqueda semántica

Cómo los motores de búsqueda relacionan el significado en lugar de las palabras clave: el Knowledge Graph, Hummingbird, RankBrain, la coincidencia neuronal, BERT y MUM, y lo que significa para el SEO.

Publicado por primera vez: 24 jun 2026 · Última actualización: 13 ago 2026 · Avanzado
Idiomas

La búsqueda semántica recupera por significado, no por coincidencia exacta de palabras clave. Google llegó a eso por capas: el Knowledge Graph (2012, 'cosas, no cadenas'), Hummingbird (2013, significado de la consulta completa), RankBrain (2015, consultas novedosas), la coincidencia neuronal (2018, sinónimos a nivel de concepto), BERT (2019, significado contextual de las palabras) y MUM (2021, multimodal). Por eso el relleno de palabras clave y la persecución de cada sinónimo dejaron de funcionar, y por eso la profundidad temática, las entidades claras y la alineación con la intención empezaron a importar. La búsqueda semántica es el objetivo; la búsqueda vectorial es una forma de lograrlo. Las 'palabras clave LSI' son un mito: John Mueller lo dijo sin rodeos. La respuesta de optimización no ha cambiado a lo largo de una década de actualizaciones: escribe de forma natural, cubre el tema, nombra tus entidades.

TL;DR — La búsqueda semántica recupera por significado, no por coincidencia exacta de palabras clave. Google la construyó por capas: Knowledge Graph (2012), Hummingbird (2013), RankBrain (2015), coincidencia neuronal (2018), BERT (2019), MUM (2021) — cada una resolviendo una pieza diferente (entidades, significado de consulta completa, consultas novedosas, sinónimos a nivel de concepto, significado contextual de palabras, razonamiento multimodal). Aumentan la recuperación por palabras clave (BM25 aún se ejecuta primero a escala), no la reemplazan. La búsqueda semántica es el objetivo; la búsqueda vectorial es una implementación. “Las palabras clave LSI” son un mito. La respuesta de optimización no ha cambiado en una década: lenguaje natural, profundidad temática, entidades claras, alineación de intención.

Búsqueda por palabras clave vs. búsqueda semántica

La recuperación por palabras clave y la recuperación semántica son complementarias, no eras mutuamente excluyentes. Evidence for this claim BERT learns bidirectional contextual language representations that can be fine-tuned for search-relevant language tasks. Scope: BERT research; semantic retrieval systems may use many other models and signals. Confidence: high · Verified: Devlin et al.: BERT Las explicaciones públicas de Google confirman los sistemas de comprensión del lenguaje sin revelar los pesos completos de clasificación. Evidence for this claim Google reported using BERT to better understand language and context in some Search queries. Scope: Google Search's documented rollout; it does not mean lexical matching was replaced or disclose the full ranking system. Confidence: high · Verified: Google: Understanding searches better than ever before

La recuperación clásica clasifica los documentos según estadísticas de términos. TF-IDF (frecuencia de término × frecuencia inversa de documento) pondera una palabra según la frecuencia con la que aparece en un documento frente a lo rara que es en el corpus. BM25 (“Best Match 25”) refina eso con normalización de longitud y una curva de saturación, y sigue siendo el punto de referencia dominante de primera etapa en Elasticsearch, Solr y Lucene — y dentro de Google y Bing. Potente, rápido y completamente basado en palabras. No tiene idea de que “grifo que gotea” y “llave que gotea” significan lo mismo.

La búsqueda semántica añade una capa de comprensión encima:

DimensiónBúsqueda por palabras claveBúsqueda semántica
Coincide enTérminos exactosSignificado / intención
SinónimosSolo si se configuran manualmenteDe forma nativa
Variantes de entidadesSolo si se normalizanMediante reconocimiento de entidades
Consultas largas / conversacionalesMal (cada palabra ponderada por separado)Bien (frase completa comprendida)
Donde aún ganaNombres de marca exactos, SKU, cadenas técnicasTodo lo más difuso

El marco importante: la búsqueda semántica aumenta la recuperación por palabras clave en lugar de reemplazarla. A escala de Google, un paso de índice invertido estilo BM25 todavía hace el primer corte de alta recuperación por velocidad, y luego los sistemas neuronales reordenan y añaden documentos que comparten conceptos pero no palabras. El testimonio de Pandu Nayak ante el DOJ en 2023 describió exactamente esto — un sistema de incrustaciones (internamente RankEmbed) que “identifica algunos documentos más para añadir a los identificados por la recuperación tradicional.” La recuperación por palabras clave no murió; obtuvo un compañero consciente del significado.

Cómo construyó Google la búsqueda semántica — los hitos

La evolución fue incremental. Ninguna actualización única cambió Google de “palabras clave” a “significado” — fue una década de capas, cada una resolviendo un problema distinto.

Semantic search evolved through systems with different jobs; the milestones are not one interchangeable algorithm. Fuente: Semantic Search

The timeline begins with Knowledge Graph in 2012, followed by Hummingbird in 2013, RankBrain in 2015, neural matching in 2018, BERT in 2019, MUM in 2021, and the 2023-plus LLM era.

© Patrick Stox LLC · CC BY 4.0 ·

2012 — Knowledge Graph (“cosas, no cadenas”)

La base de datos de Google de entidades del mundo real y sus relaciones. El lema con el que Amit Singhal presentó el sistema — “things, not strings” (traducción) «entidades, no simples cadenas de texto» — sigue siendo la mejor explicación en una sola línea del cambio semántico. Se lanzó con más de quinientos millones de entidades y más de 3,5 mil millones de datos; el enfoque importa más que las cifras. Esto permite a Google desambiguar “Taj Mahal” (monumento, músico o casino) y responder directamente preguntas sobre entidades. El Knowledge Graph es la columna vertebral de entidades sobre la que se apoya el resto de la pila; profundizo en ello en SEO de entidades.

2013 — Hummingbird (significado de consulta completa)

Una reescritura completa del motor de consultas central de Google — no un ajuste como Panda o Penguin, sino un motor nuevo. Singhal lo llamó el cambio más dramático desde 2001. El objetivo eran las consultas conversacionales y de cola larga: prestar atención a la consulta completa — la frase completa, el significado — en lugar de palabras particulares. El resumen contemporáneo de Danny Sullivan lo captura bien: Hummingbird “is paying more attention to each word in a query, ensuring that the whole query… is taken into account, rather than particular words.” (traducción) «presta más atención a cada palabra de una consulta, asegurando que la consulta completa… se tenga en cuenta, en lugar de palabras particulares.» Google dice que afectó al 90 % de las búsquedas. (Ahora figura como retirado en la Guía de Sistemas de Clasificación — superado por los sistemas que evolucionaron a partir de él.)

2015 — RankBrain (consultas nunca antes vistas)

Aprendizaje automático aplicado a la interpretación de consultas. RankBrain se ocupa aproximadamente del 15 % de las consultas diarias que Google nunca había visto: convierte una consulta desconocida en un vector matemático y encuentra consultas conceptualmente similares que entiende. Greg Corrado, el científico de Google que lo confirmó (a través de Bloomberg, no de una publicación del blog de Google), lo describió como la conversión de “vast amounts of written language into mathematical entities — called vectors — that the computer can understand.” (traducción) «enormes cantidades de lenguaje escrito en entidades matemáticas —llamadas vectores— que la computadora puede entender». Para 2016 procesaba todas las consultas. El límite es importante: RankBrain relaciona consultas desconocidas con conceptos conocidos; no es lo mismo que BERT.

2018 — Coincidencia neuronal (sinónimos a nivel de concepto)

Mientras RankBrain relacionaba consultas con conceptos, la coincidencia neuronal amplió esa relación al lado del documento: conecta los conceptos de una consulta con los de una página aunque no compartan vocabulario. La explicación en lenguaje sencillo de Danny Sullivan es la mejor: “Last few months, Google has been using neural matching, [an] AI method to better connect words to concepts. Super synonyms, in a way, and impacting 30% of queries.” (traducción) «En los últimos meses, Google ha estado usando la coincidencia neuronal, [un] método de IA para conectar mejor palabras con conceptos. En cierto modo, supersinónimos, con impacto en el 30 % de las consultas». El ejemplo canónico: “¿por qué mi televisor se ve raro?” puede mostrar resultados sobre el “efecto telenovela”, un concepto que ninguna frase menciona. (Internamente, el testimonio del DOJ de 2023 reveló que este linaje se denomina RankEmbed / RankEmbedBERT.)

2019 — BERT (significado contextual de las palabras)

El gran avance del PLN. BERT (Representaciones de Codificador Bidireccional de Transformadores) lee una palabra en contexto: observa las palabras anteriores y posteriores, en lugar de avanzar de izquierda a derecha de una en una. Así capta cómo “to” cambia el significado de “2019 brazil traveler to usa need a visa” (un brasileño que viaja a Estados Unidos, algo que los sistemas anteriores interpretaban al revés). Pandu Nayak lo llamó el “biggest leap forward in the past five years, and one of the biggest leaps forward in the history of Search,” (traducción) «mayor salto adelante de los últimos cinco años y uno de los mayores avances de la historia de la Búsqueda», con impacto en una de cada diez consultas en inglés de Estados Unidos durante su lanzamiento y ahora en casi todas. También es la actualización que los profesionales del SEO interpretan mal con más frecuencia: Danny Sullivan fue tajante — “There’s nothing to optimize for with BERT.” (traducción) «No hay nada que optimizar para BERT».

2021 — MUM (multimodal, multilingüe)

Modelo Unificado Multitarea — construido sobre el marco T5, entrenado en 75 idiomas, y capaz de entender información a través de texto e imágenes. Google dice que es 1 000 veces más potente que BERT y, a diferencia de BERT, puede tanto entender como generar lenguaje. Advertencia importante: MUM se usa para casos específicos de alta complejidad (preguntas complejas de varios pasos, ciertos fragmentos destacados, compras) — nunca fue el motor de clasificación general de Google, y no “reemplazó” a BERT.

2023+ — LLMs y búsqueda con IA

La recuperación semántica ahora alimenta las respuestas generativas. Las descripciones generales de IA y el modo de IA usan la misma recuperación basada en significado para encontrar pasajes relevantes, y luego un LLM sintetiza una respuesta — ver RAG. La capa semántica determina qué se recupera y se cita; el modelo solo lo redacta.

Búsqueda semántica vs. búsqueda vectorial

Estos se confunden constantemente, así que sé preciso:

  • Búsqueda semántica es el objetivo — recuperar por significado e intención.
  • Búsqueda vectorial es una implementación — representar consultas y documentos como vectores densos y encontrar vecinos más cercanos por distancia coseno.

La búsqueda vectorial es la implementación moderna más común, pero no es el único camino hacia la búsqueda semántica: la expansión de consultas, las reglas de sinónimos, las búsquedas en el Grafo de Conocimiento y el reconocimiento de entidades te llevan allí sin calcular una sola incrustación. Piensa en la búsqueda semántica como el destino y la búsqueda vectorial como un vehículo (rápido, escalable). La mecánica del vehículo — incrustaciones, similitud coseno, búsqueda de vecinos más cercanos — se cubre en los artículos de incrustaciones y búsqueda vectorial; no las volveré a derivar aquí.

Cómo funciona realmente bajo el capó

Cuatro partes móviles, aproximadamente en orden:

  1. Comprensión de consultas — clasificación de intención (informativa, de navegación, transaccional, comercial), extracción de entidades y expansión de sinónimos/conceptos. Este es el territorio de RankBrain y BERT.
  2. Reconocimiento de entidades + el Grafo de Conocimiento — identificar las cosas del mundo real sobre las que tratan una consulta y un documento, y desambiguarlas. Alrededor del 40 % de las palabras en inglés tienen múltiples significados; el contexto resuelve cuál quieres decir.
  3. Embeddings y similitud semántica — codificar el significado como vectores para que “arreglar un grifo que gotea” y “reparar un grifo que gotea” queden cerca entre sí (~0,89 de similitud a pesar de apenas compartir una palabra). Profundización en embeddings.
  4. Ranking de pasajes y re-ranking neuronal — desde 2020, pasajes individuales de una página pueden posicionarse para una consulta incluso cuando toda la página no está perfectamente orientada, y un re-ranker neuronal reordena el conjunto recuperado por palabras clave según el ajuste semántico. Por eso cada sección debe sostenerse por sí misma.

El mito de las palabras clave LSI

Esto importa porque impulsa muchos consejos malos. “Palabras clave LSI” (Latent Semantic Indexing) es una técnica de recuperación de información de 1988 que Google nunca ha confirmado usar como factor de ranking. John Mueller lo dijo claramente: “There’s no such thing as LSI keywords — anyone who’s telling you otherwise is mistaken, sorry.” (traducción) «No existe tal cosa como palabras clave LSI: cualquiera que te diga lo contrario está equivocado, lo siento». Lo que Google realmente usa es mucho más sofisticado: coincidencia neuronal, BERT, embeddings de palabras, reconocimiento de entidades. Así que cuando una herramienta te entrega una lista de “palabras clave LSI”, lo útil no es la parte LSI; es que esos términos reflejan el vocabulario del tema. Cubre el tema de forma natural y obtienes eso gratis.

Qué significa la búsqueda semántica para el SEO

Cada actualización semántica importante ha empujado en la misma dirección, lo que hace que el manual sea inusualmente estable:

  • La cobertura del tema supera a la densidad de palabras clave. Google juzga si una página cubre un tema a fondo, no si alcanza una palabra clave n veces. La cobertura profunda posiciona para docenas de consultas relacionadas que nunca apuntaste individualmente.
  • Optimización de entidades. Nombra y describe tus entidades con claridad; usa datos estructurados (sameAs, @id) para desambiguarlas contra Wikipedia/Wikidata. Esta es la disciplina de SEO de entidades.
  • La alineación de la intención no es negociable. Google clasifica la intención de la consulta y filtra por ella. Una página que responde a una intención diferente a la de la consulta no posicionará sin importar qué tan bien coincidan las palabras clave.
  • Escribe de forma natural. Con BERT leyendo el contexto, las preposiciones y la estructura de las oraciones llevan significado. El consejo de Gary Illyes sobre RankBrain sigue vigente: “If you try to write like a machine then RankBrain will just get confused and probably just pushes you back.” (traducción) «Si intentas escribir como una máquina, RankBrain se confundirá y probablemente te empuje hacia atrás».
  • Los sinónimos se manejan por ti. No necesitas cada variación; cubrir el vocabulario natural del tema señala profundidad sin relleno.
  • Calidad a nivel de pasaje. Cada H2/sección debe sostenerse por sí misma como una respuesta limpia y autocontenida — eso es lo que recuperan el ranking de pasajes y AI Overviews.

Cuando el SEO semántico importa menos

Chequeo de honestidad: para un negocio local de un solo servicio o un sitio delgado, el trabajo pesado de entidades y autoridad temática puede no dar resultados. El ROI aparece cuando compites en profundidad informativa dentro de un tema. Como dijo Sally Mills: “If you do SEO properly, you’re automatically doing semantic SEO. It’s just that most people aren’t doing it properly.” (traducción) «Si haces SEO correctamente, automáticamente estás haciendo SEO semántico. Es solo que la mayoría de la gente no lo está haciendo correctamente». Y Google no se volverá puramente semántico pronto: la recuperación semántica completa es costosa, la coincidencia exacta sigue siendo un comportamiento común del usuario, y los resultados puramente semánticos siguen siendo poco fiables. La recuperación por palabras clave y la comprensión semántica coexisten.

Cómo la búsqueda con IA se basa en esto

Los AI Overviews, el AI Mode y los asistentes de IA son búsqueda semántica más generación. Recuperan pasajes por significado (normalmente recuperación densa — ver RAG y búsqueda vectorial), y luego un LLM escribe la respuesta. El planteamiento de Bing sobre este cambio es contundente: el grounding de la indexación, en sus palabras, “is being built to help AI systems decide what to say.” (traducción) «se está construyendo para ayudar a los sistemas de IA a decidir qué decir». La consecuencia práctica: las mismas cosas que hacen que un pasaje se posicione bien — entidades claras, secciones autocontenidas, profundidad temática — son las que hacen que sea probable que se cite en una respuesta de IA. No hay ningún truco aparte.

Add an expert note

Pin an expert quote

New person? Create their unclaimed profile at /admin/experts/ → Pin a quote first.