Búsqueda semántica
Cómo los motores de búsqueda relacionan el significado en lugar de las palabras clave: el Knowledge Graph, Hummingbird, RankBrain, la coincidencia neuronal, BERT y MUM, y lo que significa para el SEO.
Idiomas
La búsqueda semántica recupera por significado, no por coincidencia exacta de palabras clave. Google llegó a eso por capas: el Knowledge Graph (2012, 'cosas, no cadenas'), Hummingbird (2013, significado de la consulta completa), RankBrain (2015, consultas novedosas), la coincidencia neuronal (2018, sinónimos a nivel de concepto), BERT (2019, significado contextual de las palabras) y MUM (2021, multimodal). Por eso el relleno de palabras clave y la persecución de cada sinónimo dejaron de funcionar, y por eso la profundidad temática, las entidades claras y la alineación con la intención empezaron a importar. La búsqueda semántica es el objetivo; la búsqueda vectorial es una forma de lograrlo. Las 'palabras clave LSI' son un mito: John Mueller lo dijo sin rodeos. La respuesta de optimización no ha cambiado a lo largo de una década de actualizaciones: escribe de forma natural, cubre el tema, nombra tus entidades.
TL;DR — La búsqueda semántica significa que los motores de búsqueda coinciden con el significado de lo que buscas, no solo con las palabras exactas que escribiste. Google averigua “¿qué quiere realmente esta persona?” y “¿de qué trata realmente esta página?” — y luego conecta ambos. Es por eso que ya no tienes que repetir palabras clave una y otra vez, y por qué escribir de forma natural sobre un tema funciona mejor que rellenarlo con frases.
Qué es la búsqueda semántica
La búsqueda semántica busca coincidencias basadas en el significado y el contexto, además de los términos exactos. Evidence for this claim BERT learns bidirectional contextual language representations that can be fine-tuned for search-relevant language tasks. Scope: BERT research; semantic retrieval systems may use many other models and signals. Confidence: high · Verified: Devlin et al.: BERT Los sistemas modernos pueden combinar modelos de lenguaje, recuperación léxica, entidades y otras señales en lugar de depender de una sola técnica. Evidence for this claim Google reported using BERT to better understand language and context in some Search queries. Scope: Google Search's documented rollout; it does not mean lexical matching was replaced or disclose the full ranking system. Confidence: high · Verified: Google: Understanding searches better than ever before
Durante mucho tiempo, los motores de búsqueda contaban principalmente palabras. Si buscabas “vuelos baratos”, buscaban páginas con las palabras “vuelos” y “baratos”. Útil, pero limitado: no tenía idea de que “tarifa aérea asequible” significa lo mismo, o que “jaguar” podría ser un animal o un coche.
La búsqueda semántica soluciona eso. En lugar de hacer coincidir letras y palabras, intenta comprender el significado. Dos ideas la impulsan:
- Comprender lo que quieres decir. Google lee toda tu consulta como una oración, no como un saco de palabras clave. Deduce tu intención: ¿estás tratando de comprar algo, aprender algo o encontrar un sitio específico?
- Comprender de qué trata una página. Averigua los temas que cubre una página y las cosas del mundo real (personas, lugares, productos) que menciona, no solo qué palabras aparecen.
Una buena forma de visualizarlo: buscar “cómo arreglar un grifo que gotea” y “reparar un grifo que pierde” debería devolver los mismos resultados, aunque esas frases casi no compartan palabras. Para un motor de palabras clave parecen no relacionadas. Para un motor semántico significan lo mismo.
Por qué cambió el SEO
Cuando Google comprendió el significado, muchos trucos antiguos dejaron de funcionar:
- No necesitas rellenar con palabras clave. Google ya conoce sinónimos y términos relacionados. Repetir “mejores zapatillas para correr” veinte veces no ayuda; puede perjudicar.
- No necesitas una página separada para cada redacción. “Tutorial de Python”, “guía de Python” y “aprender Python” significan aproximadamente lo mismo, así que Google elige una página para posicionar todas ellas. Dividirlas entre páginas solo compite contigo mismo.
- Cubrir bien un tema supera alcanzar un número de palabras clave. Una página que responde genuinamente a una pregunta — con los detalles relacionados que un lector querría — supera a una que solo menciona la palabra clave muchas veces.
Lo que la mayoría de la gente entiende mal
La búsqueda semántica no significa que las palabras clave estén muertas. La investigación de palabras clave sigue diciéndote qué busca la gente y con qué frecuencia. Lo que murió es el relleno de palabras clave y la idea de que debes repetir frases exactas. Y para ser claros: “las palabras clave LSI” no son algo real. John Mueller, de Google, lo dijo directamente. Espolvorear “palabras clave semánticamente relacionadas” de una herramienta no es así como funciona esto: cubrir el tema de forma natural es lo correcto.
¿Quieres la historia completa (Knowledge Graph, Hummingbird, RankBrain, BERT, MUM) y el detalle técnico de cómo funciona? Cambia a la pestaña Avanzado.
TL;DR — La búsqueda semántica recupera por significado, no por coincidencia exacta de palabras clave. Google la construyó por capas: Knowledge Graph (2012), Hummingbird (2013), RankBrain (2015), coincidencia neuronal (2018), BERT (2019), MUM (2021) — cada una resolviendo una pieza diferente (entidades, significado de consulta completa, consultas novedosas, sinónimos a nivel de concepto, significado contextual de palabras, razonamiento multimodal). Aumentan la recuperación por palabras clave (BM25 aún se ejecuta primero a escala), no la reemplazan. La búsqueda semántica es el objetivo; la búsqueda vectorial es una implementación. “Las palabras clave LSI” son un mito. La respuesta de optimización no ha cambiado en una década: lenguaje natural, profundidad temática, entidades claras, alineación de intención.
Búsqueda por palabras clave vs. búsqueda semántica
La recuperación por palabras clave y la recuperación semántica son complementarias, no eras mutuamente excluyentes. Evidence for this claim BERT learns bidirectional contextual language representations that can be fine-tuned for search-relevant language tasks. Scope: BERT research; semantic retrieval systems may use many other models and signals. Confidence: high · Verified: Devlin et al.: BERT Las explicaciones públicas de Google confirman los sistemas de comprensión del lenguaje sin revelar los pesos completos de clasificación. Evidence for this claim Google reported using BERT to better understand language and context in some Search queries. Scope: Google Search's documented rollout; it does not mean lexical matching was replaced or disclose the full ranking system. Confidence: high · Verified: Google: Understanding searches better than ever before
La recuperación clásica clasifica los documentos según estadísticas de términos. TF-IDF (frecuencia de término × frecuencia inversa de documento) pondera una palabra según la frecuencia con la que aparece en un documento frente a lo rara que es en el corpus. BM25 (“Best Match 25”) refina eso con normalización de longitud y una curva de saturación, y sigue siendo el punto de referencia dominante de primera etapa en Elasticsearch, Solr y Lucene — y dentro de Google y Bing. Potente, rápido y completamente basado en palabras. No tiene idea de que “grifo que gotea” y “llave que gotea” significan lo mismo.
La búsqueda semántica añade una capa de comprensión encima:
| Dimensión | Búsqueda por palabras clave | Búsqueda semántica |
|---|---|---|
| Coincide en | Términos exactos | Significado / intención |
| Sinónimos | Solo si se configuran manualmente | De forma nativa |
| Variantes de entidades | Solo si se normalizan | Mediante reconocimiento de entidades |
| Consultas largas / conversacionales | Mal (cada palabra ponderada por separado) | Bien (frase completa comprendida) |
| Donde aún gana | Nombres de marca exactos, SKU, cadenas técnicas | Todo lo más difuso |
El marco importante: la búsqueda semántica aumenta la recuperación por palabras clave en lugar de reemplazarla. A escala de Google, un paso de índice invertido estilo BM25 todavía hace el primer corte de alta recuperación por velocidad, y luego los sistemas neuronales reordenan y añaden documentos que comparten conceptos pero no palabras. El testimonio de Pandu Nayak ante el DOJ en 2023 describió exactamente esto — un sistema de incrustaciones (internamente RankEmbed) que “identifica algunos documentos más para añadir a los identificados por la recuperación tradicional.” La recuperación por palabras clave no murió; obtuvo un compañero consciente del significado.
Cómo construyó Google la búsqueda semántica — los hitos
La evolución fue incremental. Ninguna actualización única cambió Google de “palabras clave” a “significado” — fue una década de capas, cada una resolviendo un problema distinto.
The timeline begins with Knowledge Graph in 2012, followed by Hummingbird in 2013, RankBrain in 2015, neural matching in 2018, BERT in 2019, MUM in 2021, and the 2023-plus LLM era.
© Patrick Stox LLC · CC BY 4.0 ·
2012 — Knowledge Graph (“cosas, no cadenas”)
La base de datos de Google de entidades del mundo real y sus relaciones. El lema con el que Amit Singhal presentó el sistema — “things, not strings” (traducción) «entidades, no simples cadenas de texto» — sigue siendo la mejor explicación en una sola línea del cambio semántico. Se lanzó con más de quinientos millones de entidades y más de 3,5 mil millones de datos; el enfoque importa más que las cifras. Esto permite a Google desambiguar “Taj Mahal” (monumento, músico o casino) y responder directamente preguntas sobre entidades. El Knowledge Graph es la columna vertebral de entidades sobre la que se apoya el resto de la pila; profundizo en ello en SEO de entidades.
2013 — Hummingbird (significado de consulta completa)
Una reescritura completa del motor de consultas central de Google — no un ajuste como Panda o Penguin, sino un motor nuevo. Singhal lo llamó el cambio más dramático desde 2001. El objetivo eran las consultas conversacionales y de cola larga: prestar atención a la consulta completa — la frase completa, el significado — en lugar de palabras particulares. El resumen contemporáneo de Danny Sullivan lo captura bien: Hummingbird “is paying more attention to each word in a query, ensuring that the whole query… is taken into account, rather than particular words.” (traducción) «presta más atención a cada palabra de una consulta, asegurando que la consulta completa… se tenga en cuenta, en lugar de palabras particulares.» Google dice que afectó al 90 % de las búsquedas. (Ahora figura como retirado en la Guía de Sistemas de Clasificación — superado por los sistemas que evolucionaron a partir de él.)
2015 — RankBrain (consultas nunca antes vistas)
Aprendizaje automático aplicado a la interpretación de consultas. RankBrain se ocupa aproximadamente del 15 % de las consultas diarias que Google nunca había visto: convierte una consulta desconocida en un vector matemático y encuentra consultas conceptualmente similares que sí entiende. Greg Corrado, el científico de Google que lo confirmó (a través de Bloomberg, no de una publicación del blog de Google), lo describió como la conversión de “vast amounts of written language into mathematical entities — called vectors — that the computer can understand.” (traducción) «enormes cantidades de lenguaje escrito en entidades matemáticas —llamadas vectores— que la computadora puede entender». Para 2016 procesaba todas las consultas. El límite es importante: RankBrain relaciona consultas desconocidas con conceptos conocidos; no es lo mismo que BERT.
2018 — Coincidencia neuronal (sinónimos a nivel de concepto)
Mientras RankBrain relacionaba consultas con conceptos, la coincidencia neuronal amplió esa relación al lado del documento: conecta los conceptos de una consulta con los de una página aunque no compartan vocabulario. La explicación en lenguaje sencillo de Danny Sullivan es la mejor: “Last few months, Google has been using neural matching, [an] AI method to better connect words to concepts. Super synonyms, in a way, and impacting 30% of queries.” (traducción) «En los últimos meses, Google ha estado usando la coincidencia neuronal, [un] método de IA para conectar mejor palabras con conceptos. En cierto modo, supersinónimos, con impacto en el 30 % de las consultas». El ejemplo canónico: “¿por qué mi televisor se ve raro?” puede mostrar resultados sobre el “efecto telenovela”, un concepto que ninguna frase menciona. (Internamente, el testimonio del DOJ de 2023 reveló que este linaje se denomina RankEmbed / RankEmbedBERT.)
2019 — BERT (significado contextual de las palabras)
El gran avance del PLN. BERT (Representaciones de Codificador Bidireccional de Transformadores) lee una palabra en contexto: observa las palabras anteriores y posteriores, en lugar de avanzar de izquierda a derecha de una en una. Así capta cómo “to” cambia el significado de “2019 brazil traveler to usa need a visa” (un brasileño que viaja a Estados Unidos, algo que los sistemas anteriores interpretaban al revés). Pandu Nayak lo llamó el “biggest leap forward in the past five years, and one of the biggest leaps forward in the history of Search,” (traducción) «mayor salto adelante de los últimos cinco años y uno de los mayores avances de la historia de la Búsqueda», con impacto en una de cada diez consultas en inglés de Estados Unidos durante su lanzamiento y ahora en casi todas. También es la actualización que los profesionales del SEO interpretan mal con más frecuencia: Danny Sullivan fue tajante — “There’s nothing to optimize for with BERT.” (traducción) «No hay nada que optimizar para BERT».
2021 — MUM (multimodal, multilingüe)
Modelo Unificado Multitarea — construido sobre el marco T5, entrenado en 75 idiomas, y capaz de entender información a través de texto e imágenes. Google dice que es 1 000 veces más potente que BERT y, a diferencia de BERT, puede tanto entender como generar lenguaje. Advertencia importante: MUM se usa para casos específicos de alta complejidad (preguntas complejas de varios pasos, ciertos fragmentos destacados, compras) — nunca fue el motor de clasificación general de Google, y no “reemplazó” a BERT.
2023+ — LLMs y búsqueda con IA
La recuperación semántica ahora alimenta las respuestas generativas. Las descripciones generales de IA y el modo de IA usan la misma recuperación basada en significado para encontrar pasajes relevantes, y luego un LLM sintetiza una respuesta — ver RAG. La capa semántica determina qué se recupera y se cita; el modelo solo lo redacta.
Búsqueda semántica vs. búsqueda vectorial
Estos se confunden constantemente, así que sé preciso:
- Búsqueda semántica es el objetivo — recuperar por significado e intención.
- Búsqueda vectorial es una implementación — representar consultas y documentos como vectores densos y encontrar vecinos más cercanos por distancia coseno.
La búsqueda vectorial es la implementación moderna más común, pero no es el único camino hacia la búsqueda semántica: la expansión de consultas, las reglas de sinónimos, las búsquedas en el Grafo de Conocimiento y el reconocimiento de entidades te llevan allí sin calcular una sola incrustación. Piensa en la búsqueda semántica como el destino y la búsqueda vectorial como un vehículo (rápido, escalable). La mecánica del vehículo — incrustaciones, similitud coseno, búsqueda de vecinos más cercanos — se cubre en los artículos de incrustaciones y búsqueda vectorial; no las volveré a derivar aquí.
Cómo funciona realmente bajo el capó
Cuatro partes móviles, aproximadamente en orden:
- Comprensión de consultas — clasificación de intención (informativa, de navegación, transaccional, comercial), extracción de entidades y expansión de sinónimos/conceptos. Este es el territorio de RankBrain y BERT.
- Reconocimiento de entidades + el Grafo de Conocimiento — identificar las cosas del mundo real sobre las que tratan una consulta y un documento, y desambiguarlas. Alrededor del 40 % de las palabras en inglés tienen múltiples significados; el contexto resuelve cuál quieres decir.
- Embeddings y similitud semántica — codificar el significado como vectores para que “arreglar un grifo que gotea” y “reparar un grifo que gotea” queden cerca entre sí (~0,89 de similitud a pesar de apenas compartir una palabra). Profundización en embeddings.
- Ranking de pasajes y re-ranking neuronal — desde 2020, pasajes individuales de una página pueden posicionarse para una consulta incluso cuando toda la página no está perfectamente orientada, y un re-ranker neuronal reordena el conjunto recuperado por palabras clave según el ajuste semántico. Por eso cada sección debe sostenerse por sí misma.
El mito de las palabras clave LSI
Esto importa porque impulsa muchos consejos malos. “Palabras clave LSI” (Latent Semantic Indexing) es una técnica de recuperación de información de 1988 que Google nunca ha confirmado usar como factor de ranking. John Mueller lo dijo claramente: “There’s no such thing as LSI keywords — anyone who’s telling you otherwise is mistaken, sorry.” (traducción) «No existe tal cosa como palabras clave LSI: cualquiera que te diga lo contrario está equivocado, lo siento». Lo que Google realmente usa es mucho más sofisticado: coincidencia neuronal, BERT, embeddings de palabras, reconocimiento de entidades. Así que cuando una herramienta te entrega una lista de “palabras clave LSI”, lo útil no es la parte LSI; es que esos términos reflejan el vocabulario del tema. Cubre el tema de forma natural y obtienes eso gratis.
Qué significa la búsqueda semántica para el SEO
Cada actualización semántica importante ha empujado en la misma dirección, lo que hace que el manual sea inusualmente estable:
- La cobertura del tema supera a la densidad de palabras clave. Google juzga si una página cubre un tema a fondo, no si alcanza una palabra clave n veces. La cobertura profunda posiciona para docenas de consultas relacionadas que nunca apuntaste individualmente.
- Optimización de entidades. Nombra y describe tus entidades con claridad; usa datos estructurados (
sameAs,@id) para desambiguarlas contra Wikipedia/Wikidata. Esta es la disciplina de SEO de entidades. - La alineación de la intención no es negociable. Google clasifica la intención de la consulta y filtra por ella. Una página que responde a una intención diferente a la de la consulta no posicionará sin importar qué tan bien coincidan las palabras clave.
- Escribe de forma natural. Con BERT leyendo el contexto, las preposiciones y la estructura de las oraciones llevan significado. El consejo de Gary Illyes sobre RankBrain sigue vigente: “If you try to write like a machine then RankBrain will just get confused and probably just pushes you back.” (traducción) «Si intentas escribir como una máquina, RankBrain se confundirá y probablemente te empuje hacia atrás».
- Los sinónimos se manejan por ti. No necesitas cada variación; cubrir el vocabulario natural del tema señala profundidad sin relleno.
- Calidad a nivel de pasaje. Cada H2/sección debe sostenerse por sí misma como una respuesta limpia y autocontenida — eso es lo que recuperan el ranking de pasajes y AI Overviews.
Cuando el SEO semántico importa menos
Chequeo de honestidad: para un negocio local de un solo servicio o un sitio delgado, el trabajo pesado de entidades y autoridad temática puede no dar resultados. El ROI aparece cuando compites en profundidad informativa dentro de un tema. Como dijo Sally Mills: “If you do SEO properly, you’re automatically doing semantic SEO. It’s just that most people aren’t doing it properly.” (traducción) «Si haces SEO correctamente, automáticamente estás haciendo SEO semántico. Es solo que la mayoría de la gente no lo está haciendo correctamente». Y Google no se volverá puramente semántico pronto: la recuperación semántica completa es costosa, la coincidencia exacta sigue siendo un comportamiento común del usuario, y los resultados puramente semánticos siguen siendo poco fiables. La recuperación por palabras clave y la comprensión semántica coexisten.
Cómo la búsqueda con IA se basa en esto
Los AI Overviews, el AI Mode y los asistentes de IA son búsqueda semántica más generación. Recuperan pasajes por significado (normalmente recuperación densa — ver RAG y búsqueda vectorial), y luego un LLM escribe la respuesta. El planteamiento de Bing sobre este cambio es contundente: el grounding de la indexación, en sus palabras, “is being built to help AI systems decide what to say.” (traducción) «se está construyendo para ayudar a los sistemas de IA a decidir qué decir». La consecuencia práctica: las mismas cosas que hacen que un pasaje se posicione bien — entidades claras, secciones autocontenidas, profundidad temática — son las que hacen que sea probable que se cite en una respuesta de IA. No hay ningún truco aparte.
Resumen de IA
Una versión condensada de la versión avanzada:
- Búsqueda semántica = recuperación por significado, no coincidencia exacta de palabras clave. Esa distinción es el punto central. “Cómo arreglar un grifo que gotea” y “reparar una llave que pierde” deberían devolver los mismos resultados aunque casi no compartan palabras.
- Complementa la búsqueda por palabras clave; no la reemplaza. La recuperación al estilo BM25 sigue ejecutándose primero a escala (velocidad + exhaustividad); los sistemas neuronales reordenan los resultados y añaden documentos que coinciden por concepto. El testimonio ante el DOJ confirmó que la capa de incrustaciones de Google (RankEmbed) añade documentos a la recuperación tradicional.
- Google la construyó por capas: Knowledge Graph (2012, “cosas, no cadenas”) → Hummingbird (2013, significado de la consulta completa, 90 % de las búsquedas) → RankBrain (2015, consultas novedosas) → coincidencia neuronal (2018, “supersinónimos” a nivel de concepto, 30 % de las consultas) → BERT (2019, significado contextual de las palabras, una de cada diez consultas) → MUM (2021, multimodal, 75 idiomas, nunca el motor general de ranking).
- Búsqueda semántica ≠ búsqueda vectorial. La búsqueda semántica es el objetivo; la búsqueda vectorial es una implementación (otras son la expansión de consultas, las reglas de sinónimos y las consultas al Knowledge Graph).
- Las “palabras clave LSI” son un mito — John Mueller lo dijo directamente. Google usa coincidencia neuronal, BERT e incrustaciones en su lugar.
- Manual de SEO (sin cambios durante una década): cobertura temática antes que densidad de palabras clave, entidades claras + datos estructurados, alineación con la intención, redacción natural y calidad a nivel de pasaje. La investigación de palabras clave sigue importando; el relleno de palabras clave no.
- Búsqueda con IA = recuperación semántica + generación. Lo que se posiciona bien (entidades claras, pasajes autocontenidos y profundidad) es lo que se cita.
Documentación oficial
Documentación y anuncios de fuentes primarias de Google y Microsoft.
- Una guía de los sistemas de ranking de la Búsqueda de Google — descripciones oficiales actuales de BERT, neural matching, RankBrain, MUM y Passage Ranking (y la lista de sistemas retirados, incluido Hummingbird).
- Presentación del Knowledge Graph: cosas, no cadenas — el lanzamiento de entidades de 2012 y el marco de “things, not strings”.
- Entender las búsquedas mejor que nunca (BERT) — el anuncio de BERT de Pandu Nayak en 2019, con los ejemplos de visa/esteticista.
- MUM: un nuevo hito de IA para entender la información — el modelo multimodal y multilingüe de 2021.
- Cómo la IA impulsa excelentes resultados de búsqueda — la visión general de Google sobre cómo encajan RankBrain, neural matching, BERT y MUM.
Microsoft / Bing
- La ciencia detrás de la búsqueda semántica (Azure AI) — “un motor de clasificación semántica basado en Transformer que entiende el significado detrás del texto.”
- Clasificación semántica en Azure AI Search — el patrón de recuperación BM25/RRF → re-clasificación con transformer, explicado.
- Hacia una búsqueda más inteligente: aprendizaje profundo para la semántica de consultas — profundidad técnica poco común sobre la clasificación neuronal pre-BERT de Bing (vectores GloVe, CNN + similitud de coseno).
- Presentamos Deep Search — una de las primeras descripciones públicas de la expansión de consultas a escala de producción.
Citas de la fuente
Declaraciones oficiales de representantes de Google y Microsoft. Cuando hay un enlace profundo disponible, salta al pasaje citado en la página de origen.
Google — el cambio semántico
- “Things, not strings.” (traducción) «Cosas, no cadenas». — Amit Singhal, al presentar el Knowledge Graph, 2012. Ir a la cita
Google — BERT (Pandu Nayak, 2019)
- “BERT models can therefore consider the full context of a word by looking at the words that come before and after it — particularly useful for understanding the intent behind search queries.” (traducción) «De este modo, BERT puede interpretar una palabra a partir de todo su entorno, observando lo que aparece antes y después; esto resulta especialmente útil para comprender qué pretende encontrar quien busca».
- ““[The] biggest leap forward in the past five years, and one of the biggest leaps forward in the history of Search.”” (traducción) «[El] mayor salto adelante de los últimos cinco años y uno de los mayores avances de la historia de la Búsqueda».
- “Language understanding remains an ongoing challenge, and it keeps us motivated to continue to improve Search.” (traducción) «La comprensión del lenguaje sigue siendo un desafío constante y nos motiva a continuar mejorando la Búsqueda». Ir a la cita
Danny Sullivan, enlace de búsqueda de Google
- Sobre la coincidencia neuronal (2018): “Last few months, Google has been using neural matching — AI method to better connect words to concepts. Super synonyms, in a way, and impacting 30% of queries.” (traducción) «Durante los últimos meses, Google ha empleado la coincidencia neuronal, un método de IA que vincula mejor las palabras con los conceptos. Funciona, en cierto modo, como un sistema de supersinónimos y afecta al 30 % de las consultas».
- “RankBrain helps Google better relate pages to concepts. Neural matching helps Google better relate words to searches. It’s like a super synonym system.” (traducción) «RankBrain ayuda a Google a relacionar mejor las páginas con los conceptos. La coincidencia neuronal ayuda a Google a relacionar mejor las palabras con las búsquedas. Es como un sistema de supersinónimos».
- Sobre la optimización para BERT (2019): “There’s nothing to optimize for with BERT, nor anything for a site owner to be ‘concerned’ about. The fundamentals of us seeking to reward great content remain unchanged.” (traducción) «No hay nada que optimizar para BERT ni nada por lo que el propietario de un sitio deba “preocuparse”. Los principios con los que buscamos recompensar el contenido excelente no han cambiado».
Gary Illyes, Google
- Sobre escribir para RankBrain (Big Digital Adelaide, 2016): “Optimizing for RankBrain is actually super easy… write in natural language. Try to write content that sounds human. If you try to write like a machine then RankBrain will just get confused and probably just pushes you back.” (traducción) «Optimizar para RankBrain es realmente muy sencillo… escribe con lenguaje natural. Intenta redactar contenido que suene humano. Si tratas de escribir como una máquina, RankBrain se confundirá y probablemente te relegará».
John Mueller, Google
- Sobre el mito de LSI (Twitter, 30 de julio de 2019): “There’s no such thing as LSI keywords — anyone who’s telling you otherwise is mistaken, sorry.” (traducción) «No existen las palabras clave LSI; quien te diga lo contrario está equivocado, lo siento».
Greg Corrado, Google (sobre RankBrain, vía Bloomberg, 2015)
- “RankBrain uses artificial intelligence to embed vast amounts of written language into mathematical entities — called vectors — that the computer can understand. If RankBrain sees a word or phrase it isn’t familiar with, the machine can make a guess as to what words or phrases might have a similar meaning and filter the result accordingly.” (traducción) «RankBrain usa inteligencia artificial para convertir enormes cantidades de lenguaje escrito en entidades matemáticas —llamadas vectores— que la computadora puede entender. Si RankBrain encuentra una palabra o frase que no conoce, la máquina puede inferir qué palabras o frases podrían tener un significado parecido y filtrar el resultado en consecuencia».
Pandu Nayak, Google (testimonio antimonopolio del DOJ, 2023)
- “RankEmbed identifies a few more documents to add to those identified by the traditional retrieval.” (traducción) «RankEmbed identifica algunos documentos adicionales para sumarlos a los identificados por la recuperación tradicional». (Confirma que la capa de incrustaciones semánticas de Google complementa la recuperación clásica por palabras clave en lugar de reemplazarla.)
Microsoft — Azure AI / Bing
- “Semantic search is moving beyond keyword-based ranking to a Transformer-based semantic ranking engine that understands the meaning behind the text.” (traducción) «La búsqueda semántica está dejando atrás el ranking basado en palabras clave para adoptar un motor de ranking semántico basado en Transformer que comprende el significado del texto». — Microsoft Research, 2021.
Los hitos semánticos de Google: hoja de referencia
La pila en capas, en orden. Cada una resolvió un problema distinto; ninguna reemplazó a la anterior.
| Año | Hito | Qué resolvió | Escala (según lo declarado) |
|---|---|---|---|
| 2012 | Knowledge Graph | Cadenas → cosas (entidades + relaciones) | 500M+ entidades, 3,5B+ hechos en el lanzamiento |
| 2013 | Hummingbird | Palabras clave → significado de la consulta completa (conversacional, cola larga) | ~90 % de las búsquedas; ahora retirado |
| 2015 | RankBrain | Consultas nunca antes vistas → conceptos conocidos | ~15 % de las consultas diarias; todas las consultas para 2016 |
| 2018 | Neural matching | Conceptos de consulta ↔ conceptos de documento (“super sinónimos”) | ~30 % de las consultas |
| 2019 | BERT | Significado contextual de las palabras dentro de una oración (bidireccional) | 1 de cada 10 consultas en inglés de EE. UU. → casi todas |
| 2021 | MUM | Razonamiento multimodal, multilingüe y de múltiples pasos | 75 idiomas; 1000× BERT; no es el clasificador general |
| 2023+ | LLM + RAG | La recuperación semántica alimenta respuestas generativas | AI Overviews, AI Mode, asistentes de IA |
Distinciones rápidas para tener claras
- RankBrain vs. BERT — RankBrain mapea consultas desconocidas a conceptos conocidos; BERT entiende el significado contextual de las palabras dentro de una oración de consulta.
- Búsqueda semántica vs. búsqueda vectorial — la búsqueda semántica es el objetivo; la búsqueda vectorial es una implementación (otras: expansión de consulta, reglas de sinónimos, Knowledge Graph).
- SEO semántico — cobertura de temas, relaciones de entidades, coincidencia de intención. No es relleno de sinónimos, y definitivamente no son “palabras clave LSI” (un mito; consulte el artículo).
- La búsqueda por palabras clave no está muerta — la recuperación estilo BM25 sigue ejecutándose primero; los sistemas semánticos reordenan y añaden documentos coincidentes por concepto encima.
Los modelos mentales
1. Objetivo vs. implementación. La búsqueda semántica es el destino (recuperar por significado). La búsqueda vectorial es un vehículo (embeddings + vecino más cercano). También puedes llegar caminando: expansión de consulta, reglas de sinónimos, búsquedas de entidades. No confundas el destino con una ruta.
2. La pila en capas, no un interruptor. Knowledge Graph (entidades) + RankBrain (consultas desconocidas) + neural matching (sinónimos conceptuales) + BERT (contexto de palabras) + MUM (multimodal). Se apilan y cooperan; ninguna actualización descartó la anterior. Cuando razones sobre “cómo entiende Google esta consulta”, pregunta qué capa está haciendo el trabajo.
3. La recuperación es de dos etapas. Etapa 1: rápida, basada en palabras clave, de alta recuperación (BM25 sobre un índice invertido). Etapa 2: reordenamiento neuronal + adiciones coincidentes por concepto. La búsqueda semántica es principalmente la etapa 2: aumenta la etapa 1, no la elimina.
4. El invariante de optimización. Cada actualización semántica apunta en la misma dirección: lenguaje natural, profundidad temática, entidades claras, alineación de intención. Si una táctica solo tiene sentido para un motor que cuenta palabras clave (relleno, obsesión por coincidencia exacta, “palabras clave LSI”), estás optimizando para una máquina que ya no existe.
5. La regla de “lo que se cita” para la búsqueda con IA. Las respuestas de IA = recuperación semántica + generación. Lo que posiciona un pasaje (entidades claras, secciones autocontenidas, profundidad) es lo que hace que se recupere y cite. No hay un truco separado de búsqueda con IA: es la misma calidad a nivel de pasaje.
Errores de búsqueda semántica
Crear páginas en torno a listas de “palabras clave LSI”
El consejo de palabras clave LSI etiqueta incorrectamente cómo funciona la recuperación moderna. Cubre el tema de forma natural, nombra entidades y relaciones reales, y responde a la intención del usuario en lugar de añadir una lista de sinónimos generada mecánicamente.
Tratar la búsqueda semántica y la búsqueda vectorial como sinónimos
La recuperación semántica es el objetivo de hacer coincidir el significado; los vectores son un método que puede respaldarlo. Mantén la distinción al evaluar un sistema o elegir una auditoría.
Repetir el término principal en lugar de resolver la ambigüedad
Más repetición no aclara qué entidad o intención sirve una página. Usa nombres explícitos, atributos, contexto y subtemas conectados para que el significado sobreviva más allá de una sola cadena de palabras clave.
Ponte a prueba: Búsqueda semántica
Recursos que valen tu tiempo
Mis reseñas relacionadas
- Semantic SEO (Ahrefs) — la guía avanzada para profesionales (soy revisor de esta), que cubre el modelo EAV y por qué Google no se volverá puramente semántico.
En este sitio
- Entity SEO — la disciplina práctica de nombrar, describir y desambiguar entidades (el lado del Knowledge Graph de la búsqueda semántica).
- Embeddings y búsqueda vectorial — el mecanismo técnico que hace posible la similitud basada en significado.
- RAG — cómo la búsqueda con IA recupera pasajes y fundamenta las respuestas generadas.
De otros
- Búsqueda semántica — guía de Ahrefs de Mateusz Makosiewicz sobre recuperación basada en significado, entidades y contenido.
- El Grafo de conocimiento de Google — guía de Ahrefs de Despina Gavoyannis y Michal Pecánek sobre datos de entidades y SEO.
- Glosario de RankBrain y glosario de Hummingbird (Ahrefs) — entradas de consulta rápida del equipo editorial de Ahrefs.
- Guía de los sistemas de ranking de la Búsqueda de Google — lista autorizada de los sistemas activos y retirados.
- SEO junto al mar — retrospectiva de Hummingbird — historia detallada con el contexto de Singhal.
- Google Hummingbird (Search Engine Land) — informe original de Danny Sullivan sobre el anuncio de 2013, con citas de Singhal; fuente primaria para “90% of searches” y el significado de la frase completa.
- Conoce RankBrain, el algoritmo de búsqueda con inteligencia artificial de Google (Search Engine Land) — informe original de 2015 que reveló RankBrain, con las citas literales de Greg Corrado sobre vectores y consultas desconocidas.
- Coincidencia neuronal de Google (Search Engine Journal) — cubre el lanzamiento de la coincidencia neuronal en 2018, el tuit de los “supersinónimos” de Danny Sullivan y la distinción respecto a RankBrain.
- Preguntas frecuentes: todo sobre el algoritmo BERT en la Búsqueda de Google (Search Engine Land) — preguntas y respuestas completas, incluida la indicación de Danny Sullivan de que no hay “nada que optimizar”.
- Google entrega su lucrativa búsqueda web a máquinas de IA (Bloomberg) — divulgación original de RankBrain; Greg Corrado confirma que es “the third-most important signal” (traducción) «la tercera señal más importante».
- La ciencia de la búsqueda semántica: cómo la IA de Bing impulsa Azure Cognitive Search (Microsoft Research) — explica el proceso de reordenamiento de Bing, de BM25 a Transformer, e incluye las mejoras del 2 % y el 4,5 % en el CTR observadas en las pruebas de Microsoft Docs.
Vídeos
- Google Search Central (YouTube) — la serie How Google Search Works, incluidos los explicadores sobre comprensión de consultas y los sistemas detrás de ella. Canal
Estadísticas que vale la pena citar
- ~40 % de las palabras en inglés tienen varios significados — por eso el contexto (ubicación, historial y palabras cercanas) permite que la búsqueda semántica desambigüe “apple” o “jaguar”. Fuente
- ~0,89 de similitud vectorial entre “how to fix a leaky faucet” (traducción) «cómo arreglar un grifo que gotea» y “repairing a dripping tap” (traducción) «reparar una llave que pierde», pese a que casi no comparten palabras. Es la manifestación concreta de la coincidencia por significado. Fuente
- La coincidencia neuronal afecta a ~30 % de las consultas (Danny Sullivan, 2018) — el alcance de la coincidencia de “supersinónimos” a nivel de concepto.
- BERT afectó a una de cada diez consultas en inglés de Estados Unidos durante su lanzamiento (Pandu Nayak, 2019) y ahora interviene en casi todas las consultas en inglés. Fuente
- El Knowledge Graph contiene hoy ~1,6 billones de datos sobre ~54 mil millones de entidades (frente a 500M de entidades en su lanzamiento en 2012) — la escala de la columna vertebral de entidades de Google. Fuente
Registro de cambios
Actualizado el 13 ago 2026.
Resumen editorial y detalles registrados del cambio.Detalles del cambio
-
Los detalles del cambio están disponibles actualmente en inglés.
La comparación completa no está disponible: no se archivó una instantánea anterior para esta revisión.
Actualizado el 13 ago 2026.
Resumen editorial y detalles registrados del cambio.Detalles del cambio
-
Los detalles del cambio están disponibles actualmente en inglés.
La comparación completa no está disponible: no se archivó una instantánea anterior para esta revisión.
Actualizado el 13 ago 2026.
Resumen editorial y detalles registrados del cambio.Detalles del cambio
-
Los detalles del cambio están disponibles actualmente en inglés.
La comparación completa no está disponible: no se archivó una instantánea anterior para esta revisión.
Actualizado el 13 ago 2026.
Resumen editorial y detalles registrados del cambio.Detalles del cambio
-
Los detalles del cambio están disponibles actualmente en inglés.
La comparación completa no está disponible: no se archivó una instantánea anterior para esta revisión.
Actualizado el 13 ago 2026.
Resumen editorial y detalles registrados del cambio.Detalles del cambio
-
Los detalles del cambio están disponibles actualmente en inglés.
La comparación completa no está disponible: no se archivó una instantánea anterior para esta revisión.
Actualizado el 3 ago 2026.
Resumen editorial y detalles registrados del cambio.Detalles del cambio
-
Los detalles del cambio están disponibles actualmente en inglés.
La comparación completa no está disponible: no se archivó una instantánea anterior para esta revisión.
Actualizado el 22 jul 2026.
Resumen editorial y detalles registrados del cambio.Detalles del cambio
-
Los detalles del cambio están disponibles actualmente en inglés.
La comparación completa no está disponible: no se archivó una instantánea anterior para esta revisión.
Actualizado el 17 jul 2026.
Resumen editorial y detalles registrados del cambio.Detalles del cambio
-
Los detalles del cambio están disponibles actualmente en inglés.
La comparación completa no está disponible: no se archivó una instantánea anterior para esta revisión.