Embeddings (representaciones vectoriales)

Los embeddings son vectores numéricos densos que codifican el significado del texto: así la búsqueda semántica, el ranking de Google y RAG emparejan contenido por significado en lugar de por palabras clave.

Publicado por primera vez: 24 jun 2026 · Última actualización: 8 ago 2026 · Avanzado
Idiomas

Un embedding es una lista de números —un vector denso— que codifica el significado de una palabra, una frase o un documento en un espacio de muchas dimensiones, de modo que el texto semánticamente similar queda cerca. Los producen modelos encoder (codificadores), no LLM generativos; la similitud se mide con similitud del coseno. Los embeddings hacen funcionar la búsqueda semántica, el clustering y la capa de recuperación de RAG, y Google usa recuperación basada en embeddings (Neural Matching / RankEmbed, RankEmbedBERT) junto con su índice de palabras clave. La conclusión para el SEO no es una palanca que ajustar —Danny Sullivan dijo sobre BERT *"there's nothing to optimize for"* _(traducción)_ «no hay nada que optimizar»—, pero el contenido temáticamente coherente se agrupa con nitidez cerca de las consultas que debería responder.

TL;DR — Un embedding es un vector denso de números en coma flotante (normalmente de cientos a unos pocos miles de dimensiones) que codifica significado, producido por un modelo encoder (codificador), no por un LLM generativo. Significado parecido → vectores cercanos, medido con similitud del coseno. El campo pasó de los embeddings de palabras estáticos (word2vec, GloVe) a los contextuales (BERT), y de ahí al nivel de frase y a los embeddings modernos de API. Google usa recuperación basada en embeddings (Neural Matching / RankEmbed, RankEmbedBERT) junto con su índice de palabras clave: híbrido, no un reemplazo. Los embeddings son además la columna vertebral de recuperación de RAG. No hay ninguna palanca de embeddings que ajustar; la coherencia temática es lo que hace que el contenido se agrupe cerca de las consultas adecuadas.

Qué es realmente un embedding

Los embeddings sirven para la similitud y la recuperación, pero no son una medida directa de verdad, calidad ni valor de ranking. Evidence for this claim Embeddings represent inputs as numerical vectors that can be compared for relatedness and used for search, clustering, and classification. Scope: OpenAI embedding models and documented uses; vector dimensions and behavior vary by model. Confidence: high · Verified: OpenAI: Embeddings guide Los resultados de la investigación dependen del modelo entrenado y del entorno de evaluación. Evidence for this claim Learned vector representations can encode useful distributional relationships between words. Scope: Word2vec-era language representations; observed vector relationships are model- and training-data-specific, not ground truth. Confidence: high · Verified: Mikolov et al.: Efficient Estimation of Word Representations

Un embedding es un vector numérico denso —una lista de números en coma flotante— que representa texto (o imágenes, audio, video) como un punto en un espacio de muchas dimensiones. La documentación de OpenAI lo dice sin rodeos: “An embedding is a vector (list) of floating point numbers.” (traducción) «Un embedding es un vector (una lista) de números en coma flotante.»

La propiedad que lo define es geométrica: el contenido semánticamente similar tiene vectores similares. El texto que significa aproximadamente lo mismo apunta aproximadamente en la misma dirección; el texto sin relación apunta a otra parte. Eso no es una casualidad afortunada: el modelo se entrena para que las palabras y frases usadas en contextos similares terminen con vectores similares. El significado se convierte en posición.

Los embeddings (representaciones vectoriales) convierten la similitud semántica en distancia: los significados relacionados quedan cerca aunque la redacción exacta sea distinta. Fuente: /ai-search/how-search-works/embeddings/

Un espacio semántico conceptual sitúa la consulta «restablecer mi contraseña» cerca de documentos titulados «Guía para contraseñas olvidadas», «Pasos para recuperar la cuenta» y «No puedo iniciar sesión». El documento no relacionado «Precios para empresas» queda más lejos. Cerca significa semánticamente más similar; lejos significa menos similar. Los espacios de embeddings reales tienen muchas más dimensiones y una geometría específica de cada modelo.

© Patrick Stox LLC · CC BY 4.0 ·

Vale la pena precisar algunas cosas:

  • Encoder, no generador. Los embeddings provienen de modelos encoder (codificadores) cuyo trabajo es comprimir el significado en un vector de tamaño fijo. Es una arquitectura y un propósito distintos de los de un LLM generativo, que predice el siguiente token. (Más abajo, sobre la distinción entre lo interno y la API.)
  • Densos, no dispersos. A diferencia de las representaciones one-hot o de bolsa de palabras (casi todo ceros, una casilla por palabra del vocabulario), los embeddings reparten el significado por todas las dimensiones. El glosario de ML de Google presenta los embeddings como representaciones densas y de menor dimensionalidad que resuelven lo que la codificación one-hot no puede expresar: permiten que un modelo reconozca que “hot dogs and shawarmas are more related than hot dogs and salads.” (traducción) «los hot dogs y los shawarmas están más relacionados que los hot dogs y las ensaladas».
  • Más dimensiones ≠ siempre mejor. Más dimensiones pueden capturar más matices, pero cuestan más de almacenar y de calcular, y la ganancia depende de la tarea. Es un compromiso, no un dial de «cuanto más grande, mejor».

Medir la similitud: la similitud del coseno

Para comparar dos embeddings se mide la distancia —o, más exactamente, el ángulo— entre ellos. La métrica estándar es la similitud del coseno: mide el ángulo entre dos vectores independientemente de su longitud, con una puntuación que va de −1 (opuestos) pasando por 0 (sin relación / ortogonales) hasta 1 (misma dirección). Menor distancia = más relacionados.

Muchas API de embeddings normalizan los vectores a longitud unitaria, lo que hace que la similitud del coseno y el producto escalar produzcan el mismo ranking; OpenAI señala que el coseno es la opción convencional y ligeramente más económica. Voyage AI (el proveedor de embeddings que recomienda Anthropic) resume bien la intuición: “the cosine similarity between two embeddings captures the semantic relatedness of the corresponding original passages.” (traducción) «la similitud del coseno entre dos embeddings captura la relación semántica de los pasajes originales correspondientes». Hacer esa comparación de vecinos más cercanos a gran escala es un problema en sí mismo: de eso se encarga el vector search (búsqueda vectorial).

Cómo llegamos aquí: la evolución

La historia va de las palabras sueltas a los pasajes completos, y de los significados fijos a los que tienen en cuenta el contexto.

  • word2vec (Google, 2013). Mikolov y sus colaboradores presentaron dos arquitecturas (CBOW y Skip-Gram) para aprender vectores densos de palabras a partir de corpus enormes. El resultado famoso: el vector «rey» − «hombre» + «mujer» queda más cerca de «reina», evidencia de que la aritmética vectorial captura relaciones semánticas. (Matiz: esa analogía es ilustrativa, no está garantizada siempre; según el modelo puede caer en «reyes» o «monarca».) Son embeddings estáticos: un vector fijo por palabra, así que «banco» recibe el mismo vector en «banco fluvial» (orilla del río) y en «cuenta bancaria» (cuenta bancaria).
  • GloVe (Stanford, 2014). Una alternativa basada en recuentos, construida sobre estadísticas globales de coocurrencia en lugar de una red predictiva: objetivo distinto, embeddings igualmente útiles. También estáticos.
  • Universal Sentence Encoder (Google, 2018). Embeddings para frases completas, no solo para palabras. La idea central: “Sentences are semantically similar if they have a similar distribution of responses” (traducción) «Las frases son semánticamente similares si tienen una distribución de respuestas similar»: «¿Qué edad tienes?» y «¿Cuál es tu edad?» invitan a las mismas respuestas, así que se sitúan cerca en el espacio de embeddings.
  • BERT (Google, 2018; desplegado en Search en octubre de 2019). El gran cambio: embeddings contextuales. La misma palabra recibe un vector distinto según la frase que la rodea, porque BERT es bidireccional: lee las palabras anteriores y posteriores a un token para fijar su significado. Así, «banco» en «banco fluvial» y en «cuenta bancaria» por fin recibe vectores distintos.
  • Sentence-BERT (2019). Resolvió el problema de escalabilidad de BERT para la búsqueda por similitud. El BERT original necesita que ambas frases se introduzcan juntas, lo que resulta brutal en cómputo a gran escala; SBERT produce embeddings de frase de tamaño fijo que se pueden comparar con similitud del coseno, y reduce de horas a segundos el costo de encontrar el par más similar en un corpus grande.
  • API de embeddings modernas (2024–actualidad). La familia text-embedding-3 de OpenAI, los embeddings de Gemini de Google, Voyage y embed-v4.0 de Cohere: multilingües, cada vez más multimodales (texto, imagen, audio y video en un mismo espacio) y redimensionables mediante Matryoshka Representation Learning (truncar el vector a menos dimensiones sin reentrenar, sacrificando algo de precisión a cambio de almacenamiento y velocidad).

El pipeline de ranking de Google no es puramente semántico ni puramente de palabras clave: es híbrido, y las piezas de embeddings complementan el clásico índice invertido en lugar de sustituirlo. Según la propia documentación de Google sobre sistemas de ranking y el testimonio antimonopolio de Pandu Nayak ante el DOJ, los sistemas nombrados incluyen:

  • BERT: el sistema de Google para las palabras en contexto. En su lanzamiento ayudó a Search a “better understand one in 10 searches in the U.S. in English,” (traducción) «entender mejor una de cada 10 búsquedas en EE. UU. en inglés», sobre todo en consultas conversacionales más largas donde preposiciones como «para» y «a» cambian el significado.
  • Neural Matching / RankEmbed: recuperación basada en embeddings que traduce consultas y documentos al mismo espacio vectorial para mostrar resultados que coinciden conceptualmente incluso sin palabras clave compartidas. Nayak lo describió como un complemento: “RankEmbed identifies a few more documents to add to those identified by the traditional retrieval.” (traducción) «RankEmbed identifica unos cuantos documentos más para añadir a los identificados por la recuperación tradicional». Ahí la recuperación se basa en un producto escalar o en una medida de distancia en el espacio de embeddings.
  • RankEmbedBERT: una evolución posterior que combina la recuperación de RankEmbed con la comprensión del lenguaje de BERT, entrenada con puntuaciones de los evaluadores de calidad y registros de búsqueda, y notablemente mejor en consultas complejas y de cola larga.

La lectura práctica: la presencia de palabras clave sigue importando porque la recuperación léxica (el índice invertido, al estilo BM25) sigue haciendo el primer filtrado. Los sistemas de embeddings añaden candidatos relacionados conceptualmente y reordenan los resultados. Ambas señales están en juego, que es exactamente por lo que “BERT killed keywords” (traducción) «BERT mató a las palabras clave» es una afirmación equivocada.

Los embeddings en la búsqueda con IA (el pipeline de RAG)

Aquí es donde los embeddings tocan de forma más directa las AI Overviews y los asistentes de búsqueda con IA. La generación aumentada por recuperación (RAG) usa los embeddings como su capa de recuperación:

  1. Indexar: el contenido se segmenta en fragmentos (chunking) que son pasajes, cada pasaje se convierte en embedding y los vectores van a una base de datos vectorial.
  2. Recuperar: la consulta del usuario se convierte en embedding, una búsqueda de vecinos más cercanos encuentra los fragmentos más próximos (mediante vector search) y los top-K fragmentos se entregan al LLM como contexto.
  3. Generar: el LLM escribe una respuesta grounded (fundamentada) en esos fragmentos recuperados.

Aquí la estructura importa porque cada fragmento se recupera de forma aislada. La investigación de Dan Petrovic (citada en el artículo de Ahrefs Lo que realmente sabemos sobre la optimización para la búsqueda con LLM) encontró que Chrome procesa solo los ~30 primeros pasajes de una página para generar embeddings y los segmenta en pasajes de unas 200 palabras con solapamiento, para preservar el contexto entre fragmentos. Si una sección no se sostiene por sí sola una vez extraída de la página, representa mal su contenido.

Embeddings de tokens frente a API de embeddings de texto

Una distinción que hace tropezar a mucha gente: los embeddings que están dentro de un LLM y los que se obtienen de una API no son lo mismo.

  • Los embeddings de tokens son las representaciones internas del modelo: cada token recibe un vector que se transforma capa por capa durante la generación. Son maquinaria para producir el siguiente token.
  • Las API de embeddings de texto (OpenAI, Google, Voyage, Cohere) producen un único vector de tamaño fijo para toda una cadena de entrada, diseñado específicamente para recuperación y similitud. A menudo es un modelo aparte, con un objetivo de entrenamiento distinto.

Cuando los SEO hablan de «generar el embedding de una página» o de calcular similitud del coseno para el enlazado interno o para agrupar palabras clave, se refieren al tipo de API.

Qué significa esto para el SEO

  • La coherencia semántica gana a la densidad de palabras clave. Como los modelos entienden el contexto, «portátil para juegos» y «portátil de alto rendimiento» ya están cerca. Sobrecargar de palabras clave no ayuda: produce contenido temáticamente disperso, con un embedding más turbio.
  • Estructure para la recuperación por fragmentos. Los pasajes se convierten en embeddings y se recuperan por sí solos. Ponga el contenido importante al principio, mantenga las secciones autónomas y use HTML semántico claro.
  • Exhaustividad temática. El contenido que cubre de verdad un asunto acaba cerca de más consultas relacionadas en el espacio vectorial. Ese es el mecanismo que hay detrás de «construir autoridad temática».
  • No hay ninguna palanca de embeddings. Danny Sullivan, sobre BERT: “There’s nothing to optimize for… The fundamentals of us seeking to reward great content remain unchanged.” (traducción) «No hay nada para lo que optimizar… Los fundamentos de nuestro objetivo de premiar el gran contenido siguen sin cambios». Las puntuaciones de similitud del coseno que da una herramienta son ayudas de análisis, no datos que usted envíe a Google.

Los embeddings son el tejido conectivo que hay debajo de casi todo este clúster: son aquello sobre lo que funciona la búsqueda semántica, lo que compara el vector search, aquello para lo que la segmentación en fragmentos (chunking) prepara el texto, y la columna vertebral de recuperación de RAG. También son la razón por la que el rastreo sigue importando primero: el contenido tiene que descargarse antes de que cualquier sistema pueda generar su embedding.

Add an expert note

Pin an expert quote

New person? Create their unclaimed profile at /admin/experts/ → Pin a quote first.