Búsqueda vectorial

Cómo la búsqueda con IA encuentra contenido relevante comparando vectores de incrustación: algoritmos ANN (HNSW, ScaNN), métricas de distancia, búsqueda híbrida y su significado para el SEO.

Publicado por primera vez: 24 jun 2026 · Última actualización: 3 ago 2026 · Avanzado
Idiomas

La búsqueda vectorial encuentra contenido comparando el significado de una consulta con el contenido almacenado como vectores de incrustación, recuperando los más cercanos en un espacio de alta dimensión. A gran escala utiliza algoritmos de vecinos más cercanos aproximados (ANN) — HNSW, IVF, FAISS, ScaNN — que intercambian una pequeña parte de la precisión por grandes ganancias de velocidad, porque la comparación exacta sobre miles de millones de vectores es imposible en tiempo real. Es un método para lograr la búsqueda semántica, no un sinónimo de ella, y es el paso de recuperación dentro de todo sistema RAG, incluido lo que alimenta los AI Overviews. La búsqueda en producción rara vez se ejecuta sola: el patrón real es híbrido (BM25 de palabras clave + vector + reordenamiento). Para el SEO no hay ningún ajuste que activar: la proximidad vectorial es la nueva puerta de entrada al grupo de candidatos, y recompensa la profundidad temática a nivel de pasaje sobre la densidad de palabras clave.

TL;DR — La búsqueda vectorial recupera los vectores más cercanos a un vector de consulta en un espacio de incrustaciones de alta dimensión, usando algoritmos de vecino más cercano aproximado (ANN) — HNSW, IVF, FAISS, ScaNN — porque la comparación exacta sobre miles de millones de vectores es imposible en tiempo real. ANN es aproximado por diseño: intercambia una pizca de recuperación por velocidad de órdenes de magnitud. La búsqueda vectorial es un mecanismo para la búsqueda semántica, no un sinónimo de ella, y es el paso de recuperación dentro de cada sistema RAG (AI Overviews incluido). La producción rara vez lo ejecuta solo — el patrón real es híbrido: BM25 + vector + reordenamiento. Para SEO no hay perilla que girar; la proximidad vectorial es la puerta al grupo de candidatos y recompensa profundidad a nivel de pasaje y coherencia temática.

Dónde se sitúa la búsqueda vectorial

La recuperación vectorial es un componente que puede alimentar la clasificación o la generación; no es un sistema de búsqueda completo por sí mismo. Evidence for this claim HNSW is an approximate nearest-neighbor method that organizes vectors in a multilayer navigable graph for efficient search. Scope: The HNSW algorithm and reported evaluations; production indexes may use different ANN methods and parameters. Confidence: high · Verified: Malkov and Yashunin: HNSW No existe un umbral de distancia fijo ni un algoritmo de índice universalmente mejor. Evidence for this claim Embedding vectors can be compared by distance to retrieve related items. Scope: OpenAI embedding guidance; retrieval quality depends on model choice, corpus, index, filters, and evaluation. Confidence: high · Verified: OpenAI: Embeddings guide

Los embeddings te dan los vectores — la búsqueda vectorial es lo que haces con ellos. Si los embeddings son la mitad de la historia del “qué es un vector”, esta es la mitad del “ahora encuentra los más cercanos”. Y vale la pena ser precisos sobre una distinción que la industria difumina constantemente: la búsqueda semántica es el objetivo; la búsqueda vectorial es un método para alcanzarlo. La búsqueda semántica también puede apoyarse en grafos de conocimiento, reconocimiento de entidades y coincidencia de intenciones. La búsqueda vectorial específicamente significa recuperación ANN sobre un espacio de embeddings — así que no son sinónimos, aunque se usen como si lo fueran.

Cómo funciona la búsqueda vectorial, paso a paso

El proceso es el mismo ya seas Google o un proyecto RAG de fin de semana:

The query is embedded into the same representation as indexed content before nearby candidates are retrieved. Fuente: Vector Search

Documents are embedded and indexed before the search. At query time, the system embeds the query, searches an approximate-nearest-neighbor index, finds nearby vectors, and returns their corresponding documents as candidates.

© Patrick Stox LLC · CC BY 4.0 ·

  1. Incorpora el contenido. Un modelo codificador convierte cada fragmento de contenido en un vector. Nota fragmento — la búsqueda vectorial no compara páginas completas; compara pasajes. El fragmentado es la unidad de recuperación, por eso la densidad a nivel de pasaje importa más que la presencia de palabras clave a nivel de página.
  2. Construye un índice. Los vectores van a un índice vectorial construido para búsquedas rápidas de vecinos más cercanos (un índice ANN — más abajo).
  3. Incorpora la consulta. En el momento de la consulta, el mismo modelo convierte la consulta del usuario en un vector en el mismo espacio.
  4. Ejecuta la búsqueda ANN. El índice devuelve los k vectores más cercanos al vector de consulta — el conjunto de candidatos.
  5. Clasifica y devuelve. Esos candidatos se puntúan, a menudo se reclasifican, y los mejores se sirven (o, en RAG, se pasan a un LLM para generar a partir de ellos).

Vecino más cercano aproximado — por qué “aproximado”

Encontrar los vecinos más cercanos exactos significa comparar la consulta con cada vector almacenado — O(N) por consulta. Con miles de millones de vectores, en milisegundos, eso es inviable. Así que la búsqueda en producción usa ANN: estructuras de indexación que encuentran los vecinos más cercanos casi perfectamente mientras omiten la gran mayoría de las comparaciones.

Como dice Elastic, ANN “sacrifica la precisión perfecta a cambio de ejecutar eficientemente en espacios de embeddings de alta dimensión, a escala.” Weaviate enmarca la misma compensación como el intercambio de “un poco de precisión por una gran ganancia en velocidad.” Esto no es un error — es la elección de ingeniería que hace posible la búsqueda vectorial en absoluto. La métrica para “qué tan buena es la aproximación” es el recall: Google lo define como “el porcentaje de vecinos más cercanos devueltos por el índice que son realmente vecinos más cercanos verdaderos.” El propio servicio Vector Search de Google — renombrado de “Vertex AI Vector Search” y ahora documentado bajo la plataforma Gemini Enterprise Agent — reporta un recall del 95–98 % — cedes un par de puntos porcentuales de los vecinos verdaderos y obtienes búsqueda a escala web a cambio.

Algoritmos ANN clave

No necesitas implementarlos, pero conocer los nombres desmitifica gran parte de la discusión sobre búsqueda con IA.

  • HNSW (Hierarchical Navigable Small World) — el estándar de la industria. Un grafo de múltiples capas donde las capas superiores son “carriles rápidos” dispersos con conexiones de largo alcance para un recorrido rápido, y las capas inferiores son “carreteras locales” densas para una navegación precisa. Logra una complejidad de búsqueda aproximadamente logarítmica, por eso domina la producción. Lo usan Weaviate, Pinecone, pgvector, Qdrant y más. El inconveniente es la memoria: los índices HNSW consumen mucha RAM. El veredicto de Pinecone — “HNSW nos da una gran calidad de búsqueda a velocidades de búsqueda muy rápidas — pero siempre hay un inconveniente — los índices HNSW ocupan una cantidad significativa de memoria.”
  • IVF (Inverted File Index) — particiona el espacio en clústeres (k-means), y en el momento de la consulta solo busca los pocos clústeres más cercanos a la consulta (nprobe). Pinecone lo llama “un índice muy popular porque es fácil de usar, con alta calidad de búsqueda y velocidad de búsqueda razonable… una buena opción escalable.”
  • FAISS — la biblioteca de Facebook AI (Johnson, Douze, Jégou) para búsqueda de similitud a escala de miles de millones. Es una caja de herramientas, no un solo algoritmo: una línea base exacta plana (IndexFlatL2), IVF agrupado, IVFPQ con cuantización de producto para una compresión de memoria de 4 a 64 veces, y una implementación de HNSW. Su adaptación a GPU reportó una aceleración de 8,5 veces en la búsqueda k-NN.
  • ScaNN (Scalable Nearest Neighbors) — la biblioteca de Google, de código abierto, la misma familia de tecnología detrás de Google Image Search, YouTube y Google Play. Su innovación es la cuantización vectorial anisotrópica: en lugar de minimizar la distancia promedio, “penaliza más fuertemente el error de cuantización que es paralelo al vector original,” porque el error direccional daña desproporcionadamente los resultados de alto producto interno (los más relevantes). La recompensa: “supera a otras bibliotecas de búsqueda de similitud vectorial por un factor de dos” en ann-benchmarks.com — aproximadamente el doble de consultas por segundo con una precisión dada.
  • Índice plano (exacto) — sin aproximación alguna; fuerza bruta, el más preciso, el más lento. Pinecone señala que los índices planos “producen los resultados más precisos” y son la opción correcta cuando la calidad de búsqueda es primordial o el índice es pequeño (menos de ~10 000 vectores). Por encima de esa escala, se pasa a ANN.

El hilo conductor: cada índice ANN es un dial entre recall, latencia, rendimiento y memoria. Como dice Weaviate, la mayoría de las bases de datos vectoriales permiten “configurar cómo debe comportarse tu algoritmo ANN… para encontrar el equilibrio adecuado.”

Métricas de distancia

“Más cercano” necesita una definición. Tres son comunes:

  • Similitud de coseno — el valor predeterminado para texto. Mide el ángulo entre dos vectores, ignorando la magnitud, por lo que un documento corto y uno largo sobre el mismo tema obtienen la misma puntuación. Weaviate: “La similitud de coseno se usa comúnmente en el procesamiento del lenguaje natural… Mide la similitud entre documentos independientemente de la magnitud.”
  • Producto punto (producto interno) — se usa cuando la relevancia se define por el producto interno (el problema MIPS que ScaNN optimiza).
  • Distancia euclidiana (L2) — distancia en línea recta; se usa cuando la magnitud tiene significado.

Aquí está el atajo práctico: para vectores normalizados, la similitud de coseno y el producto punto dan clasificaciones idénticas, y la mayoría de los modelos de incrustación modernos normalizan su salida a longitud unitaria. OpenAI lo dice claramente — “Recomendamos la similitud de coseno. La elección de la función de distancia normalmente no importa mucho” — precisamente porque sus incrustaciones tienen longitud 1. La regla real, según Weaviate: “Usa la métrica de distancia que coincida con el modelo que estás usando… No hay una ‘talla única’.”

Bases de datos vectoriales

Una base de datos vectorial almacena vectores y ejecuta ANN sobre ellos para que no tengas que construir la infraestructura de índices tú mismo. Los nombres comunes — Pinecone (gestionado), Weaviate (búsqueda híbrida integrada), Chroma y FAISS (excelentes para prototipos/procesos en memoria), Qdrant, Milvus (escala autoalojada) y pgvector (una extensión de Postgres, para equipos que ya usan SQL). Los enumero, no los clasifico: la elección correcta depende de la escala, de si prefieres una solución gestionada o autoalojada, y de si necesitas búsqueda híbrida de serie. A la escala de Google/Bing, la “base de datos” es infraestructura interna de ScaNN/ANN, no cualquiera de estas.

Búsqueda híbrida: cómo funciona realmente la producción

El planteamiento de “búsqueda por palabras clave frente a búsqueda vectorial” es un falso binario. La búsqueda puramente vectorial falla en consultas de coincidencia exacta (códigos de error, SKU, nombres propios), y la búsqueda puramente por palabras clave falla en variantes semánticas. Por eso los sistemas serios ejecutan búsqueda híbrida: recuperación por palabras clave (BM25) y vectorial en paralelo, fusión de resultados (comúnmente con Reciprocal Rank Fusion), y luego los mejores candidatos se reordenan con un cross-encoder. Microsoft define la búsqueda híbrida como “the execution of vector search and keyword search in the same request… The queries execute in parallel, and the results are merged into a single response and ranked accordingly.” (traducción) «la ejecución de la búsqueda vectorial y la búsqueda por palabras clave en la misma solicitud… Las consultas se ejecutan en paralelo y los resultados se fusionan en una única respuesta y se clasifican en consecuencia.» El Vector Search de Google admite los mismos tres modos: denso (semántico), disperso (por palabras clave) e híbrido. Si te llevas algo de esta sección: la recuperación en producción casi nunca es solo vectorial. Es la combinación la que gana.

Cómo usa Google (y Bing) realmente la búsqueda vectorial

Esto no es una novedad de la era ChatGPT de 2023. La infraestructura precede a la ola de LLM por años:

  • ScaNN (ICML 2020, de código abierto) impulsa Google Image Search, YouTube y Google Play, y sustenta el producto Vector Search de Google (el servicio antes llamado Vertex AI Vector Search), que “shares the same backend” (traducción) «comparte el mismo backend» que esos productos de consumo. Kaz Sato, de Google, calificó la tecnología como “one of the most important components of Google’s core services.” (traducción) «uno de los componentes más importantes de los servicios principales de Google.» Especificación de rendimiento: “tens of thousands of requests per second… in less than 10 ms for the 90th percentile with a recall rate of 95–98%.” (traducción) «decenas de miles de solicitudes por segundo… en menos de 10 ms para el percentil 90 con una tasa de recuperación del 95–98 %.»
  • Bing ya ejecutaba índices vectoriales de más de 100 mil millones para 2019. En palabras de Microsoft, Bing podía “search through this giant index of 100 billion-plus vectors to find the most related results in 5 milliseconds.” (traducción) «buscar en este índice gigante de más de 100 mil millones de vectores para encontrar los resultados más relevantes en 5 milisegundos.» Eso fue hace más de seis años.
  • Dense Passage Retrieval (DPR, EMNLP 2020) demostró que la recuperación vectorial densa podía superar a Lucene-BM25 en 9–19 % absoluto en precisión de recuperación de pasajes top-20 con un simple dual-encoder. DPR es el modelo que sigue la recuperación RAG moderna: el paso de recuperación detrás de AI Overviews es un descendiente de este patrón.
  • MUVERA (2025) hace que la recuperación multivectorial sea tan rápida como la búsqueda de vector único: aproximadamente “10% higher recall with ~90% lower latency” (traducción) «un 10 % más de recuperación con ~90 % menos de latencia» que los métodos anteriores.
  • TurboQuant (ICLR 2026) comprime vectores para la búsqueda del vecino más cercano con una reducción de memoria reportada de 6x y una pérdida de precisión prácticamente nula.

El punto no es memorizar la hoja de ruta: es que la recuperación basada en embeddings es cómo los grandes motores encuentran contenido relevante, y lo ha sido durante años.

Qué significa esto para el SEO

Déjame ser cuidadoso aquí, porque es donde el consejo de SEO suele excederse.

La proximidad vectorial es la nueva puerta al grupo de candidatos. En las respuestas basadas en RAG, la recuperación ocurre antes de la generación. Si tu pasaje no está semánticamente cerca del embedding de la consulta, nunca entra en la lista corta desde la que escribe el modelo, por lo que no puede citarse. Ese es el mecanismo.

Pero no existe un “interruptor de optimización para la búsqueda vectorial”. La señal subyacente es la coherencia semántica y la profundidad temática, que es lo que el contenido de calidad siempre ha requerido. La búsqueda vectorial no recompensa un truco nuevo; penaliza el contenido superficial y el relleno de palabras clave (que no forman un vecindario coherente en el espacio de incrustaciones) y recompensa la cobertura genuinamente completa y bien estructurada. Como lo expresé en el artículo sobre incrustaciones, haciendo eco de Danny Sullivan sobre BERT: en gran medida no hay nada que “optimizar” aquí: haces que tu contenido se agrupe limpiamente cerca de las consultas que debería responder.

Dos implicaciones concretas que se derivan:

  • La segmentación importa. La recuperación opera sobre pasajes, no sobre páginas completas. Una página puede no clasificar para nada si ningún pasaje individual es una coincidencia semántica limpia. Escribe pasajes que se sostengan por sí mismos.
  • La profundidad temática y la cobertura de entidades son cómo ocupas el vecindario correcto en el espacio de incrustaciones. El contenido superficial y disperso se incrusta en una región difusa cerca de nada en particular.

La búsqueda vectorial es el motor de recuperación detrás de RAG y las respuestas de IA; la clasificación de pasajes es lo que les sucede a los candidatos después de la recuperación; y los rastreadores de IA que alimentan estos sistemas incrustan e indexan vectorialmente lo que obtienen. Para el pipeline más amplio, consulta Cómo funciona la búsqueda.

Add an expert note

Pin an expert quote

New person? Create their unclaimed profile at /admin/experts/ → Pin a quote first.