Busca vetorial

Como a busca por IA encontra conteúdo relevante comparando vetores de embeddings — algoritmos ANN (HNSW, ScaNN), métricas de distância, busca híbrida e o que isso significa para SEO.

A busca vetorial encontra conteúdo comparando o significado de uma consulta com o conteúdo armazenado como vetores de embeddings e recuperando os mais próximos em um espaço de alta dimensionalidade. Em escala, usa algoritmos de vizinhos mais próximos aproximados (ANN) — HNSW, IVF, FAISS, ScaNN — que trocam uma pequena parcela de recall por enormes ganhos de velocidade, porque a comparação exata entre bilhões de vetores é impossível em tempo real. É um método para realizar busca semântica, não um sinônimo dela, e é a etapa de recuperação de todo sistema RAG, inclusive dos que alimentam AI Overviews. Em produção, a busca raramente usa apenas vetores: o padrão real é híbrido (palavras-chave BM25 + vetores + reordenação). Para SEO, não existe um ajuste específico — a proximidade vetorial é a nova porta de entrada no conjunto de candidatos e recompensa coerência temática e profundidade em cada trecho, em vez de densidade de palavras-chave.

Resumo — A busca vetorial recupera os vetores mais próximos de um vetor de consulta em um espaço de embeddings de alta dimensionalidade, usando algoritmos de vizinhos mais próximos aproximados (ANN) — HNSW, IVF, FAISS, ScaNN — porque comparar bilhões de vetores de forma exata é impossível em tempo real. ANN é aproximado por projeto: troca uma pequena parcela de recall por ganhos de velocidade de ordens de grandeza. A busca vetorial é um mecanismo de busca semântica, não um sinônimo, e é a etapa de recuperação de todo sistema RAG, inclusive AI Overviews. Em produção, raramente opera sozinha: o padrão real é híbrido, BM25 + vetores + reordenação. Para SEO não existe um ajuste específico; a proximidade vetorial determina a entrada no conjunto de candidatos e recompensa coerência temática e profundidade em cada trecho.

Onde a busca vetorial se encaixa

A recuperação vetorial é um componente que pode alimentar a classificação ou a geração; sozinha, não é um sistema de busca completo. Evidência desta afirmação HNSW is an approximate nearest-neighbor method that organizes vectors in a multilayer navigable graph for efficient search. Escopo: The HNSW algorithm and reported evaluations; production indexes may use different ANN methods and parameters. Confiança: alta · Verificado: Malkov and Yashunin: HNSW Nenhum limiar fixo de distância ou algoritmo de indexação é universalmente o melhor. Evidência desta afirmação Embedding vectors can be compared by distance to retrieve related items. Escopo: OpenAI embedding guidance; retrieval quality depends on model choice, corpus, index, filters, and evaluation. Confiança: alta · Verificado: OpenAI: Embeddings guide

Embeddings fornecem os vetores; busca vetorial é o que você faz com eles. Se embeddings explicam a metade “o que é um vetor”, esta é a metade “agora encontre os mais próximos”. Vale ser preciso sobre uma distinção que o setor confunde o tempo todo: busca semântica é o objetivo; busca vetorial é um dos métodos para alcançá-lo. A busca semântica também pode usar grafos de conhecimento, reconhecimento de entidades e correspondência de intenção. Busca vetorial significa especificamente recuperação ANN em um espaço de embeddings. Portanto, não são sinônimos, embora sejam tratados como se fossem.

Como a busca vetorial funciona, passo a passo

O processo é o mesmo no Google ou em um projeto de RAG feito no fim de semana:

A consulta é incorporada na mesma representação que o conteúdo indexado antes de os candidatos próximos serem recuperados. Fonte: Busca vetorial

Os documentos são incorporados e indexados antes da busca. No momento da consulta, o sistema incorpora a consulta, pesquisa em um índice de vizinhos mais próximos aproximados, encontra vetores próximos e retorna seus documentos correspondentes como candidatos.

© Patrick Stox LLC · CC BY 4.0 ·

  1. Gere embeddings do conteúdo. Um modelo codificador converte cada trecho em um vetor. Observe: trecho. A busca vetorial não compara páginas inteiras, mas passagens. Chunking define a unidade de recuperação, por isso a densidade do trecho importa mais que a presença de palavras-chave na página.
  2. Construa um índice. Os vetores entram em um índice preparado para buscas rápidas de vizinhos mais próximos — um índice ANN, explicado abaixo.
  3. Gere o embedding da consulta. No momento da busca, o mesmo modelo converte a consulta do usuário em um vetor no mesmo espaço.
  4. Execute a busca ANN. O índice retorna os k vetores mais próximos do vetor da consulta: o conjunto de candidatos.
  5. Classifique e retorne. Os candidatos recebem pontuações, muitas vezes passam por reordenação, e os melhores são apresentados ou, no RAG, enviados a um LLM para gerar a resposta.

Vizinhos mais próximos aproximados: por que “aproximados”

Encontrar os vizinhos mais próximos exatos exige comparar a consulta com cada vetor armazenado: O(N) por consulta. Com bilhões de vetores e prazo de milissegundos, isso é inviável. Por isso, a busca em produção usa ANN: estruturas de indexação que encontram os vizinhos mais próximos de forma quase perfeita, pulando a grande maioria das comparações.

Como diz a Elastic, ANN “sacrifices perfect accuracy in exchange for executing efficiently in high dimensional embedding spaces, at scale.” (tradução) «sacrifica a precisão perfeita em troca de uma execução eficiente em espaços de embeddings de alta dimensionalidade, em escala.» A Weaviate descreve a mesma troca como abrir mão de “a bit of accuracy for a huge gain in speed.” (tradução) «um pouco de precisão por um enorme ganho de velocidade.» Não é um defeito: é a escolha de engenharia que viabiliza a busca vetorial. A métrica que indica “quão boa é a aproximação” é recall. O Google a define como “the percentage of nearest neighbors returned by the index that are actually true nearest neighbors.” (tradução) «a porcentagem de vizinhos mais próximos retornados pelo índice que são de fato os verdadeiros vizinhos mais próximos.» O serviço Vector Search do Google — antes chamado “Vertex AI Vector Search” e agora documentado na Gemini Enterprise Agent Platform — informa recall de 95–98 %. Você abre mão de alguns pontos percentuais dos vizinhos verdadeiros e ganha busca em escala da web.

Principais algoritmos ANN

Você não precisa implementá-los, mas conhecer os nomes esclarece boa parte das discussões sobre busca por IA.

  • HNSW (Hierarchical Navigable Small World) — o padrão do setor. É um grafo em camadas: as superiores são “vias expressas” esparsas, com conexões de longo alcance para percursos rápidos; as inferiores são “ruas locais” densas para navegação precisa. A complexidade de busca é aproximadamente logarítmica, por isso domina a produção. Weaviate, Pinecone, pgvector, Qdrant e outros o usam. O problema é a memória: índices HNSW consomem muita RAM. A avaliação da Pinecone: “HNSW gives us great search-quality at very fast search-speeds — but there’s always a catch — HNSW indexes take up a significant amount of memory.” (tradução) «O HNSW oferece ótima qualidade de busca em velocidades muito altas — mas sempre há um porém — os índices HNSW ocupam uma quantidade significativa de memória.»
  • IVF (Inverted File Index) — divide o espaço em grupos com k-means e, na consulta, pesquisa apenas os poucos grupos mais próximos (nprobe). A Pinecone o chama de “a very popular index as it’s easy to use, with high search- quality and reasonable search-speed… a good scalable option.” (tradução) «um índice muito popular por ser fácil de usar, com alta qualidade de busca e velocidade razoável… uma boa opção escalável.»
  • FAISS — biblioteca do Facebook AI, de Johnson, Douze e Jégou, para busca por similaridade na escala de bilhões. É uma caixa de ferramentas, não um único algoritmo: uma referência exata flat (IndexFlatL2), IVF com agrupamento, IVFPQ com quantização de produto para compressão de memória de 4–64x e uma implementação de HNSW. A adaptação para GPU relatou aceleração de 8,5x na busca k-NN.
  • ScaNN (Scalable Nearest Neighbors) — biblioteca de código aberto do Google, da mesma família de tecnologias por trás de Google Image Search, YouTube e Google Play. Sua inovação é a quantização vetorial anisotrópica: em vez de minimizar a distância média, ela “more heavily penalizes quantization error that is parallel to the original vector,” (tradução) «penaliza mais fortemente o erro de quantização paralelo ao vetor original,» porque o erro direcional prejudica desproporcionalmente os resultados com alto produto interno, os mais relevantes. O resultado: “outperforms other vector similarity search libraries by a factor of two” (tradução) «supera outras bibliotecas de busca por similaridade vetorial por um fator de dois» no ann-benchmarks.com — aproximadamente o dobro de consultas por segundo com a mesma precisão.
  • Índice flat (exato) — nenhuma aproximação; força bruta, maior precisão e menor velocidade. A Pinecone observa que índices flat “produce the most accurate results” (tradução) «produzem os resultados mais precisos» e são a escolha certa quando a qualidade da busca é prioritária ou o índice é pequeno, abaixo de aproximadamente 10 000 vetores. Acima disso, usa-se ANN.

O ponto comum: todo índice ANN ajusta a relação entre recall, latência, vazão e memória. Como diz a Weaviate, a maioria dos bancos vetoriais permite “configure how your ANN algorithm should behave… to find the right balance.” (tradução) «configurar como seu algoritmo ANN deve se comportar… para encontrar o equilíbrio certo.»

Métricas de distância

É preciso definir “mais próximo”. Três definições são comuns:

  • Similaridade por cosseno — o padrão para texto. Mede o ângulo entre dois vetores, ignorando a magnitude; assim, um documento curto e outro longo sobre o mesmo assunto recebem pontuações semelhantes. Segundo a Weaviate: “Cosine similarity is commonly used in Natural Language Processing… It measures the similarity between documents regardless of the magnitude.” (tradução) «A similaridade por cosseno é comumente usada em Processamento de Linguagem Natural… Ela mede a similaridade entre documentos independentemente da magnitude.»
  • Produto escalar (produto interno) — usado quando a relevância é definida pelo produto interno, o problema MIPS para o qual o ScaNN otimiza.
  • Distância euclidiana (L2) — distância em linha reta; usada quando a magnitude tem significado.

Atalho prático: para vetores normalizados, similaridade por cosseno e produto escalar produzem classificações idênticas, e a maioria dos modelos modernos normaliza a saída para comprimento unitário. A OpenAI afirma: “We recommend cosine similarity. The choice of distance function typically doesn’t matter much” (tradução) «Recomendamos a similaridade por cosseno. A escolha da função de distância normalmente não importa muito» — justamente porque seus embeddings têm comprimento 1. A regra real, segundo a Weaviate: “Use the distance metric that matches the model that you’re using… There is no ‘one size fits all’.” (tradução) «Use a métrica de distância que corresponde ao modelo que você está usando… Não existe uma solução única para todos.»

Bancos de dados vetoriais

Um banco vetorial armazena vetores e executa ANN sobre eles, dispensando a construção da infraestrutura de indexação. Os nomes comuns são Pinecone — gerenciado —, Weaviate — busca híbrida integrada —, Chroma e FAISS — ótimos para protótipos e uso no próprio processo —, Qdrant, Milvus — escala com hospedagem própria — e pgvector, extensão do Postgres para equipes que já usam SQL. Estou listando, não classificando: a escolha depende da escala, da preferência por serviço gerenciado ou hospedagem própria e da necessidade de busca híbrida pronta. Na escala de Google e Bing, o “banco” é infraestrutura interna ScaNN/ANN, não uma dessas opções.

Busca híbrida: como funciona na produção

O enquadramento “busca por palavras-chave versus busca vetorial” é uma falsa dicotomia. Busca puramente vetorial perde consultas de correspondência exata — códigos de erro, SKUs, nomes próprios —, enquanto busca puramente lexical perde variantes semânticas. Sistemas robustos usam busca híbrida: recuperação por palavras-chave (BM25) e vetores em paralelo, fusão dos resultados, geralmente com Reciprocal Rank Fusion, e reordenação dos melhores candidatos por um cross-encoder. A Microsoft define busca híbrida como “the execution of vector search and keyword search in the same request… The queries execute in parallel, and the results are merged into a single response and ranked accordingly.” (tradução) «a execução de busca vetorial e busca por palavras-chave na mesma solicitação… As consultas são executadas em paralelo, e os resultados são combinados em uma única resposta e classificados de acordo.» O Vector Search do Google oferece os mesmos três modos: dense — semântico —, sparse — lexical — e hybrid. Guarde esta ideia: recuperação em produção quase nunca usa apenas vetores. A combinação é que funciona melhor.

Como Google e Bing realmente usam busca vetorial

Não é uma novidade da era do ChatGPT de 2023. A infraestrutura antecede a onda de LLMs em vários anos:

  • ScaNN — ICML 2020, código aberto — alimenta Google Image Search, YouTube e Google Play e sustenta o Vector Search do Google, antes chamado Vertex AI Vector Search. O serviço “shares the same backend” (tradução) «compartilha o mesmo backend» desses produtos de consumo. Kaz Sato, do Google, chamou a tecnologia de “one of the most important components of Google’s core services.” (tradução) «um dos componentes mais importantes dos principais serviços do Google.» Especificação de desempenho: “tens of thousands of requests per second… in less than 10 ms for the 90th percentile with a recall rate of 95–98%.” (tradução) «dezenas de milhares de solicitações por segundo… em menos de 10 ms no 90º percentil, com uma taxa de recall de 95–98 %.»
  • O Bing já operava índices com mais de 100 bilhões de vetores em 2019. Nas palavras da Microsoft, podia “search through this giant index of 100 billion-plus vectors to find the most related results in 5 milliseconds.” (tradução) «pesquisar esse índice gigante de mais de 100 bilhões de vetores para encontrar os resultados mais relacionados em 5 milissegundos.» Isso foi há mais de seis anos.
  • Dense Passage Retrieval (DPR, EMNLP 2020) demonstrou que a recuperação vetorial densa podia superar Lucene-BM25 em 9–19 % absolutos na precisão de recuperação dos 20 melhores trechos com um dual-encoder simples. DPR é o modelo seguido pela recuperação RAG moderna; a etapa por trás de AI Overviews descende desse padrão.
  • MUVERA — 2025 — torna a recuperação multivetorial tão rápida quanto a busca com vetor único, com aproximadamente “10% higher recall with ~90% lower latency” (tradução) «recall 10 % maior e latência cerca de 90 % menor» que os métodos anteriores.
  • TurboQuant — ICLR 2026 — comprime vetores para busca de vizinhos mais próximos, com redução de memória relatada de 6x e perda de precisão efetivamente nula.

A ideia não é decorar essa trajetória, mas entender que a recuperação baseada em embeddings é como os grandes mecanismos encontram conteúdo relevante — e já fazem isso há anos.

O que isso significa para SEO

Vou ser cuidadoso aqui, porque é neste ponto que os conselhos de SEO costumam extrapolar.

A proximidade vetorial é o novo critério de entrada no conjunto de candidatos. Nas respostas baseadas em RAG, a recuperação acontece antes da geração. Se o trecho não estiver semanticamente próximo do embedding da consulta, não entra na seleção usada pelo modelo para escrever e não pode ser citado. Esse é o mecanismo.

Mas não existe um ajuste de “otimização para busca vetorial”. O sinal subjacente é coerência semântica e profundidade temática, o que conteúdo de qualidade sempre exigiu. A busca vetorial não recompensa um novo truque: penaliza conteúdo superficial e repetição excessiva de palavras-chave, que não formam uma vizinhança coerente no espaço de embeddings, e recompensa cobertura realmente abrangente e bem estruturada. Como escrevi no artigo sobre embeddings, ecoando Danny Sullivan sobre BERT, em grande parte não há nada para “otimizar”: o conteúdo deve se agrupar claramente perto das consultas que deveria responder.

Duas implicações concretas decorrem disso:

  • Chunking importa. A recuperação opera sobre trechos, não páginas inteiras. Uma página pode não se classificar para nada se nenhum trecho individual corresponder claramente ao significado. Escreva passagens que se sustentem sozinhas.
  • Profundidade temática e cobertura de entidades ajudam a ocupar a vizinhança certa no espaço de embeddings. Conteúdo superficial e disperso fica em uma região vaga, sem proximidade com nada em particular.

A busca vetorial é o mecanismo de recuperação por trás de RAG e das respostas por IA; a classificação de passagens acontece com os candidatos depois da recuperação. Os rastreadores de IA que alimentam esses sistemas geram embeddings e indexam vetorialmente o que buscam. Para o processo mais amplo, veja Como a busca funciona.

Adicionar uma nota de especialista

Fixar uma citação de especialista

É uma pessoa nova? Crie o perfil não reivindicado dela em /admin/experts/ → Fixar uma citação de especialista primeiro.