Busca vetorial
Como a busca por IA encontra conteúdo relevante comparando vetores de embeddings — algoritmos ANN (HNSW, ScaNN), métricas de distância, busca híbrida e o que isso significa para SEO.
A busca vetorial encontra conteúdo comparando o significado de uma consulta com o conteúdo armazenado como vetores de embeddings e recuperando os mais próximos em um espaço de alta dimensionalidade. Em escala, usa algoritmos de vizinhos mais próximos aproximados (ANN) — HNSW, IVF, FAISS, ScaNN — que trocam uma pequena parcela de recall por enormes ganhos de velocidade, porque a comparação exata entre bilhões de vetores é impossível em tempo real. É um método para realizar busca semântica, não um sinônimo dela, e é a etapa de recuperação de todo sistema RAG, inclusive dos que alimentam AI Overviews. Em produção, a busca raramente usa apenas vetores: o padrão real é híbrido (palavras-chave BM25 + vetores + reordenação). Para SEO, não existe um ajuste específico — a proximidade vetorial é a nova porta de entrada no conjunto de candidatos e recompensa coerência temática e profundidade em cada trecho, em vez de densidade de palavras-chave.
Resumo — A busca vetorial encontra conteúdo pelo significado, em vez de corresponder às palavras exatas que você digitou. Ela transforma sua consulta e cada documento armazenado em uma lista de números — um vetor — e retorna os documentos cujos números estão mais próximos dos números da consulta. É assim que a busca por IA e os chatbots encontram os trechos usados nas respostas.
O que é busca vetorial
A busca vetorial recupera itens pela proximidade em um espaço de embeddings, muitas vezes usando índices de vizinhos mais próximos aproximados para operar em escala. Evidência desta afirmação HNSW is an approximate nearest-neighbor method that organizes vectors in a multilayer navigable graph for efficient search. Escopo: The HNSW algorithm and reported evaluations; production indexes may use different ANN methods and parameters. Confiança: alta · Verificado: Malkov and Yashunin: HNSW A similaridade depende do modelo de embeddings, da função de distância e dos dados indexados. Evidência desta afirmação Embedding vectors can be compared by distance to retrieve related items. Escopo: OpenAI embedding guidance; retrieval quality depends on model choice, corpus, index, filters, and evaluation. Confiança: alta · Verificado: OpenAI: Embeddings guide
A busca tradicional por palavras-chave faz correspondências entre palavras. Se você pesquisar “como corrigir um site lento” e uma página disser “melhorar o desempenho do site”, um mecanismo puramente lexical pode não encontrá-la: palavras diferentes, mesmo significado.
A busca vetorial resolve isso. Um modelo de embeddings lê o texto e o transforma em uma longa lista de números — um vetor — que captura o que ele significa. Conteúdos sobre a mesma coisa recebem números semelhantes e ficam próximos em uma espécie de mapa matemático. A busca vetorial pergunta: quais vetores armazenados estão mais próximos do vetor da consulta?
Assim, “corrigir um site lento” e “melhorar o desempenho do site” ficam próximos no mapa, e a busca vetorial encontra a correspondência mesmo sem coincidência entre as palavras.
Um modelo mental simples
Imagine cada página da web como um ponto em um mapa gigante, com pontos sobre o mesmo assunto próximos: todas as páginas sobre cães em uma vizinhança, todas as páginas sobre impostos em outra. Quando você pesquisa, a consulta também vira um ponto. A busca vetorial encontra os pontos mais próximos e os retorna.
Essa é a ideia toda. A dificuldade é fazer isso rapidamente quando existem bilhões de pontos — e esse é o próximo conceito a entender.
Por que “aproximado”
Comparar a consulta com cada vetor armazenado seria lento demais na escala da web. Por isso, sistemas reais usam atalhos inteligentes chamados algoritmos de vizinhos mais próximos aproximados (ANN). Eles não verificam cada ponto: percorrem caminhos inteligentes pelo mapa para encontrar os mais próximos de forma quase perfeita, em poucos milissegundos. “Quase” basta: deixar de encontrar o 19º melhor resultado entre milhões não muda sua resposta, e o ganho de velocidade é enorme.
Por que isso importa para você
Nas respostas por IA — AI Overviews do Google, busca do ChatGPT, Perplexity — o sistema primeiro recupera alguns trechos relevantes e depois escreve a resposta com base neles. Essa etapa de recuperação é busca vetorial. Se o conteúdo não estiver semanticamente próximo da pergunta, não entra na seleção de candidatos e não pode ser citado.
Não existe truque para “otimizar para busca vetorial”. Ela recompensa o que conteúdo de qualidade sempre exigiu: texto claro, realmente focado no assunto e com profundidade. Páginas superficiais e cheias de palavras-chave não ficam em uma vizinhança coerente do mapa, por isso não são recuperadas.
Quer entender os algoritmos HNSW e ScaNN, as métricas de distância, como o Google realmente usa isso e o panorama completo para SEO? Abra a aba Avançado.
Resumo — A busca vetorial recupera os vetores mais próximos de um vetor de consulta em um espaço de embeddings de alta dimensionalidade, usando algoritmos de vizinhos mais próximos aproximados (ANN) — HNSW, IVF, FAISS, ScaNN — porque comparar bilhões de vetores de forma exata é impossível em tempo real. ANN é aproximado por projeto: troca uma pequena parcela de recall por ganhos de velocidade de ordens de grandeza. A busca vetorial é um mecanismo de busca semântica, não um sinônimo, e é a etapa de recuperação de todo sistema RAG, inclusive AI Overviews. Em produção, raramente opera sozinha: o padrão real é híbrido, BM25 + vetores + reordenação. Para SEO não existe um ajuste específico; a proximidade vetorial determina a entrada no conjunto de candidatos e recompensa coerência temática e profundidade em cada trecho.
Onde a busca vetorial se encaixa
A recuperação vetorial é um componente que pode alimentar a classificação ou a geração; sozinha, não é um sistema de busca completo. Evidência desta afirmação HNSW is an approximate nearest-neighbor method that organizes vectors in a multilayer navigable graph for efficient search. Escopo: The HNSW algorithm and reported evaluations; production indexes may use different ANN methods and parameters. Confiança: alta · Verificado: Malkov and Yashunin: HNSW Nenhum limiar fixo de distância ou algoritmo de indexação é universalmente o melhor. Evidência desta afirmação Embedding vectors can be compared by distance to retrieve related items. Escopo: OpenAI embedding guidance; retrieval quality depends on model choice, corpus, index, filters, and evaluation. Confiança: alta · Verificado: OpenAI: Embeddings guide
Embeddings fornecem os vetores; busca vetorial é o que você faz com eles. Se embeddings explicam a metade “o que é um vetor”, esta é a metade “agora encontre os mais próximos”. Vale ser preciso sobre uma distinção que o setor confunde o tempo todo: busca semântica é o objetivo; busca vetorial é um dos métodos para alcançá-lo. A busca semântica também pode usar grafos de conhecimento, reconhecimento de entidades e correspondência de intenção. Busca vetorial significa especificamente recuperação ANN em um espaço de embeddings. Portanto, não são sinônimos, embora sejam tratados como se fossem.
Como a busca vetorial funciona, passo a passo
O processo é o mesmo no Google ou em um projeto de RAG feito no fim de semana:
Os documentos são incorporados e indexados antes da busca. No momento da consulta, o sistema incorpora a consulta, pesquisa em um índice de vizinhos mais próximos aproximados, encontra vetores próximos e retorna seus documentos correspondentes como candidatos.
© Patrick Stox LLC · CC BY 4.0 ·
- Gere embeddings do conteúdo. Um modelo codificador converte cada trecho em um vetor. Observe: trecho. A busca vetorial não compara páginas inteiras, mas passagens. Chunking define a unidade de recuperação, por isso a densidade do trecho importa mais que a presença de palavras-chave na página.
- Construa um índice. Os vetores entram em um índice preparado para buscas rápidas de vizinhos mais próximos — um índice ANN, explicado abaixo.
- Gere o embedding da consulta. No momento da busca, o mesmo modelo converte a consulta do usuário em um vetor no mesmo espaço.
- Execute a busca ANN. O índice retorna os k vetores mais próximos do vetor da consulta: o conjunto de candidatos.
- Classifique e retorne. Os candidatos recebem pontuações, muitas vezes passam por reordenação, e os melhores são apresentados ou, no RAG, enviados a um LLM para gerar a resposta.
Vizinhos mais próximos aproximados: por que “aproximados”
Encontrar os vizinhos mais próximos exatos exige comparar a consulta com cada vetor armazenado: O(N) por consulta. Com bilhões de vetores e prazo de milissegundos, isso é inviável. Por isso, a busca em produção usa ANN: estruturas de indexação que encontram os vizinhos mais próximos de forma quase perfeita, pulando a grande maioria das comparações.
Como diz a Elastic, ANN “sacrifices perfect accuracy in exchange for executing efficiently in high dimensional embedding spaces, at scale.” (tradução) «sacrifica a precisão perfeita em troca de uma execução eficiente em espaços de embeddings de alta dimensionalidade, em escala.» A Weaviate descreve a mesma troca como abrir mão de “a bit of accuracy for a huge gain in speed.” (tradução) «um pouco de precisão por um enorme ganho de velocidade.» Não é um defeito: é a escolha de engenharia que viabiliza a busca vetorial. A métrica que indica “quão boa é a aproximação” é recall. O Google a define como “the percentage of nearest neighbors returned by the index that are actually true nearest neighbors.” (tradução) «a porcentagem de vizinhos mais próximos retornados pelo índice que são de fato os verdadeiros vizinhos mais próximos.» O serviço Vector Search do Google — antes chamado “Vertex AI Vector Search” e agora documentado na Gemini Enterprise Agent Platform — informa recall de 95–98 %. Você abre mão de alguns pontos percentuais dos vizinhos verdadeiros e ganha busca em escala da web.
Principais algoritmos ANN
Você não precisa implementá-los, mas conhecer os nomes esclarece boa parte das discussões sobre busca por IA.
- HNSW (Hierarchical Navigable Small World) — o padrão do setor. É um grafo em camadas: as superiores são “vias expressas” esparsas, com conexões de longo alcance para percursos rápidos; as inferiores são “ruas locais” densas para navegação precisa. A complexidade de busca é aproximadamente logarítmica, por isso domina a produção. Weaviate, Pinecone, pgvector, Qdrant e outros o usam. O problema é a memória: índices HNSW consomem muita RAM. A avaliação da Pinecone: “HNSW gives us great search-quality at very fast search-speeds — but there’s always a catch — HNSW indexes take up a significant amount of memory.” (tradução) «O HNSW oferece ótima qualidade de busca em velocidades muito altas — mas sempre há um porém — os índices HNSW ocupam uma quantidade significativa de memória.»
- IVF (Inverted File Index) — divide o espaço em grupos com k-means e, na consulta, pesquisa apenas os poucos grupos mais próximos (
nprobe). A Pinecone o chama de “a very popular index as it’s easy to use, with high search- quality and reasonable search-speed… a good scalable option.” (tradução) «um índice muito popular por ser fácil de usar, com alta qualidade de busca e velocidade razoável… uma boa opção escalável.» - FAISS — biblioteca do Facebook AI, de Johnson, Douze e Jégou, para busca por similaridade na escala de bilhões. É uma caixa de ferramentas, não um único algoritmo: uma referência exata flat (
IndexFlatL2), IVF com agrupamento, IVFPQ com quantização de produto para compressão de memória de 4–64x e uma implementação de HNSW. A adaptação para GPU relatou aceleração de 8,5x na busca k-NN. - ScaNN (Scalable Nearest Neighbors) — biblioteca de código aberto do Google, da mesma família de tecnologias por trás de Google Image Search, YouTube e Google Play. Sua inovação é a quantização vetorial anisotrópica: em vez de minimizar a distância média, ela “more heavily penalizes quantization error that is parallel to the original vector,” (tradução) «penaliza mais fortemente o erro de quantização paralelo ao vetor original,» porque o erro direcional prejudica desproporcionalmente os resultados com alto produto interno, os mais relevantes. O resultado: “outperforms other vector similarity search libraries by a factor of two” (tradução) «supera outras bibliotecas de busca por similaridade vetorial por um fator de dois» no ann-benchmarks.com — aproximadamente o dobro de consultas por segundo com a mesma precisão.
- Índice flat (exato) — nenhuma aproximação; força bruta, maior precisão e menor velocidade. A Pinecone observa que índices flat “produce the most accurate results” (tradução) «produzem os resultados mais precisos» e são a escolha certa quando a qualidade da busca é prioritária ou o índice é pequeno, abaixo de aproximadamente 10 000 vetores. Acima disso, usa-se ANN.
O ponto comum: todo índice ANN ajusta a relação entre recall, latência, vazão e memória. Como diz a Weaviate, a maioria dos bancos vetoriais permite “configure how your ANN algorithm should behave… to find the right balance.” (tradução) «configurar como seu algoritmo ANN deve se comportar… para encontrar o equilíbrio certo.»
Métricas de distância
É preciso definir “mais próximo”. Três definições são comuns:
- Similaridade por cosseno — o padrão para texto. Mede o ângulo entre dois vetores, ignorando a magnitude; assim, um documento curto e outro longo sobre o mesmo assunto recebem pontuações semelhantes. Segundo a Weaviate: “Cosine similarity is commonly used in Natural Language Processing… It measures the similarity between documents regardless of the magnitude.” (tradução) «A similaridade por cosseno é comumente usada em Processamento de Linguagem Natural… Ela mede a similaridade entre documentos independentemente da magnitude.»
- Produto escalar (produto interno) — usado quando a relevância é definida pelo produto interno, o problema MIPS para o qual o ScaNN otimiza.
- Distância euclidiana (L2) — distância em linha reta; usada quando a magnitude tem significado.
Atalho prático: para vetores normalizados, similaridade por cosseno e produto escalar produzem classificações idênticas, e a maioria dos modelos modernos normaliza a saída para comprimento unitário. A OpenAI afirma: “We recommend cosine similarity. The choice of distance function typically doesn’t matter much” (tradução) «Recomendamos a similaridade por cosseno. A escolha da função de distância normalmente não importa muito» — justamente porque seus embeddings têm comprimento 1. A regra real, segundo a Weaviate: “Use the distance metric that matches the model that you’re using… There is no ‘one size fits all’.” (tradução) «Use a métrica de distância que corresponde ao modelo que você está usando… Não existe uma solução única para todos.»
Bancos de dados vetoriais
Um banco vetorial armazena vetores e executa ANN sobre eles, dispensando a construção da infraestrutura de indexação. Os nomes comuns são Pinecone — gerenciado —, Weaviate — busca híbrida integrada —, Chroma e FAISS — ótimos para protótipos e uso no próprio processo —, Qdrant, Milvus — escala com hospedagem própria — e pgvector, extensão do Postgres para equipes que já usam SQL. Estou listando, não classificando: a escolha depende da escala, da preferência por serviço gerenciado ou hospedagem própria e da necessidade de busca híbrida pronta. Na escala de Google e Bing, o “banco” é infraestrutura interna ScaNN/ANN, não uma dessas opções.
Busca híbrida: como funciona na produção
O enquadramento “busca por palavras-chave versus busca vetorial” é uma falsa dicotomia. Busca puramente vetorial perde consultas de correspondência exata — códigos de erro, SKUs, nomes próprios —, enquanto busca puramente lexical perde variantes semânticas. Sistemas robustos usam busca híbrida: recuperação por palavras-chave (BM25) e vetores em paralelo, fusão dos resultados, geralmente com Reciprocal Rank Fusion, e reordenação dos melhores candidatos por um cross-encoder. A Microsoft define busca híbrida como “the execution of vector search and keyword search in the same request… The queries execute in parallel, and the results are merged into a single response and ranked accordingly.” (tradução) «a execução de busca vetorial e busca por palavras-chave na mesma solicitação… As consultas são executadas em paralelo, e os resultados são combinados em uma única resposta e classificados de acordo.» O Vector Search do Google oferece os mesmos três modos: dense — semântico —, sparse — lexical — e hybrid. Guarde esta ideia: recuperação em produção quase nunca usa apenas vetores. A combinação é que funciona melhor.
Como Google e Bing realmente usam busca vetorial
Não é uma novidade da era do ChatGPT de 2023. A infraestrutura antecede a onda de LLMs em vários anos:
- ScaNN — ICML 2020, código aberto — alimenta Google Image Search, YouTube e Google Play e sustenta o Vector Search do Google, antes chamado Vertex AI Vector Search. O serviço “shares the same backend” (tradução) «compartilha o mesmo backend» desses produtos de consumo. Kaz Sato, do Google, chamou a tecnologia de “one of the most important components of Google’s core services.” (tradução) «um dos componentes mais importantes dos principais serviços do Google.» Especificação de desempenho: “tens of thousands of requests per second… in less than 10 ms for the 90th percentile with a recall rate of 95–98%.” (tradução) «dezenas de milhares de solicitações por segundo… em menos de 10 ms no 90º percentil, com uma taxa de recall de 95–98 %.»
- O Bing já operava índices com mais de 100 bilhões de vetores em 2019. Nas palavras da Microsoft, podia “search through this giant index of 100 billion-plus vectors to find the most related results in 5 milliseconds.” (tradução) «pesquisar esse índice gigante de mais de 100 bilhões de vetores para encontrar os resultados mais relacionados em 5 milissegundos.» Isso foi há mais de seis anos.
- Dense Passage Retrieval (DPR, EMNLP 2020) demonstrou que a recuperação vetorial densa podia superar Lucene-BM25 em 9–19 % absolutos na precisão de recuperação dos 20 melhores trechos com um dual-encoder simples. DPR é o modelo seguido pela recuperação RAG moderna; a etapa por trás de AI Overviews descende desse padrão.
- MUVERA — 2025 — torna a recuperação multivetorial tão rápida quanto a busca com vetor único, com aproximadamente “10% higher recall with ~90% lower latency” (tradução) «recall 10 % maior e latência cerca de 90 % menor» que os métodos anteriores.
- TurboQuant — ICLR 2026 — comprime vetores para busca de vizinhos mais próximos, com redução de memória relatada de 6x e perda de precisão efetivamente nula.
A ideia não é decorar essa trajetória, mas entender que a recuperação baseada em embeddings é como os grandes mecanismos encontram conteúdo relevante — e já fazem isso há anos.
O que isso significa para SEO
Vou ser cuidadoso aqui, porque é neste ponto que os conselhos de SEO costumam extrapolar.
A proximidade vetorial é o novo critério de entrada no conjunto de candidatos. Nas respostas baseadas em RAG, a recuperação acontece antes da geração. Se o trecho não estiver semanticamente próximo do embedding da consulta, não entra na seleção usada pelo modelo para escrever e não pode ser citado. Esse é o mecanismo.
Mas não existe um ajuste de “otimização para busca vetorial”. O sinal subjacente é coerência semântica e profundidade temática, o que conteúdo de qualidade sempre exigiu. A busca vetorial não recompensa um novo truque: penaliza conteúdo superficial e repetição excessiva de palavras-chave, que não formam uma vizinhança coerente no espaço de embeddings, e recompensa cobertura realmente abrangente e bem estruturada. Como escrevi no artigo sobre embeddings, ecoando Danny Sullivan sobre BERT, em grande parte não há nada para “otimizar”: o conteúdo deve se agrupar claramente perto das consultas que deveria responder.
Duas implicações concretas decorrem disso:
- Chunking importa. A recuperação opera sobre trechos, não páginas inteiras. Uma página pode não se classificar para nada se nenhum trecho individual corresponder claramente ao significado. Escreva passagens que se sustentem sozinhas.
- Profundidade temática e cobertura de entidades ajudam a ocupar a vizinhança certa no espaço de embeddings. Conteúdo superficial e disperso fica em uma região vaga, sem proximidade com nada em particular.
A busca vetorial é o mecanismo de recuperação por trás de RAG e das respostas por IA; a classificação de passagens acontece com os candidatos depois da recuperação. Os rastreadores de IA que alimentam esses sistemas geram embeddings e indexam vetorialmente o que buscam. Para o processo mais amplo, veja Como a busca funciona.
Resumo por IA
Uma versão condensada do conteúdo avançado:
- Busca vetorial = encontrar os vetores mais próximos de um vetor de consulta em um espaço de embeddings de alta dimensionalidade. Corresponde ao significado, não às palavras exatas.
- Embeddings produzem vetores; busca vetorial recupera conteúdo a partir deles. É um mecanismo de busca semântica, não um sinônimo: busca semântica é o objetivo.
- ANN é aproximado por projeto. Comparar bilhões de vetores exatamente é impossível em tempo real; HNSW / IVF / FAISS / ScaNN trocam uma pequena parcela de recall — o Google informa 95–98 % — por ganhos de velocidade de ordens de grandeza.
- HNSW é o padrão em produção: baseado em grafos, busca logarítmica e alto consumo de memória. ScaNN é a biblioteca aberta do Google por trás de Image Search, YouTube e Google Play. Índices flat/exatos só fazem sentido abaixo de aproximadamente 10 000 vetores.
- Similaridade por cosseno é o padrão para texto. Para vetores normalizados — maioria dos modelos modernos, inclusive os da OpenAI —, cosseno e produto escalar geram classificações idênticas.
- Produção usa busca híbrida, não apenas vetores: BM25 + vetores em paralelo, fusão com Reciprocal Rank Fusion e reordenação por cross-encoder.
- Isso antecede a onda de LLMs: o Bing operava índices de mais de 100 bilhões de vetores em 2019; ScaNN e DPR são de 2020. DPR superou BM25 em 9–19 % e é o modelo da recuperação RAG.
- Consequência para SEO: a proximidade vetorial determina a entrada no conjunto de candidatos às respostas por IA. Não há ajuste específico: ela recompensa coerência temática e profundidade por passagem e penaliza conteúdo superficial com palavras-chave em excesso. A clareza de cada trecho importa.
Documentação oficial
Documentação de fontes primárias sobre busca vetorial e por embeddings, produzida pelos mecanismos de busca e pelos fornecedores de modelos de embeddings.
- Visão geral do Vector Search — serviço baseado em ScaNN, antes chamado “Vertex AI Vector Search” e agora documentado na Gemini Enterprise Agent Platform; embeddings densos, esparsos e híbridos; definição de recall.
- Apresentando o ScaNN: busca eficiente por similaridade vetorial — quantização vetorial anisotrópica e resultado 2x mais rápido no benchmark.
- Encontre qualquer coisa muito rapidamente com a tecnologia de busca vetorial do Google — explicação de Kaz Sato: palavras-chave versus vetores e especificações de desempenho.
- Infraestrutura de RAG com Agent Platform e Vector Search — como a busca vetorial funciona como etapa de recuperação no RAG; a página foi renomeada de “Vertex AI e Vector Search” quando o Google incorporou o serviço à Gemini Enterprise Agent Platform.
- MUVERA: recuperação multivetorial tão rápida quanto a busca com vetor único
- TurboQuant: compressão extrema para busca vetorial
Microsoft / Bing / Azure
- Visão geral da busca vetorial no Azure AI Search — definição de busca vetorial e híbrida pelo próprio mecanismo.
- À medida que as necessidades de busca evoluem: busca vetorial do Bing — artigo de 2019 que mostra o índice do Bing com mais de 100 bilhões de vetores.
Documentação de modelos de embeddings e fornecedores
- OpenAI — embeddings vetoriais — funções de distância e por que a escolha raramente importa para vetores normalizados.
- Weaviate — explicação da busca vetorial e Métricas de distância na busca vetorial.
- Pinecone — o que é busca por similaridade? e Índices de vizinhos mais próximos.
- Elastic — o que é busca vetorial?.
Citações das fontes
Declarações públicas do Google e da Microsoft/Bing. Cada link leva ao trecho citado na página de origem.
- “The vector similarity search (or nearest neighbor search or simply vector search) capabilities of the Vertex AI Matching Engine… share the same backend as Google Image Search, YouTube, Google Play, and more.” (tradução) «Os recursos de busca por similaridade vetorial — ou busca de vizinhos mais próximos, ou simplesmente busca vetorial — do Vertex AI Matching Engine… compartilham o mesmo backend de Google Image Search, YouTube, Google Play e outros.» — Kaz Sato, Developer Advocate, Cloud AI. Ir à fonte
- “Vector search provides a much more refined way to find content, with subtle nuances and meanings. Vectors can represent the meaning of content where ‘films’, ‘movies’, and ‘cinema’ are all collected together.” (tradução) «A busca vetorial oferece uma maneira muito mais refinada de encontrar conteúdo, com nuances e significados sutis. Vetores podem representar o significado do conteúdo, reunindo ‘films’, ‘movies’ e ‘cinema’.» Ir à fonte
- “The technology is one of the most important components of Google’s core services.” (tradução) «A tecnologia é um dos componentes mais importantes dos principais serviços do Google.» — Kaz Sato. Ir à citação
- “Today, we’re just beginning the migration from traditional search technology to new vector search. Over the next 5 to 10 years, many more best practices and tools will be developed.” (tradução) «Hoje, estamos apenas começando a migração da tecnologia de busca tradicional para a nova busca vetorial. Nos próximos 5 a 10 anos, serão desenvolvidas muito mais práticas recomendadas e ferramentas.» — Kaz Sato. Ir à citação
- ScaNN “outperforms other vector similarity search libraries by a factor of two on ann-benchmarks.com.” (tradução) «supera outras bibliotecas de busca por similaridade vetorial por um fator de dois no ann-benchmarks.com.» Ir à citação
Microsoft / Bing
- “Vector search is an information retrieval approach that supports indexing and querying over numeric representations of content. Because the content is numeric rather than plain text, matching is based on vectors that are most similar to the query vector.” (tradução) «A busca vetorial é uma abordagem de recuperação de informações que permite indexar e consultar representações numéricas do conteúdo. Como o conteúdo é numérico, e não texto simples, a correspondência se baseia nos vetores mais semelhantes ao vetor da consulta.» — Documentação do Azure AI Search. Ler a documentação
- “Keyword search algorithms just fail when people ask a question or take a picture and ask the search engine, ‘What is this?’” (tradução) «Algoritmos de busca por palavras-chave simplesmente falham quando as pessoas fazem uma pergunta ou tiram uma foto e perguntam ao mecanismo de busca: ‘O que é isto?’» — Rangan Majumder, Group Program Manager, Bing (2019). Ler a fonte
- “Bing processes billions of documents every day, and the idea now is that we can represent these entries as vectors and search through this giant index of 100 billion-plus vectors to find the most related results in 5 milliseconds.” (tradução) «O Bing processa bilhões de documentos todos os dias, e a ideia agora é representar essas entradas como vetores e pesquisar esse índice gigante de mais de 100 bilhões de vetores para encontrar os resultados mais relacionados em 5 milissegundos.» — Jeffrey Zhu, Program Manager, Bing (2019). Ler a fonte
OpenAI (fornecedora de modelos de embeddings, sobre métricas de distância)
- “An embedding is a vector (list) of floating point numbers. The distance between two vectors measures their relatedness.” (tradução) «Um embedding é um vetor — lista — de números de ponto flutuante. A distância entre dois vetores mede o quanto se relacionam.» … “We recommend cosine similarity. The choice of distance function typically doesn’t matter much.” (tradução) «Recomendamos a similaridade por cosseno. A escolha da função de distância normalmente não importa muito.» Ler a documentação
#:~:text= verificadas no briefing. As citações do Bing de 2019 foram reproduzidas literalmente do artigo da Microsoft News, mas a página não oferece âncoras estáveis de fragmento de texto. Por isso, os links apontam para a página; confira a versão ao vivo antes de tratar qualquer citação como definitiva.
Os modelos mentais
1. O mapa. Cada trecho é um ponto em um mapa de alta dimensionalidade, com significados semelhantes próximos. A consulta também é um ponto. A busca vetorial retorna os mais próximos. Todo o resto é uma otimização disso.
2. Objetivo versus mecanismo. Busca semântica é o objetivo: corresponder ao significado e à intenção. Busca vetorial é um mecanismo para alcançá-lo: ANN sobre embeddings. Separe os dois e boa parte dos textos confusos sobre busca por IA ficará mais clara.
3. O ajuste entre recall e velocidade. Todo índice ANN troca recall por latência, vazão e memória. Exato — flat — significa recall perfeito, mas não escala. HNSW significa recall quase perfeito, rapidez e alto consumo de memória. Não existe ganho sem custo: existe um ajuste, e você escolhe o ponto.
4. Híbrido é o padrão, não a exceção. Recuperação real = BM25 — recall lexical, captura termos exatos — + vetores — recall semântico, captura significado — + reordenação — qualidade do cross-encoder. Se você imagina a busca em produção como “vetores versus palavras-chave”, a imagem está errada.
5. Recuperação é a porta de entrada; a geração vem depois. Nas respostas RAG/IA, a busca vetorial define o conjunto de candidatos antes de o modelo escrever qualquer coisa. Fora do conjunto → não pode ser citado. Por isso, a proximidade semântica, não a contagem de palavras-chave na página, determina a inclusão.
6. A unidade é o trecho, não a página. Os vetores são calculados por passagem. Uma ótima página composta de trechos vagos pode não corresponder a nada. Escreva trechos autossuficientes e focados no assunto.
Busca vetorial: referência rápida
Tipos de índice ANN
| Índice | Abordagem | Recall | Velocidade | Memória | Quando usar |
|---|---|---|---|---|---|
| Flat | Força bruta exata | Perfeito | Mais lento | Baixa | <~10 000 vetores, precisão prioritária |
| IVF | Agrupar e consultar os grupos mais próximos | Alto | Boa | Moderada | Opção padrão escalável e fácil |
| IVFPQ | IVF + quantização de produto | Bom | Boa | Muito baixa (4–64x) | Memória limitada em escala |
| HNSW | Grafo de proximidade em camadas | Quase perfeito | Muito rápida | Alta (RAM) | Padrão de produção, tempo real |
| ScaNN | Quantização anisotrópica | Alto | Muito rápida | Baixa a moderada | MIPS na escala do Google |
Métricas de distância
| Métrica | O que mede | Uso |
|---|---|---|
| Similaridade por cosseno | Ângulo, ignora magnitude | Texto: o padrão |
| Produto escalar | Produto interno | MIPS / quando a magnitude importa; = cosseno para vetores normalizados |
| Euclidiana (L2) | Distância em linha reta | Quando a magnitude tem significado |
Informações rápidas
- ANN é aproximado por projeto: troca uma pequena parcela de recall por enorme velocidade. O Vector Search do Google, antes “Vertex AI Vector Search”, informa recall de 95–98 %.
- HNSW domina a produção: Weaviate, Pinecone, pgvector, Qdrant. Busca logarítmica; alto consumo de memória.
- ScaNN é a biblioteca aberta do Google, com o mesmo backend de Image Search, YouTube e Google Play; aproximadamente 2x as consultas por segundo da biblioteca seguinte com a mesma precisão.
- Para vetores normalizados, cosseno = produto escalar na classificação. A maioria dos modelos modernos, inclusive OpenAI, normaliza.
- Híbrido é o padrão real em produção: BM25 + vetores, fusão com RRF, depois reordenação por cross-encoder.
- Bancos vetoriais: Pinecone, Weaviate, Chroma, Qdrant, Milvus, pgvector — listados, não classificados.
- DPR (2020) superou BM25 em 9–19 % na recuperação de passagens: o modelo da recuperação RAG. O Bing operava índices com mais de 100 bilhões de vetores em 2019.
SEO em uma frase: a proximidade vetorial determina a entrada no conjunto de candidatos às respostas por IA. Não há ajuste específico; ela recompensa profundidade temática e trechos claros e autossuficientes.
Teste seus conhecimentos: busca vetorial
Recursos que valem seu tempo
Conteúdo relacionado neste site
- Embeddings — leia primeiro: de onde vêm os vetores.
- Busca semântica — o objetivo para o qual busca vetorial é um método.
- RAG — a busca vetorial é sua etapa de recuperação.
- Chunking — os trechos que recebem embeddings e são pesquisados.
- Como a busca funciona — o processo mais amplo: rastrear → indexar → recuperar → classificar.
Artigos fundamentais
- Recuperação densa de trechos para perguntas e respostas em domínio aberto — Karpukhin et al., EMNLP 2020: o modelo de recuperação com dual-encoder que superou BM25 em 9–19 %.
- A biblioteca Faiss — 2024: visão abrangente dos tipos de índice FAISS.
- HNSW — algoritmo por trás da maioria dos bancos vetoriais em produção; Malkov e Yashunin, 2018.
Bibliotecas de código aberto
- ScaNN — biblioteca de busca por similaridade do Google.
- FAISS — busca por similaridade na escala de bilhões, do Facebook AI.
- DPR — implementação de referência da recuperação densa de trechos.
Explicações de fornecedores: claras e bem ilustradas
- Pinecone — o que é busca por similaridade?
- Weaviate — explicação da busca vetorial
- Elastic — o que é busca vetorial?
Outras fontes do setor
- iPullRank — A evolução da recuperação de informações: do léxico ao neural — análise aprofundada de Mike King sobre a passagem da recuperação lexical para a neural/vetorial; enquadramento útil para SEO.
- Search Engine Land — A mudança para o SEO semântico: o que os vetores significam para sua estratégia — visão para profissionais sobre como a recuperação vetorial muda a estratégia de conteúdo.
- Search Engine Land — Novo algoritmo TurboQuant do Google acelera a busca vetorial — cobertura do avanço de compressão do Google em 2026 para busca de vizinhos mais próximos.
- Search Engine Journal — Pesquisa semântica com vetores — explicação acessível que liga busca por similaridade vetorial a resultados de SEO.
- IBM — o que é busca vetorial? — visão sólida dos fundamentos, sem foco em um fornecedor; uma das páginas de referência mais bem posicionadas sobre o tema.
- Oracle — o que é busca vetorial? O guia definitivo — guia abrangente de indexação, métricas de distância e integração com bancos de dados.
- Blog do Microsoft Bing — Microsoft disponibiliza como código aberto o modelo de embeddings Harrier — lançamento de abril de 2026 do modelo de embeddings Harrier da Microsoft, em 1º lugar no benchmark multilíngue MTEB-v2; diretamente relevante ao contexto de busca vetorial do Bing.
Registro de alterações
Atualizado em 20 de set. de 2026.
Resumo editorial e detalhes registrados da alteração.Resumo
Localizados títulos descritivos de documentação e leituras que ainda apareciam em inglês.
Detalhes da alteração
-
Traduzidos os rótulos dos recursos do Google e do setor, preservando nomes de produtos, siglas, URLs, números e termos técnicos.
Não é possível fazer a comparação completa — nenhum instantâneo anterior foi arquivado para esta revisão.
Atualizado em 20 de set. de 2026.
Resumo editorial e detalhes registrados da alteração.Resumo
Corrigida a formatação localizada de numerais, preservando o bloqueio da fonte.
Detalhes da alteração
-
Corrigida a formatação D4 de numerais nos metadados visíveis ao leitor; o resultado permanece provisório e aguarda revisão.
Não é possível fazer a comparação completa — nenhum instantâneo anterior foi arquivado para esta revisão.
Atualizado em 20 de set. de 2026.
Resumo editorial e detalhes registrados da alteração.Resumo
Aplicada uma correção delimitada por IA ao artigo localizado, preservando o bloqueio da fonte e a estrutura MDX.
Detalhes da alteração
-
Corrigido um bloco vinculado à fonte; o resultado automatizado continua provisório e requer revisão nativa.
Não é possível fazer a comparação completa — nenhum instantâneo anterior foi arquivado para esta revisão.
Atualizado em 8 de set. de 2026.
Resumo editorial e detalhes registrados da alteração.Resumo
Substituídos os marcadores provisórios por uma tradução completa, comparada com a fonte inglesa, com citações originais e traduções explicativas em português.
Detalhes da alteração
-
Traduzidos os 86 blocos de prosa, os metadados e os detalhes do histórico importado; preservados os 21 blocos protegidos e os valores válidos dos componentes, com preenchimento de dois campos ausentes. A revisão nativa e a verificação externa das fontes continuam pendentes.
Não é possível fazer a comparação completa — nenhum instantâneo anterior foi arquivado para esta revisão.
Atualizado em 3 de ago. de 2026.
Resumo editorial e detalhes registrados da alteração.Resumo
Registro do marcador legado 2,1 observado antes desta correção. Os detalhes das alterações e a proveniência dessa passagem anterior são desconhecidos; este registro não reconstrói o conteúdo histórico.
Detalhes da alteração
Não é possível fazer a comparação completa — nenhum instantâneo anterior foi arquivado para esta revisão.
Atualizado em 19 de jul. de 2026.
Resumo editorial e detalhes registrados da alteração.Resumo
Corrigida uma divergência no nome do serviço: o Google transferiu seu serviço de recall/latência do nome “Vertex AI Vector Search” para “Vector Search”, na Gemini Enterprise Agent Platform, conforme confirmado por uma verificação ao vivo do redirecionamento e do título da documentação na revisão original.
Detalhes da alteração
-
Antes
O serviço era chamado de “Vertex AI Vector Search” na aba Avançado, no link da documentação oficial e na consulta rápida; um documento vinculado era chamado de “Infraestrutura de RAG com Vertex AI e Vector Search” na lista de recursos.DepoisTodas as menções foram atualizadas para “Vector Search” e “Agent Platform e Vector Search”, com uma observação sobre a mudança do nome Vertex AI Vector Search e sua localização atual na Gemini Enterprise Agent Platform; o link da documentação oficial passou a apontar para a URL canônica atual.
Não é possível fazer a comparação completa — nenhum instantâneo anterior foi arquivado para esta revisão.
Atualizado em 17 de jul. de 2026.
Resumo editorial e detalhes registrados da alteração.Resumo
Adicionado um visual do fluxo de vizinhos mais próximos aproximados.
Detalhes da alteração
-
Adicionada uma figura que mostra como a busca de candidatos ANN reduz as comparações entre vetores em escala.
Não é possível fazer a comparação completa — nenhum instantâneo anterior foi arquivado para esta revisão.