Metodologia de medição da pesquisa com IA
Uma metodologia prática para registrar prompts, respostas, citações, trechos, modelos, correções e mudanças de conteúdo sem transformar evidência ausente ou amostrada em falsa certeza.
Idiomas
1 sinal de evidência nesta página
- Ferramenta relacionada ativaAI Search Evidence Lab
Armazene cada resposta de IA como uma observação versionada: prompt exato, superfície, modelo, modo de recuperação, locale, data, grupo da amostra, evidência da resposta, citações, trechos e método de extração. Conte apenas execuções avaliadas e elegíveis, mantenha recuperação, menção, citação e clique separados, repita prompts compatíveis, preserve correções humanas e trate mudanças de conteúdo não controladas como direcionais, não causais.
TL;DR — Um resultado de pesquisa com IA é uma amostra, não uma classificação. Salve a pergunta exata, onde ela foi feita, qual modelo ou produto respondeu, quando a execução ocorreu e quais links apareceram. Repita o mesmo teste várias vezes. Mantenha as falhas fora do denominador e não trate visita de bot, menção de marca, citação, clique e conversão como o mesmo evento.
O registro importa mais que a pontuação
Uma “pontuação de visibilidade em IA” é difícil de interpretar quando você não sabe o que foi testado. O mesmo prompt pode produzir respostas diferentes entre datas, modelos, países, contas ou execuções repetidas. Por isso, um registro útil começa pela observação:
- o prompt exato e sua versão;
- o produto, a API ou a superfície oficial de relatório;
- o modelo solicitado e o modelo resolvido, quando conhecidos;
- se a recuperação na web estava ativada, desativada ou indisponível;
- o país, o locale, o dispositivo e o estado da conta, quando relevantes;
- a data, o grupo da amostra e o número da repetição;
- a resposta ou o hash da evidência permitida;
- cada menção e citação observadas;
- o trecho que aparentemente sustenta cada citação, quando exposto;
- as versões do extrator e da metodologia.
Se uma execução falhar, for recusada ou não expuser os dados solicitados, mantenha esse registro. Rotule-o como não avaliado, em vez de alterá-lo para zero.
Cinco eventos que devem permanecer separados
- Buscado: um crawler verificado ou agente dirigido pelo usuário solicitou uma URL.
- Recuperado ou selecionado: a página entrou em um conjunto de recuperação observável.
- Mencionado: a resposta nomeou a entidade.
- Citado: a resposta expôs uma URL de origem.
- Visitado ou convertido: uma pessoa seguiu um link e concluiu uma ação mensurada.
Um log de servidor pode provar o primeiro evento quando o solicitante é devidamente verificado. Normalmente, ele não prova os quatro restantes. Uma captura da resposta pode provar uma menção ou citação visível, mas não revela todas as fontes que o sistema recuperou ou usou internamente.
Repita antes de recomendar uma mudança
Execute prompts compatíveis pelo menos três vezes antes de aplicar um rótulo de estabilidade; cinco é um padrão melhor. Mostre o resultado como uma fração exata — por exemplo, 3/5 respostas elegíveis citaram a página — em vez de simplesmente “60% visível”.
Quando uma citação aparece uma vez e desaparece duas vezes, a interpretação inicial correta é variabilidade. Isso não é automaticamente um problema de indexação ou uma penalidade.
Experimente o AI Search Evidence Lab com seu pacote de exemplo incluído para ver como denominadores elegíveis, persistência de citações, cobertura de trechos e conflitos de fatos permanecem separados.
TL;DR — Use um contrato de observação somente para anexação e um registro versionado de prompts. Compare apenas painéis compatíveis de prompt/superfície/recuperação/locale/método. Relate resultados binários com N e um intervalo de incerteza. Preserve a evidência bruta separadamente dos classificadores derivados e das correções humanas. O NIST AI Risk Management Framework oferece uma estrutura complementar de governança para esse registro. Avalie intervenções com controles quando possível, mas mantenha direcionais até os resultados observacionais controlados.
O envelope da observação
A observação canônica deve conter quatro camadas:
Aquisição
Registre explicitamente o tipo de fonte:
- produto para consumidores;
- API de modelo de primeira parte;
- API de primeira parte com pesquisa na web;
- provedor de terceiros;
- relatório oficial para webmasters;
- log de servidor verificado;
- upload do usuário.
Uma chamada de API de primeira parte com pesquisa é uma evidência útil sobre aquela execução da API. Ela não é uma medição direta de um produto para consumidores com nome semelhante. Preserve esse limite no armazenamento, nos rótulos da interface, nas exportações e nas agregações.
Contexto experimental
Armazene um ID de prompt estável, uma versão imutável do prompt, o hash do prompt, a superfície, o modo de recuperação, o locale, o país, o dispositivo, o estado da conta, o grupo da amostra e o ordinal da amostra. Use um painel de benchmark congelado para tendências e um painel exploratório separado para descobrir novos padrões de prompt.
Quando um prompt mudar, crie uma nova versão. Não edite observações históricas para fazê-las parecer compatíveis.
Evidência
Mantenha a evidência bruta ou com hash da resposta, as URLs citadas e recuperadas normalizadas, os trechos de menção, as posições das citações quando expostas, as consultas de fundamentação quando expostas e os trechos de suporte ou seus hashes. Normalize parâmetros de rastreamento e fragmentos de URL sem descartar a URL original.
Para citações, um registro de origem útil contém:
raw URL → normalized URL → observed canonical or redirect successor
→ answer citation position → supporting passage → observed HTTP statusEssa linhagem impede que redirecionamentos, parâmetros, cópias sindicadas e migrações aumentem artificialmente a contagem de fontes. A orientação do Google sobre canonicalização descreve os sinais relacionados à consolidação de URLs e seus limites.
Interpretação
Toda menção, sentimento, entidade, fato e motivo de perda extraído deve incluir:
- a versão do classificador ou extrator;
- estado observado, derivado, inferido ou não avaliado;
- confiança e seu motivo;
- qualquer correção humana posterior.
Uma correção não apaga a classificação original. Ela se torna um caso de calibração para avaliar a próxima versão do classificador.
Comparações compatíveis
Antes de calcular uma tendência, exija valores compatíveis para:
- ID e versão do prompt;
- superfície;
- modo de recuperação;
- locale;
- versões da metodologia e do extrator.
Anote ou interrompa a série quando o modelo resolvido ou o checkpoint mudar. Caso contrário, uma atualização do provedor pode parecer uma mudança no desempenho do conteúdo.
Para um resultado binário, informe o numerador, o denominador elegível, a estimativa pontual e um intervalo de incerteza. Exclua recusas, falhas do provedor e evidências indisponíveis do denominador, mas continue exibindo suas contagens na qualidade da execução.
Exemplos de plataformas públicas
Estes são exemplos de por que contratos específicos por fonte importam, não um pedido para forçar as plataformas a uma classificação compartilhada:
- A descrição pública do relatório de IA generativa do Search Console do Google lista impressões, páginas, países, dispositivos e datas. Armazene esses itens como campos de visibilidade documentados; não os transforme em citações ou posição na resposta. O relatório foi anunciado como uma implementação limitada em junho de 2026. Anúncio oficial
- A descrição pública do Bing Webmaster Tools AI Performance da Microsoft inclui atividade de citações, páginas citadas e consultas de fundamentação amostradas. A Microsoft afirma explicitamente que essas citações não indicam posicionamento, autoridade, classificação nem o papel de uma página em uma resposta. Anúncio oficial
O adaptador de cada fonte deve manter esses significados e marcar como indisponíveis os campos não documentados.
Experimentos de mudança de conteúdo
Crie um registro de intervenção antes de avaliar uma edição:
- hipótese;
- URLs afetadas e de controle;
- IDs de prompt;
- horário da implantação;
- horário observado da nova busca;
- métrica esperada;
- janelas anterior e posterior.
Um resultado não controlado de antes e depois é direcional. Um painel de controle compatível permite uma visão de diferença-em-diferenças, mas continua sendo observacional, a menos que a atribuição e as condições externas justifiquem uma linguagem causal mais forte.
Exija que o achado persista em execuções repetidas antes de convertê-lo em recomendação de conteúdo. A recomendação deve apontar de volta para as observações que a originaram.
Monitoramento de fatos e contradições
Mantenha um ledger de fatos revisado por humanos com entidade, predicado, valor esperado, variantes aceitáveis, fonte primária, datas de validade, sensibilidade e última verificação humana. Compare as afirmações observadas nas respostas com esse ledger.
Quando os modelos discordarem, informe conflito observado. Não declare um vencedor até que os valores sejam verificados contra evidências atuais. Fatos de preço, legais, médicos, financeiros e de segurança merecem janelas de verificação mais curtas e gates de revisão mais fortes.
Evidência de crawlers
Os controles de crawlers diferem conforme a finalidade da solicitação. OpenAI, Anthropic e Perplexity documentam papéis separados para desenvolvimento de modelos, pesquisa/indexação ou busca direcionada pelo usuário. Verifique a identidade usando uma lista de IP publicada pelo operador, DNS reverso documentado ou outro mecanismo oficial quando disponível; uma string de user agent sozinha não prova identidade.
- Documentação de crawlers da OpenAI
- Documentação de crawlers da Anthropic
- Documentação de crawlers da Perplexity
Mesmo uma solicitação verificada prova apenas aquela solicitação. Não a transforme em evidência de uso na resposta, citação, tráfego ou conversão. A documentação de bots da OpenAI, a orientação de crawlers da Anthropic e a documentação de crawlers da Perplexity descrevem limites específicos de identidade e acesso de cada provedor.
Antipadrões
- Uma pontuação universal que esconde a discordância entre superfícies.
- Uma única execução de prompt rotulada como share of voice.
- Tratar evidência indisponível como zero.
- Comparar a saída de uma API com um produto para consumidores como se fossem idênticos.
- Chamar citações de “posição”.
- Chamar uma citação 404 de alucinação antes de verificar redirecionamentos e migrações.
- Reescrever prompts, observações ou correções históricas.
- Aplicar uma mudança de classificador retroativamente sem preservar sua versão.
- Afirmar que uma edição de conteúdo causou um aumento sem um experimento apropriado.
- Recomendar
llms.txt, marcação especial para IA ou pequenos trechos como requisitos universais do Google. A orientação atual do Google diz que eles não são necessários para seus recursos de pesquisa generativa. Orientação oficial
Registro de alterações
Atualizado em 8 de ago. de 2026.
Resumo editorial e detalhes registrados da alteração.Detalhes da alteração
-
As notas detalhadas sobre as alterações estão disponíveis atualmente em inglês.
Não é possível fazer a comparação completa — nenhum instantâneo anterior foi arquivado para esta revisão.
Atualizado em 4 de ago. de 2026.
Resumo editorial e detalhes registrados da alteração.Detalhes da alteração
-
As notas detalhadas sobre as alterações estão disponíveis atualmente em inglês.
Não é possível fazer a comparação completa — nenhum instantâneo anterior foi arquivado para esta revisão.
Atualizado em 2 de ago. de 2026.
Resumo editorial e detalhes registrados da alteração.Detalhes da alteração
-
As notas detalhadas sobre as alterações estão disponíveis atualmente em inglês.
Não é possível fazer a comparação completa — nenhum instantâneo anterior foi arquivado para esta revisão.