Metodologia de medição da pesquisa com IA

Uma metodologia prática para registrar prompts, respostas, citações, trechos, modelos, correções e mudanças de conteúdo sem transformar evidência ausente ou amostrada em falsa certeza.

Publicado pela primeira vez: 28 de jul. de 2026 · Última atualização: 8 de ago. de 2026 · Avançado
Idiomas
1 sinal de evidência nesta página

Armazene cada resposta de IA como uma observação versionada: prompt exato, superfície, modelo, modo de recuperação, locale, data, grupo da amostra, evidência da resposta, citações, trechos e método de extração. Conte apenas execuções avaliadas e elegíveis, mantenha recuperação, menção, citação e clique separados, repita prompts compatíveis, preserve correções humanas e trate mudanças de conteúdo não controladas como direcionais, não causais.

TL;DR — Use um contrato de observação somente para anexação e um registro versionado de prompts. Compare apenas painéis compatíveis de prompt/superfície/recuperação/locale/método. Relate resultados binários com N e um intervalo de incerteza. Preserve a evidência bruta separadamente dos classificadores derivados e das correções humanas. O NIST AI Risk Management Framework oferece uma estrutura complementar de governança para esse registro. Avalie intervenções com controles quando possível, mas mantenha direcionais até os resultados observacionais controlados.

O envelope da observação

A observação canônica deve conter quatro camadas:

Aquisição

Registre explicitamente o tipo de fonte:

  • produto para consumidores;
  • API de modelo de primeira parte;
  • API de primeira parte com pesquisa na web;
  • provedor de terceiros;
  • relatório oficial para webmasters;
  • log de servidor verificado;
  • upload do usuário.

Uma chamada de API de primeira parte com pesquisa é uma evidência útil sobre aquela execução da API. Ela não é uma medição direta de um produto para consumidores com nome semelhante. Preserve esse limite no armazenamento, nos rótulos da interface, nas exportações e nas agregações.

Contexto experimental

Armazene um ID de prompt estável, uma versão imutável do prompt, o hash do prompt, a superfície, o modo de recuperação, o locale, o país, o dispositivo, o estado da conta, o grupo da amostra e o ordinal da amostra. Use um painel de benchmark congelado para tendências e um painel exploratório separado para descobrir novos padrões de prompt.

Quando um prompt mudar, crie uma nova versão. Não edite observações históricas para fazê-las parecer compatíveis.

Evidência

Mantenha a evidência bruta ou com hash da resposta, as URLs citadas e recuperadas normalizadas, os trechos de menção, as posições das citações quando expostas, as consultas de fundamentação quando expostas e os trechos de suporte ou seus hashes. Normalize parâmetros de rastreamento e fragmentos de URL sem descartar a URL original.

Para citações, um registro de origem útil contém:

raw URL → normalized URL → observed canonical or redirect successor
        → answer citation position → supporting passage → observed HTTP status

Essa linhagem impede que redirecionamentos, parâmetros, cópias sindicadas e migrações aumentem artificialmente a contagem de fontes. A orientação do Google sobre canonicalização descreve os sinais relacionados à consolidação de URLs e seus limites.

Interpretação

Toda menção, sentimento, entidade, fato e motivo de perda extraído deve incluir:

  • a versão do classificador ou extrator;
  • estado observado, derivado, inferido ou não avaliado;
  • confiança e seu motivo;
  • qualquer correção humana posterior.

Uma correção não apaga a classificação original. Ela se torna um caso de calibração para avaliar a próxima versão do classificador.

Comparações compatíveis

Antes de calcular uma tendência, exija valores compatíveis para:

  • ID e versão do prompt;
  • superfície;
  • modo de recuperação;
  • locale;
  • versões da metodologia e do extrator.

Anote ou interrompa a série quando o modelo resolvido ou o checkpoint mudar. Caso contrário, uma atualização do provedor pode parecer uma mudança no desempenho do conteúdo.

Para um resultado binário, informe o numerador, o denominador elegível, a estimativa pontual e um intervalo de incerteza. Exclua recusas, falhas do provedor e evidências indisponíveis do denominador, mas continue exibindo suas contagens na qualidade da execução.

Exemplos de plataformas públicas

Estes são exemplos de por que contratos específicos por fonte importam, não um pedido para forçar as plataformas a uma classificação compartilhada:

  • A descrição pública do relatório de IA generativa do Search Console do Google lista impressões, páginas, países, dispositivos e datas. Armazene esses itens como campos de visibilidade documentados; não os transforme em citações ou posição na resposta. O relatório foi anunciado como uma implementação limitada em junho de 2026. Anúncio oficial
  • A descrição pública do Bing Webmaster Tools AI Performance da Microsoft inclui atividade de citações, páginas citadas e consultas de fundamentação amostradas. A Microsoft afirma explicitamente que essas citações não indicam posicionamento, autoridade, classificação nem o papel de uma página em uma resposta. Anúncio oficial

O adaptador de cada fonte deve manter esses significados e marcar como indisponíveis os campos não documentados.

Experimentos de mudança de conteúdo

Crie um registro de intervenção antes de avaliar uma edição:

  • hipótese;
  • URLs afetadas e de controle;
  • IDs de prompt;
  • horário da implantação;
  • horário observado da nova busca;
  • métrica esperada;
  • janelas anterior e posterior.

Um resultado não controlado de antes e depois é direcional. Um painel de controle compatível permite uma visão de diferença-em-diferenças, mas continua sendo observacional, a menos que a atribuição e as condições externas justifiquem uma linguagem causal mais forte.

Exija que o achado persista em execuções repetidas antes de convertê-lo em recomendação de conteúdo. A recomendação deve apontar de volta para as observações que a originaram.

Monitoramento de fatos e contradições

Mantenha um ledger de fatos revisado por humanos com entidade, predicado, valor esperado, variantes aceitáveis, fonte primária, datas de validade, sensibilidade e última verificação humana. Compare as afirmações observadas nas respostas com esse ledger.

Quando os modelos discordarem, informe conflito observado. Não declare um vencedor até que os valores sejam verificados contra evidências atuais. Fatos de preço, legais, médicos, financeiros e de segurança merecem janelas de verificação mais curtas e gates de revisão mais fortes.

Evidência de crawlers

Os controles de crawlers diferem conforme a finalidade da solicitação. OpenAI, Anthropic e Perplexity documentam papéis separados para desenvolvimento de modelos, pesquisa/indexação ou busca direcionada pelo usuário. Verifique a identidade usando uma lista de IP publicada pelo operador, DNS reverso documentado ou outro mecanismo oficial quando disponível; uma string de user agent sozinha não prova identidade.

Mesmo uma solicitação verificada prova apenas aquela solicitação. Não a transforme em evidência de uso na resposta, citação, tráfego ou conversão. A documentação de bots da OpenAI, a orientação de crawlers da Anthropic e a documentação de crawlers da Perplexity descrevem limites específicos de identidade e acesso de cada provedor.

Antipadrões

  • Uma pontuação universal que esconde a discordância entre superfícies.
  • Uma única execução de prompt rotulada como share of voice.
  • Tratar evidência indisponível como zero.
  • Comparar a saída de uma API com um produto para consumidores como se fossem idênticos.
  • Chamar citações de “posição”.
  • Chamar uma citação 404 de alucinação antes de verificar redirecionamentos e migrações.
  • Reescrever prompts, observações ou correções históricas.
  • Aplicar uma mudança de classificador retroativamente sem preservar sua versão.
  • Afirmar que uma edição de conteúdo causou um aumento sem um experimento apropriado.
  • Recomendar llms.txt, marcação especial para IA ou pequenos trechos como requisitos universais do Google. A orientação atual do Google diz que eles não são necessários para seus recursos de pesquisa generativa. Orientação oficial

Add an expert note

Pin an expert quote

New person? Create their unclaimed profile at /admin/experts/ → Pin a quote first.