Metodología para medir la búsqueda con IA

Una metodología práctica para registrar prompts, respuestas, citas, pasajes, modelos, correcciones y cambios de contenido sin convertir la ausencia o el muestreo de evidencia en una falsa certeza.

Publicado por primera vez: 28 jul 2026 · Última actualización: 6 ago 2026 · Avanzado
Idiomas
1 señal de evidencia en esta página

Guarda cada respuesta de IA como una observación versionada: prompt exacto, superficie, modelo, modo de recuperación, locale, fecha, grupo de muestra, evidencia de la respuesta, citas, pasajes y método de extracción. Cuenta solo las ejecuciones evaluadas que cumplen los requisitos, mantén separados recuperado, mencionado, citado y clicado, repite los prompts compatibles, conserva las correcciones humanas y trata los cambios de contenido sin control como direccionales, no causales.

TL;DR — Usa un contrato de observación de solo adición y un registro de prompts versionado. Compara únicamente paneles compatibles por prompt, superficie, recuperación, locale y método. Informa los resultados binarios con N y un intervalo de incertidumbre. Conserva la evidencia sin procesar por separado de los clasificadores derivados y las correcciones humanas. El Marco de gestión de riesgos de IA de NIST ofrece un marco de gobernanza complementario para ese registro. Evalúa las intervenciones con controles cuando sea posible, pero considera direccionales incluso los resultados observacionales controlados.

El sobre de observación

La observación canónica debe contener cuatro capas:

Adquisición

Registra explícitamente el tipo de fuente:

  • producto de consumo;
  • API del modelo del propio proveedor;
  • API del propio proveedor con búsqueda web;
  • proveedor externo;
  • informe oficial para webmasters;
  • registro de servidor verificado;
  • carga del usuario.

Una llamada a una API del propio proveedor con búsqueda es evidencia útil sobre la ejecución de esa API. No es una medición directa de un producto de consumo con un nombre parecido. Conserva ese límite en el almacenamiento, las etiquetas de la interfaz, las exportaciones y las agregaciones.

Contexto experimental

Guarda un ID de prompt estable, una versión de prompt inmutable, el hash del prompt, la superficie, el modo de recuperación, el locale, el país, el dispositivo, el estado de la cuenta, el grupo de muestra y el ordinal de la muestra. Usa un panel de referencia congelado para las tendencias y otro panel exploratorio para descubrir nuevos patrones de prompts.

Cuando cambie un prompt, crea una versión nueva. No edites las observaciones históricas para que parezcan compatibles.

Evidencia

Conserva la evidencia de la respuesta en bruto o hasheada, las URL citadas y recuperadas normalizadas, los tramos de menciones, las posiciones de las citas cuando se expongan, las consultas de fundamentación cuando se expongan y los pasajes de respaldo o sus hashes. Normaliza los parámetros de seguimiento y los fragmentos de URL sin descartar la URL original.

Para las citas, un registro de fuente útil contiene:

raw URL → normalized URL → observed canonical or redirect successor
        → answer citation position → supporting passage → observed HTTP status

Esa línea de procedencia evita que las redirecciones, los parámetros, las copias sindicadas y las migraciones inflen los recuentos de fuentes. La orientación de Google sobre canonicalización describe las señales relacionadas de consolidación de URL y sus límites.

Interpretación

Cada mención, sentimiento, entidad, hecho y motivo de pérdida extraído debe incluir:

  • la versión del clasificador o extractor;
  • el estado observado, derivado, inferido o no evaluado;
  • la confianza y su motivo;
  • cualquier corrección humana posterior.

Una corrección no elimina la clasificación original. Se convierte en un caso de calibración para evaluar la siguiente versión del clasificador.

Comparaciones compatibles

Antes de calcular una tendencia, exige valores compatibles para:

  • ID y versión del prompt;
  • superficie;
  • modo de recuperación;
  • locale;
  • versiones de metodología y extractor.

Anota el cambio de modelo resuelto o de checkpoint, o divide la serie cuando ocurra. De lo contrario, una actualización del proveedor puede parecer un cambio de rendimiento del contenido.

Para un resultado binario, informa el numerador, el denominador elegible, la estimación puntual y un intervalo de incertidumbre. Excluye del denominador las negativas, los fallos del proveedor y la evidencia no disponible, pero sigue mostrando sus recuentos en la calidad de la ejecución.

Ejemplos de plataformas públicas

Estos son ejemplos de por qué importan los contratos específicos de cada fuente, no una petición para forzar las plataformas a compartir una clasificación:

  • La descripción pública de Google de su informe de IA generativa de Search Console enumera impresiones, páginas, países, dispositivos y fechas. Guárdalos como campos de visibilidad documentados; no los transformes en citas ni en posición de respuesta. El informe se anunció como un despliegue limitado en junio de 2026. Anuncio oficial
  • La descripción pública de Microsoft sobre el rendimiento de IA en Bing Webmaster Tools incluye actividad de citas, páginas citadas y consultas de fundamentación muestreadas. Microsoft dice explícitamente que esas citas no indican colocación, autoridad, posición ni el papel de una página en una respuesta. Anuncio oficial

El adaptador de cada fuente debe conservar esos significados y marcar como no disponibles los campos no documentados.

Experimentos de cambios de contenido

Crea un registro de intervención antes de juzgar una edición:

  • hipótesis;
  • URL afectadas y URL de control;
  • IDs de prompt;
  • hora del despliegue;
  • hora de rastreo observada;
  • métrica esperada;
  • ventanas anterior y posterior.

Un resultado no controlado de antes y después es direccional. Un panel de control compatible permite una perspectiva de diferencias en diferencias, pero sigue siendo observacional salvo que la asignación y las condiciones externas justifiquen un lenguaje causal más contundente.

Exige que el hallazgo persista en ejecuciones repetidas antes de convertirlo en una recomendación de contenido. La recomendación debe enlazar con las observaciones que la generaron.

Supervisión de hechos y contradicciones

Mantén un registro de hechos revisado por humanos con entidad, predicado, valor esperado, variantes aceptables, fuente primaria, fechas de validez, sensibilidad y última verificación humana. Compara las afirmaciones observadas en las respuestas con ese registro.

Cuando los modelos no coincidan, informa conflicto observado. No declares un ganador hasta contrastar los valores con la evidencia actual. Los hechos sobre precios, asuntos legales, medicina, finanzas y seguridad merecen ventanas de verificación más cortas y controles de revisión más estrictos.

Evidencia de rastreadores

Los controles de rastreo difieren según la finalidad de la solicitud. OpenAI, Anthropic y Perplexity documentan funciones separadas para el desarrollo de modelos, la búsqueda o indexación y la obtención dirigida por el usuario. Verifica la identidad mediante una lista de IP publicada por el operador, DNS inverso documentado u otro mecanismo oficial cuando esté disponible; la cadena user-agent por sí sola no demuestra la identidad.

Incluso una solicitud verificada solo demuestra esa solicitud. No la conviertas en evidencia de uso en una respuesta, cita, tráfico o conversión. La documentación de bots de OpenAI, la orientación de rastreadores de Anthropic y la documentación de rastreadores de Perplexity describen los límites de identidad y acceso específicos de cada proveedor.

Antipatrones

  • Una puntuación universal que oculta el desacuerdo entre superficies.
  • Una sola ejecución de un prompt presentada como cuota de voz.
  • Tratar la evidencia no disponible como cero.
  • Comparar la salida de una API con un producto de consumo como si fueran idénticos.
  • Llamar «posición» a las citas.
  • Llamar alucinación a una cita de 404 antes de comprobar las redirecciones y las migraciones.
  • Reescribir prompts, observaciones o correcciones históricas.
  • Aplicar retroactivamente un cambio de clasificador sin conservar su versión.
  • Afirmar que una edición de contenido causó un aumento sin un experimento adecuado.
  • Recomendar llms.txt, marcado especial para IA o fragmentos diminutos como requisitos universales de Google. La orientación actual de Google dice que no son necesarios para sus funciones de búsqueda generativa.

Add an expert note

Pin an expert quote

New person? Create their unclaimed profile at /admin/experts/ → Pin a quote first.