Generación Aumentada por Recuperación (RAG)
Cómo funciona RAG: el patrón de recuperar y luego generar detrás de Google AI Overviews, ChatGPT Search y Perplexity, y qué significa para que tu contenido sea citado.
Idiomas
RAG (Generación Aumentada por Recuperación) es el patrón de recuperar y luego generar detrás de la búsqueda con IA. Ejecuta dos fases en el momento de la consulta: recuperación (encontrar pasajes relevantes de un índice externo) y generación aumentada (alimentar esos pasajes a un LLM para escribir una respuesta fundamentada y citada), sin cambiar nunca los pesos del modelo. Así es como las respuestas de IA cubren información más allá del corte de entrenamiento del modelo. La fase de recuperación encadena fragmentación → incrustaciones → búsqueda vectorial → reordenamiento → pasajes top-k. RAG reduce las alucinaciones pero no las elimina, y un contexto recuperado insuficiente puede empeorarlas. Para el SEO no hay un índice de IA separado: ser rastreable, indexado y estructurado en pasajes claros y autocontenidos es el requisito previo para ser recuperado y citado.
La arquitectura original de RAG combinaba un modelo de lenguaje con información recuperada de un índice externo durante la generación. Evidence for this claim The original RAG paper combined a pretrained sequence-to-sequence model with a non-parametric dense-vector index retrieved during generation. Scope: Lewis et al.'s 2020 RAG architecture and experiments, not every modern retrieval system. Confidence: high · Verified: Lewis et al.: Retrieval-Augmented Generation La documentación moderna de plataformas utiliza la misma idea general de recuperar y luego generar. Evidence for this claim Google Cloud describes RAG as retrieving relevant information from external knowledge sources and providing it to a model to improve generated responses. Scope: General RAG architecture in Google Cloud documentation; quality depends on retrieval, source quality, and generation. Confidence: high · Verified: Google Cloud: RAG overview
TL;DR — RAG (Generación Aumentada por Recuperación) es cómo los motores de búsqueda de IA consultan información antes de responder. En lugar de responder puramente desde la memoria, el sistema primero recupera pasajes relevantes de un índice de búsqueda, y luego genera una respuesta basada en lo que encontró. Por eso Google AI Overviews, ChatGPT Search, y Perplexity pueden citar páginas web recientes — y por eso seguir en el índice sigue importando.
Qué es RAG
Un modelo de lenguaje grande (un LLM, lo que está detrás de ChatGPT y herramientas similares) aprende de una enorme cantidad de texto durante el entrenamiento. Pero ese entrenamiento tiene una fecha de corte, y el modelo no puede memorizarlo todo — así que por sí solo o no conoce hechos recientes o especializados, o inventa algo que suena correcto.
RAG soluciona eso permitiendo que el modelo consulte información. Cuando haces una pregunta, un sistema RAG hace dos cosas en orden:
- Recuperación — busca en un índice (como el de Google o Bing) y trae de vuelta los pasajes más relevantes para tu pregunta.
- Generación aumentada — entrega esos pasajes al LLM, que escribe una respuesta basada en ellos y normalmente muestra enlaces a las fuentes.
La forma más sencilla de imaginarlo: en lugar de responder solo desde la memoria, la IA hace su tarea primero.
Un ejemplo rápido
Pregunta a un motor de búsqueda de IA “¿qué cambió en el último iPhone?”. El modelo no fue entrenado con un producto que se lanzó la semana pasada. Con RAG, busca en la web, recupera algunos artículos recientes y escribe su respuesta a partir de ellos — con citas en las que puedes hacer clic. Sin RAG, diría que no lo sabe o adivinaría.
Por qué te importa
Aquí está la parte que sorprende a la gente: RAG no usa un “índice de IA” separado. Google AI Overviews recupera del índice de búsqueda normal de Google. ChatGPT Search se lanzó con el índice de Bing y también ejecuta su propio rastreador (OAI-SearchBot) — OpenAI no ha dicho exactamente cómo se combinan ambos hoy. De cualquier manera, los mismos fundamentos que siempre han importado — ser rastreable, estar indexado, escribir con claridad — son exactamente lo que decide si tu contenido puede ser recuperado y citado en una respuesta de IA.
La otra cosa que debes saber: RAG reduce las respuestas incorrectas (alucinaciones) pero no las elimina. La IA aún puede malinterpretar lo que recuperó. Así que ser la fuente más clara y directa sobre un tema realmente ayuda.
¿Quieres la mecánica real — embeddings, fragmentación, reordenamiento, RAG ingenuo vs. agéntico, y el manual de SEO? Cambia a la pestaña Avanzado.
El sistema de 2020 de Lewis y sus colegas combinó la generación de secuencias con la recuperación densa de un índice no paramétrico. Evidence for this claim The original RAG paper combined a pretrained sequence-to-sequence model with a non-parametric dense-vector index retrieved during generation. Scope: Lewis et al.'s 2020 RAG architecture and experiments, not every modern retrieval system. Confidence: high · Verified: Lewis et al.: Retrieval-Augmented Generation La descripción general actual de Google Cloud define RAG de manera más amplia como el suministro de conocimiento externo recuperado a un modelo. Evidence for this claim Google Cloud describes RAG as retrieving relevant information from external knowledge sources and providing it to a model to improve generated responses. Scope: General RAG architecture in Google Cloud documentation; quality depends on retrieval, source quality, and generation. Confidence: high · Verified: Google Cloud: RAG overview
TL;DR — RAG es un patrón de dos fases en tiempo de inferencia: recuperación (encontrar pasajes relevantes en un corpus externo) y luego generación aumentada (alimentar esos pasajes a un LLM para producir una respuesta fundamentada y citada). Los pesos nunca cambian — combina la memoria paramétrica del modelo con la memoria no paramétrica recuperada en vivo. La fase de recuperación encadena fragmentación → embeddings → búsqueda vectorial → reordenamiento → top-k. El RAG “ingenuo” es recuperar y luego generar; el RAG avanzado añade reescritura de consultas y reordenamiento; el RAG agéntico añade recuperación iterativa de múltiples saltos. La recuperación puede fundamentar respuestas pero no garantiza la corrección; en una evaluación de Gemma, el contexto insuficiente coincidió con más respuestas incorrectas. Para SEO: no hay un índice de IA separado; la rastreabilidad, la indexación y la claridad a nivel de pasaje son los requisitos previos para ser recuperado.
Las dos fases (y por qué “tiempo de inferencia” es el punto clave)
Five stages run left to right at inference time. Chunking splits documents into retrievable passages. Embeddings represent each passage as a dense vector. Vector search retrieves candidates and some systems combine it with BM25 keyword search. Re-ranking re-scores and narrows the candidate set. The top surviving passages enter the model context. The model's weights do not change.
© Patrick Stox LLC · CC BY 4.0 ·
Two sources feed one generation step. Parametric memory is knowledge encoded in the model weights during training and is limited by the training data and cutoff. Non-parametric memory consists of passages retrieved from an external index at query time. Generation uses both while the weights remain unchanged, producing an answer that can be grounded in and cite the retrieved sources; this does not guarantee correctness.
© Patrick Stox LLC · CC BY 4.0 ·
Desglosa el acrónimo y tienes el modelo: Recuperación más Generación Aumentada. Llega una consulta; el sistema recupera los pasajes más relevantes de un corpus externo; inyecta esos pasajes en la ventana de contexto del LLM; el LLM genera una respuesta fundamentada en ellos.
El detalle que todos entienden mal: esto ocurre en el momento de la inferencia, y los pesos del modelo nunca se tocan. RAG no es entrenamiento ni ajuste fino. El artículo original de 2020 de Patrick Lewis y sus colegas de Facebook AI Research lo enmarcó como la combinación de dos tipos de memoria — memoria paramétrica (conocimiento incorporado en los pesos durante el entrenamiento) y memoria no paramétrica (conocimiento recuperado en vivo de un índice). RAG usa ambas a la vez. AWS expone el caso práctico con claridad: volver a entrenar un modelo fundacional para conocimiento nuevo o específico de un dominio es costoso, y “RAG es un enfoque más rentable para introducir nuevos datos al LLM.”
(El nombre, para lo que vale, fue un accidente. Lewis admitió más tarde: “Definitivamente habríamos pensado más en el nombre si hubiéramos sabido que nuestro trabajo se volvería tan extendido… Siempre planeamos tener un nombre que sonara mejor, pero cuando llegó el momento de escribir el artículo, nadie tuvo una mejor idea.”)
Dentro de la fase de recuperación
“Recuperar los pasajes relevantes” está haciendo mucho trabajo en esa frase. En un sistema real es un pipeline:
- Fragmentación. Los documentos se dividen en piezas recuperables. El tamaño del fragmento es un verdadero equilibrio: demasiado pequeño y un pasaje pierde su contexto; demasiado grande y inunda el presupuesto de tokens con irrelevancia. Las estrategias van desde recuentos fijos de tokens (100/256/512) hasta ventanas recursivas/deslizantes o “Small2Big” (recuperar una oración pequeña, devolver su fragmento padre para la generación).
- Embeddings. Cada fragmento se convierte en un vector denso — una representación numérica de su significado — para que la similitud se calcule semánticamente, no por coincidencia de palabras clave. Por eso el contenido sobre un tema se recupera incluso cuando no usa la redacción exacta de la consulta.
- Búsqueda vectorial. La consulta también se incrusta, y el sistema encuentra los fragmentos cuyos vectores están más cerca de ella. La mayoría de las pilas de producción ejecutan búsqueda híbrida — recuperación por vector denso más búsqueda por palabras clave BM25 — porque cada una capta recuperaciones que la otra pierde.
- Reordenamiento. Un modelo separado vuelve a puntuar los candidatos según su relevancia para la consulta y los reordena, “reduciendo efectivamente el conjunto general de documentos.” Solo los mejores supervivientes llegan al contexto.
- Top-k en el prompt. Los mejores pasajes se concatenan con la consulta del usuario y se entregan al generador.
La fragmentación es el eslabón frágil. Anthropic identificó que “las soluciones RAG tradicionales eliminan el contexto al codificar la información” — un fragmento extraído de su documento pierde el contexto circundante que lo hacía significativo. Su técnica de Recuperación Contextual (anteponer contexto específico del fragmento antes de la indexación) redujo las recuperaciones fallidas en un 49%, y en un 67% combinada con reordenamiento. Esa es una señal fuerte de que el problema de la fragmentación es real — y de que los pasajes autocontenidos y ricos en contexto son más fáciles de recuperar correctamente.
RAG ingenuo, avanzado y agéntico
La literatura de encuestas (Gao et al., 2023) divide RAG en una taxonomía útil:
- RAG ingenuo — “un proceso tradicional que incluye indexación, recuperación y generación.” Recupera top-k una vez, genera una vez. “Tiene dificultades con la precisión y el recall, lo que lleva a la selección de fragmentos desalineados o irrelevantes.”
- RAG avanzado — añade “estrategias de pre-recuperación y post-recuperación.” Pre-recuperación: reescritura de consultas y mejor indexación (incluyendo HyDE, donde el modelo genera una respuesta hipotética, incrusta eso, y recupera documentos que parecen respuestas en lugar de preguntas). Post-recuperación: re-ranking y compresión de contexto.
- RAG modular / agéntico — el modelo recupera, razona sobre lo que aún falta, y recupera de nuevo, iterando a través de múltiples saltos. Este es el estado actual de la búsqueda con IA. Como dijo Michael King: “El patrón de recuperar-una-vez-y-luego- generar que definió la primera ola está obsoleto… El RAG agéntico es ahora el estándar.”
Esto importa para el SEO porque el contenido ahora tiene que sobrevivir a múltiples rondas de recuperación y verificación de contradicciones — no solo a una única pasada de recuperación.
¿El RAG elimina las alucinaciones? No.
Two bars report Gemma's incorrect-answer rate in one Google Research evaluation. With no context, the rate is 10.2 percent. With insufficient context, the rate is 66.1 percent. The comparison comes from Google Research's ICLR 2025 sufficient-context study and should not be generalized to every model, dataset, or retrieval system.
El RAG puede fundamentar respuestas en fuentes recuperadas, pero el LLM aún puede malinterpretar o sobreinterpretar lo que ha extraído. Google Research (ICLR 2025) documentó un resultado contraintuitivo en una evaluación: Gemma produjo respuestas incorrectas en el 10,2 % de las preguntas sin contexto y el 66,1 % con contexto insuficiente. Los investigadores informan que los modelos pueden “sobresalir con contexto suficiente pero no reconocer cuando el contexto es insuficiente.” Trata esto como una advertencia específica del modelo y de la evaluación, no como prueba de que la recuperación causa universalmente peores respuestas. La lección práctica es más limitada: la calidad de la recuperación y la suficiencia del contexto necesitan ser evaluadas en lugar de asumidas. Google operacionalizó el hallazgo como un re-ranker de LLM en su Vertex AI RAG Engine.
RAG frente al ajuste fino
Estos se confunden constantemente, y son fundamentalmente diferentes:
- RAG recupera información externa en el momento de la consulta. Los pesos no cambian. Mejor para información nueva/cambiante, requisitos de citación y costo. El estudio encontró que “RAG supera consistentemente al [fine-tuning no supervisado], tanto para conocimiento existente encontrado durante el entrenamiento como para conocimiento completamente nuevo.”
- Fine-tuning modifica los pesos del modelo en una ejecución de entrenamiento separada. Mejor para cambiar estilo y comportamiento, o enseñar conocimiento de dominio estable que no cambia.
Usarías RAG para hacer que un modelo conozca los últimos hechos; usarías fine-tuning para cambiar cómo habla.
RAG en la práctica: Google, ChatGPT, Perplexity
- Resúmenes de IA de Google. Google llama a RAG “a technique (also known as grounding)… relying on our core Search ranking systems to retrieve relevant, up-to-date web pages from our Search index.” (traducción) «una técnica —también conocida como fundamentación— que se apoya en nuestros sistemas principales de posicionamiento de la Búsqueda para recuperar páginas web pertinentes y actualizadas de nuestro índice de Búsqueda». De esto se derivan dos cosas. Primero, no existe un índice de IA separado — “our generative AI features on Google Search are rooted in our core Search ranking and quality systems.” (traducción) «nuestras funciones de IA generativa en la Búsqueda de Google se basan en nuestros sistemas principales de posicionamiento y calidad de la Búsqueda». Segundo, Google ejecuta expansión de consultas: “concurrent, related queries generated by the model to request more information.” (traducción) «consultas simultáneas y relacionadas generadas por el modelo para solicitar más información». Una sola pregunta puede generar múltiples subconsultas, cada una recuperando contenido diferente — por lo que tu contenido tiene que satisfacer las subpreguntas implícitas, no solo la consulta principal.
- Búsqueda de ChatGPT. Lanzada (octubre de 2024) con Bing como su socio de datos, y la documentación del propio rastreador de OpenAI confirma que OAI-SearchBot realiza búsqueda e indexación independientes para citas de búsqueda, separadas del rastreo de entrenamiento de GPTBot. OpenAI no ha publicado la combinación de recuperación actual entre Bing y su propio índice, y desde entonces OpenAI ha posicionado la Búsqueda de ChatGPT como un competidor independiente de Bing en lugar de un envoltorio alrededor de él — así que trata “es básicamente Bing” como una simplificación. La palanca documentada y accionable es más estrecha y más duradera: no bloquees OAI-SearchBot en robots.txt, porque ese es el rastreador que OpenAI mismo nombra como el que indexa contenido para citas de búsqueda.
- Perplexity. Construido sobre recuperación híbrida (Vespa.ai — BM25 + densa) con modelos de incrustación personalizados y un umbral estricto de re-clasificación: según análisis de terceros, solo el ~30 % superior de más de 60 fuentes recuperadas sobrevive a la etapa de generación, y “las citas no se añaden retroactivamente después de la generación — se asignan estructuralmente durante el ensamblaje del contexto.” Deep Research ejecuta el bucle agéntico a través de docenas de búsquedas.
Qué significa RAG para el SEO
Quita la jerga y el manual es concreto:
- Estar en el índice es el requisito previo — punto final. Sin un índice de IA separado, la cadena de rastreo → indexación → recuperación tiene que estar intacta. Si una página no puede ser rastreada e indexada, no puede ser recuperada en una respuesta de IA. Lo mismo es cierto para los motores de IA que construyen sus propios grupos: rastreadores de IA como OAI-SearchBot y PerplexityBot tienen que tener permiso para acceder a ti, o eres invisible para esas respuestas.
- Escribe pasajes autocontenidos. RAG recupera fragmentos, no páginas completas. Como dijo Francine Monahan de iPullRank, los sistemas de IA examinan “fragmentos de páginas en lugar de la página como un todo” — así que crea “pasajes y frases destacados” que respondan a una pregunta específica por sí mismos. Esto es exactamente la estructura de H2/H3 y las oraciones temáticas claras que el buen SEO ya recompensa. Google dice explícitamente que no cortes tu contenido en pedazos pequeños para la IA — el contenido bien estructurado se divide bien por sí solo.
- Cubre los subtemas. La expansión de consultas significa que una pregunta puede desencadenar muchas recuperaciones. La profundidad en subpreguntas relacionadas supera a una página rellena alrededor de una sola palabra clave.
- La autoridad impulsa la citación más que la posición en el ranking. De un análisis de 8 000 citas: “Una fuerte presencia orgánica en búsqueda y una amplia visibilidad web lleva a citas de IA, no al revés” — y “contenido altamente autoritativo de una página de menor ranking” a veces se cita sobre uno menos creíble en el primer puesto. Mis propios datos coinciden (de mi investigación de citas en Resúmenes de IA): las menciones en páginas muy enlazadas son el predictor más fuerte de inclusión en Resúmenes de IA (ρ ≈ 0,70), y las menciones web de marca correlacionaron ~0,66 en 75 000 marcas.
- El contenido fresco tiene una ventaja. Las citas de IA son significativamente más frescas que los resultados orgánicos, así que la actualidad importa.
Si quieres la versión de una frase: RAG no reemplazó al SEO — elevó las apuestas en las partes del SEO que siempre trataron de ser encontrable y ser claro.
Resumen de IA
Una versión condensada de la versión avanzada:
- RAG = Recuperación + Generación Aumentada. Dos fases en tiempo de inferencia: recuperar pasajes relevantes de un corpus externo y luego alimentarlos a un LLM para generar una respuesta fundamentada y citada. Los pesos del modelo nunca cambian — no es entrenamiento ni ajuste fino.
- Combina dos memorias: paramétrica (integrada en los pesos) + no paramétrica (recuperada en vivo). Así las respuestas de IA cubren información más allá del corte de entrenamiento.
- La recuperación es un pipeline: fragmentación → embeddings → búsqueda vectorial (a menudo híbrida con BM25) → reordenamiento → pasajes top-k en el prompt. La fragmentación es el eslabón frágil; los pasajes con contexto rico se recuperan mejor (Anthropic redujo las recuperaciones fallidas en 49 %).
- Tres variantes: ingenua (recuperar una vez), avanzada (reescritura de consultas, HyDE, reordenamiento) y agéntica (multi-salto iterativo) — la agéntica es ahora el estándar de búsqueda con IA.
- Reduce, no elimina, las alucinaciones. Con contexto insuficiente, la tasa de alucinación de un modelo saltó de 10,2 % a 66,1 % — una mala recuperación puede ser peor que ninguna.
- RAG vs. ajuste fino: RAG para hechos nuevos/cambiantes + citas + costo; ajuste fino para estilo/comportamiento y conocimiento estable.
- Motores: los Resúmenes de IA de Google recuperan del índice principal (sin índice de IA separado) con expansión de consultas; ChatGPT Search se lanzó sobre el índice de Bing y también ejecuta su propio rastreador, OAI-SearchBot — la combinación exacta actual no está publicada, así que no bloquees OAI-SearchBot; Perplexity mediante recuperación híbrida con un umbral estricto de reordenamiento y citas asignadas durante el ensamblaje del contexto.
- SEO: ser rastreable + indexado es el requisito previo; escribe pasajes autocontenidos; cubre subtemas (expansión); la autoridad/E-E-A-T impulsa las citas más que la posición en el ranking; el contenido fresco tiene ventaja.
Documentación oficial
Documentación y definiciones de fuentes primarias de los proveedores.
- Guía de Google para optimizar para funciones de IA generativa — define RAG como fundamentación sobre el índice principal de Búsqueda; cubre la expansión de consultas.
- Resúmenes de IA y Modo IA en la Búsqueda — confirma que no hay requisitos adicionales más allá de la indexación estándar y la elegibilidad para fragmentos destacados.
- RAG y fundamentación en Vertex AI — la definición de recuperar-luego-generar de Google Cloud (Burak Gokturk).
- Perspectivas más profundas sobre RAG: el papel del contexto suficiente — Google Research (ICLR 2025) sobre el modo de fallo por contexto insuficiente.
Microsoft / Azure
- RAG e IA generativa — Azure AI Search — RAG definido como fundamentación en contenido propietario; comprensión de consultas, restricciones de tokens y el movimiento hacia la recuperación agéntica.
OpenAI
- Resumen de los rastreadores de OpenAI — confirma que OAI-SearchBot realiza búsqueda e indexación independientes para las citas de ChatGPT Search, separado del rastreo de entrenamiento de GPTBot; no revela la combinación actual con el índice de Bing.
Anthropic
- Presentamos la recuperación contextual — el problema de pérdida de contexto por fragmentos y una solución medida (49 % / 67 % menos recuperaciones fallidas).
AWS
- ¿Qué es la generación aumentada por recuperación? — explicación clara en tres etapas y el argumento de costo de RAG frente a reentrenamiento.
Documentos fundacionales
- Generación aumentada por recuperación para tareas de PNL intensivas en conocimiento — Lewis et al., NeurIPS 2020 (el artículo original de RAG; memoria paramétrica vs. no paramétrica).
- Generación aumentada por recuperación para LLM: una encuesta — Gao et al. (la taxonomía ingenua / avanzada / modular, HyDE, re-clasificación).
Citas de la fuente
Declaraciones oficiales de los proveedores y los investigadores originales. Los enlaces profundos saltan al pasaje citado cuando está disponible.
Google — RAG es fundamentación, sobre el índice principal
- “A technique (also known as grounding) used to improve the quality, accuracy, and freshness of AI responses by relying on our core Search ranking systems to retrieve relevant, up-to-date web pages from our Search index.” (traducción) «Una técnica (también conocida como fundamentación) utilizada para mejorar la calidad, precisión y frescura de las respuestas de IA al depender de nuestros sistemas principales de clasificación de Búsqueda para recuperar páginas web relevantes y actualizadas de nuestro índice de Búsqueda.» — Google Search Central, guía de optimización de IA. Ir a la cita
- “Our generative AI features on Google Search are rooted in our core Search ranking and quality systems.” (traducción) «Nuestras funciones de IA generativa en Google Search están arraigadas en nuestros sistemas principales de clasificación y calidad de Búsqueda.» — Google Search Central, guía de optimización de IA.
Google Cloud — la definición de recuperar-luego-generar
- “Retrieval Augmented Generation (RAG), a technique developed to mitigate these challenges, first ‘retrieves’ facts about a question, then provides those facts to the model before it ‘generates’ an answer – this is what we mean by grounding.” (traducción) «La generación aumentada por recuperación (RAG), una técnica desarrollada para mitigar estos desafíos, primero “recupera” hechos sobre una pregunta, luego proporciona esos hechos al modelo antes de que “genere” una respuesta: esto es lo que queremos decir con fundamentación.» — Burak Gokturk, vicepresidente y gerente general, Cloud AI, Google Cloud (27 de junio de 2024). Ir a la cita
El artículo original de RAG — memoria paramétrica vs. no paramétrica
- “retrieval-augmented generation (RAG) — models which combine pre-trained parametric and non-parametric memory for language generation.” (traducción) «generación aumentada por recuperación (RAG): modelos que combinan memoria paramétrica y no paramétrica preentrenada para la generación de lenguaje.» — Lewis et al., NeurIPS 2020.
Patrick Lewis, autor principal — sobre el nombre (vía NVIDIA Blog, Rick Merritt)
- “We definitely would have put more thought into the name had we known our work would become so widespread.” (traducción) «Definitivamente habríamos pensado más en el nombre si hubiéramos sabido que nuestro trabajo se volvería tan extendido.»
- “We always planned to have a nicer sounding name, but when it came time to write the paper, no one had a better idea.” (traducción) «Siempre planeamos tener un nombre que sonara mejor, pero cuando llegó el momento de escribir el artículo, nadie tuvo una mejor idea.» Leer la cobertura
Microsoft — RAG como fundamentación en tu contenido
- “Retrieval-augmented generation (RAG) is a pattern that extends LLM capabilities by grounding responses in your proprietary content.” (traducción) «La generación aumentada por recuperación (RAG) es un patrón que extiende las capacidades de los LLM al fundamentar las respuestas en tu contenido propietario.» — Microsoft, documentación de Azure AI Search.
Anthropic — el problema de la fragmentación
- “traditional RAG solutions remove context when encoding information.” (traducción) «las soluciones RAG tradicionales eliminan contexto al codificar información.» — Anthropic, Contextual Retrieval (19 de septiembre de 2024). Leer la publicación
AWS — RAG vs. reentrenamiento
- “Retrieval-Augmented Generation (RAG) is the process of optimizing the output of a large language model, so it references an authoritative knowledge base outside of its training data sources before generating a response.” (traducción) «La generación aumentada por recuperación (RAG) es el proceso de optimizar la salida de un modelo de lenguaje grande, para que haga referencia a una base de conocimiento autoritativa fuera de sus fuentes de datos de entrenamiento antes de generar una respuesta.» — AWS.
- “RAG is a more cost-effective approach to introducing new data to the LLM.” (traducción) «RAG es un enfoque más rentable para introducir nuevos datos al LLM.» — AWS.
OpenAI — su propio rastreador para ChatGPT Search
- “OpenAI uses OAI-SearchBot and GPTBot robots.txt tags to enable webmasters to manage how their sites and content work with AI… a webmaster can allow OAI-SearchBot in order to appear in search results while disallowing GPTBot to indicate that crawled content should not be used for training.” (traducción) «OpenAI utiliza las etiquetas robots.txt de OAI-SearchBot y GPTBot para permitir que los webmasters gestionen cómo sus sitios y contenido funcionan con IA… un webmaster puede permitir OAI-SearchBot para aparecer en los resultados de búsqueda mientras deshabilita GPTBot para indicar que el contenido rastreado no debe usarse para entrenamiento.» — OpenAI, Descripción general de los rastreadores de OpenAI. Leer la documentación
Michael King, iPullRank — el cambio agéntico (Search Engine Land)
- “The retrieve-once-then-generate pattern that defined the first wave is obsolete… Agentic RAG is now the default.” (traducción) «El patrón de recuperar-una-vez-luego-generar que definió la primera ola está obsoleto… RAG agéntico es ahora el predeterminado.» Leer la cobertura
Hoja de referencia de RAG
El proceso, de principio a fin
“query → [retrieval: chunk · embed · vector search (+BM25) · re-rank · top-k] → augment (passages into context) → generate (LLM writes grounded, cited answer)”
(traducción) Consulta → recuperación: fragmentar · crear embeddings · búsqueda vectorial (+BM25) · reordenar · elegir los mejores pasajes → aumentar el contexto con esos pasajes → generar una respuesta fundamentada y con citas.
RAG vs. ajuste fino
| RAG | Ajuste fino | |
|---|---|---|
| ¿Cambia los pesos del modelo? | No | Sí |
| Cuándo ocurre | Inferencia (tiempo de consulta) | Ejecución de entrenamiento separada |
| Mejor para | Hechos nuevos/cambiantes, citas, costo | Estilo, comportamiento, conocimiento de dominio estable |
| Actualiza el conocimiento mediante | Reindexación del corpus | Reentrenamiento |
Las tres generaciones de RAG
| Variante | Qué hace | Dónde se ve |
|---|---|---|
| Ingenua | Recupera top-k una vez, genera una vez | Chatbots tempranos, preguntas y respuestas simples |
| Avanzada | + reescritura de consultas, HyDE, reordenamiento, compresión | La mayoría de RAG en producción |
| Agéntica | Iterativa de múltiples saltos: recuperar → razonar → recuperar de nuevo | Google AI Mode, Perplexity Deep Research, ChatGPT Search |
Grupos de recuperación de motores de un vistazo
| Motor | Recupera de | Nota |
|---|---|---|
| Google AI Overviews | Índice principal de Google | Sin índice de IA separado; fan-out de consultas |
| ChatGPT Search | Índice de Bing + rastreador propio de OpenAI | No bloquees OAI-SearchBot; la mezcla exacta no se divulga |
| Perplexity | Híbrido (Vespa.ai) | Umbral de reordenamiento estricto; las citas se asignan durante el ensamblaje |
Datos rápidos
- RAG = Recuperación + Aumentada + Generación; acuñado en Lewis et al., 2020.
- Es en tiempo de inferencia — los pesos nunca cambian.
- La alucinación no está resuelta: el contexto insuficiente llevó a un modelo de 10,2 % → 66,1 %.
- El fragmentado consciente del contexto redujo las recuperaciones fallidas en 49 % (67 % con reordenamiento).
- No “fragmentes” tu contenido para IA de antemano — una estructura clara de H2/H3 se fragmenta bien por sí sola.
Los modelos mentales
1. Recuperar → Aumentar → Generar. Todo sistema RAG son estos tres movimientos. Cuando una respuesta de IA es incorrecta, localiza qué etapa falló: ¿recuperó los pasajes correctos, pasó suficiente contexto, o el modelo generó mal a partir de buenas fuentes? La mayoría de los problemas de visibilidad en IA son problemas de recuperación, no de generación.
2. Memoria paramétrica vs. no paramétrica. El modelo tiene conocimiento paramétrico (congelado en sus pesos, limitado a su corte de entrenamiento) y conocimiento no paramétrico (recuperado en vivo). Publicar contenido no puede tocar los pesos — pero puede alimentar la recuperación en vivo. Esa es toda la razón por la que el SEO todavía se aplica a la búsqueda con IA.
3. RAG vs. ajuste fino es una división entre conocimiento y comportamiento. ¿Necesitas que el modelo sepa hechos nuevos o cambiantes? RAG. ¿Necesitas cambiar cómo se comporta o escribe? Ajuste fino. No ajustes fino para añadir hechos que cambian semanalmente.
4. La calidad de la recuperación es el cuello de botella — y funciona en ambos sentidos. Una mejor recuperación supera a un modelo más grande. Y una recuperación insuficiente puede ser peor que ninguna. Así que el objetivo para tu contenido no es solo “ser recuperado” — es “ser recuperado como un pasaje suficiente y autocontenido” que permita al modelo responder de manera definitiva.
5. La cadena de rastreo → indexación → recuperación. No hay un índice de IA separado. Si una página falla en el rastreo o la indexación, nunca puede llegar a la recuperación — para el RAG de Google o para los motores de IA que construyen sus propios grupos. Arregla la cadena primero; optimiza los pasajes después.
Ponte a prueba: Generación aumentada por recuperación
Recursos que valen tu tiempo
Mis escritos e investigaciones relacionados
- Lo que realmente sabemos sobre optimizar para la búsqueda con LLM — El artículo de Ahrefs usando mis datos: las menciones en páginas con muchos enlaces son el predictor más fuerte de inclusión en AI Overviews (ρ ≈ 0,70).
- Optimización para motores generativos — la respuesta SEO a un panorama de búsqueda impulsado por RAG.
- ¿GEO? ¿AEO? ¿LLMO? ¿Qué es toda esta cosa de SEO con IA? — mi charla en Ahrefs Evolve 2025 sobre el panorama de la búsqueda con IA y por qué el requisito previo de indexación no ha cambiado.
Los artículos fundamentales
- Generación aumentada por recuperación para tareas de PNL intensivas en conocimiento — Lewis et al., 2020 (el origen).
- RAG para LLMs: una encuesta — Gao et al. (la taxonomía ingenua/avanzada/modular).
De otros
- Cómo funcionan los motores de búsqueda con IA — Ryan Law (Ahrefs) sobre RAG como mecanismo de fundamentación.
- Google AI Overviews: todo lo que necesitas saber — Ong y Law (Ahrefs) sobre RAG sobre el índice principal.
- ¿Qué es la generación aumentada por recuperación? — NVIDIA (incluye la anécdota del nombre de Lewis).
- Cómo la generación aumentada por recuperación está redefiniendo el SEO — Francine Monahan, iPullRank (optimización a nivel de pasaje).
- Más allá de RAG: por qué cada plataforma de búsqueda con IA ahora es agéntica — Michael King, Search Engine Land.
- Cómo funcionan las respuestas de Perplexity AI — Ishtiaque Ahmed, un desglose técnico del pipeline de recuperación/clasificación/citación.
- Cómo lograr que la IA te cite: información SEO de 8 000 citas de IA — James Allen, Search Engine Land; la autoridad y E-E-A-T impulsan las citas de IA más que la posición en el ranking.
- Cómo usa Perplexity Vespa.ai — el relato de primera mano de Vespa.ai sobre la arquitectura híbrida de recuperación BM25 + densa de Perplexity.
- Generación aumentada por recuperación — Wikipedia — una visión general de referencia útil; cubre el envenenamiento de RAG y la advertencia de alucinaciones.
Estadísticas que vale la pena citar
- Salto de alucinación del 10,2 % al 66,1 % — la tasa de alucinación de un modelo con contexto recuperado insuficiente frente a ningún contexto en absoluto; una mala recuperación puede ser peor que ninguna. Google Research, ICLR 2025. Fuente
- 49 % menos recuperaciones fallidas gracias al chunking consciente del contexto (Contextual Embeddings), que aumenta al 67 % cuando se combina con re-ranking. Anthropic, 2024. Fuente
- ρ ≈ 0,70 — las menciones en páginas con muchos enlaces son el predictor más fuerte de inclusión en Google AI Overviews en mi investigación; las menciones web de marca correlacionaron ~0,66 en 75 000 marcas. Fuente
- Tasa de supervivencia de ~30 % — según análisis de terceros, solo aproximadamente el 30 % superior de 60+ fuentes recuperadas superan el umbral de re-ranking de Perplexity hacia la etapa de generación. Fuente
- RAG > ajuste fino no supervisado para tareas de conocimiento — “for both existing knowledge encountered during training and entirely new knowledge.” (traducción) «tanto para el conocimiento existente encontrado durante el entrenamiento como para conocimiento completamente nuevo». Fuente
Registro de cambios
Actualizado el 13 ago 2026.
Resumen editorial y detalles registrados del cambio.Detalles del cambio
-
Los detalles del cambio están disponibles actualmente en inglés.
-
Los detalles del cambio están disponibles actualmente en inglés.
-
Los detalles del cambio están disponibles actualmente en inglés.
La comparación completa no está disponible: no se archivó una instantánea anterior para esta revisión.
Actualizado el 19 jul 2026.
Resumen editorial y detalles registrados del cambio.Detalles del cambio
-
Los detalles del cambio están disponibles actualmente en inglés.
-
Los detalles del cambio están disponibles actualmente en inglés.
La comparación completa no está disponible: no se archivó una instantánea anterior para esta revisión.