Generación Aumentada por Recuperación (RAG)

Cómo funciona RAG: el patrón de recuperar y luego generar detrás de Google AI Overviews, ChatGPT Search y Perplexity, y qué significa para que tu contenido sea citado.

Publicado por primera vez: 24 jun 2026 · Última actualización: 13 ago 2026 · Avanzado
Idiomas

RAG (Generación Aumentada por Recuperación) es el patrón de recuperar y luego generar detrás de la búsqueda con IA. Ejecuta dos fases en el momento de la consulta: recuperación (encontrar pasajes relevantes de un índice externo) y generación aumentada (alimentar esos pasajes a un LLM para escribir una respuesta fundamentada y citada), sin cambiar nunca los pesos del modelo. Así es como las respuestas de IA cubren información más allá del corte de entrenamiento del modelo. La fase de recuperación encadena fragmentación → incrustaciones → búsqueda vectorial → reordenamiento → pasajes top-k. RAG reduce las alucinaciones pero no las elimina, y un contexto recuperado insuficiente puede empeorarlas. Para el SEO no hay un índice de IA separado: ser rastreable, indexado y estructurado en pasajes claros y autocontenidos es el requisito previo para ser recuperado y citado.

El sistema de 2020 de Lewis y sus colegas combinó la generación de secuencias con la recuperación densa de un índice no paramétrico. Evidence for this claim The original RAG paper combined a pretrained sequence-to-sequence model with a non-parametric dense-vector index retrieved during generation. Scope: Lewis et al.'s 2020 RAG architecture and experiments, not every modern retrieval system. Confidence: high · Verified: Lewis et al.: Retrieval-Augmented Generation La descripción general actual de Google Cloud define RAG de manera más amplia como el suministro de conocimiento externo recuperado a un modelo. Evidence for this claim Google Cloud describes RAG as retrieving relevant information from external knowledge sources and providing it to a model to improve generated responses. Scope: General RAG architecture in Google Cloud documentation; quality depends on retrieval, source quality, and generation. Confidence: high · Verified: Google Cloud: RAG overview

TL;DR — RAG es un patrón de dos fases en tiempo de inferencia: recuperación (encontrar pasajes relevantes en un corpus externo) y luego generación aumentada (alimentar esos pasajes a un LLM para producir una respuesta fundamentada y citada). Los pesos nunca cambian — combina la memoria paramétrica del modelo con la memoria no paramétrica recuperada en vivo. La fase de recuperación encadena fragmentación → embeddings → búsqueda vectorial → reordenamiento → top-k. El RAG “ingenuo” es recuperar y luego generar; el RAG avanzado añade reescritura de consultas y reordenamiento; el RAG agéntico añade recuperación iterativa de múltiples saltos. La recuperación puede fundamentar respuestas pero no garantiza la corrección; en una evaluación de Gemma, el contexto insuficiente coincidió con más respuestas incorrectas. Para SEO: no hay un índice de IA separado; la rastreabilidad, la indexación y la claridad a nivel de pasaje son los requisitos previos para ser recuperado.

Las dos fases (y por qué “tiempo de inferencia” es el punto clave)

Retrieval is a pipeline: chunk, embed, search, re-rank, then hand the survivors to the model. Fuente: /ai-search/how-search-works/rag/

Five stages run left to right at inference time. Chunking splits documents into retrievable passages. Embeddings represent each passage as a dense vector. Vector search retrieves candidates and some systems combine it with BM25 keyword search. Re-ranking re-scores and narrows the candidate set. The top surviving passages enter the model context. The model's weights do not change.

© Patrick Stox LLC · CC BY 4.0 ·

RAG combines trained model memory with retrieved context at query time — without changing the weights. Fuente: /ai-search/how-search-works/rag/

Two sources feed one generation step. Parametric memory is knowledge encoded in the model weights during training and is limited by the training data and cutoff. Non-parametric memory consists of passages retrieved from an external index at query time. Generation uses both while the weights remain unchanged, producing an answer that can be grounded in and cite the retrieved sources; this does not guarantee correctness.

© Patrick Stox LLC · CC BY 4.0 ·

Desglosa el acrónimo y tienes el modelo: Recuperación más Generación Aumentada. Llega una consulta; el sistema recupera los pasajes más relevantes de un corpus externo; inyecta esos pasajes en la ventana de contexto del LLM; el LLM genera una respuesta fundamentada en ellos.

El detalle que todos entienden mal: esto ocurre en el momento de la inferencia, y los pesos del modelo nunca se tocan. RAG no es entrenamiento ni ajuste fino. El artículo original de 2020 de Patrick Lewis y sus colegas de Facebook AI Research lo enmarcó como la combinación de dos tipos de memoria — memoria paramétrica (conocimiento incorporado en los pesos durante el entrenamiento) y memoria no paramétrica (conocimiento recuperado en vivo de un índice). RAG usa ambas a la vez. AWS expone el caso práctico con claridad: volver a entrenar un modelo fundacional para conocimiento nuevo o específico de un dominio es costoso, y “RAG es un enfoque más rentable para introducir nuevos datos al LLM.”

(El nombre, para lo que vale, fue un accidente. Lewis admitió más tarde: “Definitivamente habríamos pensado más en el nombre si hubiéramos sabido que nuestro trabajo se volvería tan extendido… Siempre planeamos tener un nombre que sonara mejor, pero cuando llegó el momento de escribir el artículo, nadie tuvo una mejor idea.”)

Dentro de la fase de recuperación

“Recuperar los pasajes relevantes” está haciendo mucho trabajo en esa frase. En un sistema real es un pipeline:

  1. Fragmentación. Los documentos se dividen en piezas recuperables. El tamaño del fragmento es un verdadero equilibrio: demasiado pequeño y un pasaje pierde su contexto; demasiado grande y inunda el presupuesto de tokens con irrelevancia. Las estrategias van desde recuentos fijos de tokens (100/256/512) hasta ventanas recursivas/deslizantes o “Small2Big” (recuperar una oración pequeña, devolver su fragmento padre para la generación).
  2. Embeddings. Cada fragmento se convierte en un vector denso — una representación numérica de su significado — para que la similitud se calcule semánticamente, no por coincidencia de palabras clave. Por eso el contenido sobre un tema se recupera incluso cuando no usa la redacción exacta de la consulta.
  3. Búsqueda vectorial. La consulta también se incrusta, y el sistema encuentra los fragmentos cuyos vectores están más cerca de ella. La mayoría de las pilas de producción ejecutan búsqueda híbrida — recuperación por vector denso más búsqueda por palabras clave BM25 — porque cada una capta recuperaciones que la otra pierde.
  4. Reordenamiento. Un modelo separado vuelve a puntuar los candidatos según su relevancia para la consulta y los reordena, “reduciendo efectivamente el conjunto general de documentos.” Solo los mejores supervivientes llegan al contexto.
  5. Top-k en el prompt. Los mejores pasajes se concatenan con la consulta del usuario y se entregan al generador.

La fragmentación es el eslabón frágil. Anthropic identificó que “las soluciones RAG tradicionales eliminan el contexto al codificar la información” — un fragmento extraído de su documento pierde el contexto circundante que lo hacía significativo. Su técnica de Recuperación Contextual (anteponer contexto específico del fragmento antes de la indexación) redujo las recuperaciones fallidas en un 49%, y en un 67% combinada con reordenamiento. Esa es una señal fuerte de que el problema de la fragmentación es real — y de que los pasajes autocontenidos y ricos en contexto son más fáciles de recuperar correctamente.

RAG ingenuo, avanzado y agéntico

La literatura de encuestas (Gao et al., 2023) divide RAG en una taxonomía útil:

  • RAG ingenuo“un proceso tradicional que incluye indexación, recuperación y generación.” Recupera top-k una vez, genera una vez. “Tiene dificultades con la precisión y el recall, lo que lleva a la selección de fragmentos desalineados o irrelevantes.”
  • RAG avanzado — añade “estrategias de pre-recuperación y post-recuperación.” Pre-recuperación: reescritura de consultas y mejor indexación (incluyendo HyDE, donde el modelo genera una respuesta hipotética, incrusta eso, y recupera documentos que parecen respuestas en lugar de preguntas). Post-recuperación: re-ranking y compresión de contexto.
  • RAG modular / agéntico — el modelo recupera, razona sobre lo que aún falta, y recupera de nuevo, iterando a través de múltiples saltos. Este es el estado actual de la búsqueda con IA. Como dijo Michael King: “El patrón de recuperar-una-vez-y-luego- generar que definió la primera ola está obsoleto… El RAG agéntico es ahora el estándar.”

Esto importa para el SEO porque el contenido ahora tiene que sobrevivir a múltiples rondas de recuperación y verificación de contradicciones — no solo a una única pasada de recuperación.

¿El RAG elimina las alucinaciones? No.

In one evaluation, Gemma answered incorrectly on 10.2% of questions with no context and 66.1% with insufficient context; this is not a universal model effect. Fuente: Data: Google Research

Two bars report Gemma's incorrect-answer rate in one Google Research evaluation. With no context, the rate is 10.2 percent. With insufficient context, the rate is 66.1 percent. The comparison comes from Google Research's ICLR 2025 sufficient-context study and should not be generalized to every model, dataset, or retrieval system.

El RAG puede fundamentar respuestas en fuentes recuperadas, pero el LLM aún puede malinterpretar o sobreinterpretar lo que ha extraído. Google Research (ICLR 2025) documentó un resultado contraintuitivo en una evaluación: Gemma produjo respuestas incorrectas en el 10,2 % de las preguntas sin contexto y el 66,1 % con contexto insuficiente. Los investigadores informan que los modelos pueden “sobresalir con contexto suficiente pero no reconocer cuando el contexto es insuficiente.” Trata esto como una advertencia específica del modelo y de la evaluación, no como prueba de que la recuperación causa universalmente peores respuestas. La lección práctica es más limitada: la calidad de la recuperación y la suficiencia del contexto necesitan ser evaluadas en lugar de asumidas. Google operacionalizó el hallazgo como un re-ranker de LLM en su Vertex AI RAG Engine.

RAG frente al ajuste fino

Estos se confunden constantemente, y son fundamentalmente diferentes:

  • RAG recupera información externa en el momento de la consulta. Los pesos no cambian. Mejor para información nueva/cambiante, requisitos de citación y costo. El estudio encontró que “RAG supera consistentemente al [fine-tuning no supervisado], tanto para conocimiento existente encontrado durante el entrenamiento como para conocimiento completamente nuevo.”
  • Fine-tuning modifica los pesos del modelo en una ejecución de entrenamiento separada. Mejor para cambiar estilo y comportamiento, o enseñar conocimiento de dominio estable que no cambia.

Usarías RAG para hacer que un modelo conozca los últimos hechos; usarías fine-tuning para cambiar cómo habla.

RAG en la práctica: Google, ChatGPT, Perplexity

  • Resúmenes de IA de Google. Google llama a RAG “a technique (also known as grounding)… relying on our core Search ranking systems to retrieve relevant, up-to-date web pages from our Search index.” (traducción) «una técnica —también conocida como fundamentación— que se apoya en nuestros sistemas principales de posicionamiento de la Búsqueda para recuperar páginas web pertinentes y actualizadas de nuestro índice de Búsqueda». De esto se derivan dos cosas. Primero, no existe un índice de IA separado“our generative AI features on Google Search are rooted in our core Search ranking and quality systems.” (traducción) «nuestras funciones de IA generativa en la Búsqueda de Google se basan en nuestros sistemas principales de posicionamiento y calidad de la Búsqueda». Segundo, Google ejecuta expansión de consultas: “concurrent, related queries generated by the model to request more information.” (traducción) «consultas simultáneas y relacionadas generadas por el modelo para solicitar más información». Una sola pregunta puede generar múltiples subconsultas, cada una recuperando contenido diferente — por lo que tu contenido tiene que satisfacer las subpreguntas implícitas, no solo la consulta principal.
  • Búsqueda de ChatGPT. Lanzada (octubre de 2024) con Bing como su socio de datos, y la documentación del propio rastreador de OpenAI confirma que OAI-SearchBot realiza búsqueda e indexación independientes para citas de búsqueda, separadas del rastreo de entrenamiento de GPTBot. OpenAI no ha publicado la combinación de recuperación actual entre Bing y su propio índice, y desde entonces OpenAI ha posicionado la Búsqueda de ChatGPT como un competidor independiente de Bing en lugar de un envoltorio alrededor de él — así que trata “es básicamente Bing” como una simplificación. La palanca documentada y accionable es más estrecha y más duradera: no bloquees OAI-SearchBot en robots.txt, porque ese es el rastreador que OpenAI mismo nombra como el que indexa contenido para citas de búsqueda.
  • Perplexity. Construido sobre recuperación híbrida (Vespa.ai — BM25 + densa) con modelos de incrustación personalizados y un umbral estricto de re-clasificación: según análisis de terceros, solo el ~30 % superior de más de 60 fuentes recuperadas sobrevive a la etapa de generación, y “las citas no se añaden retroactivamente después de la generación — se asignan estructuralmente durante el ensamblaje del contexto.” Deep Research ejecuta el bucle agéntico a través de docenas de búsquedas.

Qué significa RAG para el SEO

Quita la jerga y el manual es concreto:

  • Estar en el índice es el requisito previo — punto final. Sin un índice de IA separado, la cadena de rastreo → indexación → recuperación tiene que estar intacta. Si una página no puede ser rastreada e indexada, no puede ser recuperada en una respuesta de IA. Lo mismo es cierto para los motores de IA que construyen sus propios grupos: rastreadores de IA como OAI-SearchBot y PerplexityBot tienen que tener permiso para acceder a ti, o eres invisible para esas respuestas.
  • Escribe pasajes autocontenidos. RAG recupera fragmentos, no páginas completas. Como dijo Francine Monahan de iPullRank, los sistemas de IA examinan “fragmentos de páginas en lugar de la página como un todo” — así que crea “pasajes y frases destacados” que respondan a una pregunta específica por sí mismos. Esto es exactamente la estructura de H2/H3 y las oraciones temáticas claras que el buen SEO ya recompensa. Google dice explícitamente que no cortes tu contenido en pedazos pequeños para la IA — el contenido bien estructurado se divide bien por sí solo.
  • Cubre los subtemas. La expansión de consultas significa que una pregunta puede desencadenar muchas recuperaciones. La profundidad en subpreguntas relacionadas supera a una página rellena alrededor de una sola palabra clave.
  • La autoridad impulsa la citación más que la posición en el ranking. De un análisis de 8 000 citas: “Una fuerte presencia orgánica en búsqueda y una amplia visibilidad web lleva a citas de IA, no al revés” — y “contenido altamente autoritativo de una página de menor ranking” a veces se cita sobre uno menos creíble en el primer puesto. Mis propios datos coinciden (de mi investigación de citas en Resúmenes de IA): las menciones en páginas muy enlazadas son el predictor más fuerte de inclusión en Resúmenes de IA (ρ ≈ 0,70), y las menciones web de marca correlacionaron ~0,66 en 75 000 marcas.
  • El contenido fresco tiene una ventaja. Las citas de IA son significativamente más frescas que los resultados orgánicos, así que la actualidad importa.

Si quieres la versión de una frase: RAG no reemplazó al SEO — elevó las apuestas en las partes del SEO que siempre trataron de ser encontrable y ser claro.

Add an expert note

Pin an expert quote

New person? Create their unclaimed profile at /admin/experts/ → Pin a quote first.