Modelo de Lenguaje Grande (LLM)

Qué es un modelo de lenguaje grande, cómo predice texto token por token, los LLM que impulsan la búsqueda con IA (Gemini, GPT-4) y qué significan para el SEO.

Publicado por primera vez: 24 jun 2026 · Última actualización: 11 ago 2026 · Avanzado
Idiomas

Un modelo de lenguaje grande (LLM) genera texto prediciendo el siguiente token: no razona como un humano, sino que ejecuta una finalización probabilística. Los LLM se basan en la arquitectura de transformadores y se dividen en dos roles en la búsqueda: los modelos de comprensión como BERT ayudan a clasificar, mientras que los modelos generativos como Gemini (Google AI Overviews) y GPT-4 (Bing Copilot) escriben las respuestas. Están limitados por un corte de conocimiento, una ventana de contexto finita y una tendencia a alucinar, que es exactamente por lo que existen RAG y la fundamentación. Para los profesionales del SEO, la noticia práctica es aburrida: la indexación sigue siendo el requisito previo, las menciones de marca se correlacionan con la visibilidad en IA más fuertemente que los backlinks, y el 'SEO normal' es lo que te hace ser citado.

TL;DR — Un LLM estima la probabilidad del siguiente token y genera texto de forma autorregresiva: ese es todo el motor. Se ejecuta sobre la arquitectura de transformadores, que procesa una secuencia completa en paralelo mediante la atención, en lugar de token por token como las RNN. En la búsqueda hay dos trabajos distintos: comprensión (codificadores estilo BERT que ayudan a clasificar) y generación (Gemini, GPT-4 que escriben respuestas de IA). Los LLM están limitados por un corte de conocimiento, una ventana de contexto finita y la alucinación, que es precisamente la razón por la que existen RAG y la fundamentación. Para el SEO, la indexación sigue siendo el requisito previo, y en el estudio de 75 000 marcas de Ahrefs realizado por Louise Linehan y Xibeijia Guan las señales basadas en texto, como las menciones de marca, se correlacionaron con la visibilidad en AI Overview aproximadamente 3 veces más fuertemente que los backlinks.

Qué es realmente un LLM

Un LLM no es una base de datos de hechos garantizados, y una salida fluida no es prueba de precisión. Evidence for this claim Large autoregressive language models are trained to predict tokens from preceding context and can perform varied language tasks through prompting. Scope: GPT-3 research findings; later models, training methods, and product systems differ. Confidence: high · Verified: Brown et al.: Language Models are Few-Shot Learners Los productos de búsqueda que usan LLM pueden combinarlos con sistemas externos de recuperación y clasificación. Evidence for this claim Applications can give a language model tools for web search, file search, code execution, or external functions. Scope: OpenAI API tool capabilities; tool access is configured separately and should not be conflated with the base model's stored knowledge. Confidence: high · Verified: OpenAI: Tools guide

Un modelo de lenguaje, en palabras del propio Google, “estimates the probability of a token or sequence of tokens occurring within a longer sequence of tokens.” (traducción) «estima la probabilidad de que un token o secuencia de tokens ocurra dentro de una secuencia más larga de tokens». Esa es la base. Un LLM es una versión muy grande de eso: un modelo de aprendizaje profundo con miles de millones de parámetros entrenado para predecir el siguiente token en texto a escala web.

Dos cosas lo hacen “grande” y capaz:

  • Escala. Miles de millones de parámetros, entrenados con corpus enormes. A medida que los modelos crecen, capacidades como el resumen, el razonamiento y la generación de código comienzan a surgir sin estar programadas explícitamente.
  • La arquitectura de transformadores. Introducida en el artículo de Google de 2017 La atención es todo lo que necesitas, los transformadores procesan una secuencia completa a la vez y usan un mecanismo de atención para que cada token pueda “mirar” a todos los demás. El Curso intensivo de aprendizaje automático de Google plantea el contraste directamente: los grandes modelos de lenguaje “can evaluate the whole context at once,” (traducción) «pueden evaluar todo el contexto a la vez», a diferencia de las redes neuronales recurrentes más antiguas que procesaban “token by token” (traducción) «token por token» y sufrían el “vanishing gradient problem.” (traducción) «problema del gradiente evanescente».

El modelo se entrena mediante la predicción del siguiente token en texto sin procesar y, luego, normalmente se refina con RLHF (aprendizaje por refuerzo a partir de la retroalimentación humana) para hacerlo más útil y seguro. En la inferencia, genera autorregresivamente: un token a la vez, y cada predicción se retroalimenta como entrada para la siguiente. Un ajuste llamado temperatura controla cuán aleatorio es ese muestreo.

Conviene mantener las etapas separadas, porque la gente las confunde constantemente. Evidence for this claim Pretraining learns broad statistical representations, post-training changes model behavior toward instructions or preferences, and inference applies the resulting model to supplied context; prompt context does not by itself update model weights. Scope: General pipeline description across instruction-tuned LLMs; the exact post-training method (RLHF, DPO, or other) and how a given product layer handles session memory vary by provider and are not covered here. Confidence: high · Verified: Ouyang et al.: Training language models to follow instructions with human feedback El pretraining es donde realmente se establecen los pesos: el modelo aprende patrones estadísticos amplios a partir de la predicción del siguiente token en un corpus enorme. El post-training (RLHF y pasos similares de ajuste de preferencias) ajusta esos mismos pesos nuevamente, hacia instrucciones y comportamiento de seguridad. La inferencia — lo que ocurre cuando le envías un prompt — no actualiza los pesos en absoluto; el modelo solo aplica lo que aprendió en las dos etapas de entrenamiento al texto que le entregas. Por eso también una ventana de contexto larga no es que el modelo “aprenda” sobre ti: el texto adicional es entrada para esa única solicitud, no una actualización de entrenamiento, y desaparece cuando la sesión termina, a menos que una función separada del producto lo guarde y lo realimente como memoria.

Mantén el modelo mental honesto: esto es un proceso probabilístico. El modelo produce completaciones plausibles, no hechos verificados.

Comprensión vs. generación: dos trabajos distintos

Esta es la distinción que aclara la mayor parte de la confusión sobre los LLM en la búsqueda.

  • BERT (2019) es un modelo bidireccional solo de codificador. Google: considera “the full context of a word by looking at the words that come before and after it.” (traducción) «el contexto completo de una palabra al observar las palabras que vienen antes y después de ella.» El trabajo de BERT es comprensión — interpretar consultas y documentos para mejorar la clasificación. No genera respuestas. Google dijo que BERT “help Search better understand one in 10 searches in the U.S. in English,” (traducción) «ayudaría a Search a comprender mejor 1 de cada 10 búsquedas en EE. UU. en inglés,» y Pandu Nayak lo llamó “the biggest leap forward in the past five years.” (traducción) «el mayor avance en los últimos cinco años.»
  • Gemini / GPT-4 son modelos generativos (estilo decodificador, autorregresivos). Su trabajo es generación — sintetizar el texto de la respuesta de AI Overview o Copilot a partir de pasajes recuperados.

Entonces, cuando un SEO pregunta “¿el LLM clasifica mi página?” la respuesta honesta es: un modelo de comprensión estilo BERT ha influido durante mucho tiempo en la clasificación; un modelo generativo como Gemini escribe el resumen de IA sobre lo que sea que haya surgido en el paso de recuperación. Modelos diferentes, etapas diferentes.

La evolución de los LLM de Google en la búsqueda

Una línea de tiempo aproximada, porque el linaje importa:

  • 2017La atención es todo lo que necesitas (Google Research): el artículo del transformer sobre el que se construye todo lo demás.
  • 2019 — BERT: primer LLM transformer en la clasificación de Google; “1 de cada 10 búsquedas.”
  • 2021 — MUM: un modelo basado en T5 de aproximadamente 110 mil millones de parámetros que Google calificó como “1,000 times more powerful than BERT,” (traducción) «1 000 veces más potente que BERT,» multimodal y entrenado en más de 75 idiomas.
  • 2023 — Gemini: “built from the ground up to be multimodal,” (traducción) «construido desde cero para ser multimodal,» preentrenado en múltiples modalidades desde el inicio; lanzado en variantes Ultra / Pro / Nano. Google lo reportó como el primer modelo en “outperform human experts on MMLU” (traducción) «superar a los expertos humanos en MMLU» (90,0 %). (Números de referencia como ese están vinculados a la versión exacta del modelo, el conjunto de pruebas y la fecha de evaluación que el laboratorio usó en ese momento — no se transfieren automáticamente a actualizaciones posteriores de la misma familia de modelos.)
  • 2024 — AI Overviews (graduándose de SGE): la capa generativa llega a la página de resultados.
  • 2025 — AI Mode + Gemini 3: Elizabeth Reid describió Gemini 3 en Search como algo que aporta “state-of-the-art reasoning, deep multimodal understanding and powerful agentic capabilities,” (traducción) «razonamiento de vanguardia, comprensión multimodal profunda y capacidades agénticas potentes,» con el sistema enrutando inteligentemente preguntas complejas a Gemini 3 y tareas más simples a modelos más rápidos.
  • 2026 — Gemini 3 se convierte en el modelo predeterminado para AI Overviews. Según Robby Stein, “Gemini 3 is now the default model for AI Overviews.” (traducción) «Gemini 3 es ahora el modelo predeterminado para AI Overviews.»

Bing Copilot: GPT-4 + Prometheus + el índice de Bing

Microsoft confirmó en marzo de 2023 que “the new Bing is running on GPT-4, which we’ve customized for search,” (traducción) «el nuevo Bing se ejecuta en GPT-4, que hemos personalizado para la búsqueda,» y que “as OpenAI makes updates to GPT-4 and beyond, Bing benefits from those improvements.” (traducción) «a medida que OpenAI realice actualizaciones a GPT-4 y más allá, Bing se beneficiará de esas mejoras.»

La pieza que conecta un LLM congelado con la web en vivo es el modelo Prometheus de Microsoft — descrito como un modelo que combina el índice fresco de Bing con el razonamiento de GPT. El pipeline de Copilot reformula tu consulta en cadenas de búsqueda, recupera del índice de Bing, y hace que GPT sintetice una respuesta fundamentada y citada. (Nota: ese desglose detallado del pipeline proviene de análisis técnicos de terceros, no de una especificación oficial de Microsoft — trata el paso a paso como reportado por la industria.)

Cómo AI Overviews genera realmente una respuesta (el pipeline de RAG)

La razón por la que estos sistemas pueden responder sobre las noticias de hoy a pesar de un corte de entrenamiento antiguo es la generación aumentada por recuperación. La propia definición de Google Cloud: RAG “combines the strengths of traditional information retrieval systems with the capabilities of generative large language models.” (traducción) «combina las fortalezas de los sistemas tradicionales de recuperación de información con las capacidades de los grandes modelos de lenguaje generativos.» Conceptualmente:

  1. Envías una consulta.
  2. Las consultas complejas se descomponen — el query fan-out de Google — en subconsultas.
  3. Cada subconsulta recupera pasajes candidatos del índice.
  4. Esos pasajes se inyectan en la ventana de contexto del LLM — esto es grounding, anclando la respuesta a fuentes recuperadas en lugar de solo a datos de entrenamiento.
  5. El LLM genera una respuesta sintetizada con citas.
  6. Se ejecutan comprobaciones de seguridad y calidad, y se devuelve la respuesta.

La implicación para el SEO es una cadena de puertas. Tu contenido tiene que ser (a) rastreable por los bots de IA, (b) indexado, (c) mostrado por la recuperación, (d) seleccionado frente a pasajes competidores, y (e) representado con precisión en la salida. Fallar en cualquier etapa significa que no apareces en la respuesta.

Limitaciones que importan para los SEO

LimitaciónQué significa para ti
Corte de conocimientoEl modelo no sabe nada más allá de su fecha de entrenamiento a menos que el RAG suministre contenido fresco. El corte no es igual a la fecha de lanzamiento: pueden diferir por meses. El corte de entrenamiento de GPT-5 se reporta como septiembre de 2024.
Ventana de contextoUn LLM solo puede procesar una cantidad finita de texto a la vez, medida en tokens. Esto limita cuánto contenido recuperado se puede alimentar, y es por eso que la fragmentación importa en la recuperación.
AlucinaciónEl modelo genera completaciones que suenan plausibles pero pueden ser incorrectas. Es un artefacto estadístico, no una mentira. La investigación de Ahrefs encontró que los asistentes de IA envían a los visitantes a páginas 404 2,87 veces más a menudo que Google Search.
Riesgo de cobertura de JavaScriptEl renderizado del rastreador de IA varía según el proveedor, por lo que el contenido dependiente de JS puede pasarse por alto cuando un buscador usa solo el HTML inicial.
Fragmentación de pasajesLos sistemas de recuperación dividen las páginas en pasajes. Mi investigación sobre el procesamiento de Chrome apuntó a pasajes de ~200 palabras y al análisis de solo los primeros ~30 pasajes de una página: el contenido enterrado en profundidad puede nunca recuperarse.

Qué significa esto para tu estrategia de contenido

Algunas cosas que me siento cómodo diciendo, separadas de las cosas que nadie fuera de los motores sabe realmente:

  • La indexación sigue siendo el requisito previo. Gary Illyes fue contundente: “To get your content to appear in AI Overview, simply use normal SEO practices.” (traducción) «Para que tu contenido aparezca en AI Overview, simplemente usa prácticas normales de SEO.» No hay una señal especial confirmada dirigida a LLM. Y sobre el muy promocionado archivo llms.txt, Illyes dijo “Google doesn’t support LLMs.txt and isn’t planning to,” (traducción) «Google no admite LLMs.txt y no planea hacerlo», con John Mueller comparándolo con la antigua etiqueta de meta keywords.
  • Las menciones de marca superan a los backlinks para la visibilidad en IA. En nuestro estudio de 75 000 marcas, las menciones web de marca fueron el correlato más fuerte de las apariciones en AI Overview (≈0,66), frente a ≈0,22 para los backlinks: las señales basadas en texto se correlacionaron aproximadamente 3 veces más fuertemente que las métricas de enlaces. Como lo expresamos, los LLM “derive their understanding of a brand’s authority from words on the page, from the prevalence of particular words, the co-occurrence of different terms and topics, and the context in which those words are used.” (traducción) «derivan su comprensión de la autoridad de una marca de las palabras en la página, de la prevalencia de palabras particulares, de la co-ocurrencia de diferentes términos y temas, y del contexto en el que se usan esas palabras».
  • Es el ganador se lo lleva todo. Las marcas en el cuartil superior de menciones web promediaron 169 menciones en AI Overview frente a 14 para el siguiente cuartil, y el 26 % de las marcas estudiadas tuvieron cero. Las colocaciones de alta autoridad y alto tráfico aumentan tu visibilidad en IA.
  • La frescura ayuda. En un análisis de 17 millones de citas, los asistentes de IA prefirieron citar contenido significativamente más nuevo que lo que suele aparecer en los resultados orgánicos.
  • No bloquees los rastreadores de IA por reflejo. Bloquear probablemente pierde visibilidad en IA sin ventaja SEO. Y recuerda el punto ciego de JS mencionado arriba: si tu contenido necesita JavaScript para aparecer, la mayoría de los rastreadores de IA no lo verán.

Y la advertencia honesta: los motores evitan consistentemente revelar cómo funciona el lado de clasificación de AI Overviews. La historia confirmada es “consigue indexación, haz SEO normal”. Todo lo demás es inferencia, incluida la mía.

Add an expert note

Pin an expert quote

New person? Create their unclaimed profile at /admin/experts/ → Pin a quote first.