Re-ranking y SEO

El reranking es la segunda etapa de un pipeline de recuperación: cómo los bi-encoders y cross-encoders reordenan los resultados recuperados por relevancia antes de que se sirvan o se entreguen a un LLM, y qué significa eso para la visibilidad en la búsqueda de IA.

Publicado por primera vez: 3 jul 2026 · Última actualización: 13 ago 2026 · Avanzado
Idiomas

El reranking es la segunda etapa de un pipeline de recuperación: una primera pasada amplia y económica recupera un conjunto candidato de documentos o pasajes, luego un modelo más lento y preciso vuelve a puntuar y reordena esa lista corta antes de que los resultados se sirvan o se alimenten a un LLM. El mecanismo central es bi-encoder vs cross-encoder: un bi-encoder codifica la consulta y el documento por separado en vectores y los compara (rápido, escalable, menos preciso), mientras que un cross-encoder los codifica juntos y puntúa el par directamente (más lento, más preciso). No se puede puntuar todo un corpus de mil millones de páginas con el modelo costoso, por lo que se recupera ampliamente y se rerankea la lista corta. Google no usa la palabra 'reranking' públicamente, pero sus sistemas nombrados BERT y de clasificación de pasajes hacen ese trabajo, y Microsoft documenta un reranker explícito derivado de Bing en Azure AI Search. El reranking no es lo mismo que la fusión de rango recíproco. La conclusión para SEO: como los rerankers puntúan pares consulta-pasaje de manera conjunta, los pasajes autocontenidos, sin ambigüedad y que se leen como una respuesta directa obtienen mejores puntuaciones.

TL;DR — El reranking es la segunda etapa de un pipeline de recuperación de dos etapas (o multi-etapa): un pase de recuperación barato y amplio (coincidencia de palabras clave BM25, similitud de vectores/embeddings, o ambos) obtiene un conjunto de candidatos, luego un modelo más lento y más preciso vuelve a puntuar y reordena esa lista corta. El mecanismo central es bi-encoder vs cross-encoder — un bi-encoder codifica la consulta y el documento por separado en vectores y los compara (rápido, precomputable, menos preciso); un cross-encoder los codifica juntos y genera una puntuación de relevancia por par (más lento, no se puede precomputar, más preciso). No puedes ejecutar un cross-encoder sobre todo un corpus, así que recuperas ampliamente y rerankeas la lista corta. Google no dice “reranking” públicamente, pero BERT y el ranking de pasajes hacen el trabajo; Microsoft documenta un reranker explícito derivado de Bing en Azure AI Search. Reranking ≠ Fusión de Rango Recíproco (RRF). Conclusión para SEO: los rerankers puntúan pares consulta-pasaje de forma conjunta, así que los pasajes autónomos y sin ambigüedad ganan.

Evidence for this claim A cross-encoder can score query-document pairs for reranking after an initial retrieval stage. Scope: Sentence-BERT evaluation and related retrieve-then-rerank use; cross-encoders are one reranking approach, not a universal implementation. Confidence: high · Verified: Reimers and Gurevych: Sentence-BERT

El patrón de recuperar y luego rerankear

La recuperación en dos etapas equilibra la amplitud de candidatos con una puntuación más costosa. Evidence for this claim A cross-encoder can score query-document pairs for reranking after an initial retrieval stage. Scope: Sentence-BERT evaluation and related retrieve-then-rerank use; cross-encoders are one reranking approach, not a universal implementation. Confidence: high · Verified: Reimers and Gurevych: Sentence-BERT La elección del modelo y las compensaciones entre latencia y calidad son específicas de la implementación. Evidence for this claim A rerank model can reorder an existing candidate list by relevance to a query. Scope: Cohere's Rerank product behavior; inputs, limits, and scoring semantics are vendor-specific. Confidence: high · Verified: Cohere: Rerank overview

Reranking changes the order only after retrieval creates the candidate set. Fuente: Reranking

A query enters fast first-stage retrieval, which produces a candidate shortlist. A slower query-candidate scoring model reranks only that shortlist into the final order. A document omitted by retrieval never reaches the reranker.

© Patrick Stox LLC · CC BY 4.0 ·

Todo sistema de relevancia a gran escala se enfrenta al mismo problema: no puedes permitirte ejecutar tu modelo de relevancia más preciso sobre todo tu corpus. Así que la solución estándar es dividir el trabajo en etapas. La documentación de búsqueda de Google Cloud lo expresa claramente: “In short, retrieval is finding relevant documents, while ranking is ordering those retrieved documents. Ranking all the available documents can be computationally expensive. Therefore, retrieval and ranking work sequentially.” (traducción) «En resumen, la recuperación encuentra documentos pertinentes y la clasificación ordena los documentos recuperados. Ordenar la totalidad de los documentos disponibles puede resultar demasiado costoso en términos computacionales. Por eso, recuperación y clasificación funcionan de forma secuencial». (Google Cloud, «Acerca de la recuperación y la clasificación»)

Etapa uno — recuperación — lanza una red amplia de forma económica. Utiliza coincidencia léxica (BM25 sobre un índice invertido), búsqueda vectorial basada en embeddings, o una combinación de ambas, y devuelve un conjunto de candidatos. Etapa dos — reordenamiento — toma esa lista corta y vuelve a puntuar cada candidato con un modelo más costoso y de mayor precisión, y luego reordena. La versión en una línea en la que todos coinciden: recupera de forma económica y amplia, reordena con precisión sobre un conjunto pequeño, y luego sirve o genera.

Bi-encoders vs cross-encoders: el mecanismo central

Todo el tema depende de una distinción arquitectónica — cuándo se encuentran la consulta y el documento.

  • Bi-encoder (el recuperador de primera etapa). Codifica la consulta y cada documento por separado, cada uno en su propio vector, y luego compara los dos vectores con algo como la similitud del coseno. Como los vectores de documento no dependen de la consulta, puedes calcularlos e indexarlos de antemano, lo que hace que la recuperación sea lo suficientemente rápida como para ejecutarse sobre todo un corpus. El costo: la consulta y el documento nunca interactúan realmente, por lo que el modelo tiene que, en efecto, comprimir todos los significados posibles de un documento en un solo vector — y los matices se pierden. Los bi-encoders son la base de los embeddings y la búsqueda vectorial.
  • Cross-encoder (el reordenador de segunda etapa). Codifica la consulta y un documento candidato juntos, como una única entrada conjunta a través de un transformer, y genera una puntuación de relevancia única para ese par. Como el modelo ve ambos a la vez, puede sopesar directamente cómo se relacionan las palabras específicas de la consulta con las palabras específicas del documento — mucho más preciso. El costo: nada se puede precalcular. Cada par consulta-documento tiene que pasar por el modelo en el momento de la consulta, por lo que es demasiado lento para aplicarlo a un índice completo. Es precisamente por eso que se reserva para la lista corta.

Google, notablemente, describe este mecanismo exacto con sus propias palabras. En la documentación de recuperación/clasificación de Google Cloud, una de las señales de recuperación listadas es cross-attention, definida como algo que “allows a model to consider the relationship between a query and a document to assign a relevance score to the document.” (traducción) «permite que un modelo considere la relación entre una consulta y un documento para asignar una puntuación de relevancia al documento.» Esa es la idea del cross-encoder bajo un nombre diferente.

¿Por qué no usar simplemente el modelo preciso en todo?

La latencia y el costo lo hacen inviable a escala, y la diferencia es enorme, no marginal. El artículo de Pinecone sobre la recuperación en dos etapas le pone un número concreto: en un conjunto de 40 millones de registros, ejecutar un reordenador cross-encoder estilo BERT sobre todo en una GPU V100 llevaría más de 50 horas, frente a menos de 100 milisegundos para la búsqueda vectorial. (Pinecone, «Rerankers y recuperación en dos etapas») Esa es toda la justificación del diseño en dos etapas: obtienes la mayor parte de la precisión del cross-encoder mientras solo pagas su costo en unas pocas docenas o unos pocos cientos de candidatos.

Vectara plantea el mismo mito directamente — la cuestión de por qué no puntuar todos los documentos con el modelo más preciso si está disponible — y la respuesta es la misma: no puedes, así que filtras de forma económica primero. (Vectara, “What is reranking and why does it matter?”)

Cómo lo hace Google

Google nunca ha publicado una declaración oficial usando los términos “reranking”, “cross-encoder” o “bi-encoder” sobre el propio Google Search — vale la pena decirlo claramente para no exagerar. Pero la función está documentada bajo otros nombres.

La propia Guía de sistemas de clasificación de búsqueda de Google nombra dos sistemas que hacen el trabajo de reranking:

  • BERT“an AI system Google uses that allows us to understand how combinations of words express different meanings and intent.” (traducción) «un sistema de IA que Google usa y que nos permite entender cómo las combinaciones de palabras expresan diferentes significados e intenciones». BERT lee conjuntamente las palabras de una consulta en contexto; un reranker basado en BERT puntúa la relevancia consulta-documento de la misma manera que un cross-encoder.
  • Passage ranking“an AI system we use to identify individual sections or ‘passages’ of a web page to better understand how relevant a page is to a search.” (traducción) «un sistema de IA que usamos para identificar secciones individuales o “pasajes” de una página web para entender mejor cuán relevante es una página para una búsqueda». Eso es reranking a nivel de pasaje en lugar de a nivel de página (consulta passage ranking para el análisis profundo).
  • RankBrain — el sistema anterior de Google que “helps us understand how words are related to concepts,” (traducción) «nos ayuda a entender cómo se relacionan las palabras con los conceptos», por lo que puede devolver contenido relevante incluso sin palabras de coincidencia exacta.

Google Research también ha publicado el mecanismo directamente: su artículo Learning-to-Rank with BERT in TF-Ranking describe la codificación de consultas y documentos con BERT y la aplicación de una capa de aprendizaje para clasificar encima, y lo enmarca explícitamente como re-ranking de pasajes — reportando el mejor rendimiento en la tarea de re-ranking de pasajes de MS MARCO a partir del 30 de marzo de 2020. Eso es una publicación de Google Research más que una guía de producto de Search Central, así que trátalo como la investigación técnica de Google, no como una declaración sobre el pipeline de búsqueda en vivo.

Un número que vale la pena matizar: el marco de “reducir a los 1 000 resultados principales y luego reordenarlos” que circula ampliamente en SEO se remonta a la interpretación de mi propia presentación de conferencia sobre investigación pública y patentes — no a una declaración actual y literal de Google sobre la Búsqueda web. El producto de búsqueda empresarial de Google Cloud sí documenta un pipeline concreto (“the model retrieves documents in the order of thousands… The ranking model then orders the retrieved documents and serves the top 400 ranked results” (traducción) «el modelo recupera documentos en el orden de miles… El modelo de clasificación luego ordena los documentos recuperados y sirve los 400 resultados clasificados principales»), pero eso es el producto Vertex AI Search, no la Búsqueda web de Google. No asumas que ni el 1 000 ni el 400 se aplican al propio Google Search.

Cómo lo hace Bing/Microsoft

Microsoft es mucho más explícito, y su documentación más clara es lo más cercano a una descripción oficial de un reranker de producción que encontrarás. El semantic ranker de Azure AI Search está documentado como “a feature that measurably improves search relevance by using Microsoft’s language understanding models to rerank search results” (traducción) «una característica que mejora mediblemente la relevancia de búsqueda al usar los modelos de comprensión del lenguaje de Microsoft para reordenar los resultados de búsqueda» — y crucialmente, “the underlying technology is from Bing and Microsoft Research.” (traducción) «la tecnología subyacente proviene de Bing y Microsoft Research».

La mecánica se ajusta claramente al patrón de dos etapas:

  • “always adds secondary ranking over an initial result set that was scored using BM25 or Reciprocal Rank Fusion (RRF).” (traducción) «siempre añade una clasificación secundaria sobre un conjunto de resultados inicial que se puntuó mediante BM25 o Reciprocal Rank Fusion (RRF)». La etapa uno es BM25 o RRF; el clasificador semántico es la etapa dos.
  • Microsoft llama a esa etapa clasificación L2, que “uses the context or semantic meaning of a query to compute a new relevance score over preranked results.” (traducción) «usa el contexto o significado semántico de una consulta para calcular una nueva puntuación de relevancia sobre resultados previamente ordenados».
  • Solo reclasifica la lista corta, nunca todo el corpus: “What semantic ranker can’t do is rerun the query over the entire corpus… Semantic ranking reranks the existing result set, consisting of the top 50 results as scored by the default ranking algorithm.” (traducción) «Lo que el clasificador semántico no puede hacer es volver a ejecutar la consulta sobre todo el corpus… La clasificación semántica reclasifica el conjunto de resultados existente, que consiste en los 50 mejores resultados según la puntuación del algoritmo de clasificación predeterminado». Incluso si vuelven más de 50 resultados, “only the top 50 results progress to semantic ranking.” (traducción) «solo los 50 mejores resultados avanzan a la clasificación semántica».

El propio blog de Bing de mayo de 2026 sobre el papel cambiante del índice no menciona directamente la reclasificación, pero refuerza que la calidad de la recuperación ahora se juzga por la fiabilidad del soporte de respuestas: “Retrieval systems must therefore optimize not just for one-shot retrieval, but for consistent, repeatable behavior across iterative use.” (traducción) «Los sistemas de recuperación deben, por tanto, optimizar no solo para la recuperación de una sola vez, sino para un comportamiento consistente y repetible en el uso iterativo».

Reclasificación en RAG y búsqueda con IA

Aquí es donde la reclasificación toca más directamente a AI Overviews, AI Mode, Copilot, ChatGPT Search y Perplexity. En un pipeline de RAG, la reclasificación es una etapa nombrada entre la recuperación y la generación: el contenido se divide en fragmentos, cada fragmento se incrusta y almacena, la consulta recupera fragmentos cercanos por similitud vectorial, un reclasificador vuelve a puntuar esos candidatos, y solo los mejores supervivientes se entregan al LLM como contexto. El reclasificador es la puerta entre “tu pasaje fue recuperado” y “tu pasaje fue realmente usado”.

Esa puerta puede ser estricta. En los sistemas de búsqueda con IA, solo una fracción de las fuentes recuperadas suele superar el umbral de reclasificación para entrar en la etapa de generación — así que ser incluido en el grupo de candidatos es el precio de entrada, no una garantía de cita. Como la propia investigación de Ahrefs sobre optimización para búsqueda con LLM plantea el problema central: “AI companies don’t reveal how LLMs select sources, so it’s hard to know how to influence their outputs.” (traducción) «Las empresas de IA no revelan cómo los LLM seleccionan las fuentes, por lo que es difícil saber cómo influir en sus resultados». La reclasificación es una gran parte de ese paso de selección oculto.

Reclasificación vs. Reciprocal Rank Fusion (RRF)

Estos se confunden constantemente — incluso en contenido SEO que por lo demás es bueno — y no son el mismo mecanismo.

  • Reclasificación vuelve a puntuar un grupo de candidatos evaluando conjuntamente cada par consulta-documento con un solo modelo (el cross-encoder). Pregunta: ¿qué tan relevante es este documento para esta consulta, realmente?
  • Reciprocal Rank Fusion (RRF) fusiona múltiples listas ya clasificadas — por ejemplo, los resultados de BM25 y los resultados de búsqueda vectorial, o los resultados de varias subconsultas en abanico — recompensando los documentos que aparecen de manera consistente en las listas. El explicador de Query Fan-Out de Ahrefs lo describe: las consultas en abanico se buscan en los índices “using reciprocal rank fusion (RRF) — a method that scores and merges multiple lists of results by rewarding those that appear consistently across them.” (traducción) «usando reciprocal rank fusion (RRF) — un método que puntúa y fusiona múltiples listas de resultados recompensando aquellos que aparecen de manera consistente en ellas».

Ambos pueden vivir en el mismo pipeline — el clasificador semántico de Azure literalmente reclasifica sobre un conjunto clasificado por BM25 o RRF — pero RRF es un paso de fusión de listas (ningún modelo lee tu contenido), mientras que la reclasificación es un paso de puntuación de contenido (un modelo lee la consulta y tu pasaje juntos). Si te llevas una aclaración: RRF combina listas; la reclasificación vuelve a leer contenido.

Una breve historia: BM25 → RankBrain → BERT → reclasificadores LLM

La reclasificación no es nueva — es el nombre moderno de un patrón que la búsqueda ha usado durante años. El hilo conductor, que recorro en mi charla de Ahrefs Evolve 2025 ¿GEO? ¿AEO? ¿LLMO? ¿A qué viene todo esto de la IA?:

  • BM25 / recuperación léxica — la puntuación clásica de coincidencia de palabras clave que aún realiza el primer filtrado amplio.
  • RankBrain (2016) — el primer sistema de clasificación de Google basado en aprendizaje automático, que entiende las palabras como conceptos.
  • BERT / DeepRank (2019) — comprensión contextual del lenguaje a nivel de pasaje; comienza la era de la reclasificación estilo cross-encoder.
  • Reclasificadores modernos basados en LLM (RankEmbed y cross-encoders de la era RAG) — los reclasificadores neuronales ahora se sitúan entre la recuperación y la generación en la búsqueda con IA.

La forma consistente en todos ellos: primero una recuperación amplia y barata, después una reordenación precisa y costosa de una lista corta.

Qué significa esto para el contenido y el SEO

Debido a que un cross-encoder puntúa la consulta y tu pasaje conjuntamente, las implicaciones prácticas refuerzan las mejores prácticas que ya conoces — ahora con un mecanismo detrás:

  • Escribe pasajes autocontenidos. Un reclasificador puntúa un pasaje en gran medida por sus propios méritos frente a la consulta. Una sección que solo tiene sentido en el contexto de los tres párrafos anteriores puntúa peor que una que se lee como una respuesta completa. Esto se relaciona directamente con clasificación de pasajes y fragmentación.
  • Responde a la pregunta específica, cerca del inicio de la sección. Las respuestas directas puntúan mejor que la introducción gradual. Pon la respuesta primero y luego desarrolla.
  • Minimiza la ambigüedad. Los pronombres y las frases dependientes del contexto (“como se mencionó anteriormente”, “este enfoque”) que solo se resuelven en otra parte de la página hacen que un pasaje sea más difícil de puntuar de forma aislada. Nombra la cosa.
  • La recuperación sigue siendo el requisito previo. La reclasificación solo ve lo que la recuperación le entrega. Una página que no puede ser rastreada e indexada, o que nunca se recupera, nunca llega al reclasificador. Arregla primero la visibilidad; optimiza los pasajes después.

Nada de esto es un ajuste que envíes a Google. Es el mismo consejo de “sé claro y sé encontrado”, dirigido a la etapa específica — la segunda mirada — que decide qué contenido recuperado se utiliza realmente.

Add an expert note

Pin an expert quote

New person? Create their unclaimed profile at /admin/experts/ → Pin a quote first.