再ランキング

再ランキングは検索パイプラインの第2段階です。バイエンコーダーとクロスエンコーダーが、取得した結果を関連性に基づいて再順序付けし、提供またはLLMに渡す前にどのように並べ替えるか、そしてそれがAI検索の可視性に何を意味するかについて説明します。

初回公開:2026年7月3日 · 最終更新:2026年8月3日 · Advanced
言語

再ランキングは検索パイプラインの第2段階です。安価で広範な最初のパスが候補となる文書やパッセージのセットを取得し、その後、より遅くて精密なモデルがその候補リストを再スコアリングして再順序付けし、結果が提供されるかLLMに渡されます。中心となる仕組みはバイエンコーダーとクロスエンコーダーの比較です。バイエンコーダーはクエリと文書を別々にベクトル化して比較します(高速、スケーラブル、精度は低め)。一方、クロスエンコーダーはそれらを一緒にエンコードしてペアを直接スコアリングします(低速、高精度)。高価なモデルで数十億ページのコーパス全体をスコアリングすることはできないため、広く取得して候補リストを再ランキングします。Googleは公には「再ランキング」という言葉を使いませんが、その名前の付いたBERTやパッセージランキングシステムがその役割を果たしており、MicrosoftはAzure AI SearchでBing由来の明示的な再ランカーを文書化しています。再ランキングはReciprocal Rank Fusionと同じではありません。SEOの要点:再ランカーはクエリとパッセージのペアを共同でスコアリングするため、自己完結的で曖昧さがなく、直接的な回答として読めるパッセージがより高いスコアを得ます。

TL;DR — 再ランキングは、2段階(または多段階)レトリーバルパイプラインの2番目の段階です。安価で広範なレトリーバルパス(BM25キーワードマッチ、埋め込み/ベクトル類似度、またはその両方)が候補セットを取得し、その後、より遅くより精密なモデルがその候補リストを再スコアリングして並べ替えます。中核となるメカニズムはバイエンコーダーとクロスエンコーダーです。バイエンコーダーはクエリとドキュメントを別々にベクトルにエンコードして比較します(高速、事前計算可能、精度は低い)。クロスエンコーダーはそれらを一緒にエンコードし、ペアごとに1つの関連性スコアを出力します(低速、事前計算不可、より正確)。コーパス全体に対してクロスエンコーダーを実行することはできないため、広くレトリーバルして候補リストを再ランキングします。Googleは公には「再ランキング」とは言いませんが、BERTとパッセージランキングがその役割を果たします。MicrosoftはAzure AI SearchでBing由来の明示的な再ランカーを文書化しています。再ランキング ≠ Reciprocal Rank Fusion(RRF)。SEOの要点:再ランカーはクエリとパッセージのペアを共同でスコアリングするため、自己完結型で曖昧さのないパッセージが勝ちます。

Evidence for this claim A cross-encoder can score query-document pairs for reranking after an initial retrieval stage. Scope: Sentence-BERT evaluation and related retrieve-then-rerank use; cross-encoders are one reranking approach, not a universal implementation. Confidence: high · Verified: Reimers and Gurevych: Sentence-BERT

レトリーバルしてから再ランキングするパターン

二段階検索は、候補の網羅性と、より高コストなスコアリングの間でトレードオフを行います。 Evidence for this claim A cross-encoder can score query-document pairs for reranking after an initial retrieval stage. Scope: Sentence-BERT evaluation and related retrieve-then-rerank use; cross-encoders are one reranking approach, not a universal implementation. Confidence: high · Verified: Reimers and Gurevych: Sentence-BERT モデルの選択とレイテンシと品質のトレードオフは実装に依存します。 Evidence for this claim A rerank model can reorder an existing candidate list by relevance to a query. Scope: Cohere's Rerank product behavior; inputs, limits, and scoring semantics are vendor-specific. Confidence: high · Verified: Cohere: Rerank overview

Reranking changes the order only after retrieval creates the candidate set. 出典: Reranking

A query enters fast first-stage retrieval, which produces a candidate shortlist. A slower query-candidate scoring model reranks only that shortlist into the final order. A document omitted by retrieval never reaches the reranker.

© Patrick Stox LLC · CC BY 4.0 ·

大規模な関連性システムはすべて同じ問題に直面します。最も正確な関連性モデルをコーパス全体に対して実行する余裕はありません。そこで標準的な解決策は、作業を段階に分割することです。Google Cloud自身の検索ドキュメントには、その論理が明確に述べられています:「要するに、検索(retrieval)は関連ドキュメントを見つけることであり、ランキング(ranking)はそれらの検索されたドキュメントを順序付けることです。利用可能なすべてのドキュメントをランキングすることは、計算コストが高くなる可能性があります。したがって、検索とランキングは順番に機能します。」 (Google Cloud, “About retrieval and ranking”)

第一段階 — 検索(retrieval) — は、低コストで広く網を張ります。語彙マッチング(転置インデックス上のBM25)、埋め込みベースのベクトル検索、またはそのハイブリッドを使用し、候補セットを返します。第二段階 — 再ランキング(reranking) — は、その候補リストを受け取り、より高コストで高精度なモデルで各候補を再スコアリングし、並べ替えます。誰もが行き着く一言で言うと:安価に広く検索し、少数のセットに対して正確に再ランキングし、その後提供または生成します。

バイエンコーダー vs クロスエンコーダー:核となる仕組み

このトピック全体は、1つのアーキテクチャ上の違いに依存しています — クエリとドキュメントがいつ出会うか、です。

  • バイエンコーダー(第一段階の検索器)。クエリと各ドキュメントを別々にエンコードし、それぞれを独自のベクトルにし、その後コサイン類似度などで2つのベクトルを比較します。ドキュメントベクトルはクエリに依存しないため、事前に計算してインデックス化でき、それが検索をコーパス全体で実行できるほど高速にしている理由です。コスト:クエリとドキュメントが実際には相互作用しないため、モデルは事実上、ドキュメントの可能な意味をすべて単一のベクトルに圧縮する必要があり、ニュアンスが失われます。バイエンコーダーは、埋め込みとベクトル検索が基づいているものです。
  • クロスエンコーダー(第二段階の再ランカー)。クエリと1つの候補ドキュメントを一緒に、トランスフォーマーを通した単一の共同入力としてエンコードし、そのペアに対する単一の関連性スコアを出力します。モデルが両方を同時に見るため、クエリの特定の単語がドキュメントの特定の単語とどのように関連するかを直接評価でき、はるかに正確です。コスト:事前計算できるものはありません。すべてのクエリ-ドキュメントペアをクエリ時にモデルに通す必要があるため、インデックス全体に適用するには遅すぎます。それがまさに、候補リストのために予約されている理由です。

Googleは、特筆すべきことに、この正確な仕組みを自らの言葉で説明しています。Google Cloudの検索/ランキングドキュメントでは、リストされている検索シグナルの1つがクロスアテンションであり、*「モデルがクエリとドキュメントの関係を考慮して、ドキュメントに関連性スコアを割り当てることを可能にする」*ものと定義されています。これは、クロスエンコーダーのアイデアを別の名前で呼んだものです。

なぜ正確なモデルをすべてに使わないのか?

レイテンシとコストにより、大規模には実行不可能であり、その差はわずかではなく莫大です。Pineconeの二段階検索に関する記事には、具体的な数字が示されています:4 000万レコードのセットで、BERTスタイルのクロスエンコーダー再ランカーをV100 GPUで全体に実行すると、50時間以上かかるのに対し、ベクトル検索では100ミリ秒未満です。(Pinecone, “Rerankers and Two-Stage Retrieval”) それが二段階設計の正当化のすべてです — クロスエンコーダーの精度の大部分を得ながら、そのコストを数十または数百の候補にのみ支払うのです。

Vectaraは同じ神話を直接的に提示しています——最も正確なモデルが利用可能なら、なぜすべてのドキュメントをそのモデルでスコアリングしないのかという疑問——そして答えも同じです:それはできないので、まず安価にフィルタリングするのです。 (Vectara, “What is reranking and why does it matter?”)

Googleがこれをどう行うか

GoogleはGoogle検索自体について「リランキング」「クロスエンコーダー」「バイエンコーダー」という用語を使った公式声明を一度も発表していません——これは過剰に主張しないよう明確に述べておく価値があります。しかし、その機能は別の名前で文書化されています。

Google自身のGoogle検索ランキングシステムガイドは、リランキングの役割を果たす2つのシステムを挙げています:

  • BERT“an AI system Google uses that allows us to understand how combinations of words express different meanings and intent.” BERTはクエリの単語を文脈の中で共同で読み取ります;BERTベースのリランカーは、クロスエンコーダーと同じようにクエリとドキュメントの関連性をスコアリングします。
  • パッセージランキング“an AI system we use to identify individual sections or ‘passages’ of a web page to better understand how relevant a page is to a search.” これはページレベルではなくパッセージレベルでのリランキングです(詳細はパッセージランキングを参照)。
  • RankBrain — Googleの初期のシステムで、“helps us understand how words are related to concepts,” つまり、完全一致の単語がなくても関連するコンテンツを返すことができます。

Google Researchもまた、そのメカニズムを率直に公開しています:その論文Learning-to-Rank with BERT in TF-Rankingは、BERTでクエリとドキュメントをエンコードし、その上に学習-to-ランク層を適用することを説明し、それを明示的にパッセージリランキングとして位置づけています——2020年3月30日時点でのMS MARCOパッセージリランキングタスクでの最高性能を報告しています。これはSearch Centralの製品ガイダンスではなくGoogle Researchの出版物なので、Googleの技術研究として扱い、ライブの検索パイプラインに関する声明とは見なさないでください。

注意すべき数字が1つあります:SEO界で広く流通している「上位1,000件に絞り込んでから並べ替える」という枠組みは、私自身のカンファレンスデッキによる公開研究と特許の解釈に遡ります——現在の、そのままのGoogleのウェブ検索に関する声明ではありません。Google Cloudのエンタープライズ検索製品は具体的なパイプラインを文書化しています(“the model retrieves documents in the order of thousands… The ranking model then orders the retrieved documents and serves the top 400 ranked results”)が、それはVertex AI Search製品であり、Googleウェブ検索ではありません。1 000も400もGoogle検索自体に当てはまると想定しないでください。

Bing/Microsoftがこれをどう行うか

Microsoftははるかに明示的であり、その最も明確なドキュメントは、公式の本番リランカーの説明に最も近いものです。Azure AI Searchのセマンティックランカーは、“a feature that measurably improves search relevance by using Microsoft’s language understanding models to rerank search results”として文書化されています——そして決定的に、“the underlying technology is from Bing and Microsoft Research.”

そのメカニズムは、2段階パターンにきれいにマッピングされます:

  • これは “常に、BM25 または Reciprocal Rank Fusion (RRF) でスコアリングされた初期の結果セットに対して二次的なランキングを追加します。” ステージ 1 は BM25 または RRF で、セマンティックランカーはステージ 2 です。
  • Microsoft はそのステージを L2 ランキング と呼び、“クエリのコンテキストまたはセマンティックな意味を使用して、事前にランク付けされた結果に対して新しい関連性スコアを計算します。”
  • これは候補リストのみを再ランク付けし、コーパス全体は決して再ランク付けしません: “セマンティックランカーができないことは、コーパス全体に対してクエリを再実行することです… セマンティックランキングは、デフォルトのランキングアルゴリズムによってスコアリングされた上位 50 件の結果で構成される既存の結果セットを再ランク付けします。” 50 件を超える結果が返された場合でも、“上位 50 件の結果のみがセマンティックランキングに進みます。”

Bing 自身の 2026 年 5 月のインデックスの進化する役割に関するブログ は、再ランク付けを直接挙げてはいませんが、検索品質が現在、回答サポートの信頼性によって判断されていることを強調しています: “検索システムは、ワンショット検索だけでなく、反復的な使用にわたって一貫性のある再現可能な動作のために最適化する必要があります。“

RAG と AI 検索における再ランク付け

ここが、再ランク付けが AI Overviews、AI Mode、Copilot、ChatGPT Search、Perplexity に最も直接関わる部分です。RAG パイプラインでは、再ランク付けは検索と生成の間の名前付きステージです: コンテンツはチャンク化され、各チャンクは埋め込まれて保存され、クエリはベクトル類似度によって近くのチャンクを取得し、再ランカーがそれらの候補を再スコアリングし、上位の生き残りだけがコンテキストとして LLM に渡されます。再ランカーは、「あなたのパッセージが取得された」と「あなたのパッセージが実際に使用された」の間のゲートです。

そのゲートは厳格になり得ます。AI 検索システムでは、取得されたソースのごく一部だけが通常、再ランクのしきい値を通過して生成ステージに進みます。そのため、候補プールに引き込まれることは参加費であり、引用の保証ではありません。Ahrefs 自身の LLM 検索の最適化に関する調査 が中核的な問題を次のように述べています: “AI 企業は LLM がソースをどのように選択するかを明らかにしないため、その出力にどのように影響を与えるかを知ることは困難です。” 再ランク付けは、その隠された選択ステップの大きな部分を占めています。

再ランク付けと Reciprocal Rank Fusion (RRF) の比較

これらは常に混同されます — それ以外は優れた SEO コンテンツの中でも — そして、それらは同じメカニズムではありません。

  • 再ランク付け は、単一のモデル (クロスエンコーダー) で各クエリとドキュメントのペアを共同評価することにより、1 つの 候補プールを再スコアリングします。これは次のように問いかけます: このドキュメントはこのクエリに実際にどの程度関連しているか?
  • Reciprocal Rank Fusion (RRF) は、複数の既にランク付けされたリストをマージ します — たとえば、BM25 の結果とベクトル検索の結果、または複数のファンアウト サブクエリの結果 — リスト全体で一貫して表示されるドキュメントに報酬を与えることによって。Ahrefs の Query Fan-Out の説明 は次のように説明しています: ファンアウト クエリはインデックス全体で検索され、“reciprocal rank fusion (RRF) — リスト全体で一貫して表示されるものを報酬を与えることによって、複数の結果リストをスコアリングしてマージする方法 — を使用します。”

両方は同じパイプラインに共存できます — Azure のセマンティックランカーは文字通り BM25 または RRF でランク付けされたセットの上で再ランク付けします — しかし、RRF はリストマージステップ (モデルはコンテンツを読み取らない) であり、再ランク付けはコンテンツスコアリングステップ (モデルがクエリとパッセージを一緒に読み取る) です。1 つの明確化を取り除くなら: RRF はリストを結合し、再ランク付けはコンテンツを再読み取りします。

簡単な歴史: BM25 → RankBrain → BERT → LLM 再ランカー

再ランク付けは新しいものではありません — これは検索が長年使用してきたパターンの現代的な名前です。この一貫した流れは、私の Ahrefs Evolve 2025 の講演 GEO? AEO? LLMO? What’s With All This AI Stuff? で説明しています:

  • BM25 / 語彙検索 — 今も一次絞り込みで使われる古典的なキーワード一致スコアリング。
  • RankBrain(2016年) — 単語を概念として理解する、Google初の機械学習ランキングシステム。
  • BERT / DeepRank(2019年) — 文脈を考慮したパッセージレベルの言語理解。クロスエンコーダー型の再ランキング時代が始まる。
  • 現代のLLMベースの再ランカー(RankEmbedやRAG時代のクロスエンコーダー) — ニューラル再ランカーは現在、AI検索において検索と生成の間に位置する。

すべてに共通する形:まず安価で広範な検索、次に高価で精密な少数候補の並べ替え。

コンテンツとSEOへの影響

クロスエンコーダーはクエリとパッセージを共同でスコアリングするため、実際的な影響は、すでにご存じのベストプラクティスを強化するものだ——今度はその背後にあるメカニズムが明確になった:

  • 自己完結型のパッセージを書く。 再ランカーは、クエリに対するパッセージを主に単独の価値でスコアリングする。直前の3つの段落の文脈でのみ意味をなすセクションは、完全な回答として読めるものよりもスコアが低くなる。これはパッセージランキングチャンキングに直接関連する。
  • セクションの冒頭付近で、特定の質問に答える。 前置きよりも直接的な回答の方がスコアが高い。先に答えを述べ、その後で詳しく説明する。
  • 曖昧さを最小限にする。 代名詞や文脈依存の表現(「前述のとおり」「このアプローチ」など)は、ページの他の場所でしか解決されないため、パッセージを単独でスコアリングするのが難しくなる。物事に名前を付けよう。
  • 検索は依然として前提条件。 再ランキングは、検索が渡したものだけを見る。クロールやインデックスができないページ、または検索で取得されないページは、そもそも再ランカーに到達しない。まず発見可能性を修正し、次にパッセージを最適化する。

これはどれもGoogleに提出する設定項目ではない。同じ「明確にし、見つけられるようにする」というアドバイスを、取得されたコンテンツが実際に使われるかどうかを決定する特定の段階——つまり2回目の見直し——に向けたものだ。

Add an expert note

Pin an expert quote

New person? Create their unclaimed profile at /admin/experts/ → Pin a quote first.