検索拡張生成(RAG)

RAGの仕組み—Google AI Overviews、ChatGPT Search、Perplexityの背後にある「取得してから生成する」パターン—と、それがコンテンツが引用されるために何を意味するか。

初回公開:2026年6月24日 · 最終更新:2026年8月3日 · 上級者向け

RAG(検索拡張生成)は、AI検索の背後にある「取得してから生成する」パターンです。クエリ時に2つのフェーズを実行します—取得(外部インデックスから関連パッセージを見つける)と拡張生成(それらのパッセージをLLMに渡して、根拠のある引用付きの回答を書かせる)—モデルの重みを変更することはありません。これが、AI回答がモデルのトレーニングカットオフを超えた情報をカバーする方法です。取得フェーズは、チャンキング→埋め込み→ベクトル検索→再ランキング→トップkパッセージのチェーンです。RAGは幻覚を減らしますが、排除するわけではありません—そして、取得されたコンテキストが不十分だと、幻覚を悪化させる可能性があります。SEOにとって、別のAIインデックスはありません:クロール可能で、インデックスされ、明確で自己完結したパッセージに構造化されていることが、取得され引用されるための前提条件です。

Lewisらによる2020年のシステムは、非パラメトリックインデックスからの高密度検索とシーケンス生成を組み合わせたものでした。 この主張の根拠 The original RAG paper combined a pretrained sequence-to-sequence model with a non-parametric dense-vector index retrieved during generation. 対象範囲: Lewis et al.'s 2020 RAG architecture and experiments, not every modern retrieval system. 信頼度: 高 · 検証日: Lewis et al.: Retrieval-Augmented Generation Google Cloudの現在の概要では、RAGを、取得した外部知識をモデルに供給することとしてより広く定義しています。 この主張の根拠 Google Cloud describes RAG as retrieving relevant information from external knowledge sources and providing it to a model to improve generated responses. 対象範囲: General RAG architecture in Google Cloud documentation; quality depends on retrieval, source quality, and generation. 信頼度: 高 · 検証日: Google Cloud: RAG overview

TL;DR — RAGは、2段階の推論時パターンです。取得(外部コーパスから関連する文章を見つける)、次に拡張生成(その文章をLLMに渡して、根拠のある引用付きの回答を生成する)です。重みは変わりません。モデルのパラメトリックメモリと、ライブで取得された非パラメトリックメモリを組み合わせます。取得フェーズは、チャンキング → 埋め込み → ベクトル検索 → 再ランキング → top-k の順に連鎖します。「ナイーブ」RAGは取得してから生成するものです。高度なRAGはクエリ書き換えと再ランキングを追加します。エージェント型RAGは、反復的でマルチホップの取得を追加します。取得は回答の根拠を提供できますが、正確性を保証するものではありません。あるGemmaの評価では、不十分なコンテキストが誤った回答の増加と関連していました。SEOにとっては、別のAIインデックスは存在しません。クロール可能性、インデックス登録、文章レベルの明確さが、取得されるための前提条件です。

2つのフェーズ(そして「推論時」がすべてである理由)

検索はパイプラインです:チャンク化、埋め込み、検索、再ランキング、そして生き残ったものをモデルに渡します。 出典: /ai-search/how-search-works/rag/

推論時に5つの段階が左から右に実行されます。チャンキングは文書を検索可能なパッセージに分割します。埋め込みは各パッセージを密なベクトルとして表現します。ベクトル検索は候補を取得し、一部のシステムではBM25キーワード検索と組み合わせます。再ランキングは候補セットを再スコアリングして絞り込みます。上位の生き残ったパッセージがモデルのコンテキストに入ります。モデルの重みは変更されません。

© Patrick Stox LLC · CC BY 4.0 ·

RAGは、トレーニング済みモデルのメモリとクエリ時に取得されたコンテキストを組み合わせます — 重みは変更されません。 出典: /ai-search/how-search-works/rag/

2つのソースが1つの生成ステップに供給されます。パラメトリックメモリは、トレーニング中にモデルの重みにエンコードされた知識であり、トレーニングデータとカットオフによって制限されます。非パラメトリックメモリは、クエリ時に外部インデックスから取得されたパッセージで構成されます。生成は、重みが変更されないまま両方を使用し、取得されたソースに基づいて引用できる回答を生成します。これは正確性を保証するものではありません。

© Patrick Stox LLC · CC BY 4.0 ·

頭字語を分解すると、モデルが見えてきます。検索(Retrieval)拡張生成(Augmented Generation) です。クエリが入ると、システムは外部コーパスから最も関連性の高いパッセージを取得し、それらをLLMのコンテキストウィンドウに注入し、LLMはそれらに基づいて回答を生成します。

誰もが間違える詳細:これは推論時に行われ、モデルの重みは決して変更されません。 RAGはトレーニングでもファインチューニングでもありません。Facebook AI ResearchのPatrick Lewisらによる2020年の元の論文では、これを2種類のメモリの組み合わせとして位置づけていました。パラメトリックメモリ(トレーニング中に重みに組み込まれる知識)とノンパラメトリックメモリ(インデックスからライブで取得される知識)です。RAGは両方を同時に使用します。AWSは実際的なケースを明確に述べています。新しい知識やドメイン固有の知識を得るために基盤モデルを再トレーニングするのは高コストであり、「RAGはLLMに新しいデータを導入するためのより費用対効果の高いアプローチです。」

(ちなみに、この名前は偶然でした。Lewisは後に認めています:「私たちの研究がこれほど広まるとは知っていたら、名前にもっと考えを込めていたでしょう… 私たちは常にもっと良い名前を計画していましたが、論文を書く時が来たとき、誰も良いアイデアを持っていませんでした。」

検索フェーズの内部

「関連パッセージを取得する」というのは、その文では多くのことを担っています。実際のシステムでは、これはパイプラインです:

  1. チャンキング。 ドキュメントは取得可能な断片に分割されます。チャンクサイズは実際のトレードオフです。小さすぎるとパッセージが文脈を失い、大きすぎるとトークン予算を無関係なもので溢れさせます。戦略は、固定トークン数(100/256/512)から再帰的/スライディングウィンドウ、「Small2Big」(小さな文を取得し、生成用に親チャンクを返す)まで多岐にわたります。
  2. 埋め込み。 各チャンクは密ベクトル(その意味の数値表現)に変換され、類似性はキーワード一致ではなく意味的に計算されます。これが、トピックについてのコンテンツが、正確なクエリ表現を使用していなくても取得される理由です。
  3. ベクトル検索。 クエリも埋め込まれ、システムはそのベクトルが最も近いチャンクを見つけます。ほとんどの本番スタックはハイブリッド検索(密ベクトル検索プラスBM25キーワード検索)を実行します。なぜなら、それぞれが他方が見逃す再現率を捕捉するからです。
  4. 再ランキング。 別のモデルがクエリへの関連性によって候補を再スコアリングし、並べ替えます。「全体的なドキュメントプールを効果的に削減します。」 上位の生き残りだけがコンテキストに入ります。
  5. プロンプトへのTop-k。 最良のパッセージがユーザーのクエリと連結され、生成器に渡されます。

チャンキングは脆弱なリンクです。Anthropicは、*「従来のRAGソリューションは情報をエンコードする際にコンテキストを除去する」*と特定しました。チャンクがドキュメントから取り出されると、それを意味のあるものにしていた周囲のコンテキストを失います。彼らのContextual Retrieval技術(インデックス作成前にチャンク固有のコンテキストを前置する)は、失敗した取得を**49%削減し、再ランキングと組み合わせると67%**削減しました。これは、チャンキング問題が現実であること、そして自己完結型でコンテキスト豊富なパッセージが正しく取得しやすいことを示す強いシグナルです。

ナイーブ、アドバンスト、エージェンティックRAG

調査文献(Gao et al., 2023)はRAGを有用な分類法に分割しています:

  • Naive RAG「インデックス作成、検索、生成を含む従来のプロセス。」 トップkを一度取得し、一度生成する。「精度と再現率に課題があり、ミスアライメントや無関係なチャンクの選択につながる。」
  • Advanced RAG「検索前および検索後の戦略」 を追加。検索前: クエリの書き換えとより良いインデックス作成(HyDE を含む。モデルが仮説的な回答を生成し、それ を埋め込み、質問ではなく回答のように見えるドキュメントを取得する)。検索後: 再ランキングとコンテキスト圧縮。
  • Modular / agentic RAG — モデルが検索し、まだ欠けているものを推論し、再度検索し、複数ホップ にわたって反復する。これがAI検索の現在の状態です。Michael King氏が述べたように: 「最初の波を定義した一度検索してから生成するパターンは時代遅れです…Agentic RAGが今やデフォルトです。」

これはSEOにとって重要です。なぜなら、コンテンツは単一の検索パスだけでなく、複数 の検索ラウンドと矛盾チェックに耐えなければならないからです。

RAGは幻覚を排除するのか?いいえ。

ある評価では、Gemmaは文脈なしの質問の10.2%に誤答し、不十分な文脈では66.1%に誤答しました。これは普遍的なモデル効果ではありません。 出典: Data: Google Research

2本の棒は、Google Researchの1つの評価におけるGemmaの不正解率を示しています。文脈なしでは10.2%、不十分な文脈では66.1%です。この比較は、Google ResearchのICLR 2025十分な文脈に関する研究からのものであり、すべてのモデル、データセット、検索システムに一般化すべきではありません。

RAGは取得したソースに回答を基づかせることができますが、LLMは取得した内容を誤読したり、過剰に解釈したりする可能性があります。Google Research(ICLR 2025)は、ある評価で直感に反する結果を記録しました。Gemmaは、コンテキストなしの質問の10,2%と、コンテキストが不十分な場合の66,1%で誤った回答 を生成しました。研究者らは、モデルが*「十分なコンテキストがあれば優れているが、コンテキストが不十分な場合にそれを認識できない」* と報告しています。これは、検索が普遍的に悪い回答を引き起こすという証拠ではなく、モデルおよび評価固有の警告として扱ってください。実際的な教訓はより狭いものです。検索品質とコンテキストの十分性は、想定するのではなく評価する必要があるということです。Googleはこの発見を、Vertex AI RAG EngineのLLM再ランカーとして実用化しました。

RAGとファインチューニング

これらは常に混同されますが、根本的に異なります:

  • RAG はクエリ時に外部情報を取得します。重みは変更されません。最新/変化する情報、引用要件、コストに最適です。調査では、「RAGは、トレーニング中に遭遇した既存の知識と完全に新しい知識の両方において、[教師なしファインチューニング]を一貫して上回る」 ことがわかりました。
  • ファインチューニング は、別のトレーニング実行でモデルの重みを変更します。スタイルと動作 の変更、または変化しない安定したドメイン知識の教育に最適です。

モデルに最新の事実を 知らせる ためにはRAGを利用し、モデルの 話し方 を変えるためにはファインチューニングを利用することになるでしょう。

実際のRAG: Google、ChatGPT、Perplexity

  • Google AI Overviews. Google は RAG を 「(グラウンディングとも呼ばれる) 手法… 中核となる検索ランキング システムに依存して、検索インデックスから関連性の高い最新の ウェブページを取得する」 と呼んでいます。これには2つの意味があります。第一に、独立した AI インデックスは存在しません「Google 検索の生成 AI 機能は、中核となる検索ランキングおよび品質システムに 根ざしています。」 第二に、Google は クエリ ファンアウト を実行します: 「モデルによって生成された、より多くの情報を要求するための並行した関連クエリ。」 1つの質問から複数のサブクエリが生成され、それぞれが異なるコンテンツを取得します — つまり、あなたのコンテンツは、メインのクエリだけでなく、暗黙のサブ質問も満たす必要があります。
  • ChatGPT Search. (2024年10月) Bing をデータパートナーとして開始され、 OpenAI 自身のクローラーのドキュメントは、OAI-SearchBot が GPTBot の トレーニング クロールとは別に、検索引用のために独立したフェッチとインデックス作成を行うことを確認しています。OpenAI は Bing と自社インデックス間の現在の取得割合を公開しておらず、OpenAI は ChatGPT Search を Bing のラッパーではなく、Bing に対する独立した競合製品として位置付けています — そのため、「基本的に Bing だ」というのは単純化しすぎです。文書化された実行可能なレバーはより狭く、より耐久性があります: robots.txt で OAI-SearchBot をブロックしないでください。なぜなら、それが OpenAI 自身が検索引用のためにコンテンツをインデックスするクローラーとして挙げているものだからです。
  • Perplexity. ハイブリッド検索 (Vespa.ai — BM25 + 密) とカスタム埋め込みモデル、および厳格な再ランキングしきい値に基づいています: 第三者分析によると、取得された60以上のソースのうち上位約30%のみが生成段階まで生き残り、「引用は生成後に後付けされるのではなく、コンテキスト構築中に構造的に割り当てられます。」 Deep Research は、数十の検索にわたってエージェント ループを実行します。

RAG が SEO にとって意味すること

専門用語を除けば、そのプレイブックは具体的です:

  • インデックスに含まれることが前提条件です — それ以外はありません。 独立した AI インデックスがないということは、 クロール → インデックス → 取得のチェーンが intact である必要があるということです。ページが クロール およびインデックスされなければ、AI の回答に取得されることはありません。 独自のプールを構築する AI エンジンにも同じことが当てはまります: AI クローラー (OAI-SearchBot や PerplexityBot など) があなたをフェッチすることを許可されなければ、それらの回答からは見えなくなります。
  • 自己完結型のパッセージを書く。 RAG はページ全体ではなく 断片 を取得します。 iPullRank の Francine Monahan が述べたように、AI システムは 「ページ全体ではなくページの断片」 を調べます — したがって、特定の質問に単独で答える 「際立ったパッセージやフレーズ」 を作成します。これは、優れた SEO がすでに評価している H2/H3 構造と明確なトピック文とまったく同じです。Google は、AI のためにコンテンツを細かく分割する べきではない と明示的に述べています — 構造化されたコンテンツは自然に適切にチャンク化されます。
  • サブトピックをカバーする。 クエリ ファンアウトとは、1つの質問が多くの取得をトリガーできることを意味します。関連するサブ質問にわたる深さは、単一のキーワードに詰め込まれた1つのページよりも優れています。
  • 権威はランク位置よりも引用を促進します。 8 000件の引用分析から: 「強力なオーガニック検索プレゼンスと広範なウェブ可視性が AI 引用につながります。その逆ではありません」 — そして 「ランキングが低いページからの非常に権威のあるコンテンツ」 が、信頼性の低い上位ランキングのページよりも引用されることがあります。私自身のデータも一致しています (私の AI Overview 引用調査 から): リンクの多いページでの言及が AI Overview への掲載の最も強い予測因子であり (ρ ≈ 0,70)、ブランドのウェブ言及は 75 000 ブランドにわたって約 0,66 の相関がありました。
  • 新しいコンテンツには利点があります。 AI 引用はオーガニック結果よりも有意に新しい傾向があるため、鮮度が重要です。

1文でまとめると: RAG は SEO を置き換えたのではなく、常に見つけやすく明確であることに関する SEO の部分の重要性を高めました。

専門家メモを追加

専門家の引用を固定

新しい人物ですか?まず、 /admin/experts/ → 専門家の引用を固定 から未登録プロフィールを作成してください。