チャンク化とAI検索

AIシステムがページを埋め込み、インデックス登録、検索取得のためにパッセージへ分割する方法を説明します。チャンクサイズ、重複、意味チャンク化、文脈プレフィックスとGoogleのパッセージランキングとの関係を扱います。

初回公開:2026年6月24日 · 最終更新:2026年8月22日 · Advanced
言語

チャンク化は、AIシステムが文書を埋め込みと検索取得の前に小さなパッセージへ分ける前処理です。AI検索で検索取得される単位はページではなくチャンクなので、インデックス登録だけでは足りず、特定のクエリに単独で答えるパッセージが必要です。サイズは精度と文脈のトレードオフで、重複は境界を守る一方トークンを重複させます。意味チャンク化が固定サイズより確実に優れるわけではなく、古い文脈プレフィックスは検索を誤らせます。Lost in the Middleは特定の2023年モデルとタスクで測定された位置効果です。特定サイズは最適化できませんが、明確な見出しの下で答えを先に置く自己完結セクションは、RAGとGoogleのパッセージ原理に沿います。

要点 — チャンク化は、文書を埋め込み、インデックス登録、検索取得する前にパッセージへ分ける前処理です。埋め込みモデルとコンテキストウィンドウにはトークン制限があり、ページ単位よりパッセージ単位の検索取得の方が精密です。検索取得の単位はページではなくチャンクです。 チャンクサイズはトレードオフで、小さいチャンクは正確ですが文脈が薄く、大きいチャンクは文脈が豊かですがノイズが増えます。チャンクサイズ、重複幅、分割器のどれも引用を保証しません。重複は境界を守る一方、インデックスサイズと重複を増やします。意味チャンク化が固定サイズより確実に優れるわけではありません。文脈プレフィックスはチャンクを明確にできますが、古いプレフィックスは検索を誤らせます。「Lost in the Middle」は特定の2023年モデルとタスクで測定された位置効果です。特定のチャンクサイズは最適化できず、Googleも小片への分割を試みるべきではないと述べていますが、明確な見出しの下で答えを先に置く自己完結セクションなら、RAGにもGoogleのパッセージランキングにもきれいに対応します。

チャンク化とは、なぜ存在するのか

検索システムはインデックス済みの単位を扱いますが、公開検索エンジンが、サイト運営者の制御できる共通のチャンクサイズを公開しているわけではありません。 Evidence for this claim Retrieval systems can split files into chunks that are embedded and indexed for later search. Scope: OpenAI's retrieval implementation; chunk sizes, overlap, and indexing behavior are implementation-dependent. Confidence: high · Verified: OpenAI: Retrieval guide RAG研究は検索してから生成するパターンを支持しますが、すべてのAI検索製品が同一の仕組みを使うことを証明するものではありません。 Evidence for this claim Retrieval-augmented generation combines a generator with retrieved external passages or documents. Scope: The original RAG research architecture; it does not establish one optimal chunking strategy for every production system. Confidence: high · Verified: Lewis et al.: Retrieval-Augmented Generation

チャンク化とは、文書をチャンクまたはパッセージという小さく独立したセグメントへ分け、埋め込みに変換し、ベクトルインデックスへ保存してから、クエリへの回答で検索取得する処理です。これはRAG(Retrieval-Augmented Generation)パイプラインの基礎であり、クエリ時ではなく取り込み時に起きるため、AI検索SEO担当者が見落としやすい工程です。

2つの問題がチャンク化を必要にします。

  • トークン制限の問題。 埋め込みモデルは入力ごとに受け付けるトークン数に上限があります。Microsoftによれば、text-embedding-3-small モデルの上限は 8 191トークンで、他のモデルではさらに小さい場合があります。LLMのコンテキストウィンドウも有限です。5 000語の長いページは単一単位に収まらず、分割されます。
  • 検索精度の問題。 「technical SEO」についての5 000語のページを1つのベクトルに押し込めると、平均化された曖昧なシグナルになります。「crawl budget」だけを扱う400語のセクションを独立したベクトルにすれば、長く複数テーマを含むページから関連する1つのパッセージを取り出せます。

ここから導かれる最も重要な考えは、AI検索で検索取得される単位はページではなくチャンクであるということです。クロールとインデックス登録は必要ですが、十分ではありません。特定のクエリに単独で明確に答えるチャンクが必要です。オーガニック検索で**#15のページでも、#1**の結果より抽出しやすいパッセージを持っていれば、AIの引用を獲得できます。

チャンク化の全体フロー

Chunking changes the retrieval unit: the page is published once, but its passages are stored and matched separately. 出典: /ai-search/how-search-works/chunking/

A four-stage flow begins with one long document containing several topics. The system splits and embeds focused passages as separate vectors. A query retrieves one or more best-matching passages, and those selected passages enter the model context for answer generation.

© Patrick Stox LLC · CC BY 4.0 ·

  1. 取り込みと分割。 AIクローラーがページをダウンロードし、チャンク化アルゴリズムが通常は重複を持つセグメントへ分けます。
  2. 埋め込み。 各チャンクを数値ベクトルに変換し、ベクトルインデックスへ保存します。これが埋め込みの工程です。
  3. 検索取得と生成。 クエリを埋め込み、ベクトル検索で最も近いチャンクベクトルを取得し、LLMへ渡して引用付きの回答を作ります。

このアーキテクチャ全体は、Karpukhinらの2020年のDense Passage Retrievalにさかのぼります。この研究は、上位20件のパッセージ精度で密ベクトル類似度が旧来のキーワード手法(BM25)を9–19%の絶対差で上回り、特定の質問に答えるには文書単位よりパッセージ単位の検索取得が有効だと示しました。Lewisらの2020年のRAG論文 がこのパターンを名付け、Wikipediaの100-word passages(100語のパッセージ)をチャンクとして使いました。ウェブコンテンツを検索取得するAI検索システムは、いずれもこのパイプラインの変種を実行しています。

チャンク化の戦略

単一のアルゴリズムはありません。システムは複数の方式から選び、時間とともに変更します。

単一のアルゴリズムはありません。システムは複数の方式から選び、時間とともに変更します。

  • 固定サイズ — トークン数または文字数で分割し、一部を重複させる最も一般的な方式です。Microsoftの例は、“a fixed size sufficient for semantically meaningful paragraphs (for example, 200 words or 600 characters)” (翻訳)「意味的に意味のある段落を保てる十分な固定サイズ(例えば200語または600文字)」で、重複は10–15%です。
  • 文/段落 — 任意のトークン数ではなく自然言語の境界で分け、意味単位を保ちます。
  • 意味/内容認識 — 埋め込み類似度で文をまとめ、話題が変わる箇所で分割し、各チャンクを1つの話題に近づけます。
  • 階層/再帰(RAPTOR) — 文書→セクション→段落という要約ツリーを作り、クエリに適した抽象度で答えられるようにします。Sarthiらの2024年のRAPTORは、GPT-4と組み合わせた難しいQAベンチマークで 20% absolute accuracy(絶対精度)の向上を報告しました。
  • 重複付きスライディングウィンドウ — 隣接するチャンクでトークンを共有し、境界をまたぐ文が失われるのを防ぎます。
  • 適応型/クエリ依存(Mix-of-Granularity) — 学習済みルーターがクエリごとにチャンクサイズを選びます。最も高度な方式ですが、商用システムではまだ標準ではありません。

チャンクサイズと重複 — 中心となるトレードオフ

これは誰もが尋ねるレバーですが、正直な答えは「状況による」です。

  • 小さいチャンク(128–256トークン): 検索取得はより正確になりますが、答えに必要な周辺文脈を失うことがあります。
  • 大きいチャンク(512–1 024トークン): 文脈を多く保てますが、検索取得がノイジーになり、関連箇所以外も一緒に取り込みます。

研究は単一の勝者を決めていません。LlamaIndexの評価では、その設定で1 024トークンが最適でした。Chromaのベンチマークでは200-tokenの再帰的分割器が指標全体で一貫していました。Ravi Thejaの結論は、“Identifying the best chunk size for a RAG system is as much about intuition as it is empirical evidence.” (翻訳)「RAGシステムに最適なチャンクサイズを特定することは、経験的証拠と同じくらい直感にも関わる」というものです。これらの数字は、1つのチームが、1つの文書集合、1つの埋め込みモデル、1つの評価タスクで得た結果であり、普遍的な設定ではありません。チャンクサイズ、重複幅、分割器のどれも、外部AIシステムでの検索取得、引用、ランキング、回答への採用を保証しません。 各プロバイダーのパイプラインが既定値を選び、予告なく変更できます。

重複は、この問題の過小評価されがちな半分です。重複がなければ境界付近の内容が分断されて失われます。Microsoftは、チャンク間の移行を滑らかにするために25%の重複から始めることを推奨し、他の資料は10–15%を提案しています。Microsoftの表現では、“smoother transitions between chunks without excessive duplication” (翻訳)「過度な重複なしにチャンク間をより滑らかに移行」できます。しかし重複は無料ではありません。重複トークンは二重に埋め込まれて保存されるため、インデックスが膨らみ、検索取得セット内にほぼ同じパッセージが隣り合って現れることがあります。原則ではなく、境界が事実を失わせる頻度と、インデックスサイズ・冗長性のコストを比較してください。実務上は、重要な事実をチャンク境界で切れやすい位置に埋めないことが大切です。

では、意味チャンク化は常に勝つのでしょうか。いいえ、そこが不都合な発見です。Vectaraの2024年の研究は、実世界の文書では “performance differences are minimal” (翻訳)「性能差は最小限」だとし、埋め込みモデルの品質の方がチャンク戦略より重要だと報告しました。GPT-4oが回答を生成した場合、方式間の差は “negligible” (翻訳)「無視できるほど小さい」ものでした。この結果は、Vectaraの文書集合、モデル、評価方法に固有のものです。意味チャンク化がどのパイプラインでも役立たないという証明ではなく、確実に勝つ既定値ではないという証拠です。SEO担当者にとっては、正確な構造に固執するより、コンテンツの品質と意味の明確さを重視する方が重要だということです。

チャンクの文脈:プレフィックスで直せること、直せないこと

人間には明確に読めるチャンクでも、周囲の文書から切り離されると検索でうまく扱われないことがあります。所属するセクション、実際に指しているエンティティ、2つ上の見出しで述べた条件が失われるためです。記録されている対策の1つが、埋め込み前に、文書タイトル、所属セクション、チャンクの主題を示す短いチャンク固有の文脈文字列を付ける方法です。Anthropicがcontextual retrievalと呼ぶこの方法なら、孤立したチャンクの曖昧さを減らし、文脈不足による検索漏れを抑えられます。

ただし、その修正自体にも失敗モードがあります。古い、または誤った文脈は役に立たないだけでなく、検索を誤ったチャンクへ積極的に誘導します。ページ再編後もセクションと一致しない見出しから作ったプレフィックスや、チャンクの範囲を誤って述べる文脈要約は、プレフィックスなしより悪い結果になります。文脈の保存は、追加して忘れればよい一方向の改善ではなく、固有のエラーを持つパイプライン設計上の選択です。

Googleのパッセージランキング — チャンク化のSEO上の祖先

Googleは「RAG」という言葉が広まるずっと前から、サブ文書の粒度を使ってきました。2020年のSearch OnでPrabhakar Raghavanはパッセージランキングを発表し、“By better understanding the relevancy of specific passages, not just the overall page, we can find that needle-in-a-haystack information you’re looking for.” (翻訳)「ページ全体だけでなく、特定パッセージの関連性をよりよく理解すれば、探している干し草の山から針のような情報を見つけられる」と述べました。これは米国英語でFebruary 10, 2021(2021年2月10日)に開始され、クエリのおよそ**7%**に影響します。

この仕組みについては2つの誤解があります。

この仕組みについては、2つの点が誤解されがちです。

  • 「パッセージランキング」であり「パッセージインデックス登録」ではない。 Googleの最初の発表は「indexing」と表現しましたが、すぐに “this change doesn’t mean we’re indexing individual passages independently of pages.” (翻訳)「この変更は、ページとは独立して個々のパッセージをインデックス登録するという意味ではない」と訂正しました。ページは今も全体としてインデックス登録され、関連パッセージは追加のランキングシグナルです。
  • ランキングされるのはページであり、パッセージではない。 John Muellerは、“Passage ranking is not about ranking a specific passage but understanding the content on a really long, not SEO optimized page, and ranking that page (not the passage) for a query where the passage is relevant.” (翻訳)「パッセージランキングは特定のパッセージをランキングするものではなく、とても長くSEO最適化されていないページの内容を理解し、そのパッセージが関連するクエリに対してページ(パッセージではない)をランキングするものだ」と説明しました。

パッセージランキングとRAGチャンク化は、特定のクエリに対して、ページではなく段落を照合するのが適切な場合があるという原理を共有します。しかし結果は異なります。パッセージランキングはページのランキングを引き上げ、RAGチャンク化は生成回答へ渡すチャンクを検索取得します。同じ考え方でも仕組みは別です。Dawn Andersonの報告によれば、技術的な基盤はDeepCTです。これはTF-IDFに代わるBERT由来の文脈的な用語重み付けであり、用語の出現頻度がそのまま関連性を意味するわけではなくなります。

「Lost in the Middle」— 答えの位置が重要

チャンクが検索取得された後も、LLMのコンテキスト内でどこに置かれるかが、モデルが実際に使うかどうかに影響します。Stanfordの「Lost in the Middle」研究(Liuら、2023年)は、“performance is often highest when relevant information occurs at the beginning or end of the input context, and significantly degrades when models must access relevant information in the middle of long contexts.” (翻訳)「関連情報が入力コンテキストの最初または最後にあると性能が最も高く、長いコンテキストの中央にある関連情報へアクセスしなければならない場合に大きく低下する」と報告しました。

この結果を、すべてのモデルに既定で当てはまるものとして扱ってはいけません。これは、Liuらが2023年にテストした特定のモデル世代について、名前のある複数文書QAとキー・バリュー検索タスクで測定された位置効果です。現在のすべてのモデルがコンテキスト中央の証拠を無視するという証明ではありません。アーキテクチャ、実効コンテキストウィンドウの長さ、新しい学習方法によって効果は狭まることも広がることもあります。固定法則ではなく、設計で対処すべき文書化されたリスクとして扱ってください。

それでもコンテンツ上の含意は具体的で、リスクの低いものです。答えを先に置く。 各セクションの最初の文に定義、主要な発見、直接の答えを置き、4段落目まで埋めないでください。これは人間の流し読みを助ける答え先行(BLUF)の規律であり、同時に、効果が存在するモデルでコンテキストの中央に置かれて脱落するリスクを減らします。

見えない実務上の制約

  • Chromeの約30パッセージ制限。 Dan Petrovicの研究では、ChromeのDocumentChunkerは約200語のパッセージでコンテンツを解析し、ページの最初の30パッセージだけを考慮するとされています。意味的なHTMLを上から下へたどるため、重要な内容は10 000語のページの末尾ではなく早い位置に置くべきです。
  • チャンク化器は制御できない。 Despina Gavoyannis(Ahrefs)は、“You can’t control how Google, ChatGPT, or Perplexity chunk your content. Their pipelines change based on cost, model, and context.” (翻訳)「Google、ChatGPT、Perplexityがコンテンツをどうチャンク化するかは制御できない。パイプラインはコスト、モデル、コンテキストに応じて変わる」と率直に述べています。また、“Manual ‘chunk optimization’ is impossible in practice.” (翻訳)「手作業による『チャンク最適化』は実務上不可能」とも述べています。

「チャンク最適化」の実態とGoogleの注意点

Googleの2026年AI最適化ガイドは、誇張を省いて次のように述べています。“There’s no requirement to break your content into tiny pieces for AI to better understand it.” (翻訳)「AIがコンテンツをよりよく理解できるように、小さな断片へ分ける必要はありません。」同ガイドは、システムがページ上の複数の話題のニュアンスを理解し、関連する部分をユーザーに表示できるとも説明しています。“are able to understand the nuance of multiple topics on a page and show the relevant piece to users.” (翻訳)「ページ上の複数の話題のニュアンスを理解し、関連する部分をユーザーに表示できます。」したがって、コンテンツを一律の300語ブロックへ書き換えないでください。

しかし、これは構造が無関係だという意味ではありません。Gavoyannisの表現では、“Most SEOs using the term [chunk optimization] are just talking about good content structure.” (翻訳)「chunk optimizationという言葉を使うSEO担当者の多くは、単に優れたコンテンツ構造について話しているだけ」です。バズワードの新しさを膨らませているだけで、下にある助言は妥当です。Duane Forresterの言葉は変化をよく表しています。“If traditional SEO optimized for clicks, GenAI systems optimize for chunks… Structure still wins.” (翻訳)「従来のSEOがクリックを最適化したなら、GenAIシステムはチャンクを最適化する……それでも構造が勝つ。」

では何をするか。チャンク対応のコンテンツを書きます。

  • セクションごとに1つの話題。 焦点の合ったH2/H3なら、一貫したチャンクへきれいに対応します。
  • 答えを先に。 主張を先に置き、その下で根拠を示します。
  • 自己完結したセクション。 単独で表示されてもこの段落が意味を成すか確認します。成さないなら、チャンクとして切り出されたときにも通じません。
  • 適切な長さ。 主要セクションを200–500語にすると、256–512トークンのチャンクと自然に整合します。役に立つだけの完全さを保ち、人工的に短くしません。
  • 構造化された形式。 表とリストはシステムが検出しやすい明示的な境界を作ります(Onelyの研究では、表が引用率を約2,5xに高めます)。

Mike Kingの表現が、安心材料として適切です。“chunking and writing for users is not mutually exclusive” (翻訳)「チャンク化とユーザー向けの文章作成は両立しないものではありません。」読者の流し読みを助ける構造は、チャンク化もきれいにします。人間を犠牲にしてロボット向けに最適化するのではなく、同じコンテンツを整えるのです。

パッセージランキングとRAGチャンク化 — 比較

GoogleのパッセージランキングRAGチャンク化
正体ランキングシグナル前処理ステップ
粒度ページ内のパッセージ埋め込み前に分割したチャンク
結果ページが上位になるチャンクが回答へ検索される
実行時点ランキング時取り込み時、その後に検索取得
分割を制御できるかいいえいいえ
共有原理サブ文書の粒度。特定質問にはページより段落が一致しやすい同じ原理

パイプライン内の位置

チャンク化はAI検索取得の最初の動きです。chunk → embed → store → retrieve → generate(チャンク化→埋め込み→保存→検索取得→生成)という流れで進みます。各チャンクがベクトルになる埋め込みを経て、クエリが最も近いチャンクに一致するベクトル検索へ進み、検索取得されたチャンクが回答になるRAGへつながります。上流では、AIクローラーがコンテンツを最初に取り込む方法です。このパイプラインの従来検索版については、検索の仕組みを参照してください。

Add an expert note

Pin an expert quote

New person? Create their unclaimed profile at /admin/experts/ → Pin a quote first.