チャンクテスター

Free, no signup. AI answer engines don't read your page — they read chunks of it, stripped of surrounding context, and a well-written page can still retrieve badly once it's been split that way. See how yours splits, and which chunks would confuse a retrieval system. Pairs with the chunking guide.

Chunking strategies
StrategyBest forTrade-off
Structure Headed documentsKeeps semantic sections together
Fixed Simple baselineCan split lists and ideas
Paragraph Short-answer contentLess surrounding context

Note: every retrieval system chunks differently — this models a common structure-aware strategy so you can spot problems, not reproduce one vendor exactly. Token counts are a chars/4 estimate. Pasted content never leaves your browser.

完全にブラウザー内で実行され、貼り付けた内容はアップロードも保存もされません。 Fetch a URL sends only that address to our server to retrieve the HTML; extraction and chunking still happen in your browser. 匿名化した実行単位の結果件数を集計調査に使う場合があります。URL、ドメイン、IPアドレス、識別子は含めず、100回未満の実行から統計を公開しません。

フィードバック
不具合を報告

チャンクテスター で問題が発生しましたか?状況をお知らせください。報告は公開リストではなく、非公開の確認キューに直接送られます。

送信される情報
 ツールへの入力、アップロード、貼り付けたソース、完全な結果、クエリパラメーター、URLフラグメントは自動では添付されません。上で選択した箇所は編集または削除できます。ブラウザーと不正利用防止のメタデータはスパム防止のために処理されます。 

このツールについて

コンテンツまたはURLを貼り付け、検索システムがAI回答エンジンの取得・引用単位へどのように分割するかを確認します。

色付きのチャンク帯、トークン推定、長すぎるチャンク、見出し文脈の欠落、宙に浮く代名詞、分割された表やリストを示します。チャンクサイズと重なりを調整できます。

機能

  • AI取得単位のチャンク可視化
  • トークン数と色付きの帯
  • 長さ、見出し、代名詞、表・リストの警告
  • チャンクサイズと重なりの調整

仕組み

貼り付けたテキストまたは取得した本文を見出し、段落、リスト、表で区切り、指定サイズと重なりを適用します。各チャンクのトークン推定と文脈の不足を検査し、取得されにくい候補を色分けします。

制限事項

  • これは検索システムの推定分割であり、特定のAIエンジンの内部実装、取得、引用を再現・保証しません。
  • URL取得は公開応答に限られ、JavaScript後の状態、ログイン、将来のインデックスを推測しません。

よくある質問

AI 検索におけるコンテンツチャンクとは何ですか?

チャンクは、通常は最も近い見出しの下にまとめられた数百トークン程度の短い文章です。検索取得システムはページ全体ではなく、この単位を保存して検索します。AI 回答エンジンは質問を受けると、最もよく一致する個別チャンクを取得して引用し、URL 全体を引用するわけではありません。周囲のページが優れていても、チャンク単体で意味が通じなければ、取得または引用されにくくなります。

チャンクは何トークンにすべきですか?

検索取得システムごとに分割方法が異なるため、万能な数値はありません。このツールは一般的な中間値として目標 300 トークン、重複率 15% を既定値にし、目標を 100〜800 トークンの範囲で変更できます。目標の 1.3 倍を超えると検索取得側が切り詰める可能性が高いため、「長すぎる」と表示します。トークン数は文字数を 4 で割った推定で、実際のトークナイザーによる計数ではありません。

チャンクに「文脈依存の書き出し」と表示されるのはなぜですか?

最初の文が文脈に依存する語、つまり「これ」「それ」「彼ら」「しかし」「したがって」のような代名詞や単独の接続表現で始まるチャンクに表示します。これらの語は別のチャンクにある可能性のある前の文章を指すため、検索時にページから切り出すと文章単体で意味が通じません。修正するには、セクションの冒頭を主語が明確な自己完結したトピック文にします。

チャンクテスターは Google や OpenAI など特定の提供元の動作を再現しますか?

いいえ。最も近い見出しの下にブロックをまとめ、重なりを持つトークン単位の枠に収め、見出しと最初の段落を分離しないという、一般的な構造認識型のチャンク分割方式をモデル化します。目的は特定の提供元を完全に再現することではなく、ほぼどのシステムでも取得しにくい文章を見つけることです。チャンク境界は代表例として扱い、個別エンジンと同一とは考えないでください。

貼り付けたコンテンツはどこかへ送信されますか?

いいえ。貼り付けモードでは抽出とチャンク分割が完全にブラウザー内で実行され、何もアップロードされません。任意の「URL を取得」モードだけがサーバーのエンドポイントを呼び出し、そのエンドポイントが取得するのは指定した公開ページで、貼り付けたテキストではありません。どちらの方法でも保存されません。

次のステップ引用可能性・エンティティ保持リライター — generate the corrected version. ガイダンスは英語で利用できます.