LLM可視性 / AI可視性

LLM可視性(AI可視性)とは何か、オーガニック可視性と同じではない理由、そしてAI Overviews、ChatGPT、Perplexity、Copilot、Geminiでどのように測定するかについて説明します。

初回公開:2026年6月24日 · 最終更新:2026年8月22日 · 上級者向け

LLM可視性とは、AI生成の回答内でブランドがどれだけ頻繁に、そしてどれだけ目立つように表示されるかです。これはオーガニック可視性と同じではありません。AI Overviewsの引用の約38%しか従来のトップ10から来ておらず、最も相関するのはブランドのウェブ言及(0,664)であり、ドメインレーティング(0,326)ではありません。これは3つの状態(取得→言及→引用)に分かれ、それぞれ異なるツールが必要で、プラットフォームごとにまったく異なる動作をし、変動が大きいため、単一のプロンプト実行はデータとは言えません。定義されたプロンプトプールをShare of Model Voiceとして経時的に追跡して測定し、Brand Radarのようなツールは正確なトラフィック数ではなく方向性を示すものとして扱ってください。

TL;DR — LLM可視性とは、ブランドがAI生成の回答(AI Overviews、AI Mode、ChatGPT、Perplexity、Copilot、Gemini、Grok)にどれだけ頻繁かつ目立つ形で登場するかを総合した指標です。これはオーガニック可視性ではありません — AI Overviewの引用のうち従来のトップ10からのものはわずか約38%(以前は76%)で、最も強い相関はブランド付きウェブ言及(0,664)であり、Domain Rating(0,326)ではありません。これは取得(retrieved)→ 言及(mentioned)→ 引用(cited)という3つの状態に分かれ、それぞれ異なるツールが必要です。引用のみの測定では状況を大きく過小評価します。プラットフォームごとに挙動が根本的に異なり、変動が大きいため、単一のプロンプト実行はデータポイントになり得ず、適切な測定単位は定義されたプロンプトプールShare of Model Voiceとして経時的に追跡することです。Brand Radarのようなツールは正確なトラフィック数ではなく、方向性を示す指標を提供します。

LLM可視性とは何か(そして何でないか)

測定はプロンプト、モデルバージョン、時間、ロケール、サンプリングに依存します。 この主張の根拠 ChatGPT search can answer with information from the web and provide linked sources. 対象範囲: ChatGPT search; appearance in a sampled answer is product-, query-, locale-, and time-dependent. 信頼度: 高 · 検証日: OpenAI: ChatGPT search プロバイダーのクローラー制御はアクセスポリシーを説明するものであり、回答への組み込みを保証するものではありません。 この主張の根拠 OpenAI distinguishes crawler controls for search inclusion from controls for model training. 対象範囲: OpenAI's documented crawlers and controls; allowing a crawler does not guarantee retrieval, citation, or answer inclusion. 信頼度: 高 · 検証日: OpenAI: Crawlers

LLM可視性 — AI可視性とも呼ばれます — は、ブランド、ドメイン、またはページがAI検索システムが生成する回答にどれだけ頻繁かつ目立つ形で登場するかを総合した指標です。これは単一の数値ではなく、オーガニック可視性と同じようにカテゴリです。違いは測定するサーフェスです。ランク付けされたリンクのリストではなく、合成された文章による回答です。

最初に頭に焼き付けてほしいのは、LLM可視性はオーガニック可視性と同じではないということです。2025年半ばには、AI Overviewの引用の約76%がオーガニックトップ10にランクインしているページからのものでした。2026年初頭までに、これは当社のデータでは約**38%**にまで低下しています(他の調査ではさらに低い数値も出ています)。オーガニックランクはかつてAIプレゼンスの適切な代理指標でした。もうそうではありません。これらは異なるシグナルであり、異なる測定プログラムが必要です。

なぜ乖離するのでしょうか。AI上の可視性を左右するシグナルは、検索順位を左右するシグナルと同じではないからです。Louise LinehanとXibeijia Guanが75 000ブランドを対象に行ったAhrefsの調査 — その結果について私は後にAhrefs Evolve 2025 で解説しました — では、Google AI Overview上の可視性との相関は次の順でした:

シグナルAI可視性との相関
ブランド付きウェブ言及0,664
ブランド付きアンカーテキスト0,527
ブランド付き検索ボリューム0,392
Domain Rating0,326

最大のシグナルは、自社サイト外でのブランドの存在感です。ここに構造的な逆転があります。PageRankを渡さず、従来のSEOではほとんど評価対象にならないリンクなしの言及が、AI上の可視性と最も強く相関します。だからこそ私は、仕事の重点が “optimize your site” (翻訳)「自社サイトを最適化する」から “optimize how the internet talks about you.” (翻訳)「インターネット上で自社がどう語られるかを最適化する」へ移ったと言い続けています。これはアーンドメディアのデータとも一致します。AIによる引用の82〜89%は第三者の情報源(Forbes、TechCrunch、WSJのような媒体)から生じ、ブランド自身のページからではありません。講演で示した具体例では、ZapierにAhrefsを取り上げたページが16あり、その16ページがAhrefsに関するAI回答1 431件で引用されていました。自社について他者が作るコンテンツが、影響の大半を担っています。

3つの状態:取得(retrieved)→ 言及(mentioned)→ 引用(cited)→ クリック(clicked)

「AI可視性」には、根本的に異なる3つの状態が隠れています。これらを混同することが、ほとんどの測定ミスの原因です:

状態意味確認方法
取得(Retrieved)AIの検索システムがあなたのページをソース資料として取得したサーバーログ(ChatGPT-UserPerplexity-UserGooglebot-Extended
言及(Mentioned)生成された回答テキストにあなたのブランド名が登場するブランドモニタリング / 文字列一致(Brand Radar);手動プロンプトテスト
引用(Cited)あなたのURLがソースとして明示的にリンクされているBrand Radarの引用ページ/ドメイン;Bing WMT AI Performance;GSC AI機能

そして、その3つの下流に4つ目があります:クリック — 実際に誰かが回答からあなたのサイトを訪れる稀なケースです(GA4 / ウェブ解析)。

ほとんどのツールが把握できるのは、引用された状態だけです。取得と言及の状態は、引用のみを追跡するツールからはほぼ見えません。OtterlyAIはBingのデータを分析し、“99.6% of your AI influence is invisible.” (翻訳)「AIへの影響の99.6%は見えません」と端的に表現しています。したがって、ダッシュボードで引用だけを数えてAI可視性と呼ぶと、実態を大幅に過小評価します。逆方向の見落としもあります。Superlinesによると、AI上の存在の約73%はブランド名への言及を伴わない引用、いわゆる「ゴースト引用」でした。言及と引用を併せて追跡しなければ、どちらの場合も誤った全体像になります。

その3つの根底にある疑問:これはそもそも検索駆動型の回答なのか?

取得、言及、引用はすべて、AI がこの特定のクエリのために何かを取得しに行ったことを前提としています。AI 回答のかなりの割合はそうではありません — モデルはトレーニング中にすでに学習した内容(パラメトリックメモリ)から回答し、ライブの取得ステップがまったくありません。仕組みについては RAG を参照してください:本番システムはクエリ分類器を実行し、クエリごとに検索するかどうかを決定します — すべてのリクエストで発生するステップではありません。

これは測定にとって重要です。なぜなら、何が実行可能かを変えるからです。検索駆動型の回答は、原則として、オンページおよびオフページの作業によって動かすことができます — より良いコンテンツが取得され、より良い言及が引き込まれます。メモリ駆動型の回答はそのようには動かせません:モデルはトレーニング時にブランドについて知っていることをすでに「学習」しており、モデルが再トレーニングされるまでページの編集では変わりません — それはプロバイダーのスケジュールで発生し、あなたのスケジュールではありません。多くのプロンプト実行で安定したブランド説明が見られ、引用がなく、取得の兆候もない場合、メモリ駆動型の回答を見ている可能性があります。追跡はしてくださいが、それが動くことを期待して編集に労力を費やさないでください。

出力を読むだけでどちらかを完全に信頼できる方法はありません — 意図的にテストする必要があります:プラットフォームの検索オンと検索オフの動作を比較する(それが公開されている場合)、引用がまったく表示されるかどうかを確認する、または基になるソースページが変更されたときに回答が変わるかどうかを確認する。「引用がまったくない」と「引用が存在する」を、同じスケールの2つのスコアではなく、異なる救済策を持つ異なる測定レジームとして扱ってください。

プラットフォームごとに — 可視性が大きく異なる理由

単一の「AI 可視性」数値はありません。プラットフォームはまったく異なる動作をするからです。異なるソースから引き出し、引用率も大きく異なります:

プラットフォーム動作
Perplexity頻繁に引用 — 応答あたり約21,87件の引用;約13%の確率で引用
Google AI Overviews大量のボリューム;標準インデックスに対する RAG + クエリファンアウト
Bing Copilot応答あたり約6,89件の引用
ChatGPT選択的 — 応答の1%未満(約0,59%)で引用;引用の約87%が Bing のトップオーガニック結果と一致
Grok頻繁に引用 — 約27%の確率
Claude / その他多くの場合、取得なしでトレーニングデータから回答

最大のギャップ:Perplexity は応答あたり約21,87件のソースを引用する一方、ChatGPT は応答の0,59%でしか引用しません。同じコンテンツが一方のプラットフォームでは非常に可視的であり、もう一方では事実上見えないことがあります。クロスプラットフォームの重複は乏しいです — 最も引用されたドメインのトップ50のうち、主要3プラットフォーム(AI Overviews、ChatGPT、Perplexity)すべてに出現するのはわずか7つです。LLM 可視性は実際には3つ(または7つ)の別々の可視性プロファイルです。各プラットフォームを測定してください;それらを1つの数値に平均して意味があるふりをしないでください。

変動が激しい — 単一の実行はデータではない

AIの回答は移り変わります。引用元の約40~60%は月ごとに変わります。同じクエリでも、AI Overviewの内容の大部分は実行ごとに変わります。SparkToroは、同じChatGPTプロンプトを100回実行しても、同一のブランドリストが得られる確率は100分の1未満であることを発見しました。方法論的な帰結は単純で譲歩の余地がありません。プロンプトを一度実行することはデータポイントではありません。 定義されたプロンプトプール、多数の実行、トレンドウィンドウが必要です。特定時点のスナップショットではありません。

繰り返し実行することで、スナップショットでは隠されていた分布が明らかになります。同じプロンプトでも、ブランドを引用したり、単に言及したり、省略したりすることがあります。

8回の合成実行において、プロンプト「best audit tools」は3回引用され、3回言及され、2回欠落しました。「crawl budget help」は2回引用され、3回言及され、3回欠落しました。「schema checker」は4回引用され、2回言及され、2回欠落しました。このフィクスチャには、実際のプロバイダーの出力や顧客データは含まれていません。

測定方法 — 状態に対応するスタック

単一のツールで4つの状態すべてをカバーできるものはありません。各レイヤーが1つの状態に対応するスタックを構築します。

  • レイヤー1 — サーバーログ → 取得済み。 -Userボット(ChatGPT-UserPerplexity-UserGooglebot-Extended)はライブ推論フェッチです。誰かが質問し、AIがその場であなたのページを取得しに行ったということです。これはトレーニング/インデックスボット(GPTBotClaudeBot)とは異なります。-Userボットに配信するエラーはすべて、引用の機会損失です。
  • レイヤー2 — ブランドモニタリング → 言及済み。 Ahrefs Brand Radarは、主要プラットフォーム全体で文字列一致の言及を検出し、「見つかったが引用されていない」フィルターがあり、帰属なしの影響力を分離できます。QA用に手動プロンプトテストを追加します。
  • レイヤー3 — 引用追跡 → 引用済み。 Brand RadarのCited Pages / Cited Domainsレポート、Bing Webmaster ToolsのAI Performanceレポート(引用データの最初の公式プラットフォームソース — 引用、グラウンディングクエリ、平均引用ページ数)、Google Search ConsoleのAI機能フィルター / Gen AI Performanceレポート(インプレッションのみ — クリックなし)。
  • レイヤー4 — Web解析 → クリック済み。 GA4のAIアシスタントチャネルとカスタムチャネルグループ。ダークトラフィックの問題が予想されます。AI由来の訪問の大部分はリファラーなしでDirectに分類され、AI Overview/AI Modeのクリックはgoogle/organicに統合されるため、クリック済みレイヤーは最もクリーンではありません。

正直に言っておきたい注意点が1つあります。Brand Radar(および同様のツール)は正確なトラフィック数ではなく、方向性のある指標を報告します。トレンドと相対的なシェアは真剣に扱ってください。単一の数値を正確な集計として扱わないでください。

プロンプトプール方式とモデル音声シェア

測定の単位はプロンプトプールです。高インテントのクエリを約250~500件定義し、LLMエンドポイントで毎週または毎月実行し、ブランドが表示される場所を記録し、モデル音声シェア(SOMV) — ブランド表示数 ÷ 追跡プロンプト総数 × 100 — を追跡します。プロンプトは実際の需要から取得します。営業トランスクリプト、サポートチケット、Reddit、G2レビュー、PAA、オートコンプリートなどです。較正のためのベンチマーク:関連プロンプト全体での平均言及率は約17,2%(AthenaHQ)で、40~70%は強いと見なされます。

プラットフォームの仕組みについては、Brand Radarは4億以上の検索連動プロンプトコーパス(今年初めの3億5000万以上から増加 — 成長し、ライブ更新されるインデックスなので、正確な数値は方向性として扱ってください)で動作し、ChatGPT/Perplexity/Gemini/Copilotでは毎月、AI Overviews/AI Modeでは継続的に更新され、「引用済み」(リンクされたURL)と「見つかったが引用されていない」(リンクのない文字列一致)を区別します。

知っておく価値のある測定のエッジケース

AIはあなたを過小報告するだけでなく、時にはあなたを捏造します。AIがもっともらしいURLを合成したため、実際には存在しないAhrefsのページへの訪問が数千件ありました。幻覚による引用はAI可視性測定の実際の側面であり、ほとんどのツールはそれらを自動的にフィルタリングしてくれません。したがって、「引用された」URLの妥当性を確認してください。

これが何であり、何に値するか

価値は冷静に判断してください。引用されてもクリックにつながることはまれです。Pewが2025年3月に米国で実施した閲覧行動調査 では、AIによる要約が表示されたGoogle訪問のうち、引用元がクリックされた割合はわずか1%でした。また、Google AI Modeのセッションの大半はサイト訪問なしで終わります。LLM可視性は主としてブランド認知と権威性の指標であり、直接トラフィックの指標ではありません。それでも重要です。AI Mode利用者の多くは追加調査をせず、提示された候補を受け入れるため、クリックされなくても回答に含まれること自体に価値があります。

位置づけ

これはクラスターの定義と測定のハブです。3つの状態の詳細については、取得済み、言及済み、引用済み を参照してください。GA4/アナリティクス層(ダークトラフィックとアトリビューションの問題)については、AIトラフィックアトリビューション を参照してください。これを実際に促進するオフサイトシグナル(エンティティとメンション)については、エンティティSEO と、より広範な**AI検索ハブ** を参照してください。

専門家メモを追加

専門家の引用を固定

新しい人物ですか?まず、 /admin/experts/ → 専門家の引用を固定 から未登録プロフィールを作成してください。