Citations par les IA

Comment les moteurs de réponses IA choisissent les pages à citer — la distinction entre pages récupérées, marques mentionnées et sources citées, pourquoi une citation n’est ni un classement ni un backlink, et ce qui rend une page plus susceptible d’être citée dans les AI Overviews de Google, ChatGPT, Perplexity et Copilot.

Première publication : 3 juil. 2026 · Dernière mise à jour : 8 août 2026 · Advanced
Langues

Une citation par une IA est le lien vers la source attribué qu’un moteur de réponses IA affiche à côté de son texte généré. Elle vient au terme de trois états distincts — récupéré (l’IA a lu votre page, visible uniquement dans les journaux), mentionné (votre marque est nommée sans lien) et cité (votre URL est affichée comme source) — alors que la plupart des outils n’en voient qu’un seul. La citation repose sur du RAG au-dessus du même index central que celui du classement : être explorable, indexé et éligible à un extrait est donc le prérequis. Mais elle n’est ni un classement ni un backlink : les recherches Ahrefs indiquent que la part des citations d’AI Overviews provenant du top 10 organique a fortement diminué entre mi-2025 et début 2026 (environ 76 % vers environ 38 %), même si la méthodologie exacte de cette comparaison n’a pas été revérifiée indépendamment — retenez la direction, pas les chiffres précis. Les mentions de marque sur le Web prédisent mieux la visibilité IA que le Domain Rating, et environ 90 % des citations concernant une marque viennent de sites tiers. Être cité signifie aussi rarement obtenir un clic — la plupart des sessions IA se terminent sans visite. Enfin, l’affichage d’une citation ne prouve jamais que la source étaye réellement l’affirmation voisine : c’est une vérification distincte.

Pour OpenAI, la finalité déclarée de OAI-SearchBot est la visibilité dans la recherche, tandis que GPTBot possède un contrôle d’entraînement distinct. Evidence for this claim OpenAI identifies OAI-SearchBot as the crawler used to link to and surface websites in ChatGPT search results, separately from GPTBot training controls. Scope: OpenAI-declared crawler behavior; selection and citation are not guaranteed. Confidence: high · Verified: OpenAI: Crawlers Pour Google, la sélection des liens de soutien peut s’appuyer sur une expansion de requête au-delà d’un seul ensemble de résultats. Evidence for this claim Google says AI Overviews and AI Mode show supporting links and can use query fan-out to find a wider and more diverse set of relevant pages. Scope: Google Search AI features; link selection is system-dependent. Confidence: high · Verified: Google: AI features and your website Et l’apparition d’une citation ne prouve jamais que la page citée étaye l’affirmation voisine — c’est une vérification distincte qui s’ajoute à l’attribution. Evidence for this claim Citation presence alone is not proof the cited source supports the adjacent generated statement; a study of four 2023 generative search systems found meaningful gaps between citation recall and citation precision. Scope: Findings from evaluated 2023 generative search systems (Bing Chat, NeevaAI, Perplexity, YouChat); supports the general citation-verifiability distinction, not current-system rates. Confidence: high · Verified: Liu, Zhang & Liang: Evaluating Verifiability in Generative Search Engines (EMNLP 2023)

TL;DR — Une citation par une IA est la source attribuée affichée à côté d’un texte généré par une IA, sélectionnée au moment de la génération parmi ce que le système a récupéré via le RAG — et non classée dans une liste. C’est le dernier de trois états : récupéré (une demande enregistrée pour votre page, sans preuve que le contenu a atteint le contexte du modèle), mentionné (nommé dans le texte, sans lien) et cité (URL attribuée). Google ancre ses AI Overviews dans son index central, donc une page doit être indexée et éligible à un extrait pour être citée — mais citation ≠ classement (les recherches Ahrefs indiquent que la part du top 10 a chuté, d’environ 76 % vers environ 38 % entre mi-2025 et début 2026, même si la comparaison méthodologique exacte entre les deux études n’est pas vérifiée) et ≠ backlinks (les mentions de marque sur le Web corrèlent à environ 0,66 avec la visibilité IA contre environ 0,33 pour le Domain Rating). Environ 90 % des citations concernant une marque viennent de sites tiers et les plateformes citent de manière très différente (Perplexity cite presque tout ce qu’elle récupère ; ChatGPT cite presque rien). Même une citation ne produit généralement aucun clic — et elle ne prouve jamais que la source étaye l’affirmation voisine.

La citation est le dernier de trois états, pas toute l’histoire

Citation is one observable state, not shorthand for every way a system may have used your content. Source : /ai-search/measurement-and-reporting/retrieved-mentioned-cited/

Retrieved means a system requested or fetched the content, evidenced by logs or retrieval traces — that request is not proof the content reached the model's context. Mentioned means the answer used the brand, entity, or facts in its prose, evidenced by the answer text. Cited means the interface exposed a source link or citation to the page, evidenced by a visible source URL. These states need separate measurement.

© Patrick Stox LLC · CC BY 4.0 ·

Commencez par la distinction qui résout la plupart des confusions de mesure. Votre contenu peut être dans un, deux ou trois de ces états à la fois — et chacun demande un outil différent :

  • Récupéré. Une entrée de journal provenant d’un robot d’exploration IA ou d’un robot d’inférence en direct montre qu’une demande a été faite à votre page pendant le traitement d’une requête. C’est une preuve réelle d’une récupération — mais une demande dans vos journaux ne prouve pas que le contenu a été placé dans le contexte du modèle ni utilisé ; les journaux montrent ce qui a été demandé, pas ce qui a été sélectionné. Cela se détecte uniquement dans les journaux serveur (agents utilisateurs des robots IA), et reste invisible pour les outils qui analysent seulement les réponses IA.
  • Mentionné. Votre marque, votre produit ou votre nom apparaît dans le texte généré — sans hyperlien. L’IA « sait que vous existez » grâce aux données d’entraînement ou au contenu récupéré et vous nomme sans attribution. C’est mesurable avec des outils d’analyse de réponses comme Ahrefs Brand Radar.
  • Cité. L’URL de votre page est affichée comme source attribuée — lien cliquable, référence numérotée ou encadré de source nommé. Cela suppose que l’IA ait à la fois récupéré votre contenu et décidé qu’il méritait une attribution.

Les écarts entre ces états constituent toute l’histoire. Un contenu peut être récupéré sans être mentionné, mentionné sans être cité et — problème inverse de la « citation fantôme » — cité sans que votre marque apparaisse dans le texte. Une demande observée dans vos journaux est aussi une affirmation distincte et plus faible que « sélectionné dans la réponse » : traitez la récupération comme une preuve de demande, pas comme une preuve d’utilisation. (Le cadre récupéré / mentionné / cité mérite un traitement propre ; cet article se concentre sur le versant mécanique de la citation.)

Comment la citation est réellement produite : du RAG sur un index vivant

Les citations sont une sortie de la Retrieval-Augmented Generation — le schéma récupérer puis générer qui se trouve derrière tous les grands moteurs de réponses IA. La définition de Google la relie directement à l’ancrage : le RAG est « a technique (also known as grounding) used to improve the quality, accuracy, and freshness of AI responses by relying on our core Search ranking systems to retrieve relevant, up-to-date web pages from our Search index. » (traduction) « Une technique, également appelée grounding, utilisée pour améliorer la qualité, la précision et l’actualité des réponses IA en s’appuyant sur nos systèmes centraux de classement Search pour récupérer des pages Web pertinentes et à jour depuis notre index Search. » (Pour le pipeline de récupération lui-même — découpage, embeddings, recherche vectorielle et reranking — consultez les analyses sœurs ; ici, je m’intéresse à ce qui se passe au moment de l’attribution.)

Deux conséquences découlent directement de cette définition, et ce sont celles que Google énonce explicitement :

  • Il n’existe pas d’index IA distinct. Les AI Overviews récupèrent leurs sources dans le même index Search central que les résultats ordinaires, donc « a page must be indexed and eligible to be shown in Google Search with a snippet, fulfilling the Search technical requirements. There are no additional technical requirements. » (traduction) « Une page doit être indexée et éligible à l’affichage dans Google Search avec un extrait, en respectant les exigences techniques de Search. Il n’existe aucune exigence technique supplémentaire. » L’explorabilité, l’indexabilité et l’éligibilité à un extrait constituent le plancher de la citation. Bloquez Googlebot ou renvoyez des erreurs et vous sortez entièrement de l’éligibilité.
  • La récupération dépasse la requête unique. Google utilise l’expansion de requête : « Both AI Overviews and AI Mode may use a ‘query fan-out’ technique — issuing multiple related searches across subtopics and data sources — to develop a response. » (traduction) « Les AI Overviews et le mode AI peuvent utiliser une technique de « query fan-out » — lancer plusieurs recherches liées sur des sous-thèmes et des sources de données — pour élaborer une réponse. » Les pages sont récupérées pour des sous-requêtes qui n’apparaissent jamais dans la réponse visible. Ce sont les récupérations « sombres » — du contenu qui a contribué sans attribution.
Evidence for this claim Google says AI Overviews and AI Mode may issue multiple related searches across subtopics and data sources and identify supporting pages while generating a response. Scope: Google Search Confidence: high · Verified: AI features and your website

Au niveau de l’API, l’architecture rend explicite l’écart entre récupéré et cité : la génération ancrée de Google renvoie le texte du modèle avec des annotations de citation intégrées, chacune reliant un passage précis à une URL source — mais la liste complète des sources récupérées n’est pas exposée à l’utilisateur final. Vous voyez ce qui a été utilisé, pas ce qui a été lu.

Pourquoi la citation n’est pas un classement (et le chiffre qui le montre)

Voici un résultat directionnel particulièrement utile : être cité par une IA semble se découpler du classement n° 1 au fil du temps. Dans les recherches Ahrefs (l’étude de juillet 2025, puis une mise à jour de mars 2026 menée par Xibeijia Guan), la part des citations d’AI Overviews provenant d’une position organique dans le top 10 serait passée d’environ 76 % à la mi-2025 à environ 38 % au début de 2026 — le chiffre indépendant de BrightEdge étant même inférieur. Je veux le préciser clairement : je n’ai pas pu revérifier indépendamment la méthodologie exacte et le dénominateur de la comparaison 76 % → 38 %, donc retenez la direction (une part du top 10 en baisse), pas les pourcentages précis, tant que cette vérification n’est pas faite. L’explication officielle de Google pour cette tendance plus large est que l’expansion de requête prend davantage en charge la collecte des sources : les AI Overviews récupèrent de plus en plus les SERP de sous-requêtes plutôt que le top 10 de la requête initiale — et ce mécanisme est confirmé directement dans la documentation de Google, indépendamment de la statistique exacte ci-dessus.

Deux lectures pratiques :

  • Être classé n° 1 sur votre requête principale ne garantit plus une citation, et ne pas être dans le top 10 ne vous exclut plus. YouTube est un exemple frappant : c’est le domaine le plus cité dans les AI Overviews et une grande partie des URL YouTube citées ne se classent même pas dans le top 100 Google pour la requête. La vidéo est largement récupérée indépendamment du classement classique.
  • L’éligibilité à la citation reste conditionnée par le SEO classique (indexé + éligible à un extrait), même si la sélection des citations s’éloigne de la position. Les deux affirmations sont vraies en même temps, raison pour laquelle « l’IA a tué le SEO » et « l’IA n’est que du SEO » sont toutes deux fausses.

L’autre réflexe — « plus de backlinks, plus de citations » — résiste également mal aux données. L’étude Ahrefs de 75 000 marques menée par Louise Linehan et Xibeijia Guan a constaté que le meilleur prédicteur de l’apparition dans les AI Overviews n’était ni le Domain Rating ni les backlinks, mais les mentions de marque sur le Web, avec une corrélation d’environ 0,664, contre environ 0,326 pour le Domain Rating et moins encore pour le nombre de backlinks. Dans une analyse distincte que j’ai menée, les mentions sur des pages fortement liées corrélaient également avec les mentions par les IA.

Cela reformule tout le sujet. Ce n’est pas que l’autorité ait cessé de compter — c’est que le fait d’être mentionné est un meilleur indicateur de ce que les systèmes IA valorisent que le fait d’être lié. Le résultat de McKinsey affine l’image : le site d’une marque ne représente qu’environ 5 à 10 % des sources que les plateformes IA citent lorsqu’elles parlent de cette marque. Environ 90 % des citations à votre sujet vivent sur des sites tiers — éditeurs, plateformes d’avis, contenus générés par les utilisateurs, YouTube, Reddit. Comme je l’ai dit lors de ma conférence Ahrefs Evolve : le travail consistait autrefois à « optimiser votre site », et consiste maintenant à « optimiser la manière dont Internet parle de vous ». Seize pages du site de Zapier mentionnant Ahrefs ont suffi à faire citer Ahrefs dans plus de 1 400 réponses IA — un levier qu’aucune quantité de réglages sur le site ne peut égaler.

Les plateformes citent de manière complètement différente

« Être cité par une IA » n’est pas un comportement unique — la même page peut être récupérée sur deux plateformes avec des résultats d’attribution opposés :

  • Perplexity effectue une recherche Web en temps réel pour presque chaque requête et est conçue pour être transparente sur ses sources — elle affiche en moyenne le plus de citations par réponse de toutes les grandes plateformes et cite presque tout ce qu’elle récupère. C’est la moins susceptible de « mentionner sans citer ».
  • ChatGPT répond souvent à partir des données d’entraînement sans aucune récupération et, quand il récupère des pages (via sa couche de recherche alimentée par Bing), il ne cite qu’une petite fraction des pages consultées. Son taux de citation global est le plus faible des grandes plateformes. C’est l’exemple le plus net de la surface « mentionné mais non cité ».
  • Google AI Overviews / AI Mode attachent des citations à des segments précis, utilisent l’index central et l’expansion de requête et — comme indiqué plus haut — citent de plus en plus hors du top 10.
  • Microsoft Copilot expose quelque chose que les autres n’exposent pas : les requêtes d’ancrage, c’est-à-dire les formulations réelles utilisées pour récupérer le contenu référencé. C’est ce qui se rapproche le plus, dans un outil officiel, de la visibilité sur la couche de récupération.

La conclusion n’est pas de courir après les particularités d’une plateforme, mais de comprendre que la citation est probabiliste et instable. Les réponses IA sont volatiles : la même invite répétée produit des listes de marques et des sources différentes, donc une seule vérification ne signifie presque rien.

Des limites de produit et de mode sont également documentées. Un outil de suivi doit les enregistrer comme des résultats distincts, au lieu d’appeler toute absence de lien un problème d’éditeur :

  • API de recherche web d’OpenAI : le champ sources est l’ensemble complet des URL consultées par le modèle, tandis que les citations intégrées constituent un sous-ensemble sélectionné. Une source peut donc être récupérée sans être citée, et la documentation de l’API exige que les citations intégrées affichées soient visibles et cliquables. C’est un contrat d’API, pas la preuve que le produit ChatGPT grand public expose les mêmes champs. Evidence for this claim In OpenAI API web search, the sources field lists all consulted URLs while inline citations show only selected relevant references; source count can exceed citation count, and search_context_size guarantees neither. Scope: OpenAI API web search response fields and configuration; not a claim about undisclosed retrieval or ChatGPT consumer-product presentation. Confidence: high · Verified: OpenAI API: Web search — Sources and search context size Evidence for this claim OpenAI requires inline citations to be clearly visible and clickable when an application displays web-search results or information from those results to end users. Scope: OpenAI API web search display contract; this does not assert identical fields or presentation in the ChatGPT consumer product. Confidence: high · Verified: OpenAI API: Web search — Output and citations
  • Microsoft Copilot : le mode grand public Voice ne déclenche actuellement pas de recherche web ; aucune citation n’est donc attendue. Evidence for this claim Microsoft's consumer Copilot transparency note says web-grounded text responses include citations, while voice prompts do not trigger web search and therefore have no citations. Scope: Consumer Microsoft Copilot Voice mode; Microsoft 365 Copilot and text/web-grounded modes have different behavior. Confidence: high · Verified: Microsoft Copilot: Transparency note Dans Microsoft 365 Copilot, lorsque la recherche Web s’exécute, la vue Sources affiche les sources et la requête courte exacte envoyée à Bing ; cette requête dérivée n’utilise généralement que quelques mots de l’invite ou du fichier. Evidence for this claim Microsoft 365 Copilot's Sources view exposes the exact query sent to Bing and the sources used; the query generally uses a few prompt or uploaded-file words rather than the full input. Scope: Microsoft 365 Copilot Chat and agents when web search runs; organization policy can disable web search. Confidence: high · Verified: Microsoft 365 Copilot: How web search works
  • Gemini Apps : Google indique explicitement que toutes les réponses n’incluent pas de liens associés ou de sources. L’absence de bouton Sources signifie qu’aucun lien n’a été fourni pour cette réponse ; elle ne prouve pas à elle seule que la récupération a échoué ni que l’éditeur a bloqué quoi que ce soit. Evidence for this claim Gemini Apps may provide sources or related links, but not every response includes them; no Sources button means Gemini provided no links for that response. Scope: Gemini Apps source-link presentation; absence of links does not by itself establish retrieval failure or a publisher defect. Confidence: high · Verified: Google Gemini Apps: View related sources

La vérité inconfortable : cité ≠ trafic

Enfin, relativisez l’objectif. Être cité est aujourd’hui bien davantage un signal de notoriété et d’autorité qu’un canal de trafic. Une étude indépendante (Pew) a constaté que lorsqu’un résumé IA apparaît, seul un petit pourcentage à un chiffre des utilisateurs clique sur un lien, et qu’environ 1 % clique sur une source citée dans le résumé — la grande majorité des sessions de recherche IA se terminent sans visite de site. Optimisez les citations parce qu’elles développent la présence de la marque et l’autorité dans les réponses que les gens lisent — pas parce qu’il faut attendre un clic pour chacune.

Voici où cela s’insère : la citation est le versant attribution du grounding et du RAG, elle repose en amont sur la récupération (découpage, embeddings, recherche vectorielle, classement de passages) et côtoie les dynamiques de fraîcheur et d’hallucination des réponses IA. Les mécanismes sont partagés avec le reste du cluster ; ce qui est propre aux citations, c’est la distinction en trois états, le découplage classement/backlinks et le levier des mentions tierces.

Add an expert note

Pin an expert quote

New person? Create their unclaimed profile at /admin/experts/ → Pin a quote first.