Guide de la recherche agentique
La recherche agentique est une IA qui planifie, parcourt le Web et synthétise de façon autonome une tâche de recherche en plusieurs étapes, au lieu de répondre à une seule requête. Découvrez ce qui la distingue de la recherche par IA.
Langues
1 indice probant sur cette page
- Outil en ligne associéSEO MCP Server
La recherche agentique est une IA qui parcourt le Web, mène des recherches et produit une synthèse de façon autonome pendant plusieurs minutes, au lieu de répondre à une seule requête. Point technique essentiel : les navigateurs agentiques lancent de vraies machines virtuelles Chrome ou Edge et ne peuvent pas être bloqués par robots.txt.
TL;DR — La recherche agentique confie à l’IA l’ensemble du travail de recherche, au lieu de lui demander une réponse immédiate. Le système lance des dizaines de recherches, lit les pages réelles, puis rédige une synthèse — parfois plusieurs minutes plus tard. C’est la différence entre une réponse rapide de ChatGPT et un rapport produit par Deep Research après une dizaine de minutes. Point pratique : certains agents utilisent un véritable navigateur Chrome ;
robots.txtne permet donc pas de les bloquer.
Les trois niveaux de recherche
La « recherche agentique » désigne un modèle de produit encore en évolution, et non une architecture de classement unique et normalisée. Evidence for this claim Deep-research products can perform multi-step web research and synthesize cited results. Scope: Documented product capabilities, not a universal definition or ranking architecture for agentic search. Confidence: high · Verified: OpenAI: Introducing deep research Les systèmes documentés peuvent naviguer sur le Web, synthétiser des sources et exécuter plusieurs étapes, mais leur comportement varie selon le produit et la version. Evidence for this claim The term agentic search covers an evolving set of vendor implementations whose tools and behavior can differ. Scope: Editorial synthesis from documented product behavior; implementations and releases may vary. Confidence: medium · Verified: OpenAI: Introducing deep research
It helps to think of search as having grown three layers, un on top of the suivant:
- Recherche traditionnelle. Vous saisissez une requête, Google renvoie une liste de liens, puis vous les lisez et décidez. Le travail revient à l’humain.
- Recherche par IA. Vous posez une question ; l’IA consulte quelques sources et rédige une réponse — AI Overview, réponse de ChatGPT ou de Perplexity. Elle lit les sources et vous lisez sa synthèse.
- Recherche agentique. Vous donnez un objectif à l’IA — par exemple « compare les meilleurs outils de gestion de projet pour une agence de dix personnes et recommande-moi un choix ». Elle planifie le travail, lance plusieurs recherches, ouvre et lit de vraies pages, adapte sa méthode à ses découvertes, puis produit un rapport ou accomplit une action, comme remplir un formulaire. Les étapes intermédiaires peuvent rester invisibles.
La relation se résume ainsi : toute recherche agentique est une recherche par IA, mais toute recherche par IA n’est pas agentique. Le mode agentique correspond au sous-ensemble dans lequel le système travaille seul pendant un certain temps.
A concrete exemple
Même product, two modes:
- Réponse standard de ChatGPT : vous posez une question ; le modèle répond en quelques secondes à partir de ce qu’il « sait » déjà, avec éventuellement une recherche Web rapide. Il effectue un seul passage.
- Deep Research de ChatGPT : vous posez la même question ; le système annonce qu’il lui faudra du temps, puis consacre plusieurs minutes à rechercher, lire et recouper des dizaines de sources avant de produire une réponse structurée et citée.
Ce second mode relève de la recherche agentique. Gemini Deep Research de Google et Deep Research de Perplexity fonctionnent sur le même principe.
Pourquoi an SEO devrait care
Two raisons:
- Ces agents lisent réellement vos pages, en profondeur. Un robot traditionnel parcourt superficiellement un grand nombre de pages. Un agent peut étudier cinq à dix pages avec beaucoup d’attention et en extraire des affirmations précises. L’enjeu consiste à figurer parmi ce petit nombre de sources.
- Il n’est pas toujours possible de les exclure. Les versions qui se présentent comme
des robots de recherche — par exemple celle de Gemini — annoncent leur identité et respectent
robots.txt. Les navigateurs agentiques comme ChatGPT Agent ou Project Mariner ouvrent en revanche un véritable Chrome dans le cloud et ressemblent à un visiteur humain. Aucun nom de robot ne permet alors de les bloquer, etrobots.txtreste sans effet.
Pour examiner chaque plateforme, le tableau des agents utilisateurs et les signaux de contenu réellement utiles, passez à l’onglet Advanced.
TL;DR — La recherche agentique constitue le troisième niveau de recherche (traditionnelle → recherche par IA → agentique). Le système exécute pendant plusieurs minutes une boucle Planifier → Rechercher → Lire → Évaluer → Relancer → Synthétiser/Agir, avec 20 à plus de 160 requêtes par session et la lecture du contenu intégral des pages, pas de simples copies en cache. Pour le contrôle, les plateformes se divisent en deux groupes. Les robots déclarés (
Gemini-Deep-Research,Claude-User) respectentrobots.txt. Les navigateurs agentiques (ChatGPT Agent, Project Mariner, Copilot Actions) lancent de vraies machines virtuelles Chrome ou Edge sans agent utilisateur de robot déclaré :robots.txtne peut pas les arrêter ; seuls des contrôles côté serveur ou le futur standard Web Bot Auth le peuvent. L’intérêt commercial est élevé : le trafic issu de l’IA convertit environ 42 % mieux que le trafic non issu de l’IA, et le trafic agentique en représente la part à la plus forte intention.
Agentic search is a third couche, pas a replacement
Les descriptions actuelles des fournisseurs confirment la recherche en plusieurs étapes et l’usage d’outils, mais pas le remplacement universel de la récupération ou du classement. Evidence for this claim Deep-research products can perform multi-step web research and synthesize cited results. Scope: Documented product capabilities, not a universal definition or ranking architecture for agentic search. Confidence: high · Verified: OpenAI: Introducing deep research Les schémas de pipeline présentés ici sont des modèles explicatifs, sauf lorsqu’un fournisseur les documente explicitement. Evidence for this claim The term agentic search covers an evolving set of vendor implementations whose tools and behavior can differ. Scope: Editorial synthesis from documented product behavior; implementations and releases may vary. Confidence: medium · Verified: OpenAI: Introducing deep research
The mental model I garder coming back to:
- La recherche traditionnelle renvoie des liens ; l’humain lit et décide.
- La recherche par IA — cible du GEO/AEO, notamment AI Overviews, ChatGPT et Perplexity — renvoie une réponse synthétisée à partir du contexte récupéré.
- La recherche agentique décompose un objectif en sous-tâches, choisit ses outils, lit des pages entières, adapte ses étapes à ce qu’elle apprend et aboutit à un rapport synthétique ou à une action : achat, réservation ou envoi de formulaire.
Semrush résume bien la relation : “All agentic search is AI search. Not all agentic search is the same thing as AI search.” (traduction) « Toute recherche agentique est une recherche par IA, mais toute recherche par IA n’est pas agentique. » La formule à retenir est donc la même. Rien de cela ne remplace le SEO traditionnel : l’autorité, l’indexabilité et les données structurées restent indispensables. L’optimisation pour les agents y ajoute l’exhaustivité, la lisibilité par les machines et la clarté des entités.
How agentic systems en réalité fonctionner
La différence essentielle avec le RAG ou un appel de récupération unique est que la récupération intervient au milieu du raisonnement, dans une boucle :
An agent begins by breaking a goal into sub-tasks. It formulates one or more searches, fetches and reads live sources, and evaluates gaps, conflicts, and evidence. When evidence is missing, it revises the query and loops back to search. Once the task is sufficiently supported, it synthesizes a report or takes an allowed action. This is an explanatory model; products vary and do not all expose or implement every step identically.
Firecrawl décrit une méthode dans laquelle l’agent “decides when to search, formulates the query from context, reads actual page content from each result, and evaluates what it found before deciding whether to synthesize or search again.” (traduction) « décide quand lancer une recherche, formule la requête à partir du contexte, lit le contenu réel de chaque résultat et évalue ses découvertes avant de choisir entre synthétiser et relancer une recherche ». Conséquences pratiques :
- Lecture des pages en temps réel, pas de résumés préindexés. Les agents récupèrent et lisent le contenu intégral en ligne. La fraîcheur et la disponibilité immédiate comptent davantage que pour la recherche traditionnelle : ils ne travaillent pas sur une copie en cache.
- Reformulation itérative des requêtes. Si les résultats sont anciens ou hors sujet, l’agent réécrit la requête — par exemple en ajoutant « 2026 » lorsqu’il trouve une documentation obsolète — puis recommence.
- Enchaînement d’outils. Une même tâche peut combiner recherche Web, exécution de code, lecture de fichiers et envoi de formulaire.
Combien de recherches par session ?
Il ne s’agit pas d’une seule requête. Le volume varie selon la plateforme :
| Produit | Recherches par session | Durée |
|---|---|---|
| Perplexity Deep Research | 20–50 requêtes | 2–4 minutes |
| Gemini Deep Research | ~80 (standard) ; ~160 (Max) | jusqu’à 60 min (la plupart < 20) |
| OpenAI Deep Research | non précisé ; « des dizaines de minutes » | 10–30+ minutes |
| Project Mariner | navigation par tâche (jusqu’à 10 tâches en parallèle) | par tâche |
| ChatGPT Agent | jusqu’à ~10 tâches en parallèle | par tâche |
Les travaux SAGE de Google ont constaté que les agents d’IA effectuent en moyenne 4,9 étapes par requête : ils recherchent, comparent et évaluent plusieurs sources avant de produire un résultat.
Les principales plateformes agentiques
OpenAI — Deep Research + ChatGPT Agent. Deep Research (o3-deep-research /
o4-mini-deep-research) est conçu pour “find, analyze, and synthesize hundreds of
sources to create a comprehensive report at the level of a research analyst,”
(traduction) trouver, analyser et synthétiser des centaines de sources afin de créer
un rapport complet digne d’un analyste de recherche, et OpenAI prévient que les requêtes
“can take a long time.” (traduction) peuvent prendre beaucoup de temps. ChatGPT Agent
succède à Operator : il s’agit d’une instance Chromium hébergée dans le cloud qui parcourt
le Web réel et peut exécuter environ 10 tâches en parallèle. Ses robots de récupération
(OAI-SearchBot, ChatGPT-User) sont déclarés, contrairement au navigateur agentique.
Google — Gemini Deep Research + Project Mariner. Gemini Deep Research suit une
boucle explicite « Planifier → Rechercher → Lire → Itérer → Produire ». Google la décrit
ainsi : “continuously refin[ing] its analysis, browsing the web by searching and finding
interesting pieces of information then starting a new search based on what it’s
learned, repeating this process multiple times before generating a comprehensive
report.” (traduction) Le système affine continuellement son analyse, parcourt le Web
pour trouver des informations intéressantes, puis relance une recherche en fonction de
ce qu’il a appris, à plusieurs reprises, avant de produire un rapport complet. Il possède
un agent utilisateur déclaré, Gemini-Deep-Research, et respecte robots.txt.
Project Mariner est l’agent d’automatisation du navigateur (jusqu’à 10 tâches en
parallèle) : il utilise depuis des machines virtuelles cloud une empreinte Chrome
standard, sans agent utilisateur de robot déclaré.
Perplexity — Deep Research / Sonar. Perplexity “performs dozens of searches,
reads hundreds of sources, and reasons through the material to autonomously deliver
a comprehensive report” (traduction) effectue des dizaines de recherches, lit des
centaines de sources et raisonne sur leur contenu afin de produire de façon autonome
un rapport complet : 20 à 50 requêtes en 2 à 4 minutes. Son robot déclaré,
PerplexityBot, affirme respecter robots.txt. En août 2025,
Cloudflare reported
avoir observé des robots non déclarés, qu’il attribuait à Perplexity, accéder à du contenu
malgré des directives d’interdiction ; Perplexity a contesté le récit de Cloudflare.
Par ailleurs, la documentation de Perplexity indique que Perplexity-User ignore
généralement robots.txt, car il représente une récupération demandée par un utilisateur.
Anthropic — recherche Web de Claude + utilisation d’un ordinateur. Claude-User
(récupérations en temps réel lancées par l’utilisateur) respecte robots.txt.
Lorsque Claude fonctionne en mode d’utilisation d’un ordinateur, il pilote un navigateur
standard sans émettre d’agent utilisateur de robot déclaré : le même schéma de navigateur
agentique que Mariner et ChatGPT Agent.
Microsoft — Copilot + Copilot Actions. La récupération Web sous-jacente de Copilot
utilise Bingbot, qui respecte robots.txt. Copilot Actions (navigation agentique)
emploie un agent utilisateur Edge/Chromium standard sans signal de robot déclaré :
au niveau de l’agent utilisateur, il est impossible de le distinguer d’une navigation humaine.
Les agents utilisateurs et la faille de robots.txt
C’est le point qui prête le plus à confusion ; voici donc l’ensemble du paysage dans un tableau :
| Robot / agent | Signal d’agent utilisateur | robots.txt | Type |
|---|---|---|---|
| GPTBot | …compatible; GPTBot/1.3 | Respecté | Entraînement |
| OAI-SearchBot | …compatible; OAI-SearchBot/1.3 | Respecté | Index de recherche |
| ChatGPT-User | …compatible; ChatGPT-User/1.0 | Incertain depuis déc. 2025 | Déclenché par l’utilisateur |
| ChatGPT Agent | Agent utilisateur Chrome standard + en-tête Signature-Agent | Aucun signal | Navigateur agentique |
| ClaudeBot | …compatible; ClaudeBot/1.0 | Respecté | Entraînement |
| Claude-SearchBot | Claude-SearchBot | Respecté | Index de recherche |
| Claude-User | …compatible; Claude-User/1.0 | Respecté | Déclenché par l’utilisateur |
| PerplexityBot | …compatible; PerplexityBot/1.0 | Affirme que oui ; conformité contestée par Cloudflare | Index de recherche |
| Perplexity-User | …compatible; Perplexity-User/1.0 | Généralement ignoré | Déclenché par l’utilisateur |
| Gemini-Deep-Research | …compatible; Gemini-Deep-Research; +https://gemini.google/… | Respecté | Agent de recherche approfondie |
| Google-Agent | Agent utilisateur Chrome standard | Ignoré | Déclenché par l’utilisateur |
| Bingbot | …compatible; bingbot/2.0 | Respecté | Index de recherche / Copilot |
| Copilot Actions | Agent utilisateur Edge/Chromium standard | Aucun signal | Navigateur agentique |
| Project Mariner | Agent utilisateur Chrome standard (VM cloud) | Aucun signal | Navigateur agentique |
Les catégories importantes sont les suivantes : les robots d’entraînement et les
robots d’indexation de recherche respectent robots.txt ; le comportement des
récupérateurs déclenchés par l’utilisateur varie (OpenAI a discrètement rendu la
position de ChatGPT-User plus ambiguë en décembre 2025) ; les navigateurs agentiques
l’ignorent par conception.
Le piège essentiel : robots.txt ne peut pas bloquer les navigateurs agentiques
robots.txt est une directive destinée aux robots d’exploration. Les navigateurs
agentiques — ChatGPT Agent, Project Mariner, Copilot Actions et Claude en mode
d’utilisation d’un ordinateur — lancent de véritables instances Chrome ou Edge dans
des machines virtuelles cloud. Ils se présentent comme des navigateurs standards,
ne déclarent aucune identité de robot et sont traités comme des mandataires de
navigateur plutôt que comme des robots d’exploration. Par conséquent :
- Vous pouvez bloquer les robots d’entraînement (
GPTBot,ClaudeBot) et d’indexation (OAI-SearchBot,Claude-SearchBot) dansrobots.txt. - Vous ne pouvez pas y bloquer les navigateurs agentiques : ils ne le lisent tout simplement pas.
Les seuls moyens efficaces contre la couche des navigateurs agentiques sont les
contrôles côté serveur (règles de plages IP, limitation de débit, gestion des
robots en périphérie) et la future RFC Web Bot Auth, qui permet de vérifier les
agents par cryptographie. ChatGPT Agent fournit déjà un premier signal : il envoie une
signature HTTP ed25519 Signature-Agent: "https://chatgpt.com", son seul identifiant
fiable côté serveur. Dans les outils d’analyse ordinaires, une visite directe apparaît
comme « direct/(none) », ou comme « Bing/organic » lorsque l’agent vous a trouvé via Bing.
Conséquence qu’il faut énoncer clairement : bloquer GPTBot n’empêche pas ChatGPT de
lire vos pages en temps réel. GPTBot est le robot d’entraînement. Deep Research et
ChatGPT Agent accèdent à votre contenu par des mécanismes entièrement différents.
Les signaux de contenu utiles à l’IA agentique
Les agents lisent des pages entières et évaluent leur exhaustivité, leur aptitude à être citées, leur cohérence et leur lisibilité par les machines. D’après les recherches, voici ce qui aide réellement :
- Des pages exhaustives constituant une ressource unique. Les agents explorent en profondeur mais dans un périmètre étroit : ils peuvent lire soigneusement 5 à 10 pages plutôt que d’en survoler des centaines. Une page qui répond entièrement à un sujet et aux sous-questions qu’il soulève est bien plus utile que cinq pages minces. Selon ALM Corp : “Structure gives agents stable extraction points — a page with clear headings, labeled sections and consistent formatting is easier to quote accurately.” (traduction) La structure offre aux agents des points d’extraction stables : une page aux titres clairs, aux sections libellées et à la mise en forme cohérente est plus facile à citer avec précision.
- Un contenu bien sourcé, fiable et lisible par les machines. Les agents recoupent les informations avec des sources tierces et des bases de connaissances ; les citations externes aident donc à franchir leur seuil de confiance. Cela concorde avec mon constat sur les AI Overviews : les mentions sur des pages recevant beaucoup de liens présentent une corrélation d’environ 0,70 (Spearman) avec la visibilité dans l’IA, soit le signal individuel le plus fort de cette étude, et la récupération agentique devrait elle aussi s’appuyer sur ce schéma.
- Des données structurées. Le JSON-LD n’est pas indispensable pour être cité, mais il améliore la précision d’extraction : dans un test cité, GPT-4 est passé de 16 % à 54 % de réponses correctes lorsque le contenu comportait des données structurées.
- La vitesse. Les données BrightEdge montrent que les agents ChatGPT abandonnent immédiatement les sites lents. Ils sont moins patients que Googlebot, ce qui étend la discipline Core Web Vitals au contexte agentique. Le contenu doit aussi être accessible sans exécuter JavaScript.
- La clarté du périmètre et des compromis. Une page qui précise à qui s’adresse une solution, à qui elle ne s’adresse pas et quels compromis elle implique aide davantage un agent à établir une présélection qu’un contenu qui tente de plaire à tout le monde.
Pourquoi l’effort en vaut la peine : la qualité des conversions
Le volume de trafic est faible, mais sa qualité ne l’est pas. En mars 2026, le trafic provenant de l’IA convertit environ 42 % mieux que le trafic non issu de l’IA, et le trafic de recherche par IA convertit à environ 14,2 %, contre 2,8 % pour Google. Le trafic agentique constitue un sous-ensemble du trafic IA, et presque certainement celui dont l’intention est la plus forte : un agent n’envoie l’utilisateur sur votre page qu’après l’avoir évaluée face à d’autres solutions en son nom. Figurer parmi les quelques pages qu’il lit, puis devenir celle qu’il recommande, a donc une valeur disproportionnée.
Comment raisonner : SEO → GEO → ASO
Considérez l’optimisation agentique comme une troisième couche ajoutée aux deux
premières, et non comme un remplacement. Les fondations restent les mêmes : autorité,
indexabilité et données structurées. Les nouveautés sont des ressources exhaustives sur
un sujet unique, une lisibilité machine sans compromis, des entités clairement définies,
des citations externes et la reconnaissance que robots.txt ne constitue plus un
dispositif complet de contrôle d’accès. Consultez l’onglet Checklists pour la mise
en pratique.
Résumé par l’IA
Version condensée de l’onglet Avancé :
- La recherche agentique est la troisième couche de la recherche : recherche traditionnelle (liens) → recherche par IA (une réponse) → agentique (recherche ou action autonome en plusieurs étapes). “All agentic search is AI search. Not all AI search is agentic.” (traduction) Toute recherche agentique relève de la recherche par IA, mais toute recherche par IA n’est pas agentique.
- Elle exécute une boucle, pas une requête unique : planifier → rechercher → lire → évaluer → relancer la recherche → synthétiser ou agir, pendant plusieurs minutes. Gemini Deep Research lance environ 80 à 160 requêtes par session ; Perplexity, 20 à 50 ; SAGE de Google a constaté environ 4,9 étapes par requête.
- Deux familles de contrôle. Les robots déclarés (
Gemini-Deep-Research,Claude-User) respectentrobots.txt. Les navigateurs agentiques (ChatGPT Agent, Project Mariner, Copilot Actions) exécutent de vraies VM Chrome ou Edge sans agent utilisateur de robot déclaré :robots.txtne peut pas les bloquer. - Le piège : seuls les contrôles côté serveur ou la future RFC Web Bot Auth
arrêtent les navigateurs agentiques. L’en-tête ed25519
Signature-Agentde ChatGPT Agent est son seul identifiant fiable côté serveur. BloquerGPTBotn’empêche pas ChatGPT de vous lire. - Cloudflare et Perplexity contestent le déroulement des faits. Cloudflare a déclaré que des robots non déclarés attribués à Perplexity avaient contourné des directives d’interdiction ; Perplexity a nié l’accusation. Il faut présenter cet épisode comme un différend rapporté, et non comme un fait établi.
- Ce qui aide : pages exhaustives sur un sujet unique, citations externes (corrélation de ~0,70 de Spearman avec la visibilité IA), données structurées, rapidité et clarté du périmètre.
- Pourquoi agir : le trafic provenant de l’IA convertit environ 42 % mieux ; la recherche par IA atteint 14,2 %, contre 2,8 % pour Google. Le trafic agentique est le sous-ensemble dont l’intention est la plus forte.
Documentation officielle
Documentation de première main publiée par les créateurs des plateformes.
OpenAI
- Guide Deep Research — modèles
o3-deep-research/o4-mini-deep-research, exécution en arrière-plan et accès aux outils. - Robots et robots d’exploration d’OpenAI — chaînes complètes d’agents utilisateurs pour GPTBot, OAI-SearchBot et ChatGPT-User.
- Présentation de ChatGPT Agent — le navigateur agentique qui succède à Operator.
- Documentation de l’API Gemini Deep Research — nombre de requêtes, limites de durée et exécution en arrière-plan.
- Essayer Deep Research dans Gemini — description en langage courant de la boucle de recherche par Google.
Anthropic
- Outil d’utilisation d’un ordinateur de Claude — comment Claude pilote un navigateur ou un bureau en mode agentique.
Perplexity
- Sonar Deep Research — le modèle d’API qui sous-tend Deep Research.
- Robots d’exploration de Perplexity — PerplexityBot, Perplexity-User et leur comportement déclaré envers robots.txt.
Microsoft
- Outils Bing pour les webmasters — Bingbot sous-tend la récupération Web de Copilot ; les contrôles d’exploration se trouvent ici.
Quotes from the source
Déclarations publiques des créateurs des plateformes et des chercheurs qui documentent leur comportement.
Google — la boucle Gemini Deep Research
- “Over the course of a few minutes, Gemini continuously refines its analysis, browsing the web by searching and finding interesting pieces of information then starting a new search based on what it’s learned, repeating this process multiple times before generating a comprehensive report.” (traduction) En quelques minutes, Gemini affine continuellement son analyse, parcourt le Web à la recherche d’informations intéressantes, puis lance de nouvelles recherches à partir de ce qu’il a appris, et répète ce processus plusieurs fois avant de produire un rapport complet. — Blog de Google. Source
OpenAI — la vocation de Deep Research
- Les modèles Deep Research “find, analyze, and synthesize hundreds of sources to create
a comprehensive report at the level of a research analyst.” (traduction) trouvent,
analysent et synthétisent des centaines de sources pour créer un rapport complet digne
d’un analyste de recherche.
[unverified]— paraphrase du positionnement d’OpenAI ; à confirmer dans la documentation en ligne. Source
Perplexity — le fonctionnement de Deep Research
- “Perplexity performs dozens of searches, reads hundreds of sources, and reasons through the material to autonomously deliver a comprehensive report.” (traduction) Perplexity effectue des dizaines de recherches, lit des centaines de sources et raisonne sur leur contenu afin de produire de façon autonome un rapport complet. — Blog de Perplexity. Source
Cloudflare — les robots furtifs de Perplexity
L’accusation de Cloudflare est citée ci-dessous ; Perplexity a contesté ce récit.- “Both their declared and undeclared crawlers were attempting to access the content for scraping contrary to the web crawling norms as outlined in RFC 9309.” (traduction) Leurs robots déclarés comme non déclarés tentaient tous d’accéder au contenu pour l’extraire, contrairement aux normes d’exploration du Web énoncées dans la RFC 9309. — Cloudflare. Source
Firecrawl — définition de la recherche agentique
- La recherche agentique est une méthode dans laquelle l’agent “decides when to search, formulates the query from context, reads actual page content from each result, and evaluates what it found before deciding whether to synthesize or search again.” (traduction) décide quand rechercher, formule la requête à partir du contexte, lit le contenu réel de chaque résultat et évalue ses découvertes avant de choisir entre synthétiser ou relancer la recherche. — Blog de Firecrawl. Source
ALM Corp — ce que privilégient les agents
- “Structure gives agents stable extraction points — a page with clear headings, labeled sections and consistent formatting is easier to quote accurately.” (traduction) La structure offre aux agents des points d’extraction stables : une page aux titres clairs, aux sections libellées et à la mise en forme cohérente est plus facile à citer avec précision. — ALM Corp. Source
Semrush — la distinction entre les couches
- “All agentic search is AI search. Not all AI search is agentic.”
[unverified](traduction) Toute recherche agentique relève de la recherche par IA, mais toute recherche par IA n’est pas agentique. — paraphrase du cadre de Semrush ; formulation exacte à confirmer dans l’article en ligne. Source
[unverified] sont des
paraphrases à confirmer dans la source en ligne avant de les considérer comme textuelles. Checklist d’optimisation pour la recherche agentique
Un passage en revue pour vérifier que les agents peuvent vous trouver, vous lire, vous faire confiance et vous citer, et que vous pouvez les observer lorsqu’ils le font :
- Des pages exhaustives sur un sujet unique. Chaque sujet important dispose d’une page qui y répond entièrement, y compris aux sous-questions soulevées, plutôt que de plusieurs pages minces. Les agents lisent en profondeur, pas en largeur.
- Des sources citées et une autorité externe. Les affirmations sont attribuables ; vous êtes mentionné sur des pages tierces fiables qui reçoivent de nombreux liens (le signal de visibilité IA le plus fort que j’aie mesuré).
- Des données structurées en place. JSON-LD (Organization, FAQPage, Product, etc.) afin que les agents extraient précisément les faits sans les deviner.
- Un périmètre et des compromis clairs. Les pages indiquent à qui s’adresse une solution, à qui elle ne s’adresse pas et quels sont ses compromis, ce qui facilite la présélection d’un agent.
- Un accès rapide sans JavaScript. Le contenu essentiel figure dans le HTML brut et les pages se chargent vite, car les agents abandonnent les sites lents plus rapidement que Googlebot.
- Des contrôles d’accès côté serveur, pas seulement
robots.txt. Si vous devez restreindre l’accès, utilisez des règles de plages IP ou une gestion des robots en périphérie : les navigateurs agentiques ignorentrobots.txt. - Un
robots.txtcorrectement configuré pour les robots déclarés. Distinguez l’entraînement (GPTBot,ClaudeBot), la récupération (OAI-SearchBot,Claude-SearchBot) et la recherche approfondie (Gemini-Deep-Research) selon votre stratégie. - La surveillance des robots agentiques dans les journaux serveur. Recherchez
les agents utilisateurs de recherche approfondie déclarés et l’en-tête
Signature-Agent, seul identifiant fiable de ChatGPT Agent ; une visite directe de l’agent peut apparaître comme « direct/(none) » dans les outils d’analyse.
Agentic AI user-agent référence — cheat sheet
| Platform / agent | User-agent signal | Category | robots.txt | Notes |
|---|---|---|---|---|
| GPTBot | …compatible; GPTBot/1.3 | Training | Respects | Blocking ≠ stopping ChatGPT live reads |
| OAI-SearchBot | …compatible; OAI-SearchBot/1.3 | Search index | Respects | Feeds ChatGPT search |
| ChatGPT-User | …compatible; ChatGPT-User/1.0 | User-triggered | Unclear (Dec 2025 modifier) | Policy language softened |
| ChatGPT Agent | Chrome UA + Signature-Agent header | Agentic navigateur | Aucun | ed25519-signed; seulement reliable server-side ID |
| ClaudeBot | …compatible; ClaudeBot/1.0 | Training | Respects | — |
| Claude-SearchBot | Claude-SearchBot | Search index | Respects | — |
| Claude-User | …compatible; Claude-User/1.0 | User-triggered | Respects | — |
| Claude (computer utiliser) | Standard navigateur UA | Agentic navigateur | Aucun | Drives a réel navigateur |
| PerplexityBot | …compatible; PerplexityBot/1.0 | Search index | Dit yes; compliance disputed | Cloudflare allegation; Perplexity denial |
| Perplexity-User | …compatible; Perplexity-User/1.0 | User-triggered | Généralement ignores | Per Perplexity’s propre docs |
| Gemini-Deep-Research | …compatible; Gemini-Deep-Research; +https://gemini.google/… | Deep-research agent | Respects | Declared, blockable |
| Google-Agent | Standard Chrome UA | User-triggered | Ignores | Navigateur proxy |
| Bingbot | …compatible; bingbot/2.0 | Search / Copilot index | Respects | Underpins Copilot retrieval |
| Copilot Actions | Standard Edge/Chromium UA | Agentic navigateur | Aucun | Aucun bot signal |
| Project Mariner | Standard Chrome UA (cloud VM) | Agentic navigateur | Aucun | Up to 10 parallel tasks |
La règle en une phrase : les robots d’exploration et d’indexation déclarés respectent
robots.txt, mais les navigateurs agentiques (de vraies VM Chrome/Edge) ne le font
pas ; bloquez-les côté serveur ou au moyen de Web Bot Auth.
Agentic-search mistakes
Assuming robots.txt contrôle every agent
Some agentic systems browse via ordinary navigateur infrastructure plutôt que a declared robot d’exploration identity. Utiliser robots rules pour bots que honor les, but ne faites pas présent the fichier as an access-control boundary.
Designing seulement pour one-shot réponses
Les agents peuvent comparer, revenir en arrière, filtrer et accomplir des tâches en plusieurs étapes. Rendez la navigation, les formulaires, les états, les prix, les règles et les relations entre entités assez explicites pour résister à un parcours prolongé.
Masquer des faits essentiels derrière des interactions fragiles
An agent ne peut pas reliably utiliser information que apparaît seulement après an inaccessible gesture, canvas state, or undocumented client action. Preserve semantic HTML, stable URLs, clair étiquettes, and server-verifiable outcomes.
The Découvrir, Comprendre, Act, Vérifier framework
- Découvrir : les pages et fonctions importantes possèdent des liens stables ou des points d’entrée documentés et lisibles par les machines.
- Comprendre : les entités, contraintes, prix, règles et étapes suivantes sont clairement énoncés dans un contenu sémantique.
- Agir : les formulaires et parcours disposent de libellés explicites, de commandes prévisibles et d’états d’erreur récupérables.
- Vérifier : une action terminée produit une confirmation durable que l’utilisateur ou l’agent peut examiner avant de poursuivre.
Utiliser the framework to examiner a complet task journey. Une page peut be facile to retrieve yet encore échouer quand an agent tries to act or confirmer le résultat.
Outils pour agent-accessible search experiences
- Serveur MCP SEO — examinez un exemple limité et en lecture seule qui expose directement aux agents du contenu SEO publié et des fonctions de vérification.
- Testeur robots.txt — vérifiez les règles des robots déclarés et identifiez la directive gagnante, tout en gardant à l’esprit qu’un agent utilisant un navigateur ordinaire peut ne présenter aucune identité de robot contrôlable.
- Outils de développement du navigateur — examinez les noms sémantiques, l’ordre de focus, les appels réseau, les états d’erreur et les signaux durables d’achèvement.
- Journaux serveur — distinguez les robots documentés, les navigateurs ordinaires et les clients inconnus, sans prétendre que chaque requête révèle un agent ou son objectif.
Testez vos connaissances: Agentic search
Ressources utiles
Documentation officielle des plateformes
- OpenAI Deep Research et robots OpenAI.
- API Google Gemini Deep Research et article de lancement.
- Utilisation d’un ordinateur avec Claude d’Anthropic.
- Perplexity Sonar Deep Research et robots d’exploration de Perplexity.
Mes articles connexes
- Ce que nous savons réellement de l’optimisation pour la recherche par LLM — l’étude de corrélation à l’origine du coefficient de Spearman d’environ 0,70 pour les mentions sur des pages à forte autorité.
- À la rencontre des nouveaux robots du Web : les robots IA rattrapent ceux des moteurs de recherche — l’évolution du paysage des robots d’exploration.
Autres auteurs
- Cloudflare : Perplexity utilise des robots furtifs non déclarés — accusation et exposé technique de Cloudflare ; Perplexity l’a niée.
- Simon Willison : l’agent utilisateur de ChatGPT Agent — détails sur
Signature-Agentet ed25519. - Firecrawl : qu’est-ce que la recherche agentique ? — anatomie technique de la boucle.
- Semrush : recherche agentique et ALM Corp : explication du Web agentique — cadres stratégiques.
- No Hacks : panorama des agents utilisateurs d’IA en 2026 et liste des agents utilisateurs de robots IA de SEJ.
- BrightEdge : l’activité de l’IA agentique double — adaptez maintenant votre stratégie SEO — données sur le doublement de l’activité de ChatGPT Agent entre juillet et août 2025 et sur l’abandon des sites lents plus rapide que celui de Googlebot.
- Seer Interactive : comment savoir quand l’agent Operator d’OpenAI visite votre site — guide pratique pour identifier et mesurer les visites de navigateurs agentiques dans les outils d’analyse.
- Cloudflare : de Googlebot à GPTBot — qui explore votre site en 2025 ? — volumes d’exploration des robots IA déclarés par rapport aux robots de recherche traditionnels.
- Navoto : optimisation de la recherche agentique — guide de visibilité dans la recherche par IA en 2026 — cadre ASO pratique couvrant les couches SEO → GEO → ASO et les signaux de contenu.
Statistiques à citer
- Le trafic provenant de l’IA convertit environ 42 % mieux que le trafic non issu de l’IA (mars 2026) — la principale raison pour laquelle la visibilité agentique mérite cet effort. Source
- La recherche par IA convertit à environ 14,2 %, contre environ 2,8 % pour Google — le trafic agentique est le sous-ensemble de ce trafic IA à plus forte intention. Source
- Gemini Deep Research : environ 80 requêtes par session (standard), environ 160 (Max) — l’échelle d’une seule recherche agentique. Source
- Perplexity Deep Research : 20 à 50 requêtes par session, en 2 à 4 minutes — une exécution plus légère, mais toujours en plusieurs étapes. Source
- Corrélation de Spearman d’environ 0,70 entre les mentions sur des pages recevant beaucoup de liens et la visibilité dans l’IA (Google AI Overviews) — mon constat, qui indique probablement aussi la forme des signaux de confiance agentiques. Source
- Le trafic de l’IA agentique a progressé de 1 300 % pendant les huit premiers mois de 2025, tandis que l’activité de ChatGPT Agent a doublé entre juillet et août 2025 : c’est la composante du trafic issu de l’IA qui croît le plus vite. Source
Journal des modifications
Mis à jour le 9 août 2026.
Résumé éditorial et détails enregistrés des changements.Détails des changements
-
Les notes détaillées des changements sont actuellement disponibles en anglais.
Comparaison complète indisponible — aucun instantané antérieur n’a été archivé pour cette révision.