Guide de la recherche agentique

La recherche agentique est une IA qui planifie, parcourt le Web et synthétise de façon autonome une tâche de recherche en plusieurs étapes, au lieu de répondre à une seule requête. Découvrez ce qui la distingue de la recherche par IA.

Première publication : 24 juin 2026 · Dernière mise à jour : 9 août 2026 · Advanced
Langues
1 indice probant sur cette page

La recherche agentique est une IA qui parcourt le Web, mène des recherches et produit une synthèse de façon autonome pendant plusieurs minutes, au lieu de répondre à une seule requête. Point technique essentiel : les navigateurs agentiques lancent de vraies machines virtuelles Chrome ou Edge et ne peuvent pas être bloqués par robots.txt.

TL;DR — La recherche agentique constitue le troisième niveau de recherche (traditionnelle → recherche par IA → agentique). Le système exécute pendant plusieurs minutes une boucle Planifier → Rechercher → Lire → Évaluer → Relancer → Synthétiser/Agir, avec 20 à plus de 160 requêtes par session et la lecture du contenu intégral des pages, pas de simples copies en cache. Pour le contrôle, les plateformes se divisent en deux groupes. Les robots déclarés (Gemini-Deep-Research, Claude-User) respectent robots.txt. Les navigateurs agentiques (ChatGPT Agent, Project Mariner, Copilot Actions) lancent de vraies machines virtuelles Chrome ou Edge sans agent utilisateur de robot déclaré : robots.txt ne peut pas les arrêter ; seuls des contrôles côté serveur ou le futur standard Web Bot Auth le peuvent. L’intérêt commercial est élevé : le trafic issu de l’IA convertit environ 42 % mieux que le trafic non issu de l’IA, et le trafic agentique en représente la part à la plus forte intention.

Agentic search is a third couche, pas a replacement

Les descriptions actuelles des fournisseurs confirment la recherche en plusieurs étapes et l’usage d’outils, mais pas le remplacement universel de la récupération ou du classement. Evidence for this claim Deep-research products can perform multi-step web research and synthesize cited results. Scope: Documented product capabilities, not a universal definition or ranking architecture for agentic search. Confidence: high · Verified: OpenAI: Introducing deep research Les schémas de pipeline présentés ici sont des modèles explicatifs, sauf lorsqu’un fournisseur les documente explicitement. Evidence for this claim The term agentic search covers an evolving set of vendor implementations whose tools and behavior can differ. Scope: Editorial synthesis from documented product behavior; implementations and releases may vary. Confidence: medium · Verified: OpenAI: Introducing deep research

The mental model I garder coming back to:

  • La recherche traditionnelle renvoie des liens ; l’humain lit et décide.
  • La recherche par IA — cible du GEO/AEO, notamment AI Overviews, ChatGPT et Perplexity — renvoie une réponse synthétisée à partir du contexte récupéré.
  • La recherche agentique décompose un objectif en sous-tâches, choisit ses outils, lit des pages entières, adapte ses étapes à ce qu’elle apprend et aboutit à un rapport synthétique ou à une action : achat, réservation ou envoi de formulaire.

Semrush résume bien la relation : “All agentic search is AI search. Not all agentic search is the same thing as AI search.” (traduction) « Toute recherche agentique est une recherche par IA, mais toute recherche par IA n’est pas agentique. » La formule à retenir est donc la même. Rien de cela ne remplace le SEO traditionnel : l’autorité, l’indexabilité et les données structurées restent indispensables. L’optimisation pour les agents y ajoute l’exhaustivité, la lisibilité par les machines et la clarté des entités.

How agentic systems en réalité fonctionner

La différence essentielle avec le RAG ou un appel de récupération unique est que la récupération intervient au milieu du raisonnement, dans une boucle :

Agentic retrieval happens inside the reasoning loop: evaluate what is missing, search again, then synthesize or act.

An agent begins by breaking a goal into sub-tasks. It formulates one or more searches, fetches and reads live sources, and evaluates gaps, conflicts, and evidence. When evidence is missing, it revises the query and loops back to search. Once the task is sufficiently supported, it synthesizes a report or takes an allowed action. This is an explanatory model; products vary and do not all expose or implement every step identically.

Firecrawl décrit une méthode dans laquelle l’agent “decides when to search, formulates the query from context, reads actual page content from each result, and evaluates what it found before deciding whether to synthesize or search again.” (traduction) « décide quand lancer une recherche, formule la requête à partir du contexte, lit le contenu réel de chaque résultat et évalue ses découvertes avant de choisir entre synthétiser et relancer une recherche ». Conséquences pratiques :

  • Lecture des pages en temps réel, pas de résumés préindexés. Les agents récupèrent et lisent le contenu intégral en ligne. La fraîcheur et la disponibilité immédiate comptent davantage que pour la recherche traditionnelle : ils ne travaillent pas sur une copie en cache.
  • Reformulation itérative des requêtes. Si les résultats sont anciens ou hors sujet, l’agent réécrit la requête — par exemple en ajoutant « 2026 » lorsqu’il trouve une documentation obsolète — puis recommence.
  • Enchaînement d’outils. Une même tâche peut combiner recherche Web, exécution de code, lecture de fichiers et envoi de formulaire.

Combien de recherches par session ?

Il ne s’agit pas d’une seule requête. Le volume varie selon la plateforme :

ProduitRecherches par sessionDurée
Perplexity Deep Research20–50 requêtes2–4 minutes
Gemini Deep Research~80 (standard) ; ~160 (Max)jusqu’à 60 min (la plupart < 20)
OpenAI Deep Researchnon précisé ; « des dizaines de minutes »10–30+ minutes
Project Marinernavigation par tâche (jusqu’à 10 tâches en parallèle)par tâche
ChatGPT Agentjusqu’à ~10 tâches en parallèlepar tâche

Les travaux SAGE de Google ont constaté que les agents d’IA effectuent en moyenne 4,9 étapes par requête : ils recherchent, comparent et évaluent plusieurs sources avant de produire un résultat.

Les principales plateformes agentiques

OpenAI — Deep Research + ChatGPT Agent. Deep Research (o3-deep-research / o4-mini-deep-research) est conçu pour “find, analyze, and synthesize hundreds of sources to create a comprehensive report at the level of a research analyst,” (traduction) trouver, analyser et synthétiser des centaines de sources afin de créer un rapport complet digne d’un analyste de recherche, et OpenAI prévient que les requêtes “can take a long time.” (traduction) peuvent prendre beaucoup de temps. ChatGPT Agent succède à Operator : il s’agit d’une instance Chromium hébergée dans le cloud qui parcourt le Web réel et peut exécuter environ 10 tâches en parallèle. Ses robots de récupération (OAI-SearchBot, ChatGPT-User) sont déclarés, contrairement au navigateur agentique.

Google — Gemini Deep Research + Project Mariner. Gemini Deep Research suit une boucle explicite « Planifier → Rechercher → Lire → Itérer → Produire ». Google la décrit ainsi : “continuously refin[ing] its analysis, browsing the web by searching and finding interesting pieces of information then starting a new search based on what it’s learned, repeating this process multiple times before generating a comprehensive report.” (traduction) Le système affine continuellement son analyse, parcourt le Web pour trouver des informations intéressantes, puis relance une recherche en fonction de ce qu’il a appris, à plusieurs reprises, avant de produire un rapport complet. Il possède un agent utilisateur déclaré, Gemini-Deep-Research, et respecte robots.txt. Project Mariner est l’agent d’automatisation du navigateur (jusqu’à 10 tâches en parallèle) : il utilise depuis des machines virtuelles cloud une empreinte Chrome standard, sans agent utilisateur de robot déclaré.

Perplexity — Deep Research / Sonar. Perplexity “performs dozens of searches, reads hundreds of sources, and reasons through the material to autonomously deliver a comprehensive report” (traduction) effectue des dizaines de recherches, lit des centaines de sources et raisonne sur leur contenu afin de produire de façon autonome un rapport complet : 20 à 50 requêtes en 2 à 4 minutes. Son robot déclaré, PerplexityBot, affirme respecter robots.txt. En août 2025, Cloudflare reported avoir observé des robots non déclarés, qu’il attribuait à Perplexity, accéder à du contenu malgré des directives d’interdiction ; Perplexity a contesté le récit de Cloudflare. Par ailleurs, la documentation de Perplexity indique que Perplexity-User ignore généralement robots.txt, car il représente une récupération demandée par un utilisateur.

Anthropic — recherche Web de Claude + utilisation d’un ordinateur. Claude-User (récupérations en temps réel lancées par l’utilisateur) respecte robots.txt. Lorsque Claude fonctionne en mode d’utilisation d’un ordinateur, il pilote un navigateur standard sans émettre d’agent utilisateur de robot déclaré : le même schéma de navigateur agentique que Mariner et ChatGPT Agent.

Microsoft — Copilot + Copilot Actions. La récupération Web sous-jacente de Copilot utilise Bingbot, qui respecte robots.txt. Copilot Actions (navigation agentique) emploie un agent utilisateur Edge/Chromium standard sans signal de robot déclaré : au niveau de l’agent utilisateur, il est impossible de le distinguer d’une navigation humaine.

Les agents utilisateurs et la faille de robots.txt

C’est le point qui prête le plus à confusion ; voici donc l’ensemble du paysage dans un tableau :

Robot / agentSignal d’agent utilisateurrobots.txtType
GPTBot…compatible; GPTBot/1.3RespectéEntraînement
OAI-SearchBot…compatible; OAI-SearchBot/1.3RespectéIndex de recherche
ChatGPT-User…compatible; ChatGPT-User/1.0Incertain depuis déc. 2025Déclenché par l’utilisateur
ChatGPT AgentAgent utilisateur Chrome standard + en-tête Signature-AgentAucun signalNavigateur agentique
ClaudeBot…compatible; ClaudeBot/1.0RespectéEntraînement
Claude-SearchBotClaude-SearchBotRespectéIndex de recherche
Claude-User…compatible; Claude-User/1.0RespectéDéclenché par l’utilisateur
PerplexityBot…compatible; PerplexityBot/1.0Affirme que oui ; conformité contestée par CloudflareIndex de recherche
Perplexity-User…compatible; Perplexity-User/1.0Généralement ignoréDéclenché par l’utilisateur
Gemini-Deep-Research…compatible; Gemini-Deep-Research; +https://gemini.google/…RespectéAgent de recherche approfondie
Google-AgentAgent utilisateur Chrome standardIgnoréDéclenché par l’utilisateur
Bingbot…compatible; bingbot/2.0RespectéIndex de recherche / Copilot
Copilot ActionsAgent utilisateur Edge/Chromium standardAucun signalNavigateur agentique
Project MarinerAgent utilisateur Chrome standard (VM cloud)Aucun signalNavigateur agentique

Les catégories importantes sont les suivantes : les robots d’entraînement et les robots d’indexation de recherche respectent robots.txt ; le comportement des récupérateurs déclenchés par l’utilisateur varie (OpenAI a discrètement rendu la position de ChatGPT-User plus ambiguë en décembre 2025) ; les navigateurs agentiques l’ignorent par conception.

Le piège essentiel : robots.txt ne peut pas bloquer les navigateurs agentiques

robots.txt est une directive destinée aux robots d’exploration. Les navigateurs agentiques — ChatGPT Agent, Project Mariner, Copilot Actions et Claude en mode d’utilisation d’un ordinateur — lancent de véritables instances Chrome ou Edge dans des machines virtuelles cloud. Ils se présentent comme des navigateurs standards, ne déclarent aucune identité de robot et sont traités comme des mandataires de navigateur plutôt que comme des robots d’exploration. Par conséquent :

  • Vous pouvez bloquer les robots d’entraînement (GPTBot, ClaudeBot) et d’indexation (OAI-SearchBot, Claude-SearchBot) dans robots.txt.
  • Vous ne pouvez pas y bloquer les navigateurs agentiques : ils ne le lisent tout simplement pas.

Les seuls moyens efficaces contre la couche des navigateurs agentiques sont les contrôles côté serveur (règles de plages IP, limitation de débit, gestion des robots en périphérie) et la future RFC Web Bot Auth, qui permet de vérifier les agents par cryptographie. ChatGPT Agent fournit déjà un premier signal : il envoie une signature HTTP ed25519 Signature-Agent: "https://chatgpt.com", son seul identifiant fiable côté serveur. Dans les outils d’analyse ordinaires, une visite directe apparaît comme « direct/(none) », ou comme « Bing/organic » lorsque l’agent vous a trouvé via Bing.

Conséquence qu’il faut énoncer clairement : bloquer GPTBot n’empêche pas ChatGPT de lire vos pages en temps réel. GPTBot est le robot d’entraînement. Deep Research et ChatGPT Agent accèdent à votre contenu par des mécanismes entièrement différents.

Les signaux de contenu utiles à l’IA agentique

Les agents lisent des pages entières et évaluent leur exhaustivité, leur aptitude à être citées, leur cohérence et leur lisibilité par les machines. D’après les recherches, voici ce qui aide réellement :

  • Des pages exhaustives constituant une ressource unique. Les agents explorent en profondeur mais dans un périmètre étroit : ils peuvent lire soigneusement 5 à 10 pages plutôt que d’en survoler des centaines. Une page qui répond entièrement à un sujet et aux sous-questions qu’il soulève est bien plus utile que cinq pages minces. Selon ALM Corp : “Structure gives agents stable extraction points — a page with clear headings, labeled sections and consistent formatting is easier to quote accurately.” (traduction) La structure offre aux agents des points d’extraction stables : une page aux titres clairs, aux sections libellées et à la mise en forme cohérente est plus facile à citer avec précision.
  • Un contenu bien sourcé, fiable et lisible par les machines. Les agents recoupent les informations avec des sources tierces et des bases de connaissances ; les citations externes aident donc à franchir leur seuil de confiance. Cela concorde avec mon constat sur les AI Overviews : les mentions sur des pages recevant beaucoup de liens présentent une corrélation d’environ 0,70 (Spearman) avec la visibilité dans l’IA, soit le signal individuel le plus fort de cette étude, et la récupération agentique devrait elle aussi s’appuyer sur ce schéma.
  • Des données structurées. Le JSON-LD n’est pas indispensable pour être cité, mais il améliore la précision d’extraction : dans un test cité, GPT-4 est passé de 16 % à 54 % de réponses correctes lorsque le contenu comportait des données structurées.
  • La vitesse. Les données BrightEdge montrent que les agents ChatGPT abandonnent immédiatement les sites lents. Ils sont moins patients que Googlebot, ce qui étend la discipline Core Web Vitals au contexte agentique. Le contenu doit aussi être accessible sans exécuter JavaScript.
  • La clarté du périmètre et des compromis. Une page qui précise à qui s’adresse une solution, à qui elle ne s’adresse pas et quels compromis elle implique aide davantage un agent à établir une présélection qu’un contenu qui tente de plaire à tout le monde.

Pourquoi l’effort en vaut la peine : la qualité des conversions

Le volume de trafic est faible, mais sa qualité ne l’est pas. En mars 2026, le trafic provenant de l’IA convertit environ 42 % mieux que le trafic non issu de l’IA, et le trafic de recherche par IA convertit à environ 14,2 %, contre 2,8 % pour Google. Le trafic agentique constitue un sous-ensemble du trafic IA, et presque certainement celui dont l’intention est la plus forte : un agent n’envoie l’utilisateur sur votre page qu’après l’avoir évaluée face à d’autres solutions en son nom. Figurer parmi les quelques pages qu’il lit, puis devenir celle qu’il recommande, a donc une valeur disproportionnée.

Comment raisonner : SEO → GEO → ASO

Considérez l’optimisation agentique comme une troisième couche ajoutée aux deux premières, et non comme un remplacement. Les fondations restent les mêmes : autorité, indexabilité et données structurées. Les nouveautés sont des ressources exhaustives sur un sujet unique, une lisibilité machine sans compromis, des entités clairement définies, des citations externes et la reconnaissance que robots.txt ne constitue plus un dispositif complet de contrôle d’accès. Consultez l’onglet Checklists pour la mise en pratique.

Add an expert note

Pin an expert quote

New person? Create their unclaimed profile at /admin/experts/ → Pin a quote first.