Guide du chunking

Comment les systèmes d’IA découpent les pages en passages à vectoriser, indexer et rechercher : taille, chevauchement, méthodes sémantique et fixe, et lien avec le classement par passages de Google.

Première publication : 24 juin 2026 · Dernière mise à jour : 11 août 2026 · Advanced
Langues

Le chunking est l’étape qui divise un document en passages avant leur vectorisation et leur recherche. Le chunk, pas la page, est l’unité recherchée. Sa taille oppose précision et contexte ; le chevauchement protège les frontières mais duplique les jetons, et un préfixe contextuel périmé peut tromper le moteur. Aucun réglage ne garantit une citation. Google déconseille de fragmenter artificiellement les pages : rédigez plutôt des sections autonomes, ciblées et dont la réponse arrive en premier.

En bref — Le chunking est l’étape de prétraitement qui divise un document en passages avant leur vectorisation, leur indexation et leur recherche. Les limites de jetons et la précision expliquent ce choix : le passage, pas la page, devient l’unité recherchée. Une petite taille apporte de la précision mais peu de contexte ; une grande taille conserve le contexte mais ajoute du bruit. Aucun réglage ni algorithme ne garantit une citation. Le chevauchement protège les frontières au prix d’un index plus volumineux. Le découpage sémantique ne surpasse pas systématiquement le découpage fixe, et un préfixe contextuel périmé peut induire la recherche en erreur. L’effet « Lost in the Middle », observé sur certaines tâches et certains modèles de 2023, favorise parfois le début et la fin du contexte. Sans viser une taille secrète, rédigez des sections autonomes, organisées par titres clairs et dont la réponse arrive en premier. Ce principe de sous-document rapproche le chunking RAG du classement par passages de Google.

Ce qu’est le chunking et pourquoi il existe

Les systèmes de recherche travaillent sur des unités indexées, mais les moteurs publics ne proposent aucune taille universelle contrôlée par l’éditeur. Evidence for this claim Retrieval systems can split files into chunks that are embedded and indexed for later search. Scope: OpenAI's retrieval implementation; chunk sizes, overlap, and indexing behavior are implementation-dependent. Confidence: high · Verified: OpenAI: Retrieval guide Les recherches sur le RAG étayent le schéma recherche puis génération, sans prouver que tous les produits IA utilisent les mêmes mécanismes. Evidence for this claim Retrieval-augmented generation combines a generator with retrieved external passages or documents. Scope: The original RAG research architecture; it does not establish one optimal chunking strategy for every production system. Confidence: high · Verified: Lewis et al.: Retrieval-Augmented Generation

Le chunking consiste à diviser un document en segments distincts — chunks ou passages — avant de les transformer en embeddings, de les stocker dans un index vectoriel et de les rechercher en réponse à une requête. Cette étape fondamentale des pipelines RAG se déroule lors de l’ingestion, pas au moment de la requête, ce qui la rend invisible et souvent sous-estimée en SEO pour la recherche IA.

Deux contraintes l’imposent :

  • Limite de jetons. Un modèle d’embedding accepte un nombre borné de jetons. Microsoft indique par exemple un maximum de 8 191 jetons pour text-embedding-3-small, tandis que d’autres modèles en acceptent moins. Les fenêtres de contexte des LLM sont elles aussi finies ; les longues pages doivent être découpées.
  • Précision de la recherche. Réduire 5 000 mots sur le SEO technique à un seul vecteur produit un signal moyen et flou. Une section de 400 mots sur le budget d’exploration forme un vecteur plus précis. La granularité du sous-document permet d’extraire le passage pertinent d’une page couvrant plusieurs sujets.

Conséquence centrale : dans la recherche IA, le chunk et non la page est l’unité recherchée. Être exploré et indexé reste nécessaire, mais ne suffit pas. Un passage doit répondre seul et clairement à une requête. Une page classée en quinzième position peut ainsi obtenir une citation IA devant la première si son passage est plus facile à extraire.

Fonctionnement complet du chunking

Chunking changes the retrieval unit: the page is published once, but its passages are stored and matched separately. Source : /ai-search/how-search-works/chunking/

A four-stage flow begins with one long document containing several topics. The system splits and embeds focused passages as separate vectors. A query retrieves one or more best-matching passages, and those selected passages enter the model context for answer generation.

© Patrick Stox LLC · CC BY 4.0 ·

  1. Ingestion et découpage. Un robot IA télécharge la page ; un algorithme la divise en segments, souvent chevauchants.
  2. Embedding. Chaque segment devient un vecteur numérique stocké dans un index vectoriel. Voir les embeddings.
  3. Recherche et génération. La requête est vectorisée, les chunks les plus proches sont sélectionnés par recherche vectorielle, puis un LLM rédige la réponse et ses citations.

Cette architecture remonte au Dense Passage Retrieval de Karpukhin et ses coauteurs en 2020. Leur recherche montrait un gain absolu de 9 à 19 % sur la précision des vingt meilleurs passages face à BM25, ainsi qu’un avantage du niveau passage pour les questions précises. L’article RAG de Lewis et ses coauteurs, également publié en 2020, a nommé ce modèle et utilisé des passages Wikipédia de 100 mots. Les moteurs IA qui recherchent sur le Web déclinent ce pipeline.

Stratégies de découpage

Il n’existe pas d’algorithme unique ; les systèmes choisissent et font évoluer plusieurs approches :

  • Taille fixe : division par nombre de jetons ou de caractères, avec chevauchement. Microsoft illustre une taille suffisante pour un paragraphe cohérent, par exemple 200 mots ou 600 caractères, avec 10 à 15 % de chevauchement.
  • Phrase ou paragraphe : utilisation des frontières linguistiques plutôt que d’un compte arbitraire.
  • Sémantique : regroupement des phrases proches et coupure au changement de sujet.
  • Hiérarchique ou récursif, comme RAPTOR : arbre de résumés du document à la section puis au paragraphe. Sarthi et ses coauteurs ont rapporté en 2024 un gain absolu de 20 % sur un benchmark difficile avec GPT-4.
  • Fenêtre glissante : partage de jetons entre voisins pour ne pas perdre une phrase à la frontière.
  • Adaptatif, comme Mix-of-Granularity : routeur entraîné choisissant la taille par requête ; cette méthode sophistiquée n’est pas encore la norme commerciale.

Taille et chevauchement : le compromis central

C’est le réglage le plus demandé, et la réponse honnête reste : cela dépend.

  • Petits chunks, de 128 à 256 jetons : recherche plus précise, mais perte possible du contexte nécessaire.
  • Grands chunks, de 512 à 1 024 jetons : contexte mieux conservé, mais davantage de bruit et de contenu hors sujet.

La recherche ne désigne aucun vainqueur universel. LlamaIndex a trouvé 1 024 jetons optimaux dans son protocole ; les benchmarks Chroma ont obtenu des résultats réguliers avec un découpage récursif à 200 jetons. Ravi Theja résume : “Identifying the best chunk size for a RAG system is as much about intuition as it is empirical evidence.” (traduction) « Déterminer la meilleure taille de chunk pour un système RAG relève autant de l’intuition que des preuves empiriques. » Ces chiffres valent pour un jeu documentaire, un modèle et une évaluation précis. Aucune taille, valeur de chevauchement ou méthode ne garantit la recherche, la citation, le classement ou l’inclusion par un système IA externe.

Le chevauchement protège les informations situées à une frontière. Microsoft suggère de commencer à 25 % pour obtenir “smoother transitions between chunks without excessive duplication” (traduction) « des transitions plus fluides entre les chunks sans duplication excessive » ; d’autres sources proposent 10 à 15 %. Ce n’est pas gratuit : les jetons répétés sont vectorisés et stockés deux fois, gonflent l’index et peuvent faire remonter des passages presque identiques. Évaluez donc le coût par rapport aux faits réellement perdus aux frontières, et n’enfouissez pas une information essentielle à un point de rupture probable.

Le découpage sémantique gagne-t-il toujours ? Non. Une étude Vectara de 2024 a observé des différences minimes sur des documents réels et une influence plus forte de la qualité du modèle d’embedding. Avec GPT-4o pour les réponses, les écarts devenaient négligeables. Ce résultat dépend du corpus, des modèles et de l’évaluation : il montre seulement que l’approche sémantique n’est pas un choix gagnant par défaut. Pour le SEO, qualité du contenu et clarté sémantique comptent davantage que l’obsession d’une structure exacte.

Contexte d’un chunk : possibilités et limites des préfixes

Un passage clair pour un humain peut être mal retrouvé lorsqu’il est séparé du document, de ses titres et de ses qualificatifs. Une mesure connue consiste à ajouter avant l’embedding un bref contexte propre au chunk : titre du document, section parente et sujet réel. Anthropic nomme cette approche contextual retrieval. Titre, ascendance des sections et préfixe peuvent lever l’ambiguïté d’un passage orphelin.

Cette correction possède son propre mode d’échec : un contexte faux ou périmé ne se contente pas d’être inutile, il oriente le moteur vers le mauvais passage. Un titre devenu incohérent après une réorganisation ou un résumé incorrect vaut moins que l’absence de préfixe. La conservation du contexte est donc un choix de pipeline à surveiller, pas une amélioration automatique que l’on peut oublier.

Classement par passages de Google : l’ancêtre SEO

Google employait la granularité du sous-document avant l’essor du terme RAG. Lors de Search On 2020, Prabhakar Raghavan a annoncé le classement par passages : “By better understanding the relevancy of specific passages, not just the overall page, we can find that needle-in-a-haystack information you’re looking for.” (traduction) « En comprenant mieux la pertinence de passages précis, et pas seulement celle de la page entière, nous pouvons trouver l’information recherchée comme une aiguille dans une botte de foin. » La fonction a été lancée en anglais aux États-Unis le 10 février 2021 et touche environ 7 % des requêtes.

Deux confusions sont fréquentes :

  • Il s’agit de classement, pas d’indexation des passages. Google a corrigé sa première formulation : “this change doesn’t mean we’re indexing individual passages independently of pages.” (traduction) « Ce changement ne signifie pas que nous indexons les passages indépendamment des pages. » La page reste indexée dans son ensemble ; le passage apporte un signal de classement supplémentaire.
  • La page se classe, pas le passage. John Mueller précise : “Passage ranking is not about ranking a specific passage but understanding the content on a really long, not SEO optimized page, and ranking that page (not the passage) for a query where the passage is relevant.” (traduction) « Le classement par passages consiste à comprendre une page longue et peu optimisée, puis à classer cette page — pas le passage — pour une requête à laquelle le passage répond. »

Classement par passages et chunking RAG partagent donc un principe : un paragraphe correspond souvent mieux qu’une page entière à une requête précise. Leur résultat diffère : le premier améliore le classement de la page, le second récupère un chunk pour alimenter une réponse. Dawn Anderson rattache le mécanisme technique à DeepCT, qui remplace TF-IDF par des poids contextuels dérivés de BERT.

« Lost in the Middle » : la position de la réponse compte

Même après la récupération, la position du chunk dans le contexte peut influencer son utilisation. L’étude « Lost in the Middle » de Liu et ses coauteurs en 2023 a observé que les performances étaient souvent meilleures lorsque l’information pertinente se trouvait au début ou à la fin, et se dégradaient au milieu d’un long contexte.

Cet effet n’est pas une règle universelle. Il a été mesuré sur des tâches nommées de questions-réponses multidocuments et de recherche clé-valeur, avec les modèles testés en 2023. Des architectures, entraînements et fenêtres effectives plus récents peuvent le réduire ou l’accentuer. Traitez-le comme un risque documenté, pas comme une loi applicable à chaque modèle.

La conséquence éditoriale reste concrète et peu risquée : commencez par la réponse. Placez définition, résultat principal ou réponse directe dans la première phrase de la section, au lieu du quatrième paragraphe. Cette discipline BLUF aide aussi bien les lecteurs qui survolent que les modèles sensibles à la position.

Contraintes pratiques invisibles

  • Limite d’environ 30 passages dans Chrome. Les recherches de Dan Petrovic suggèrent que DocumentChunker analyse des passages d’environ 200 mots et ne considère que les trente premiers, en parcourant le HTML sémantique de haut en bas. Placez donc l’essentiel tôt plutôt qu’au bas d’une page de 10 000 mots.
  • Vous ne contrôlez pas le découpeur. Despina Gavoyannis, chez Ahrefs, l’exprime ainsi : “You can’t control how Google, ChatGPT, or Perplexity chunk your content. Their pipelines change based on cost, model, and context.” (traduction) « Vous ne contrôlez pas le découpage de Google, ChatGPT ou Perplexity ; leurs pipelines changent selon le coût, le modèle et le contexte. » Et : “Manual ‘chunk optimization’ is impossible in practice.” (traduction) « L’optimisation manuelle des chunks est impossible en pratique. »

Ce que signifie réellement l’optimisation des chunks

Le guide Google 2026 sur l’optimisation IA est explicite : “There’s no requirement to break your content into tiny pieces for AI to better understand it.” (traduction) « Il n’est pas nécessaire de diviser le contenu en minuscules morceaux pour que l’IA le comprenne mieux. » Ses systèmes “are able to understand the nuance of multiple topics on a page and show the relevant piece to users.” (traduction) « peuvent comprendre les nuances de plusieurs sujets sur une page et montrer le passage pertinent. » Ne réécrivez donc pas tout en blocs rigides de 300 mots.

Cela ne rend pas la structure inutile. Gavoyannis rappelle : “Most SEOs using the term [chunk optimization] are just talking about good content structure.” (traduction) « La plupart des spécialistes qui parlent d’optimisation des chunks décrivent simplement une bonne structure de contenu. » Duane Forrester résume : “If traditional SEO optimized for clicks, GenAI systems optimize for chunks… Structure still wins.” (traduction) « Le SEO traditionnel optimisait les clics ; les systèmes génératifs optimisent les chunks… La structure gagne toujours. »

Concrètement, rédigez un contenu prêt à être découpé :

  • Un sujet par section. Un H2 ou H3 ciblé correspond naturellement à un passage cohérent.
  • Réponse d’abord. Commencez par l’affirmation, puis justifiez-la.
  • Sections autonomes. Vérifiez qu’un paragraphe isolé conserve son sens.
  • Longueur adaptée. Environ 200 à 500 mots par section principale correspond souvent à des passages de 256 à 512 jetons : assez complets sans être artificiellement courts.
  • Formats structurés. Tableaux et listes exposent des frontières claires. Une étude Onely associe les tableaux à un taux de citation environ 2,5 fois supérieur.

Mike King rassure : “chunking and writing for users is not mutually exclusive.” (traduction) « Le découpage et l’écriture pour les utilisateurs ne s’excluent pas. » La structure qui aide un lecteur à parcourir la page est aussi celle qui se découpe proprement ; nul besoin de sacrifier l’humain au robot.

Classement par passages et chunking RAG, côte à côte

Classement par passages de GoogleChunking RAG
DéfinitionUn signal de classementUne étape de prétraitement
GranularitéPassage à l’intérieur d’une pageChunk créé avant l’embedding
RésultatLa page monte dans le classementUn chunk alimente la réponse
MomentAu classementÀ l’ingestion, puis à la recherche
Contrôlez-vous la coupure ?NonNon
Principe communLa granularité du sous-document : un paragraphe correspond souvent mieux qu’une page à une requête précise

Place dans le pipeline

Le chunking ouvre la recherche IA : découper → vectoriser → stocker → rechercher → générer. Il alimente les embeddings, puis la recherche vectorielle, puis le RAG. En amont, les robots IA assurent l’ingestion. Pour l’équivalent en recherche classique, consultez le fonctionnement de la recherche.

Add an expert note

Pin an expert quote

New person? Create their unclaimed profile at /admin/experts/ → Pin a quote first.