Guide du chunking
Comment les systèmes d’IA découpent les pages en passages à vectoriser, indexer et rechercher : taille, chevauchement, méthodes sémantique et fixe, et lien avec le classement par passages de Google.
Langues
Le chunking est l’étape qui divise un document en passages avant leur vectorisation et leur recherche. Le chunk, pas la page, est l’unité recherchée. Sa taille oppose précision et contexte ; le chevauchement protège les frontières mais duplique les jetons, et un préfixe contextuel périmé peut tromper le moteur. Aucun réglage ne garantit une citation. Google déconseille de fragmenter artificiellement les pages : rédigez plutôt des sections autonomes, ciblées et dont la réponse arrive en premier.
En bref — Le découpage, ou chunking, est la manière dont les moteurs de recherche IA divisent une page en passages plus petits avant de les stocker et de les interroger. Une requête n’est pas comparée à la page entière, mais au passage qui y répond le mieux. L’indexation ne suffit donc pas : chaque section importante doit rester compréhensible seule et répondre clairement à la question.
Définition du chunking
Le chunking divise les documents en unités plus petites destinées aux systèmes d’embedding et de recherche. Evidence for this claim Retrieval systems can split files into chunks that are embedded and indexed for later search. Scope: OpenAI's retrieval implementation; chunk sizes, overlap, and indexing behavior are implementation-dependent. Confidence: high · Verified: OpenAI: Retrieval guide La taille et le chevauchement des passages sont des choix d’implémentation dont la valeur optimale dépend du contenu, du modèle et de la tâche d’évaluation. Evidence for this claim Retrieval-augmented generation combines a generator with retrieved external passages or documents. Scope: The original RAG research architecture; it does not establish one optimal chunking strategy for every production system. Confidence: high · Verified: Lewis et al.: Retrieval-Augmented Generation
Dans la recherche Google classique, la page constitue l’unité : elle se classe et l’utilisateur clique dessus. Les systèmes IA procèdent autrement. Avant que ChatGPT, Perplexity ou les AI Overviews de Google utilisent un contenu, ils le divisent en chunks, ou passages, stockés séparément. À la réception d’une question, le système recherche les passages les plus proches, puis compose sa réponse à partir d’eux.
L’unité de recherche n’est donc pas votre page, mais un passage de cette page.
Pourquoi découper les documents
Deux raisons principales l’expliquent :
- Limites de taille. Les modèles qui transforment le texte en représentation mathématique — voir les embeddings — n’acceptent qu’une quantité limitée de texte. Une page de 5 000 mots doit donc être divisée.
- Précision. Une page entière sur le SEO technique correspond vaguement à une question précise sur le budget d’exploration. Une section ciblée de 400 mots constitue une correspondance bien plus nette : le système trouve l’aiguille plutôt que de transmettre toute la botte de foin.
Conséquences pour votre contenu
Vous ne contrôlez pas la façon dont chaque système IA découpe le contenu, et ce n’est pas nécessaire. Écrivez plutôt chaque section pour qu’elle reste intelligible lorsqu’elle est extraite seule :
- Donnez la réponse d’abord. Commencez par la définition ou l’affirmation essentielle.
- Gardez une section ciblée. Un sujet ou une question par titre.
- Rendez-la autonome. Demandez-vous si le paragraphe garde son sens sans ce qui l’entoure.
C’est avant tout une règle de rédaction claire. Google précise qu’il n’est pas nécessaire de transformer le contenu en minuscules fragments pour l’IA : ses systèmes effectuent eux-mêmes le découpage. La version avancée examine taille, chevauchement, recherche et lien avec le classement par passages de Google.
En bref — Le chunking est l’étape de prétraitement qui divise un document en passages avant leur vectorisation, leur indexation et leur recherche. Les limites de jetons et la précision expliquent ce choix : le passage, pas la page, devient l’unité recherchée. Une petite taille apporte de la précision mais peu de contexte ; une grande taille conserve le contexte mais ajoute du bruit. Aucun réglage ni algorithme ne garantit une citation. Le chevauchement protège les frontières au prix d’un index plus volumineux. Le découpage sémantique ne surpasse pas systématiquement le découpage fixe, et un préfixe contextuel périmé peut induire la recherche en erreur. L’effet « Lost in the Middle », observé sur certaines tâches et certains modèles de 2023, favorise parfois le début et la fin du contexte. Sans viser une taille secrète, rédigez des sections autonomes, organisées par titres clairs et dont la réponse arrive en premier. Ce principe de sous-document rapproche le chunking RAG du classement par passages de Google.
Ce qu’est le chunking et pourquoi il existe
Les systèmes de recherche travaillent sur des unités indexées, mais les moteurs publics ne proposent aucune taille universelle contrôlée par l’éditeur. Evidence for this claim Retrieval systems can split files into chunks that are embedded and indexed for later search. Scope: OpenAI's retrieval implementation; chunk sizes, overlap, and indexing behavior are implementation-dependent. Confidence: high · Verified: OpenAI: Retrieval guide Les recherches sur le RAG étayent le schéma recherche puis génération, sans prouver que tous les produits IA utilisent les mêmes mécanismes. Evidence for this claim Retrieval-augmented generation combines a generator with retrieved external passages or documents. Scope: The original RAG research architecture; it does not establish one optimal chunking strategy for every production system. Confidence: high · Verified: Lewis et al.: Retrieval-Augmented Generation
Le chunking consiste à diviser un document en segments distincts — chunks ou passages — avant de les transformer en embeddings, de les stocker dans un index vectoriel et de les rechercher en réponse à une requête. Cette étape fondamentale des pipelines RAG se déroule lors de l’ingestion, pas au moment de la requête, ce qui la rend invisible et souvent sous-estimée en SEO pour la recherche IA.
Deux contraintes l’imposent :
- Limite de jetons. Un modèle d’embedding accepte un nombre borné de jetons. Microsoft indique par exemple
un maximum de 8 191 jetons pour
text-embedding-3-small, tandis que d’autres modèles en acceptent moins. Les fenêtres de contexte des LLM sont elles aussi finies ; les longues pages doivent être découpées. - Précision de la recherche. Réduire 5 000 mots sur le SEO technique à un seul vecteur produit un signal moyen et flou. Une section de 400 mots sur le budget d’exploration forme un vecteur plus précis. La granularité du sous-document permet d’extraire le passage pertinent d’une page couvrant plusieurs sujets.
Conséquence centrale : dans la recherche IA, le chunk et non la page est l’unité recherchée. Être exploré et indexé reste nécessaire, mais ne suffit pas. Un passage doit répondre seul et clairement à une requête. Une page classée en quinzième position peut ainsi obtenir une citation IA devant la première si son passage est plus facile à extraire.
Fonctionnement complet du chunking
A four-stage flow begins with one long document containing several topics. The system splits and embeds focused passages as separate vectors. A query retrieves one or more best-matching passages, and those selected passages enter the model context for answer generation.
© Patrick Stox LLC · CC BY 4.0 ·
- Ingestion et découpage. Un robot IA télécharge la page ; un algorithme la divise en segments, souvent chevauchants.
- Embedding. Chaque segment devient un vecteur numérique stocké dans un index vectoriel. Voir les embeddings.
- Recherche et génération. La requête est vectorisée, les chunks les plus proches sont sélectionnés par recherche vectorielle, puis un LLM rédige la réponse et ses citations.
Cette architecture remonte au Dense Passage Retrieval de Karpukhin et ses coauteurs en 2020. Leur recherche montrait un gain absolu de 9 à 19 % sur la précision des vingt meilleurs passages face à BM25, ainsi qu’un avantage du niveau passage pour les questions précises. L’article RAG de Lewis et ses coauteurs, également publié en 2020, a nommé ce modèle et utilisé des passages Wikipédia de 100 mots. Les moteurs IA qui recherchent sur le Web déclinent ce pipeline.
Stratégies de découpage
Il n’existe pas d’algorithme unique ; les systèmes choisissent et font évoluer plusieurs approches :
- Taille fixe : division par nombre de jetons ou de caractères, avec chevauchement. Microsoft illustre une taille suffisante pour un paragraphe cohérent, par exemple 200 mots ou 600 caractères, avec 10 à 15 % de chevauchement.
- Phrase ou paragraphe : utilisation des frontières linguistiques plutôt que d’un compte arbitraire.
- Sémantique : regroupement des phrases proches et coupure au changement de sujet.
- Hiérarchique ou récursif, comme RAPTOR : arbre de résumés du document à la section puis au paragraphe. Sarthi et ses coauteurs ont rapporté en 2024 un gain absolu de 20 % sur un benchmark difficile avec GPT-4.
- Fenêtre glissante : partage de jetons entre voisins pour ne pas perdre une phrase à la frontière.
- Adaptatif, comme Mix-of-Granularity : routeur entraîné choisissant la taille par requête ; cette méthode sophistiquée n’est pas encore la norme commerciale.
Taille et chevauchement : le compromis central
C’est le réglage le plus demandé, et la réponse honnête reste : cela dépend.
- Petits chunks, de 128 à 256 jetons : recherche plus précise, mais perte possible du contexte nécessaire.
- Grands chunks, de 512 à 1 024 jetons : contexte mieux conservé, mais davantage de bruit et de contenu hors sujet.
La recherche ne désigne aucun vainqueur universel. LlamaIndex a trouvé 1 024 jetons optimaux dans son protocole ; les benchmarks Chroma ont obtenu des résultats réguliers avec un découpage récursif à 200 jetons. Ravi Theja résume : “Identifying the best chunk size for a RAG system is as much about intuition as it is empirical evidence.” (traduction) « Déterminer la meilleure taille de chunk pour un système RAG relève autant de l’intuition que des preuves empiriques. » Ces chiffres valent pour un jeu documentaire, un modèle et une évaluation précis. Aucune taille, valeur de chevauchement ou méthode ne garantit la recherche, la citation, le classement ou l’inclusion par un système IA externe.
Le chevauchement protège les informations situées à une frontière. Microsoft suggère de commencer à 25 % pour obtenir “smoother transitions between chunks without excessive duplication” (traduction) « des transitions plus fluides entre les chunks sans duplication excessive » ; d’autres sources proposent 10 à 15 %. Ce n’est pas gratuit : les jetons répétés sont vectorisés et stockés deux fois, gonflent l’index et peuvent faire remonter des passages presque identiques. Évaluez donc le coût par rapport aux faits réellement perdus aux frontières, et n’enfouissez pas une information essentielle à un point de rupture probable.
Le découpage sémantique gagne-t-il toujours ? Non. Une étude Vectara de 2024 a observé des différences minimes sur des documents réels et une influence plus forte de la qualité du modèle d’embedding. Avec GPT-4o pour les réponses, les écarts devenaient négligeables. Ce résultat dépend du corpus, des modèles et de l’évaluation : il montre seulement que l’approche sémantique n’est pas un choix gagnant par défaut. Pour le SEO, qualité du contenu et clarté sémantique comptent davantage que l’obsession d’une structure exacte.
Contexte d’un chunk : possibilités et limites des préfixes
Un passage clair pour un humain peut être mal retrouvé lorsqu’il est séparé du document, de ses titres et de ses qualificatifs. Une mesure connue consiste à ajouter avant l’embedding un bref contexte propre au chunk : titre du document, section parente et sujet réel. Anthropic nomme cette approche contextual retrieval. Titre, ascendance des sections et préfixe peuvent lever l’ambiguïté d’un passage orphelin.
Cette correction possède son propre mode d’échec : un contexte faux ou périmé ne se contente pas d’être inutile, il oriente le moteur vers le mauvais passage. Un titre devenu incohérent après une réorganisation ou un résumé incorrect vaut moins que l’absence de préfixe. La conservation du contexte est donc un choix de pipeline à surveiller, pas une amélioration automatique que l’on peut oublier.
Classement par passages de Google : l’ancêtre SEO
Google employait la granularité du sous-document avant l’essor du terme RAG. Lors de Search On 2020, Prabhakar Raghavan a annoncé le classement par passages : “By better understanding the relevancy of specific passages, not just the overall page, we can find that needle-in-a-haystack information you’re looking for.” (traduction) « En comprenant mieux la pertinence de passages précis, et pas seulement celle de la page entière, nous pouvons trouver l’information recherchée comme une aiguille dans une botte de foin. » La fonction a été lancée en anglais aux États-Unis le 10 février 2021 et touche environ 7 % des requêtes.
Deux confusions sont fréquentes :
- Il s’agit de classement, pas d’indexation des passages. Google a corrigé sa première formulation : “this change doesn’t mean we’re indexing individual passages independently of pages.” (traduction) « Ce changement ne signifie pas que nous indexons les passages indépendamment des pages. » La page reste indexée dans son ensemble ; le passage apporte un signal de classement supplémentaire.
- La page se classe, pas le passage. John Mueller précise : “Passage ranking is not about ranking a specific passage but understanding the content on a really long, not SEO optimized page, and ranking that page (not the passage) for a query where the passage is relevant.” (traduction) « Le classement par passages consiste à comprendre une page longue et peu optimisée, puis à classer cette page — pas le passage — pour une requête à laquelle le passage répond. »
Classement par passages et chunking RAG partagent donc un principe : un paragraphe correspond souvent mieux qu’une page entière à une requête précise. Leur résultat diffère : le premier améliore le classement de la page, le second récupère un chunk pour alimenter une réponse. Dawn Anderson rattache le mécanisme technique à DeepCT, qui remplace TF-IDF par des poids contextuels dérivés de BERT.
« Lost in the Middle » : la position de la réponse compte
Même après la récupération, la position du chunk dans le contexte peut influencer son utilisation. L’étude « Lost in the Middle » de Liu et ses coauteurs en 2023 a observé que les performances étaient souvent meilleures lorsque l’information pertinente se trouvait au début ou à la fin, et se dégradaient au milieu d’un long contexte.
Cet effet n’est pas une règle universelle. Il a été mesuré sur des tâches nommées de questions-réponses multidocuments et de recherche clé-valeur, avec les modèles testés en 2023. Des architectures, entraînements et fenêtres effectives plus récents peuvent le réduire ou l’accentuer. Traitez-le comme un risque documenté, pas comme une loi applicable à chaque modèle.
La conséquence éditoriale reste concrète et peu risquée : commencez par la réponse. Placez définition, résultat principal ou réponse directe dans la première phrase de la section, au lieu du quatrième paragraphe. Cette discipline BLUF aide aussi bien les lecteurs qui survolent que les modèles sensibles à la position.
Contraintes pratiques invisibles
- Limite d’environ 30 passages dans Chrome. Les recherches de Dan Petrovic suggèrent que DocumentChunker analyse des passages d’environ 200 mots et ne considère que les trente premiers, en parcourant le HTML sémantique de haut en bas. Placez donc l’essentiel tôt plutôt qu’au bas d’une page de 10 000 mots.
- Vous ne contrôlez pas le découpeur. Despina Gavoyannis, chez Ahrefs, l’exprime ainsi : “You can’t control how Google, ChatGPT, or Perplexity chunk your content. Their pipelines change based on cost, model, and context.” (traduction) « Vous ne contrôlez pas le découpage de Google, ChatGPT ou Perplexity ; leurs pipelines changent selon le coût, le modèle et le contexte. » Et : “Manual ‘chunk optimization’ is impossible in practice.” (traduction) « L’optimisation manuelle des chunks est impossible en pratique. »
Ce que signifie réellement l’optimisation des chunks
Le guide Google 2026 sur l’optimisation IA est explicite : “There’s no requirement to break your content into tiny pieces for AI to better understand it.” (traduction) « Il n’est pas nécessaire de diviser le contenu en minuscules morceaux pour que l’IA le comprenne mieux. » Ses systèmes “are able to understand the nuance of multiple topics on a page and show the relevant piece to users.” (traduction) « peuvent comprendre les nuances de plusieurs sujets sur une page et montrer le passage pertinent. » Ne réécrivez donc pas tout en blocs rigides de 300 mots.
Cela ne rend pas la structure inutile. Gavoyannis rappelle : “Most SEOs using the term [chunk optimization] are just talking about good content structure.” (traduction) « La plupart des spécialistes qui parlent d’optimisation des chunks décrivent simplement une bonne structure de contenu. » Duane Forrester résume : “If traditional SEO optimized for clicks, GenAI systems optimize for chunks… Structure still wins.” (traduction) « Le SEO traditionnel optimisait les clics ; les systèmes génératifs optimisent les chunks… La structure gagne toujours. »
Concrètement, rédigez un contenu prêt à être découpé :
- Un sujet par section. Un H2 ou H3 ciblé correspond naturellement à un passage cohérent.
- Réponse d’abord. Commencez par l’affirmation, puis justifiez-la.
- Sections autonomes. Vérifiez qu’un paragraphe isolé conserve son sens.
- Longueur adaptée. Environ 200 à 500 mots par section principale correspond souvent à des passages de 256 à 512 jetons : assez complets sans être artificiellement courts.
- Formats structurés. Tableaux et listes exposent des frontières claires. Une étude Onely associe les tableaux à un taux de citation environ 2,5 fois supérieur.
Mike King rassure : “chunking and writing for users is not mutually exclusive.” (traduction) « Le découpage et l’écriture pour les utilisateurs ne s’excluent pas. » La structure qui aide un lecteur à parcourir la page est aussi celle qui se découpe proprement ; nul besoin de sacrifier l’humain au robot.
Classement par passages et chunking RAG, côte à côte
| Classement par passages de Google | Chunking RAG | |
|---|---|---|
| Définition | Un signal de classement | Une étape de prétraitement |
| Granularité | Passage à l’intérieur d’une page | Chunk créé avant l’embedding |
| Résultat | La page monte dans le classement | Un chunk alimente la réponse |
| Moment | Au classement | À l’ingestion, puis à la recherche |
| Contrôlez-vous la coupure ? | Non | Non |
| Principe commun | La granularité du sous-document : un paragraphe correspond souvent mieux qu’une page à une requête précise |
Place dans le pipeline
Le chunking ouvre la recherche IA : découper → vectoriser → stocker → rechercher → générer. Il alimente les embeddings, puis la recherche vectorielle, puis le RAG. En amont, les robots IA assurent l’ingestion. Pour l’équivalent en recherche classique, consultez le fonctionnement de la recherche.
Résumé par l’IA
Version condensée de l’onglet Avancé :
- Le chunking divise un document en passages avant leur vectorisation, leur indexation et leur recherche. Première étape du RAG, il se produit à l’ingestion et non lors de la requête.
- Le chunk, pas la page, est l’unité recherchée. Un passage autonome et précis peut être cité même si sa page est moins bien classée.
- Raison d’être : limites de jetons des modèles et précision supérieure de la recherche au niveau passage.
- Taille : 128 à 256 jetons offrent de la précision avec peu de contexte ; 512 à 1 024 préservent davantage de contexte mais ajoutent du bruit. LlamaIndex a retenu 1 024 et Chroma 200 ; aucun réglage ne garantit une citation. Un chevauchement de 10 à 25 % protège les frontières au prix de duplications.
- Le découpage sémantique ne surpasse pas systématiquement la taille fixe, selon l’étude Vectara 2024 ; la qualité du modèle d’embedding peut compter davantage.
- Les préfixes contextuels peuvent lever l’ambiguïté d’un passage isolé, mais un préfixe périmé induit le moteur en erreur.
- « Lost in the Middle » décrit un effet de position mesuré sur des tâches et modèles de 2023, pas une loi universelle. Commencez néanmoins chaque section par la réponse.
- Le classement par passages de Google applique le même principe de sous-document, mais classe la page ; le chunking RAG récupère un passage.
- Vous ne choisissez pas la taille du chunk. Google déconseille de fragmenter artificiellement le contenu. Rédigez plutôt des sections ciblées, autonomes et clairement titrées.
Documentation officielle
Documentation de première main sur la recherche et le découpage au niveau passage.
- Guide des systèmes de classement de Google — le définit comme “an AI system we use to identify individual sections or ‘passages’ of a web page.” (traduction) « un système IA que nous utilisons pour identifier des sections ou passages individuels d’une page web. »
- Optimiser un site pour les fonctions d’IA générative — Google indique qu’il n’est pas nécessaire de diviser le contenu en minuscules morceaux, mise à jour du 15 juin 2026.
- Guide détaillé du fonctionnement de Google Search — pipeline exploration, indexation et diffusion que cette version IA prolonge.
Microsoft / Azure AI Search
- Découper les grands documents pour la recherche vectorielle — guide officiel détaillé : taille par défaut de 512 jetons, chevauchement initial de 25 % et comparaison des techniques, mis à jour le 8 juin 2026.
OpenSearch
- Découpage du texte — fonction intégrée au pipeline d’ingestion de la recherche vectorielle.
Référence professionnelle
- Pinecone — stratégies de découpage — taxonomie de référence et test central : un passage compréhensible hors contexte pour un humain le sera aussi pour le modèle.
Citations des sources
Déclarations publiques de Google. Chaque lien mène au passage cité dans la page source.
Google — ce qu’est, et n’est pas, le classement par passages
- “By better understanding the relevancy of specific passages, not just the overall page, we can find that needle-in-a-haystack information you’re looking for.” (traduction) « En comprenant mieux la pertinence de passages précis, pas seulement de la page entière, nous pouvons trouver l’information recherchée comme une aiguille dans une botte de foin. » — Prabhakar Raghavan, vice-président de Google, octobre 2020, via Search Engine Land. Accéder à la citation
- “this change doesn’t mean we’re indexing individual passages independently of pages.” (traduction) « Ce changement ne signifie pas que nous indexons les passages indépendamment des pages. » — Précision de Google du 20 octobre 2020, via Search Engine Land. Accéder à la citation
- “passage ranking launched yesterday afternoon Pacific Time for queries in the US in English.” (traduction) « Le classement par passages a été lancé hier après-midi, heure du Pacifique, pour les requêtes en anglais aux États-Unis. » — @searchliaison, 11 février 2021, via Search Engine Land. Lire l’article
Google — la page se classe, pas le passage
- “Passage ranking is not about ranking a specific passage but understanding the content on a really long, not SEO optimized page, and ranking that page (not the passage) for a query where the passage is relevant.” (traduction) « Le classement par passages comprend le contenu d’une page longue et peu optimisée, puis classe cette page — pas le passage — pour une requête à laquelle le passage répond. » — John Mueller, porte-parole de Google Search, via Search Engine Roundtable. Lire l’article
Google — faut-il découper son contenu ?
- “There’s no requirement to break your content into tiny pieces for AI to better understand it.” (traduction) « Il n’est pas nécessaire de diviser le contenu en minuscules morceaux pour que l’IA le comprenne mieux. » — Google Search Central, guide d’optimisation pour l’IA générative. Lire le guide
Microsoft Azure AI Search — pourquoi le découpage est nécessaire
- “Partitioning large documents into smaller chunks can help you stay under the maximum token input limits of chat completion and embedding models.” (traduction) « Diviser de grands documents en chunks plus petits aide à respecter la limite maximale de jetons des modèles de dialogue et d’embedding. » — Documentation Microsoft Azure AI Search. Lire la documentation
Aide-mémoire du chunking
Comparaison des stratégies
| Stratégie | Méthode de coupure | Atout | Risque |
|---|---|---|---|
| Taille fixe | Nombre de jetons ou caractères, par exemple 512 | Simple, rapide et prévisible | Coupe une idée sans chevauchement |
| Phrase ou paragraphe | Frontières du langage naturel | Préserve les unités sémantiques | Tailles variables et inégales |
| Sémantique | Coupe au changement de sujet selon les embeddings | Passages cohérents | Coûteux et pas toujours meilleur selon Vectara 2024 |
| Hiérarchique, RAPTOR | Arbre de résumés : document → section → paragraphe | Répond au bon niveau d’abstraction | Construction complexe |
| Fenêtre glissante | Passages fixes chevauchants | Protège le contexte aux frontières | Duplication partielle |
| Adaptatif, Mix-of-Granularity | Un routeur choisit la taille par requête | Grande souplesse | Peu courant en production |
Tailles en un coup d’œil
| Taille | Jetons | Comportement |
|---|---|---|
| Petite | 128 à 256 | Recherche précise, contexte mince |
| Moyenne | 512 | Valeur initiale courante chez Microsoft |
| Grande | 1 024 | Contexte riche, davantage de bruit ; optimum du test LlamaIndex |
| Chevauchement | 10 à 25 % | Évite les pertes aux frontières ; Microsoft commence à 25 % |
Repères essentiels
- Le chunk, pas la page, est l’unité recherchée par les systèmes IA.
- Exemple de limite :
text-embedding-3-smallaccepte 8 191 jetons. - Aucune taille, valeur de chevauchement ou méthode ne garantit recherche, citation ou inclusion.
- Le chevauchement duplique stockage et passages, avec un risque de quasi-doublons.
- Un préfixe contextuel lève une ambiguïté, mais un préfixe faux ou périmé trompe le moteur.
- Dans l’étude « Lost in the Middle », les modèles testés exploitaient mieux le début et la fin du contexte.
- DocumentChunker de Chrome examinerait seulement les 30 premiers passages environ, d’environ 200 mots.
- Chez Google, classement par passages ≠ indexation des passages : la page se classe.
- Google déconseille de fragmenter le contenu ; structurez-le clairement.
Modèles mentaux
1. Pipeline : découper → vectoriser → stocker → rechercher → générer. Le chunking vient en premier. Si le contenu n’est pas cité, vérifiez chaque maillon : exploration, passage cohérent, correspondance avec la requête et position exploitable dans le contexte du LLM.
2. L’unité est le chunk, pas la page. Ne demandez plus seulement si la page est indexée, mais si elle contient un passage autonome qui répond à la requête. L’indexation est nécessaire ; la facilité d’extraction favorise la citation.
3. Compromis taille : précision contre contexte. Les petits passages sont nets mais minces ; les grands, riches mais bruyants. Vous ne choisissez pas la taille propriétaire : rendez chaque section cohérente aux deux niveaux.
4. La réponse d’abord évite le milieu. Puisque la position peut compter, commencez par la définition ou l’affirmation. Cette discipline sert autant le lecteur qui survole que le modèle.
5. Structurez, ne fragmentez pas. Google déconseille les minuscules morceaux artificiels. Préférez une hiérarchie claire, un sujet par section et des paragraphes autonomes. L’optimisation des chunks est surtout une bonne structure sous un nom nouveau.
6. Classement par passages ≠ chunking RAG. Même granularité de sous-document, résultat différent : un signal classe la page, tandis que le RAG récupère un chunk pour une réponse.
Liste de contrôle pour un contenu prêt à être découpé
Vérifiez que le contenu reste utile lorsqu’il est séparé, recherché et cité hors contexte :
- Chaque section H2 ou H3 traite un seul sujet ou une seule question.
- Chaque section commence par la réponse, puis apporte ses justifications.
- Chaque section principale reste autonome lorsqu’elle est lue isolément.
- Sa longueur est adaptée, environ 200 à 500 mots, sans découpage artificiel.
- Le contenu le plus important arrive tôt, Chrome ne considérant, selon certaines recherches, qu’environ 30 passages.
- La hiérarchie H1 → H2 → H3 est logique et descriptive.
- Une affirmation et sa preuve ne sont pas séparées par une frontière probable.
- Tableaux et listes sont employés lorsque le contenu s’y prête réellement.
- Le texte n’a pas été transformé en blocs rigides uniquement pour respecter un compte de mots.
Une section géante pour plusieurs intentions
Un long bloc mêlant définition, mise en œuvre, exceptions et mesure peut être utile comme page, mais bruyant comme passage. Séparez les questions sous des titres et donnez à chaque section assez de contexte local.
Une rubrique pour chaque phrase
Des passages minuscules perdent nuances et relations. N’optimisez pas pour un nombre de jetons imaginaire ; conservez ensemble l’idée complète, ses limites et ses preuves.
Commencer par un renvoi sans contexte
Un passage ouvert par « ceci », « il » ou « cependant » peut être séparé du sujet nommé auparavant. Commencez les sections importantes par une phrase directe qui identifie le sujet et la réponse.
Dupliquer le texte pour imposer un chevauchement
Les paragraphes répétés créent des passages concurrents presque identiques et dégradent la lecture. Les systèmes peuvent ajouter leur propre chevauchement ; rédigez plutôt des transitions claires et des sections autonomes.
Prompt : contrôler l’autonomie d’un passage
Review the article section by section as if each section could be retrieved without its
neighbors. For each heading, state the question it answers, whether the opening sentence
names the subject, what context is missing, whether unrelated intents are mixed, and the
smallest edit that makes the section self-contained. Preserve necessary qualifications
and evidence. Do not target an arbitrary token count or rewrite the author's voice.
Article:
[PASTE ARTICLE WITH HEADINGS]Prompt : diviser une section surchargée
This section covers several ideas. Propose a minimal heading structure that groups one
complete intent per section. For each proposed section, write only an answer-first
opening sentence and list which existing paragraphs belong under it. Do not add facts,
remove caveats, duplicate prose, or turn every sentence into a heading.
Section:
[PASTE HEADING AND CONTENT] Console DevTools : signaler les longues sections rendues
Exécutez ce code sur une page d’article. Le seuil de caractères aide à la révision ; il ne représente pas une frontière de chunk d’un moteur de recherche.
console.table([...document.querySelectorAll('main h2, main h3')].map((heading, i, all) => {
let text = '';
for (let node = heading.nextElementSibling; node && !all.includes(node); node = node.nextElementSibling) text += ` ${node.textContent}`;
return { heading: heading.textContent.trim(), characters: text.trim().length };
}).filter(row => row.characters > 2000));Expression régulière : repérer les débuts de section sans contexte
Ce motif multiligne signale les titres dont le premier mot de prose est un renvoi courant. Examinez chaque résultat manuellement.
^#{2,4}\s+.+\n+(?:\n|>.*\n|\s*)*(This|That|It|They|These|Those|However|Therefore|Also|And|But|So|Then)\b Outils de contrôle des passages
- Le plan du document dans un navigateur révèle vite les titres mêlant plusieurs questions et les longues zones sans sous-titre.
- Une base vectorielle ou un bac à sable d’embeddings montre l’effet de la taille dans un test contrôlé, mais le résultat d’un modèle ne devient pas une règle SEO universelle.
- Search Console et le suivi des citations mesurent les résultats de la page, pas le chunk propriétaire stocké par une plateforme.
Valider une réécriture orientée chunking
| Test | Résultat attendu | Interprétation d’un échec | Fenêtre de suivi | Déclencheur de retour arrière |
|---|---|---|---|---|
| Lire chaque section sans ses voisines | Le titre et l’ouverture identifient sujet et réponse | Le passage dépend d’un contexte absent | Révision éditoriale | Restaurer le contexte si une réserve ou le sujet a disparu |
| Comparer affirmations et citations avant/après | Faits, réserves et liens de source restent intacts | La restructuration a modifié le sens | Avant publication | Annuler toute affirmation élargie ou non étayée |
| Tester les versions ancienne et nouvelle | Les sections longues ou dépendantes progressent sans fragmentation artificielle | Le score a été privilégié sur la compréhension | Avant publication | Revenir en arrière si fluidité ou complétude baisse |
| Tester un petit jeu de recherche versionné | Les bonnes sections remontent sans perdre les exceptions | Passages trop minces ou intentions encore mêlées | Après publication dans le système contrôlé | Regrouper ou redécouper si le contexte disparaît souvent |
| Examiner la hiérarchie rendue | Titres ordonnés, descriptifs et suivis de contenu | Le balisage a cassé la structure | Contrôle de livraison | Revenir en arrière si les titres deviennent inaccessibles ou mal formés |
Testez-vous : chunking
Ressources recommandées
Mon article connexe
- Ce que nous savons réellement de l’optimisation pour la recherche LLM — DocumentChunker de Chrome, limite de trente passages et traitement du contenu par la recherche IA.
Recherches fondatrices
- Dense Passage Retrieval, Karpukhin et al., 2020 — avantage de la recherche dense de passages sur les mots-clés.
- Retrieval-Augmented Generation, Lewis et al., 2020 — article qui a nommé le RAG et employé des passages Wikipédia de 100 mots.
- Lost in the Middle, Liu et al., 2023 — effet de position et intérêt d’une réponse placée au début.
- RAPTOR, Sarthi et al., 2024 — découpage hiérarchique par arbre de résumés.
- Le découpage sémantique vaut-il son coût ?, Vectara, 2024 — absence d’avantage systématique face à la taille fixe.
Contrepoint SEO à lire
- L’optimisation SEO des chunks est surestimée, Despina Gavoyannis, Ahrefs — elle relève surtout d’une bonne structure, sans contrôle sur le découpage des systèmes.
Guides professionnels
- Pinecone — stratégies de découpage — taxonomie de référence.
- LlamaIndex — évaluer la taille idéale, Ravi Theja — test de 128 à 2 048 jetons concluant à 1 024.
- Databricks — stratégies de chunking pour le RAG — six méthodes et conseils propres aux domaines.
Ailleurs dans le secteur
- Guide du découpage de contenu — définition, origines UX, types macro, micro et atomique, puis recherche IA.
- Découper, citer, clarifier, construire — cadre en quatre parties pour la recherche IA.
- Découpage de contenu : faut-il s’en soucier ? — présentation professionnelle, citation de Mike King et tests en questions-réponses.
- Découpé, recherché, synthétisé — point de vue d’un ancien de Bing sur la persistance du rôle de la structure.
- Contenu adapté aux LLM — source du résultat sur les tableaux et les citations.
- Rapport 2025 sur les citations IA — facteurs associés à la visibilité dans les réponses LLM.
- Guide complet des stratégies de découpage — taxonomie pour développeurs et données de benchmark Chroma.
Statistiques à citer
- 9 à 19 % en valeur absolue — avantage du DPR sur BM25 pour la précision des vingt meilleurs passages. Karpukhin et al., 2020
- Environ 7 % des requêtes — part concernée par le classement par passages lors du déploiement complet aux États-Unis en anglais le 10 février 2021. Source
- 20 % de précision absolue en plus — gain de RAPTOR sur un benchmark difficile avec GPT-4. Sarthi et al., 2024
- Modèle d’embedding > stratégie de découpage — conclusion Vectara 2024 sur ses documents réels. Étude
- Environ 30 premiers passages — quantité que DocumentChunker de Chrome examinerait par page, à environ 200 mots chacun. Via Ahrefs
- Taux de citation multiplié par environ 2,5 — résultat Onely pour les tableaux ; les listes représenteraient environ 50 % des meilleures citations IA. Onely
- 93,67 % des AI Overviews de Google citent au moins un résultat organique du top 10 : corrélation forte mais non absolue, laissant une correspondance de passage dépasser la position. The Digital Bloom, rapport 2025
Journal des modifications
Mis à jour le 11 août 2026.
Résumé éditorial et détails enregistrés des changements.Détails des changements
-
Les notes détaillées des changements sont actuellement disponibles en anglais.
Comparaison complète indisponible — aucun instantané antérieur n’a été archivé pour cette révision.
Mis à jour le 11 août 2026.
Résumé éditorial et détails enregistrés des changements.Détails des changements
-
Les notes détaillées des changements sont actuellement disponibles en anglais.
Comparaison complète indisponible — aucun instantané antérieur n’a été archivé pour cette révision.
Mis à jour le 18 juil. 2026.
Résumé éditorial et détails enregistrés des changements.Détails des changements
-
Les notes détaillées des changements sont actuellement disponibles en anglais.
-
Les notes détaillées des changements sont actuellement disponibles en anglais.
-
Les notes détaillées des changements sont actuellement disponibles en anglais.
-
Les notes détaillées des changements sont actuellement disponibles en anglais.
Comparaison complète indisponible — aucun instantané antérieur n’a été archivé pour cette révision.