Dataset Schema : guide du balisage des jeux de données
Implémenter schema.org/Dataset : propriétés obligatoires, distinction avec Google Dataset Search, licences, distributions, validation et erreurs courantes.
Langues
1 indice probant sur cette page
- Outil en ligne associéSchema Markup Validator
Le balisage Dataset décrit une collection de données pour Google Dataset Search, outil séparé de la recherche générale. Les propriétés obligatoires sont name et une description de 50 à 5 000 caractères. Ajoutez licence, gratuité, créateur, couverture et distributions. Réservez ce type aux véritables jeux de données et validez les URL, les noms uniques et le JSON-LD.
Evidence for this claim Schema.org Dataset represents a body of structured information and defines dataset-specific metadata properties. Scope: Schema.org Dataset vocabulary. Confidence: high · Verified: Schema.org: Dataset Evidence for this claim Google documents Dataset structured data for dataset discovery and requires page content and markup to describe a dataset; markup does not guarantee appearance. Scope: Current Google Dataset structured-data guidance. Confidence: high · Verified: Google Search Central: Dataset structured dataEn bref — Le balisage Dataset décrit en code une collection de données publiée sur une page : recherche, données publiques ou jeu d’entraînement. Il alimente Google Dataset Search (datasetsearch.research.google.com), outil séparé destiné aux chercheurs, et non les résultats enrichis de la recherche Google ordinaire. Si vous ne publiez pas réellement de données, ce balisage ne convient pas.
Qu’est-ce que le balisage Dataset ?
Sur la page d’un jeu de données, un humain reconnaît le titre, la licence et le créateur ; un moteur ne voit que du texte. Le balisage Dataset explicite ces éléments avec le vocabulaire schema.org : name, description, creator, license et formats de téléchargement.
Il prend presque toujours la forme JSON-LD, un petit bloc de code qui ne modifie pas l’apparence de la page.
Le point à comprendre avant tout
Contrairement à de nombreux types de schéma, Dataset ne produit pas de résultat enrichi dans Google Search. Il sert un produit séparé, Dataset Search, qui indexe les jeux de données du Web. Ne l’ajoutez donc pas dans l’espoir d’enrichir la SERP ordinaire.
Ce dont vous avez réellement besoin
Deux propriétés seulement sont obligatoires :
- name : nom précis du jeu de données.
- description : résumé en langage clair, entre 50 et 5 000 caractères.
Quelques propriétés recommandées ont une importance réelle pour ce public :
- license : URL complète des conditions de réutilisation ; le balisage les référence sans remplacer leur lecture.
- isAccessibleForFree : indique si l’accès est gratuit.
- creator, keywords et couvertures géographique et temporelle.
À qui cela s’adresse-t-il ?
Le public est ciblé : instituts de recherche, portails universitaires ou publics, hébergeurs de jeux d’entraînement et revues scientifiques publiant leurs données. Pour une entreprise ou un blog sans véritable jeu de données, ce balisage est inadapté et n’améliore pas la visibilité ordinaire.
Pour les propriétés détaillées, le piège des noms génériques et un exemple JSON-LD complet, ouvrez l’onglet Avancé.
Evidence for this claim Schema.org Dataset represents a body of structured information and defines dataset-specific metadata properties. Scope: Schema.org Dataset vocabulary. Confidence: high · Verified: Schema.org: Dataset Evidence for this claim Google documents Dataset structured data for dataset discovery and requires page content and markup to describe a dataset; markup does not guarantee appearance. Scope: Current Google Dataset structured-data guidance. Confidence: high · Verified: Google Search Central: Dataset structured dataEn bref — Le balisage schema.org/Dataset, généralement en JSON-LD, rend une collection découvrable dans Google Dataset Search. Depuis la clarification documentaire du 5 novembre 2025, sa portée est explicitement limitée à cet outil, pas à Google Search. Le profil actuel exige
description(50 à 5000 caractères, seuls les 5000 premiers étant lus) etname.licenseetisAccessibleForFreesont essentiels pour évaluer la réutilisation, sans décider des droits juridiques. Google signale les noms génériques répétés et les URL de licence incomplètes. Ce balisage vise les données scientifiques, sociales, d’apprentissage automatique et publiques, pas le SEO général.
Ce que fait réellement Dataset : la distinction Dataset Search
Soyons clairs : Dataset ne produit pas de résultat enrichi dans la recherche Web générale. Il alimente Google Dataset Search, à datasetsearch.research.google.com. Une mise à jour de Google Search Central du 5 novembre 2025 confirme que ces données structurées servent uniquement Dataset Search. Cet outil aide chercheurs et analystes à trouver des données.
Evidence for this claim Google currently scopes Dataset structured data to Google Dataset Search and explicitly clarified that it is not used by mainstream Google Search. Scope: web Confidence: high · Verified: Latest Google Search documentation updatesGoogle l’explique ainsi : “Datasets are easier to find in the Dataset Search tool when you provide supporting information such as their name, description, creator and distribution formats as structured data.” (traduction) « Les jeux de données sont plus faciles à trouver dans Dataset Search lorsque leur nom, description, créateur et formats de distribution sont fournis sous forme structurée. » Il s’agit bien de Dataset Search, pas d’un résultat enrichi général.
Propriétés obligatoires et recommandées
Voici les exigences du profil consommateur actuel de Google Dataset Search, plus étroites que tout le vocabulaire schema.org/Dataset et vérifiées au 16 juillet 2026.
Evidence for this claim Schema.org Dataset is a CreativeWork subtype for a body of structured information about topics; Google's Dataset consumer profile is a narrower platform-specific subset of that vocabulary. Scope: web Confidence: high · Verified: DatasetObligatoires dans le profil Dataset Search de Google :
name: titre du jeu.description: 50 à 5 000 caractères. Une phrase trop courte ou un dictionnaire trop long échoue. Dataset Search ne lit que les 5 000 premiers caractères ; placez les informations essentielles au début.
Recommandées par Google, avec une importance particulière ici :
license: conditions de réutilisation sous forme d’URL complète.isAccessibleForFree: accès gratuit ou non.creator,funder,citation: provenance et citation.identifier: DOI ou identifiant persistant.keywords,variableMeasured: thèmes et variables.spatialCoverage,temporalCoverage: portée spatiale et temporelle.distribution: formats accessibles, sous forme d’objetsDataDownloadaveccontentUrletencodingFormat.hasPart/isPartOf,sameAs,measurementTechnique,alternateName,version,url.
Erreurs explicitement signalées par Google
La documentation décrit plusieurs échecs concrets :
- Noms génériques ou dupliqués. Des jeux tous nommés « Snow depth » deviennent indiscernables. Rendez
nameunique avec le fournisseur, la région ou la période. - URL de licence incomplète. Un lien tronqué empêche de vérifier la condition la plus utile au public.
- Valeurs
csvw:Tableinattendues. Les métadonnées CSV on the Web mal formées peuvent déclencher des erreurs ; vérifiez le cas documenté avant de les ignorer.
Licence, droits d’accès et limites du balisage
Licence, droits d’accès et autres droits sont des couches distinctes selon DCAT, vocabulaire de catalogue interopérable avec schema.org/Dataset :
licensedécrit les conditions de réutilisation contrôlées par Dataset Search.- Les droits d’accès et autres droits restent des sujets séparés.
- Une licence au niveau du jeu peut différer de celle d’une distribution. DCAT avertit que des déclarations conflictuelles induisent le réutilisateur en erreur ; rendez toute différence volontaire et explicite.
Ce texte n’est pas un conseil juridique et le balisage ne décide pas des droits. La propriété license pointe vers des conditions ; elle n’accorde aucune licence, ne renonce à aucun droit et ne résout aucun conflit. Pour des enjeux importants, publiez un texte exact et demandez un avis compétent.
Qui devrait l’implémenter ?
Évitons de survendre ce type spécialisé :
Bon usage :
- Instituts de recherche et établissements .edu.
- Portails de données publiques.
- Hébergeurs de jeux ML, comme les dépôts de type Kaggle.
- Revues scientifiques avec données complémentaires.
- Journalisme scientifique publiant ses données.
Mauvais usage :
- Sites commerciaux, blogs ou boutiques sans jeu de données réel. Un PDF ou tableur arbitraire n’est pas un
Datasetet ce balisage n’aide pas le trafic ordinaire.
Google décrit un vaste champ scientifique : “The purpose of this markup is to improve discovery of datasets from fields such as life sciences, social sciences, machine learning, civic and government data, and more.” (traduction) « Ce balisage facilite la découverte de jeux issus des sciences du vivant, des sciences humaines, de l’apprentissage automatique et des services publics. » Il ne vise donc pas uniquement l’administration, mais toujours de vrais jeux de données.
Place de Dataset dans la famille schema.org
Dataset appartient aux Creative Works, avec Article, Book et les objets médias. Employez Article pour la prose, Book pour un livre et Dataset pour une collection interrogeable ou téléchargeable. Consultez les piliers Schema Markup et Structured Data pour le cadre général.
Modèle Dataset → distribution → version
Le jeu de données est la collection conceptuelle ; une distribution est une représentation accessible, par exemple CSV, API ou ZIP. Un jeu peut avoir plusieurs distributions. Dans schema.org, DataDownload placé dans distribution correspond à dcat:Distribution. Licence et accès peuvent donc varier par distribution.
DCAT 3, recommandation W3C compatible avec DCAT 2, ajoute la gestion formelle des versions et séries. Elle devient utile pour des publications successives, sans imposer de migration aux métadonnées DCAT 2 qui n’en ont pas besoin.
Résumé par IA
Version condensée de l’onglet Avancé :
- Définition :
schema.org/Dataset, généralement en JSON-LD, décrit une collection de données de typeDataset. - Point essentiel : il alimente Google Dataset Search, outil séparé, pas un résultat enrichi de Google Search.
- Obligatoires :
descriptionde 50 à 5000 caractères etname, vérifiés au 16 juillet 2026. - Recommandées :
license,isAccessibleForFree,creator,identifier,keywords,spatialCoverage,temporalCoverage,variableMeasured,distribution. Le balisage ne tranche pas les droits. - Dataset et distribution :
DataDownloadreprésente une distribution, commedcat:Distribution; DCAT 3 ajoute versions et séries. - Erreurs : noms génériques, URL de licence incomplète et valeurs
csvw:Tableinattendues. - Public : recherche, portails publics, hébergeurs ML et revues, pas les sites sans collection réelle.
- Mythe : ni réservé aux administrations ni tactique générale de classement.
Documentation officielle
Documentation de première main des moteurs de recherche.
Google — données structurées
- Données structurées Dataset — référence pour
name,description,csvw:Table, recommandations et erreurs. - Galerie des données structurées — place de Dataset parmi les fonctionnalités.
- Rich Results Test — contrôle d’éligibilité, pas preuve d’apparition.
- Google Dataset Search — destination réelle.
Bing / Microsoft
- Balisage des sites avec des données structurées — prise en charge générale de schema.org et recommandation JSON-LD.
Citations de la source
Déclarations officielles de Google. Les liens profonds mènent aux passages cités.
Documentation Google — objectif du balisage
- “Datasets are easier to find in the Dataset Search tool when you provide supporting information such as their name, description, creator and distribution formats as structured data.” (traduction) « Les jeux de données sont plus faciles à trouver dans Dataset Search lorsque leurs informations sont structurées. » Accéder à la citation
- “The purpose of this markup is to improve discovery of datasets from fields such as life sciences, social sciences, machine learning, civic and government data, and more.” (traduction) « Ce balisage améliore la découverte de données scientifiques, sociales, d’apprentissage automatique et publiques. » Accéder à la citation
Mythes et erreurs à éviter avec Dataset
Mythe : « Dataset donne un résultat enrichi dans Google Search. » Faux. Il alimente Google Dataset Search (datasetsearch.research.google.com), outil séparé, sans enrichir la SERP générale.
Mythe : « Dataset est réservé aux données gouvernementales. » Faux. Google cite les sciences de la vie, les sciences sociales, l’apprentissage automatique et les données publiques.
Mythe : « Tout fichier téléchargeable est un jeu de données. » Non. Un PDF marketing ou une brochure n’est pas un Dataset. Il faut une véritable collection structurée.
Erreur : valeurs name génériques ou dupliquées. Plusieurs jeux « Snow depth » deviennent indiscernables. Ajoutez fournisseur, région ou période.
Erreur : description hors de la plage 50–5 000. Une phrase trop courte ou un dictionnaire trop long échoue ; rédigez un résumé humain.
Erreur : URL license incomplète. Un lien brisé prive le public de la propriété recommandée la plus utile.
Erreur : recommander Dataset sans jeu réel. Pour de la prose, des produits ou services, ce type ne sert à rien.
Aide-mémoire Dataset
Le principe à retenir
Dataset → Google Dataset Search (datasetsearch.research.google.com), outil séparé, pas résultat enrichi général.
Obligatoires — deux seulement
| Propriété | Contrainte |
|---|---|
name | Précis et unique, sans répétition générique |
description | 50 à 5 000 caractères |
Recommandées et décisives pour ce public
| Propriété | Utilité |
|---|---|
license | Réutilisation ; URL complète. Licence, accès et autres droits restent séparés |
isAccessibleForFree | Gratuité de l’accès |
creator / funder / citation | Provenance et citation |
identifier | DOI ou identifiant persistant |
keywords / variableMeasured | Sujet et variables |
spatialCoverage / temporalCoverage | Lieu et période |
distribution | Formats réels (DataDownload) |
Erreurs signalées par Google
namegénérique ou dupliqué.- URL
licenseincomplète. - Valeur
csvw:Tableinattendue. descriptionsous 50 ou au-dessus de 5 000 caractères.
Adéquation
| Bon usage | Mauvais usage |
|---|---|
| Instituts de recherche, .edu | Blogs sans données |
| Portails publics | Boutiques |
| Hébergeurs ML | PDF marketing qualifié de jeu |
| Revues avec données complémentaires | Absence de collection réelle |
Repères rapides
- Format recommandé : JSON-LD.
- Domaines : sciences, ML et données publiques, pas seulement gouvernementales.
- Destination : Dataset Search, pas la SERP.
- Aucun équivalent Bing trouvé.
- 5 novembre 2025 : clarification explicite de Google.
Faut-il utiliser Dataset ?
Répondez honnêtement : ce type est facile à détourner.
1. La page publie-t-elle une collection structurée réelle ?
- Non : prose, produit, service ou fichier arbitraire → n’utilisez pas Dataset. Choisissez le bon CreativeWork.
- Oui → continuez.
2. Espérez-vous enrichir la recherche Google ordinaire ?
- Oui → revoyez vos attentes. Dataset alimente Dataset Search, outil séparé.
- Non, vous ciblez chercheurs et analystes → continuez.
3. Disposez-vous des deux propriétés obligatoires ?
nameprécis et unique.descriptionentre 50 et 5 000 caractères. Corrigez toute absence ou valeur hors plage.
4. Pouvez-vous ajouter les champs utiles à la réutilisation ?
Ajoutez license, isAccessibleForFree, puis creator, identifier, keywords, spatialCoverage, temporalCoverage et distribution.
5. Avant publication :
- Validez le JSON-LD, la longueur de
description, l’unicité denameet la résolution delicense. - Vérifiez ensuite Google Dataset Search, destination réelle.
Règle simple : si vous ne pouvez pas désigner le jeu de données publié, arrêtez-vous.
JSON-LD Dataset correct et défectueux
Le nœud Dataset décrit la collection ; l’objet dans distribution est une représentation accessible, DataDownload, équivalent de dcat:Distribution. Une collection peut proposer CSV, API et ZIP avec leurs contentUrl et encodingFormat, voire leurs licences propres.
Exemple Dataset bien formé
Un name précis, une description entre 50 et 5 000 caractères, une URL license complète, l’accès gratuit, la couverture et une distribution réelle :
{
"@context": "https://schema.org/",
"@type": "Dataset",
"name": "NOAA Daily Snow Depth — Colorado Front Range, 2010–2024",
"description": "Daily snow depth measurements in centimeters from 42 automated weather stations across Colorado's Front Range, collected between January 2010 and December 2024. Includes station identifiers, elevation, latitude/longitude, and quality-control flags for each reading.",
"url": "https://example.org/datasets/co-front-range-snow-depth",
"keywords": ["snow depth", "Colorado", "Front Range", "climate", "weather stations"],
"creator": {
"@type": "Organization",
"name": "Example Climate Research Institute",
"url": "https://example.org"
},
"license": "https://creativecommons.org/licenses/by/4.0/",
"isAccessibleForFree": true,
"identifier": "https://doi.org/10.1234/co-frontrange-snow-2024",
"temporalCoverage": "2010-01-01/2024-12-31",
"spatialCoverage": {
"@type": "Place",
"name": "Colorado Front Range, USA"
},
"variableMeasured": "snow depth (cm)",
"distribution": [
{
"@type": "DataDownload",
"encodingFormat": "text/csv",
"contentUrl": "https://example.org/datasets/co-front-range-snow-depth.csv"
}
]
}Même jeu, version défectueuse
Chaque ligne ci-dessous illustre une erreur courante :
{
"@context": "https://schema.org/",
"@type": "Dataset",
"name": "Snow depth",
"description": "Snow data.",
"license": "creativecommons.org/licenses/by",
"isAccessibleForFree": "yes"
}Problèmes :
name: "Snow depth": nom générique explicitement signalé par Google. Ajoutez fournisseur, région et période.description: "Snow data.": sous le minimum de 50 caractères.license: "creativecommons.org/licenses/by": URL incomplète sans protocole ni version ; utilisezhttps://creativecommons.org/licenses/by/4.0/.isAccessibleForFree: "yes": doit être un booléentrue/false, pas une chaîne.- L’absence de
creator,distributionou couverture réduit fortement la valeur, même sinameet unedescriptioncorrigée suffisent techniquement.
Où apparaît le bénéfice
Le premier exemple ne change pas la présentation dans Google Search. Son succès se vérifie dans Google Dataset Search après indexation.
Outils pour écrire et valider Dataset
Commencez par mon validateur Schema Markup. Il contrôle le vocabulaire, les exigences Google et les graphes @id, puis propose un JSON-LD corrigé. Il détecte notamment une description hors plage ou une chaîne license mal formée.
Le vérificateur d’éligibilité aux résultats enrichis répond ensuite à la question de l’éligibilité. Il accepte JSON-LD, HTML ou URL et contrôle name, description et les propriétés recommandées : creator, license, distribution.contentUrl, identifier, sameAs, temporalCoverage, spatialCoverage, variableMeasured, keywords, url. Il rappelle honnêtement que Dataset vise Dataset Search, sans carte dans la SERP.
Pour partir de zéro, le générateur Schema Markup couvre Dataset parmi 921 types schema.org et exporte six formats. Utilisez-le comme base structurelle avant les deux contrôles précédents.
Ordre conseillé : générez le JSON-LD, validez-le, puis confirmez l’éligibilité et les champs manquants avant publication et attente de Dataset Search.
Prouver l’effet du balisage Dataset
Après publication ou modification, exécutez ces contrôles binaires.
Avant les tests, placez Dataset sur la page canonique du jeu, pas sur chaque mention. Pour les miroirs, utilisez sameAs vers la version canonique au lieu de dupliquer le balisage. Ajoutez la page au sitemap : cela aide la découverte sans la garantir.
Test 1 : validité structurelle JSON-LD
Test : collez le JSON-LD dans le validateur Schema Markup. Attendu : aucune erreur ; name et description présents, longueur entre 50 et 5 000, URL license et distribution valides. Échec : vérifiez la longueur, l’URL ou une valeur csvw:Table. Fenêtre : immédiate. Annulation : toute erreur ; publiez le bloc corrigé avant la suite.
Test 2 : éligibilité Dataset
Test : ouvrez la carte Dataset dans le vérificateur d’éligibilité. Attendu : verdict ✓ sur name et description, avec état des propriétés creator, license, distribution.contentUrl, identifier, sameAs, temporalCoverage, spatialCoverage, variableMeasured, keywords, url. Échec : ✗ signale une propriété obligatoire absente ou vide. Fenêtre : immédiate. Annulation : tout ✗ obligatoire.
Test 3 : apparition dans Google Dataset Search
Test : recherchez le name exact ou votre domaine dans Google Dataset Search après réexploration. Attendu : résultat Dataset avec name, description et licence. Échec : contrôlez d’abord l’exploration et l’indexation dans Search Console ; une page non indexable ne peut apparaître. Fenêtre : Google recommande plusieurs jours pour réexplorer, sans garantir l’inclusion. Annulation : aucun délai fixe ; réauditez canonique, sameAs et unicité de name.
Testez vos connaissances : Dataset Schema
Cinq questions sur schema.org/Dataset, Dataset Search et les propriétés importantes. Choisissez une réponse, puis vérifiez-la.
Ressources utiles
Mes contenus connexes
Je n’ai pas publié de guide Dataset autonome ; mieux vaut consulter les sources primaires et les contenus structurés associés. Pour le vocabulaire général, voyez Schema Markup, Structured Data et Schema Markup for AI.
Dans le secteur
- Données structurées Dataset — référence Google pour
nameetdescription. - Google Dataset Search — destination réelle.
- Galerie des données structurées — catalogue des fonctionnalités.
- Qu’est-ce que Schema Markup ? — guide général Ahrefs.
Journal des modifications
Mis à jour le 13 août 2026.
Résumé éditorial et détails enregistrés des changements.Détails des changements
-
Les notes détaillées des changements sont actuellement disponibles en anglais.
-
Les notes détaillées des changements sont actuellement disponibles en anglais.
-
Les notes détaillées des changements sont actuellement disponibles en anglais.
Comparaison complète indisponible — aucun instantané antérieur n’a été archivé pour cette révision.
Mis à jour le 17 juil. 2026.
Résumé éditorial et détails enregistrés des changements.Détails des changements
-
Les notes détaillées des changements sont actuellement disponibles en anglais.
-
Les notes détaillées des changements sont actuellement disponibles en anglais.
-
Les notes détaillées des changements sont actuellement disponibles en anglais.
Comparaison complète indisponible — aucun instantané antérieur n’a été archivé pour cette révision.