Dataset Schema : guide du balisage des jeux de données

Implémenter schema.org/Dataset : propriétés obligatoires, distinction avec Google Dataset Search, licences, distributions, validation et erreurs courantes.

Première publication : 1 juil. 2026 · Dernière mise à jour : 13 août 2026 · Advanced
Langues
1 indice probant sur cette page

Le balisage Dataset décrit une collection de données pour Google Dataset Search, outil séparé de la recherche générale. Les propriétés obligatoires sont name et une description de 50 à 5 000 caractères. Ajoutez licence, gratuité, créateur, couverture et distributions. Réservez ce type aux véritables jeux de données et validez les URL, les noms uniques et le JSON-LD.

En bref — Le balisage schema.org/Dataset, généralement en JSON-LD, rend une collection découvrable dans Google Dataset Search. Depuis la clarification documentaire du 5 novembre 2025, sa portée est explicitement limitée à cet outil, pas à Google Search. Le profil actuel exige description (50 à 5000 caractères, seuls les 5000 premiers étant lus) et name. license et isAccessibleForFree sont essentiels pour évaluer la réutilisation, sans décider des droits juridiques. Google signale les noms génériques répétés et les URL de licence incomplètes. Ce balisage vise les données scientifiques, sociales, d’apprentissage automatique et publiques, pas le SEO général.

Evidence for this claim Schema.org Dataset represents a body of structured information and defines dataset-specific metadata properties. Scope: Schema.org Dataset vocabulary. Confidence: high · Verified: Schema.org: Dataset Evidence for this claim Google documents Dataset structured data for dataset discovery and requires page content and markup to describe a dataset; markup does not guarantee appearance. Scope: Current Google Dataset structured-data guidance. Confidence: high · Verified: Google Search Central: Dataset structured data

Soyons clairs : Dataset ne produit pas de résultat enrichi dans la recherche Web générale. Il alimente Google Dataset Search, à datasetsearch.research.google.com. Une mise à jour de Google Search Central du 5 novembre 2025 confirme que ces données structurées servent uniquement Dataset Search. Cet outil aide chercheurs et analystes à trouver des données.

Evidence for this claim Google currently scopes Dataset structured data to Google Dataset Search and explicitly clarified that it is not used by mainstream Google Search. Scope: web Confidence: high · Verified: Latest Google Search documentation updates

Google l’explique ainsi : “Datasets are easier to find in the Dataset Search tool when you provide supporting information such as their name, description, creator and distribution formats as structured data.” (traduction) « Les jeux de données sont plus faciles à trouver dans Dataset Search lorsque leur nom, description, créateur et formats de distribution sont fournis sous forme structurée. » Il s’agit bien de Dataset Search, pas d’un résultat enrichi général.

Propriétés obligatoires et recommandées

Voici les exigences du profil consommateur actuel de Google Dataset Search, plus étroites que tout le vocabulaire schema.org/Dataset et vérifiées au 16 juillet 2026.

Evidence for this claim Schema.org Dataset is a CreativeWork subtype for a body of structured information about topics; Google's Dataset consumer profile is a narrower platform-specific subset of that vocabulary. Scope: web Confidence: high · Verified: Dataset

Obligatoires dans le profil Dataset Search de Google :

  • name : titre du jeu.
  • description : 50 à 5 000 caractères. Une phrase trop courte ou un dictionnaire trop long échoue. Dataset Search ne lit que les 5 000 premiers caractères ; placez les informations essentielles au début.

Recommandées par Google, avec une importance particulière ici :

  • license : conditions de réutilisation sous forme d’URL complète.
  • isAccessibleForFree : accès gratuit ou non.
  • creator, funder, citation : provenance et citation.
  • identifier : DOI ou identifiant persistant.
  • keywords, variableMeasured : thèmes et variables.
  • spatialCoverage, temporalCoverage : portée spatiale et temporelle.
  • distribution : formats accessibles, sous forme d’objets DataDownload avec contentUrl et encodingFormat.
  • hasPart / isPartOf, sameAs, measurementTechnique, alternateName, version, url.

Erreurs explicitement signalées par Google

La documentation décrit plusieurs échecs concrets :

  • Noms génériques ou dupliqués. Des jeux tous nommés « Snow depth » deviennent indiscernables. Rendez name unique avec le fournisseur, la région ou la période.
  • URL de licence incomplète. Un lien tronqué empêche de vérifier la condition la plus utile au public.
  • Valeurs csvw:Table inattendues. Les métadonnées CSV on the Web mal formées peuvent déclencher des erreurs ; vérifiez le cas documenté avant de les ignorer.

Licence, droits d’accès et limites du balisage

Licence, droits d’accès et autres droits sont des couches distinctes selon DCAT, vocabulaire de catalogue interopérable avec schema.org/Dataset :

  • license décrit les conditions de réutilisation contrôlées par Dataset Search.
  • Les droits d’accès et autres droits restent des sujets séparés.
  • Une licence au niveau du jeu peut différer de celle d’une distribution. DCAT avertit que des déclarations conflictuelles induisent le réutilisateur en erreur ; rendez toute différence volontaire et explicite.

Ce texte n’est pas un conseil juridique et le balisage ne décide pas des droits. La propriété license pointe vers des conditions ; elle n’accorde aucune licence, ne renonce à aucun droit et ne résout aucun conflit. Pour des enjeux importants, publiez un texte exact et demandez un avis compétent.

Qui devrait l’implémenter ?

Évitons de survendre ce type spécialisé :

Bon usage :

  • Instituts de recherche et établissements .edu.
  • Portails de données publiques.
  • Hébergeurs de jeux ML, comme les dépôts de type Kaggle.
  • Revues scientifiques avec données complémentaires.
  • Journalisme scientifique publiant ses données.

Mauvais usage :

  • Sites commerciaux, blogs ou boutiques sans jeu de données réel. Un PDF ou tableur arbitraire n’est pas un Dataset et ce balisage n’aide pas le trafic ordinaire.

Google décrit un vaste champ scientifique : “The purpose of this markup is to improve discovery of datasets from fields such as life sciences, social sciences, machine learning, civic and government data, and more.” (traduction) « Ce balisage facilite la découverte de jeux issus des sciences du vivant, des sciences humaines, de l’apprentissage automatique et des services publics. » Il ne vise donc pas uniquement l’administration, mais toujours de vrais jeux de données.

Place de Dataset dans la famille schema.org

Dataset appartient aux Creative Works, avec Article, Book et les objets médias. Employez Article pour la prose, Book pour un livre et Dataset pour une collection interrogeable ou téléchargeable. Consultez les piliers Schema Markup et Structured Data pour le cadre général.

Modèle Dataset → distribution → version

Le jeu de données est la collection conceptuelle ; une distribution est une représentation accessible, par exemple CSV, API ou ZIP. Un jeu peut avoir plusieurs distributions. Dans schema.org, DataDownload placé dans distribution correspond à dcat:Distribution. Licence et accès peuvent donc varier par distribution.

Evidence for this claim A dataset is the described collection; a distribution is an accessible representation or downloadable form. Schema.org DataDownload maps to dcat:Distribution, and one dataset can have multiple distributions. Scope: data catalogs Confidence: high · Verified: Data Catalog Vocabulary (DCAT) - Version 3

DCAT 3, recommandation W3C compatible avec DCAT 2, ajoute la gestion formelle des versions et séries. Elle devient utile pour des publications successives, sans imposer de migration aux métadonnées DCAT 2 qui n’en ont pas besoin.

Add an expert note

Pin an expert quote

New person? Create their unclaimed profile at /admin/experts/ → Pin a quote first.