Panduan Dataset Schema

cara implement schema.org/Dataset markup — diperlukan deskripsi dan name properties, mengapa Dataset schema feeds Google's terpisah Dataset Penelusuran alat alih-alih sebuah mainstream web-penelusuran rich snippet, siapa seharusnya sebenarnya gunakan ini, dan umum mistakes Google flags.

Pertama kali diterbitkan: 1 Jul 2026 · Terakhir diperbarui: 8 Agu 2026 · Advanced
Bahasa
1 sinyal bukti di halaman ini

Dataset schema (schema.org/Dataset) adalah data terstruktur itu marks up sebuah data collection so ini dapat surface di Google's dedicated Dataset Penelusuran alat di datasetsearch.research.google.com. Google clarified di sebuah November 2025 documentation perbarui itu Dataset data terstruktur adalah scoped untuk Dataset Penelusuran, tidak mainstream Google Search — ini melakukan tidak produce jenis dari rich snippet Anda see pada ordinary Google searches, dan ini feeds sebuah terpisah destination Google dibangun untuk researchers, data scientists, dan similar audiences per -nya own stated purpose. hanya dua properties adalah diperlukan di Google's saat ini Dataset Penelusuran profile — deskripsi (50 untuk 5000 characters, dari yang Dataset Penelusuran membaca hanya pertama 5000) dan name — dan license/isAccessibleForFree penting di sini karena Dataset Penelusuran pengguna adalah sering weighing apakah data looks reusable, though markup itself tidak settle legal reuse rights. Google explicitly flags duplicate generic names (banyak Snow depth datasets undisambiguated) sebagai sebuah nyata masalah. ini adalah sebuah niche play untuk research institutions,.gov/.edu open-data portals, ML dataset hosting, dan journals dengan supplementary data — tidak sebuah umum SEO peringkat atau rich-hasil tactic. jika Anda situs memiliki Tidak literal dataset untuk publish, ini markup adalah tidak untuk Anda.

TL;DR — schema.org/Dataset markup (biasanya JSON-LD) membuat sebuah data-collection halaman discoverable di Google Dataset Penelusuran (datasetsearch.research.google.com). sebuah November 5, 2025 Google Search Central documentation perbarui explicitly scoped Dataset data terstruktur untuk Dataset Penelusuran — tidak mainstream Google Search — so treat ini sebagai sebuah terpisah destination, tidak sebuah umum-SERP rich snippet. Google’s saat ini Dataset Penelusuran profile memerlukan description (50–5000 chars, dari yang Dataset Penelusuran membaca hanya pertama 5000) dan name; license dan isAccessibleForFree penting lebih di sini daripada pada sebagian besar CreativeWork jenis karena Dataset Penelusuran pengguna adalah weighing reuse — though license, access rights, dan legal rights adalah distinct layers, dan markup tidak decide legal reuse (tidak legal advice). Google explicitly panggilan out duplicate generic names (banyak undisambiguated “Snow depth” (terjemahan) “Snow depth” datasets) dan incomplete license URLs sebagai dunia nyata failure modes. ini adalah sebuah niche play untuk life-sciences, social-sciences, ML, dan civic/government data publishers — tidak sebuah umum SEO peringkat tactic. jika Anda situs memiliki Tidak literal dataset, ini jenis tidak untuk Anda, dan Tidak amount dari markup perubahan itu.

Evidence for this claim Schema.org Dataset represents a body of structured information and defines dataset-specific metadata properties. Scope: Schema.org Dataset vocabulary. Confidence: high · Verified: Schema.org: Dataset Evidence for this claim Google documents Dataset structured data for dataset discovery and requires page content and markup to describe a dataset; markup does not guarantee appearance. Scope: Current Google Dataset structured-data guidance. Confidence: high · Verified: Google Search Central: Dataset structured data

Apa Dataset schema sebenarnya melakukan — Dataset Penelusuran pembedaan

ini adalah framing itu sebagian besar pesaing konten mendapatkan wrong, so I’ll menjadi blunt: Dataset schema melakukan tidak feed sebuah mainstream Google web-penelusuran rich hasil. ini feeds Google Dataset Penelusuran, sebuah dedicated alat di -nya own address (datasetsearch.research.google.com), terpisah dari main SERP. Google dibuat ini jelas alih-alih implicit: sebuah November 5, 2025 entry di Google Search Central’s documentation-memperbarui log clarified itu Dataset data terstruktur adalah digunakan hanya oleh Dataset Penelusuran, tidak oleh Google Search itself. Dataset Penelusuran adalah alat researchers, data scientists, dan analysts go untuk ketika mereka perlu untuk temukan data — dan Dataset schema adalah sinyal itu mendapatkan Anda dataset ke itu indeks. I tidak akan panggil Dataset sebuah mainstream rich hasil anywhere else pada ini halaman; pembedaan di atas adalah satu itu penting.

Evidence for this claim Google currently scopes Dataset structured data to Google Dataset Search and explicitly clarified that it is not used by mainstream Google Search. Scope: web Confidence: high · Verified: Latest Google Search documentation updates

Google’s own framing adalah sebuah penemuan-alat framing, tidak sebuah rich-snippet satu: “Datasets adalah easier untuk temukan di itu Dataset Penelusuran tool ketika Anda sediakan supporting information such sebagai mereka name, description, creator dan distribution formats sebagai structured data.” (terjemahan) “Datasets adalah easier untuk temukan di Dataset Penelusuran alat ketika Anda menyediakan supporting informasi such sebagai mereka name, deskripsi, creator dan distribution formats sebagai data terstruktur.” Baca itu dengan hati-hati — “easier untuk temukan di itu Dataset Penelusuran tool,” (terjemahan) “easier untuk temukan di Dataset Penelusuran alat,” tidak “gets a rich result in Search.” (terjemahan) “mendapatkan sebuah rich hasil di Penelusuran.” itu pembedaan adalah seluruh poin dari ini artikel.

ini adalah Google’s saat ini Dataset Penelusuran consumer profile requirements — lebih sempit daripada umum schema.org/Dataset vocabulary, dan spesifik untuk apa Google’s alat memeriksa untuk. diperiksa terhadap Google’s documentation sebagai dari 2026-07-16.

Evidence for this claim Schema.org Dataset is a CreativeWork subtype for a body of structured information about topics; Google's Dataset consumer profile is a narrower platform-specific subset of that vocabulary. Scope: web Confidence: high · Verified: Dataset

diperlukan oleh Google’s Dataset Penelusuran profile (keduanya, atau Anda’re tidak eligible):

  • name — dataset’s judul.
  • description50 untuk 5 000 characters. ini length window adalah sebuah hard constraint orang trip di atas: sebuah satu-line deskripsi di bawah 50 characters fails validation, dan sebuah enormous data dictionary di atas 5 000 characters mendapatkan rejected. Beyond ceiling, Dataset Penelusuran membaca hanya pertama 5 000 characters dari textual properties like ini satu — konten past itu poin tidak consumed, so jangan bury apa pun muat-bearing di end.

Recommended oleh Google’s profile — dan ones itu penting lebih di sini daripada di sebagian besar CreativeWork jenis:

  • license — reuse istilah, ideally sebagai sebuah bersih, menyelesaikan URL untuk license. Dataset Penelusuran pengguna adalah sering trying untuk gauge apakah data looks reusable untuk mereka purposes, so sebuah incomplete atau missing license adalah sebuah nyata cost, tidak sebuah cosmetic satu. (Lebih pada mengapa “license” (terjemahan) “license” tidak seluruh legal picture di bawah.)
  • isAccessibleForFree — apakah access adalah free. sama reasoning: reuse evaluation.
  • creator, funder, citation — provenance dan cara cite ini.
  • identifier — sebuah DOI atau lainnya persistent ID.
  • keywords, variableMeasured — apa data covers dan measures.
  • spatialCoverage, temporalCoverage — geographic dan time span dari data.
  • distribution — sebenarnya download/access formats (DataDownload objects dengan contentUrl dan encodingFormat).
  • hasPart / isPartOf, sameAs, measurementTechnique, alternateName, version, url.

umum mistakes Google secara khusus flags

Google’s docs panggil out concrete, dunia nyata failure modes — ini tidak hypotheticals:

  • Duplicate / generic dataset names. canonical contoh adalah banyak datasets semua named “Snow depth” (terjemahan) “Snow depth” dari berbeda providers dengan Tidak disambiguation. di scale ini membuat datasets indistinguishable di Dataset Penelusuran. name uniqueness penting lebih daripada untuk hampir apa pun lainnya schema jenis — bake provider, region, atau time range ke name.
  • Incomplete license URLs. sebuah truncated atau non-resolving license tautan undermines single field Anda audience sebagian besar ingin untuk periksa.
  • Unexpected csvw:Table nilai. Malformed CSV-pada—Web metadata adalah sebuah terdokumentasi sumber dari errors, though DCAT documentation notes ini spesifik warning dapat menjadi ignored di bawah condition ini mendeskripsikan — periksa Anda own case terhadap docs sebelum assuming ini applies.

License, access rights, dan apa markup tidak decide

ini adalah sebuah place I ingin untuk menjadi lebih careful daripada sebagian besar schema explainers adalah. License, access rights, dan lainnya-rights metadata adalah distinct layers, tidak satu field standing di untuk semua dari them — itu pembedaan muncul dari DCAT ( data Catalog Vocabulary itu schema.org/Dataset interoperates dengan), tidak hanya dari schema.org itself:

  • license mendeskripsikan reuse istilah Google’s Dataset Penelusuran profile memeriksa untuk.
  • Access rights (siapa dapat mendapatkan data di semua) dan lainnya rights (attribution, restrictions beyond license) adalah terpisah concerns DCAT tracks alongside license.
  • sebuah dataset dapat memiliki sebuah license di dataset tingkat dan sebuah berbeda satu di distribution tingkat (see Dataset-vs-distribution model di bawah) — DCAT explicitly warns itu conflicting dataset- dan distribution-tingkat license declarations dapat mislead whoever’s trying untuk evaluate reuse. jika Anda publish multiple distributions, pastikan mereka licenses agree dengan dataset-tingkat license atau adalah dengan sengaja, dengan jelas scoped differently.

None dari ini adalah legal advice, dan markup itself tidak decide legal reuse rights. menambahkan sebuah license property adalah sebuah machine-readable pointer untuk istilah — ini tidak grant sebuah license, waive rights, atau resolve sebuah conflicting claim. jika reuse istilah genuinely penting untuk sebuah dataset (mereka biasanya melakukan, untuk ini audience), mendapatkan license text right dan, di mana ini adalah ambiguous atau tinggi-stakes, poin pengguna untuk sebenarnya legal guidance alih-alih relying pada schema field alone.

Siapa seharusnya sebenarnya implement ini

I ingin untuk menjadi honest tentang fit alih-alih overselling sebuah niche jenis:

baik fit:

  • Research institutions dan.edu penerbitan study data.
  • Government / civic open-data portals (.gov dan equivalents).
  • ML / data-science dataset hosting — Kaggle-style repositories.
  • Scientific journals dengan supplementary datasets behind papers.
  • Science-journalism situs penerbitan data behind sebuah story.

Poor fit:

  • Typical commercial konten situs, blogs, atau stores dengan Tidak literal dataset untuk publish. tidak ada versi dari ini itu helps Anda ordinary penelusuran traffic, dan marking up sebuah random downloadable PDF atau spreadsheet sebagai sebuah Dataset adalah misuse — Google’s guidance implies sebuah nyata, data terstruktur collection, tidak apa pun arbitrary downloadable file.

purpose, di Google’s own kata, adalah broad di dalam research dan data: “The purpose of this markup is to improve discovery of datasets from fields such as life sciences, social sciences, machine learning, civic and government data, and more.” (terjemahan) “ purpose dari ini markup adalah untuk meningkatkan penemuan dari datasets dari fields such sebagai life sciences, social sciences, pembelajaran mesin, civic dan government data, dan lebih.” Note itu framing kills sebuah umum myth — ini adalah tidak “only for government data.” (terjemahan) “hanya untuk government data.” ini spans life sciences, social sciences, ML, dan civic/government data alike. tetapi ini adalah masih scoped untuk sebenarnya datasets.

Di mana Dataset sits di schema family

Dataset lives di Creative berfungsi family alongside siblings like artikel, Book, dan media-object jenis — ini adalah CreativeWork subtype untuk structured data collections secara khusus. jika apa Anda’re penerbitan adalah prose, sebuah artikel; jika ini adalah sebuah book, Book; jika ini adalah sebuah queryable/downloadable data collection, Dataset. untuk di mana semua dari ini fits di lebih luas picture, Schema Markup dan data terstruktur hubs ini artikel nests di bawah adalah place untuk mulai.

Dataset → distribution → versi model

Worth understanding conceptually sebelum Anda tulis JSON-LD: sebuah dataset adalah hal menjadi described — conceptual collection. sebuah distribution adalah satu accessible representation dari ini — sebuah CSV export, sebuah JSON API, sebuah ZIP archive. Satu dataset dapat memiliki several distributions. di schema.org istilah, DataDownload (digunakan di dalam distribution property) adalah equivalent dari DCAT’s dcat:Distribution — sama hubungan, berbeda vocabulary. itu’s mengapa license dan access informasi dapat differ oleh distribution, tidak hanya oleh dataset, dan mengapa conflict warning di bagian di atas penting.

Evidence for this claim A dataset is the described collection; a distribution is an accessible representation or downloadable form. Schema.org DataDownload maps to dcat:Distribution, and one dataset can have multiple distributions. Scope: data catalogs Confidence: high · Verified: Data Catalog Vocabulary (DCAT) - Version 3

pada top dari itu, DCAT 3 (sebuah W3C Recommendation) menambahkan formal versioning dan dataset-series semantics — berguna setelah Anda’re penerbitan diperbarui releases dari sama underlying dataset di atas time — sementara staying backward-compatible dengan DCAT 2. jika Anda’re tidak sudah menggunakan itu fitur, DCAT 2-style metadata tidak perlu sebuah upgrade hanya karena DCAT 3 ada.

Add an expert note

Pin an expert quote

New person? Create their unclaimed profile at /admin/experts/ → Pin a quote first.