Panduan Dataset Schema
cara implement schema.org/Dataset markup — diperlukan deskripsi dan name properties, mengapa Dataset schema feeds Google's terpisah Dataset Penelusuran alat alih-alih sebuah mainstream web-penelusuran rich snippet, siapa seharusnya sebenarnya gunakan ini, dan umum mistakes Google flags.
Bahasa
1 sinyal bukti di halaman ini
- Alat aktif terkaitSchema Markup Validator
Dataset schema (schema.org/Dataset) adalah data terstruktur itu marks up sebuah data collection so ini dapat surface di Google's dedicated Dataset Penelusuran alat di datasetsearch.research.google.com. Google clarified di sebuah November 2025 documentation perbarui itu Dataset data terstruktur adalah scoped untuk Dataset Penelusuran, tidak mainstream Google Search — ini melakukan tidak produce jenis dari rich snippet Anda see pada ordinary Google searches, dan ini feeds sebuah terpisah destination Google dibangun untuk researchers, data scientists, dan similar audiences per -nya own stated purpose. hanya dua properties adalah diperlukan di Google's saat ini Dataset Penelusuran profile — deskripsi (50 untuk 5000 characters, dari yang Dataset Penelusuran membaca hanya pertama 5000) dan name — dan license/isAccessibleForFree penting di sini karena Dataset Penelusuran pengguna adalah sering weighing apakah data looks reusable, though markup itself tidak settle legal reuse rights. Google explicitly flags duplicate generic names (banyak Snow depth datasets undisambiguated) sebagai sebuah nyata masalah. ini adalah sebuah niche play untuk research institutions,.gov/.edu open-data portals, ML dataset hosting, dan journals dengan supplementary data — tidak sebuah umum SEO peringkat atau rich-hasil tactic. jika Anda situs memiliki Tidak literal dataset untuk publish, ini markup adalah tidak untuk Anda.
Evidence for this claim Schema.org Dataset represents a body of structured information and defines dataset-specific metadata properties. Scope: Schema.org Dataset vocabulary. Confidence: high · Verified: Schema.org: Dataset Evidence for this claim Google documents Dataset structured data for dataset discovery and requires page content and markup to describe a dataset; markup does not guarantee appearance. Scope: Current Google Dataset structured-data guidance. Confidence: high · Verified: Google Search Central: Dataset structured dataTL;DR — Dataset schema adalah code Anda tambahkan untuk sebuah halaman itu publishes sebuah collection dari data — research data, government/civic data, sebuah machine-learning training set — so sebuah mesin pencari understands apa dataset adalah. tetapi di sini’s catch sebagian besar orang miss: ini melakukan tidak mendapatkan Anda fancy listings Anda see pada wajar Google searches. ini feeds sebuah terpisah alat called Google Dataset Penelusuran (datasetsearch.research.google.com), sebuah berbeda situs Google dibangun untuk researchers dan data scientists. jika Anda tidak secara harfiah publish data, ini markup tidak untuk Anda.
Apa Dataset schema adalah
Ketika Anda land pada sebuah halaman hosting sebuah dataset — sebuah CSV dari rainfall readings, sebuah publik
health data table, sebuah ML training set — Anda dapat baca judul, spot license,
see siapa dibuat ini. sebuah mesin pencari sees plain text dan memiliki untuk guess. Dataset
schema spells ini out di code, menggunakan shared
schema.org vocabulary: ini adalah dataset’s name,
ini adalah sebuah description dari apa ini berisi, ini adalah creator, ini adalah
license, ini adalah download formats.
ini adalah hampir selalu ditulis sebagai JSON-LD — sebuah kecil block dari code itu sits di halaman tanpa mengubah bagaimana halaman looks.
satu hal untuk memahami sebelum apa pun else
sebagian besar schema jenis earn Anda sebuah rich hasil di ordinary Google penelusuran — star ratings, FAQ dropdowns, recipe cards. Dataset schema melakukan tidak. -nya entire payoff adalah sebuah terpisah Google product: Dataset Penelusuran, sebuah dedicated alat di sebuah berbeda web address itu indeks datasets dari di seluruh web. Everyday searchers typing sebuah pertanyaan ke Google tidak pernah see ini. So jangan tambahkan Dataset schema expecting Anda halaman untuk suddenly look richer di wajar hasil — itu’s tidak apa ini melakukan.
Apa Anda sebenarnya perlu
hanya dua properties adalah truly diperlukan:
- name — apa dataset adalah called. membuat ini spesifik (lebih pada mengapa di bawah).
- deskripsi — sebuah plain-language summary dari data, antara 50 dan 5 000 characters.
Beyond itu, sebuah sedikit extras carry nyata weight untuk ini particular audience:
- license — reuse istilah, sebagai sebuah bersih URL. Researchers evaluating Anda dataset ingin untuk know license sebelum mereka invest time di ini — though markup itself adalah sebuah pointer untuk istilah, tidak sebuah substitute untuk reading them.
- isAccessibleForFree — apakah ini adalah free untuk access.
- creator, keywords, dan coverage dari data (di mana dan ketika ini adalah collected).
Siapa seharusnya bother
Honestly? sebuah sempit group: research institutions, government dan university open-data portals, machine-learning dataset hosts (think Kaggle-style situs), dan scientific journals itu publish supporting data. untuk them ini adalah genuinely valuable. untuk sebuah typical business atau blog dengan Tidak literal dataset untuk share, ini adalah wrong alat — dan menambahkan ini tidak akan help Anda wajar penelusuran visibilitas satu bit.
ingin diperlukan-vs-recommended property detail, “duplicate name” (terjemahan) “duplicate name” pitfall Google secara khusus warns tentang, dan sebuah penuh JSON-LD contoh? Switch untuk Advanced tab.
Evidence for this claim Schema.org Dataset represents a body of structured information and defines dataset-specific metadata properties. Scope: Schema.org Dataset vocabulary. Confidence: high · Verified: Schema.org: Dataset Evidence for this claim Google documents Dataset structured data for dataset discovery and requires page content and markup to describe a dataset; markup does not guarantee appearance. Scope: Current Google Dataset structured-data guidance. Confidence: high · Verified: Google Search Central: Dataset structured dataTL;DR — schema.org/Dataset markup (biasanya JSON-LD) membuat sebuah data-collection halaman discoverable di Google Dataset Penelusuran (datasetsearch.research.google.com). sebuah November 5, 2025 Google Search Central documentation perbarui explicitly scoped Dataset data terstruktur untuk Dataset Penelusuran — tidak mainstream Google Search — so treat ini sebagai sebuah terpisah destination, tidak sebuah umum-SERP rich snippet. Google’s saat ini Dataset Penelusuran profile memerlukan
description(50–5000 chars, dari yang Dataset Penelusuran membaca hanya pertama 5000) danname;licensedanisAccessibleForFreepenting lebih di sini daripada pada sebagian besar CreativeWork jenis karena Dataset Penelusuran pengguna adalah weighing reuse — though license, access rights, dan legal rights adalah distinct layers, dan markup tidak decide legal reuse (tidak legal advice). Google explicitly panggilan out duplicate generic names (banyak undisambiguated “Snow depth” (terjemahan) “Snow depth” datasets) dan incomplete license URLs sebagai dunia nyata failure modes. ini adalah sebuah niche play untuk life-sciences, social-sciences, ML, dan civic/government data publishers — tidak sebuah umum SEO peringkat tactic. jika Anda situs memiliki Tidak literal dataset, ini jenis tidak untuk Anda, dan Tidak amount dari markup perubahan itu.
Apa Dataset schema sebenarnya melakukan — Dataset Penelusuran pembedaan
ini adalah framing itu sebagian besar pesaing konten mendapatkan wrong, so I’ll menjadi blunt: Dataset schema melakukan tidak feed sebuah mainstream Google web-penelusuran rich hasil. ini feeds Google Dataset Penelusuran, sebuah dedicated alat di -nya own address (datasetsearch.research.google.com), terpisah dari main SERP. Google dibuat ini jelas alih-alih implicit: sebuah November 5, 2025 entry di Google Search Central’s documentation-memperbarui log clarified itu Dataset data terstruktur adalah digunakan hanya oleh Dataset Penelusuran, tidak oleh Google Search itself. Dataset Penelusuran adalah alat researchers, data scientists, dan analysts go untuk ketika mereka perlu untuk temukan data — dan Dataset schema adalah sinyal itu mendapatkan Anda dataset ke itu indeks. I tidak akan panggil Dataset sebuah mainstream rich hasil anywhere else pada ini halaman; pembedaan di atas adalah satu itu penting.
Evidence for this claim Google currently scopes Dataset structured data to Google Dataset Search and explicitly clarified that it is not used by mainstream Google Search. Scope: web Confidence: high · Verified: Latest Google Search documentation updatesGoogle’s own framing adalah sebuah penemuan-alat framing, tidak sebuah rich-snippet satu: “Datasets adalah easier untuk temukan di itu Dataset Penelusuran tool ketika Anda sediakan supporting information such sebagai mereka name, description, creator dan distribution formats sebagai structured data.” (terjemahan) “Datasets adalah easier untuk temukan di Dataset Penelusuran alat ketika Anda menyediakan supporting informasi such sebagai mereka name, deskripsi, creator dan distribution formats sebagai data terstruktur.” Baca itu dengan hati-hati — “easier untuk temukan di itu Dataset Penelusuran tool,” (terjemahan) “easier untuk temukan di Dataset Penelusuran alat,” tidak “gets a rich result in Search.” (terjemahan) “mendapatkan sebuah rich hasil di Penelusuran.” itu pembedaan adalah seluruh poin dari ini artikel.
diperlukan vs. recommended properties
ini adalah Google’s saat ini Dataset Penelusuran consumer profile requirements — lebih sempit daripada umum schema.org/Dataset vocabulary, dan spesifik untuk apa Google’s alat memeriksa untuk. diperiksa terhadap Google’s documentation sebagai dari 2026-07-16.
Evidence for this claim Schema.org Dataset is a CreativeWork subtype for a body of structured information about topics; Google's Dataset consumer profile is a narrower platform-specific subset of that vocabulary. Scope: web Confidence: high · Verified: Datasetdiperlukan oleh Google’s Dataset Penelusuran profile (keduanya, atau Anda’re tidak eligible):
name— dataset’s judul.description— 50 untuk 5 000 characters. ini length window adalah sebuah hard constraint orang trip di atas: sebuah satu-line deskripsi di bawah 50 characters fails validation, dan sebuah enormous data dictionary di atas 5 000 characters mendapatkan rejected. Beyond ceiling, Dataset Penelusuran membaca hanya pertama 5 000 characters dari textual properties like ini satu — konten past itu poin tidak consumed, so jangan bury apa pun muat-bearing di end.
Recommended oleh Google’s profile — dan ones itu penting lebih di sini daripada di sebagian besar CreativeWork jenis:
license— reuse istilah, ideally sebagai sebuah bersih, menyelesaikan URL untuk license. Dataset Penelusuran pengguna adalah sering trying untuk gauge apakah data looks reusable untuk mereka purposes, so sebuah incomplete atau missing license adalah sebuah nyata cost, tidak sebuah cosmetic satu. (Lebih pada mengapa “license” (terjemahan) “license” tidak seluruh legal picture di bawah.)isAccessibleForFree— apakah access adalah free. sama reasoning: reuse evaluation.creator,funder,citation— provenance dan cara cite ini.identifier— sebuah DOI atau lainnya persistent ID.keywords,variableMeasured— apa data covers dan measures.spatialCoverage,temporalCoverage— geographic dan time span dari data.distribution— sebenarnya download/access formats (DataDownloadobjects dengancontentUrldanencodingFormat).hasPart/isPartOf,sameAs,measurementTechnique,alternateName,version,url.
umum mistakes Google secara khusus flags
Google’s docs panggil out concrete, dunia nyata failure modes — ini tidak hypotheticals:
- Duplicate / generic dataset names. canonical contoh adalah banyak datasets semua
named “Snow depth” (terjemahan) “Snow depth” dari berbeda providers dengan Tidak disambiguation. di scale ini
membuat datasets indistinguishable di Dataset Penelusuran.
nameuniqueness penting lebih daripada untuk hampir apa pun lainnya schema jenis — bake provider, region, atau time range ke name. - Incomplete license URLs. sebuah truncated atau non-resolving license tautan undermines single field Anda audience sebagian besar ingin untuk periksa.
- Unexpected
csvw:Tablenilai. Malformed CSV-pada—Web metadata adalah sebuah terdokumentasi sumber dari errors, though DCAT documentation notes ini spesifik warning dapat menjadi ignored di bawah condition ini mendeskripsikan — periksa Anda own case terhadap docs sebelum assuming ini applies.
License, access rights, dan apa markup tidak decide
ini adalah sebuah place I ingin untuk menjadi lebih careful daripada sebagian besar schema explainers adalah. License, access rights, dan lainnya-rights metadata adalah distinct layers, tidak satu field standing di untuk semua dari them — itu pembedaan muncul dari DCAT ( data Catalog Vocabulary itu schema.org/Dataset interoperates dengan), tidak hanya dari schema.org itself:
licensemendeskripsikan reuse istilah Google’s Dataset Penelusuran profile memeriksa untuk.- Access rights (siapa dapat mendapatkan data di semua) dan lainnya rights (attribution, restrictions beyond license) adalah terpisah concerns DCAT tracks alongside license.
- sebuah dataset dapat memiliki sebuah license di dataset tingkat dan sebuah berbeda satu di distribution tingkat (see Dataset-vs-distribution model di bawah) — DCAT explicitly warns itu conflicting dataset- dan distribution-tingkat license declarations dapat mislead whoever’s trying untuk evaluate reuse. jika Anda publish multiple distributions, pastikan mereka licenses agree dengan dataset-tingkat license atau adalah dengan sengaja, dengan jelas scoped differently.
None dari ini adalah legal advice, dan markup itself tidak decide legal reuse
rights. menambahkan sebuah license property adalah sebuah machine-readable pointer untuk istilah —
ini tidak grant sebuah license, waive rights, atau resolve sebuah conflicting claim. jika
reuse istilah genuinely penting untuk sebuah dataset (mereka biasanya melakukan, untuk ini audience),
mendapatkan license text right dan, di mana ini adalah ambiguous atau tinggi-stakes, poin pengguna untuk
sebenarnya legal guidance alih-alih relying pada schema field alone.
Siapa seharusnya sebenarnya implement ini
I ingin untuk menjadi honest tentang fit alih-alih overselling sebuah niche jenis:
baik fit:
- Research institutions dan.edu penerbitan study data.
- Government / civic open-data portals (.gov dan equivalents).
- ML / data-science dataset hosting — Kaggle-style repositories.
- Scientific journals dengan supplementary datasets behind papers.
- Science-journalism situs penerbitan data behind sebuah story.
Poor fit:
- Typical commercial konten situs, blogs, atau stores dengan Tidak literal dataset untuk
publish. tidak ada versi dari ini itu helps Anda ordinary penelusuran traffic, dan
marking up sebuah random downloadable PDF atau spreadsheet sebagai sebuah
Datasetadalah misuse — Google’s guidance implies sebuah nyata, data terstruktur collection, tidak apa pun arbitrary downloadable file.
purpose, di Google’s own kata, adalah broad di dalam research dan data: “The purpose of this markup is to improve discovery of datasets from fields such as life sciences, social sciences, machine learning, civic and government data, and more.” (terjemahan) “ purpose dari ini markup adalah untuk meningkatkan penemuan dari datasets dari fields such sebagai life sciences, social sciences, pembelajaran mesin, civic dan government data, dan lebih.” Note itu framing kills sebuah umum myth — ini adalah tidak “only for government data.” (terjemahan) “hanya untuk government data.” ini spans life sciences, social sciences, ML, dan civic/government data alike. tetapi ini adalah masih scoped untuk sebenarnya datasets.
Di mana Dataset sits di schema family
Dataset lives di Creative berfungsi family alongside siblings like artikel,
Book, dan media-object jenis — ini adalah CreativeWork subtype untuk structured
data collections secara khusus. jika apa Anda’re penerbitan adalah prose, sebuah artikel; jika
ini adalah sebuah book, Book; jika ini adalah sebuah queryable/downloadable data collection, Dataset.
untuk di mana semua dari ini fits di lebih luas picture, Schema Markup dan
data terstruktur hubs ini artikel nests di bawah adalah place untuk mulai.
Dataset → distribution → versi model
Worth understanding conceptually sebelum Anda tulis JSON-LD: sebuah dataset adalah
hal menjadi described — conceptual collection. sebuah distribution adalah satu
accessible representation dari ini — sebuah CSV export, sebuah JSON API, sebuah ZIP archive. Satu
dataset dapat memiliki several distributions. di schema.org istilah, DataDownload (digunakan
di dalam distribution property) adalah equivalent dari DCAT’s dcat:Distribution
— sama hubungan, berbeda vocabulary. itu’s mengapa license dan access
informasi dapat differ oleh distribution, tidak hanya oleh dataset, dan mengapa
conflict warning di bagian di atas penting.
pada top dari itu, DCAT 3 (sebuah W3C Recommendation) menambahkan formal versioning dan dataset-series semantics — berguna setelah Anda’re penerbitan diperbarui releases dari sama underlying dataset di atas time — sementara staying backward-compatible dengan DCAT 2. jika Anda’re tidak sudah menggunakan itu fitur, DCAT 2-style metadata tidak perlu sebuah upgrade hanya karena DCAT 3 ada.
AI summary
sebuah condensed take pada Advanced versi:
- Apa ini adalah:
schema.org/Datasetmarkup (biasanya JSON-LD) itu mendeskripsikan sebuah data collection — research data, government/civic data, ML training sets — so ini dapat menjadi ditemukan. - ** single sebagian besar penting poin:** ini melakukan tidak produce sebuah mainstream Google web-penelusuran rich snippet. sebuah November 5, 2025 Google Search Central documentation perbarui explicitly scoped Dataset data terstruktur untuk Google Dataset Penelusuran (datasetsearch.research.google.com), sebuah terpisah destination Google dibangun untuk researchers dan data scientists — tidak mainstream Google Search.
- diperlukan properties (Google’s Dataset Penelusuran profile): hanya dua —
description(50–5000 characters, dari yang Dataset Penelusuran membaca hanya pertama 5000) danname. sebuah deskripsi di bawah 50 atau di atas 5 000 characters fails. diperiksa sebagai dari 2026-07-16. - Recommended, tetapi muat-bearing di sini:
licensedanisAccessibleForFreepenting lebih daripada di sebagian besar CreativeWork jenis karena Dataset Penelusuran pengguna adalah weighing reuse — though license, access rights, dan legal rights adalah distinct layers per DCAT, dan markup tidak decide legal reuse rights (tidak legal advice). jugacreator,identifier,keywords,spatialCoverage,temporalCoverage,variableMeasured,distribution. - Dataset vs. distribution: sebuah dataset adalah described collection; sebuah
distribution (
DataDownload) adalah satu accessible representation dari ini — sama hubungan sebagai DCAT’sdcat:Distribution. DCAT 3 menambahkan versioning/series semantics pada top, backward-compatible dengan DCAT 2. - umum mistakes Google flags: duplicate/generic names (banyak “Snow depth” (terjemahan) “Snow depth”
datasets undisambiguated —
nameuniqueness adalah critical), incomplete license URLs, unexpectedcsvw:Tablenilai. - Siapa seharusnya gunakan ini: research institutions,.gov/.edu open-data portals,
Kaggle-style ML dataset hosts, journals dengan supplementary data. Tidak typical
commercial situs dengan Tidak literal dataset — dan marking up sebuah arbitrary downloadable
file sebagai sebuah
Datasetadalah misuse. - Myth corrected: ini adalah tidak “hanya untuk government data” (terjemahan) “hanya untuk government data” — Google’s own framing spans life sciences, social sciences, ML, dan civic/government data. dan ini adalah tidak sebuah umum SEO peringkat atau rich-hasil tactic; ini adalah sebuah niche distribution play untuk sebuah spesifik audience.
Dokumentasi resmi
Utama-sumber documentation dari mesin pencari.
Google — data terstruktur
- Dataset data terstruktur — authoritative reference: diperlukan
name/description, penuh recommended-property list, dan umum-mistakes guidance (duplicate names, license URLs,csvw:Table). - data terstruktur penelusuran gallery — penuh catalog dari Google’s structured-data fitur, menunjukkan di mana Dataset (dan -nya terpisah Dataset Penelusuran destination) sits relative untuk pada-SERP rich hasil.
- Rich hasil Test — Google explicitly poin Dataset publishers di sini, tetapi treat ini sebagai sebuah periksa dari Google-didukung fitur eligibility dan Dataset-spesifik issues, tidak sebuah universal schema.org validator, dan tidak proof itu sebuah Dataset Penelusuran listing akan sebenarnya muncul.
- Google Dataset Penelusuran — sebenarnya destination ini markup feeds; browse ini untuk see apa sebuah well-marked-up dataset looks like akibatnya.
Bing / Microsoft
- Marking up Anda situs dengan data terstruktur — Bing’s umum structured-data mendukung (schema.org, JSON-LD recommended).
Quotes dari sumber
pada—record statements dari Google. Di mana sebuah sumber halaman exposes text, tautan adalah sebuah deep tautan itu jumps untuk quoted passage.
Google docs — apa markup adalah untuk
- “Datasets are easier to find in the Dataset Search tool when you provide supporting information such as their name, description, creator and distribution formats as structured data.” (terjemahan) “Datasets adalah easier untuk temukan di Dataset Penelusuran alat ketika Anda menyediakan supporting informasi such sebagai mereka name, deskripsi, creator dan distribution formats sebagai data terstruktur.” Jump untuk quote
- “The purpose of this markup is to improve discovery of datasets from fields such as life sciences, social sciences, machine learning, civic and government data, and more.” (terjemahan) “ purpose dari ini markup adalah untuk meningkatkan penemuan dari datasets dari fields such sebagai life sciences, social sciences, pembelajaran mesin, civic dan government data, dan lebih.” Jump untuk quote
Dataset schema myths dan mistakes untuk hindari
Myth: “Dataset schema gets me a rich snippet in regular Google search results.” (terjemahan) “Dataset schema mendapatkan me sebuah rich snippet di regular Google hasil pencarian.” salah — dan ini adalah mistake itu mengirim wrong orang down ini path. Dataset schema feeds Google Dataset Penelusuran (datasetsearch.research.google.com), sebuah terpisah alat sebagian besar everyday searchers tidak pernah open. ini melakukan tidak enhance bagaimana Anda halaman looks di mainstream SERP. jika sebuah umum-penelusuran rich hasil adalah apa Anda’re setelah, Dataset adalah wrong jenis entirely.
Myth: “Dataset schema is only for government data.” (terjemahan) “Dataset schema adalah hanya untuk government data.” salah. Google’s own framing adalah jelas itu ini covers “life sciences, social sciences, machine learning, civic and government data, and more.” (terjemahan) “life sciences, social sciences, pembelajaran mesin, civic dan government data, dan lebih.” Government open data adalah satu penting gunakan case, tidak boundary.
Myth: “Any downloadable file on my site is a dataset.” (terjemahan) “apa pun downloadable file pada my situs adalah sebuah dataset.”
Tidak. sebuah random PDF, sebuah marketing spreadsheet, atau sebuah downloadable brochure adalah tidak sebuah
Dataset. Google’s guidance implies sebuah nyata, data terstruktur collection. Marking up
arbitrary downloads sebagai datasets adalah misuse dan tidak akan help Anda.
Mistake: duplicate atau generic name nilai.
Google secara khusus flags ini — banyak undisambiguated “Snow depth” (terjemahan) “Snow depth” datasets dari
berbeda providers become indistinguishable. Uniqueness di name penting lebih di sini
daripada di hampir apa pun lainnya schema jenis; encode provider, region, atau time range.
Mistake: sebuah description di luar 50–5 000 character window.
sebuah satu-liner di bawah 50 characters dan sebuah giant data dictionary di atas 5 000 keduanya fail
validation. Tulis sebuah nyata, human summary di itu range.
Mistake: incomplete atau non-resolving license URLs.
license adalah field Anda research audience sebagian besar ingin untuk periksa sebelum reusing
data. sebuah truncated atau rusak license tautan undermines single sebagian besar valuable
recommended property untuk ini jenis.
Mistake: overselling ini untuk sebuah client siapa memiliki Tidak dataset. jika situs publishes prose, products, atau services — tidak literal data collections — Dataset schema melakukan tidak ada apa pun untuk ini. Recommending ini di luar -nya nyata gunakan case adalah sebagian besar umum cara ini jenis mendapatkan misapplied.
Dataset schema cheat sheet
** satu framing untuk tidak pernah forget**
Dataset schema → Google Dataset Penelusuran (datasetsearch.research.google.com), sebuah terpisah alat. Tidak sebuah mainstream web-penelusuran rich snippet.
diperlukan (hanya dua)
| Property | Constraint |
|---|---|
name | harus menjadi spesifik/unique (hindari generic repeats like “Snow depth” (terjemahan) “Snow depth”) |
description | 50–5 000 characters |
Recommended — muat-bearing ones untuk ini audience
| Property | mengapa ini penting di sini |
|---|---|
license | pengguna weigh reuse; gunakan menyelesaikan URL. License ≠ access rights ≠ lainnya rights — DCAT mempertahankan ini terpisah, dan markup tidak legal advice |
isAccessibleForFree | Free-untuk-access adalah sebuah reuse decision factor |
creator / funder / citation | Provenance dan cara cite |
identifier | DOI atau persistent ID |
keywords / variableMeasured | Apa data covers dan measures |
spatialCoverage / temporalCoverage | Di mana dan ketika data applies |
distribution | sebenarnya download formats (DataDownload) |
umum mistakes Google flags
- Duplicate / generic
namenilai ( “Snow depth” (terjemahan) “Snow depth” masalah). - Incomplete atau non-resolving
licenseURLs. - Unexpected
csvw:Tablenilai. descriptiondi bawah 50 atau di atas 5 000 characters.
Fit periksa
| baik fit | Poor fit |
|---|---|
| Research institutions,.edu | Blogs / konten situs dengan Tidak data |
| .gov / civic open-data portals | Ecommerce stores |
| ML dataset hosts (Kaggle-style) | Marketing PDFs marked sebagai “datasets” (terjemahan) “datasets” |
| Journals dengan supplementary data | Apa pun dengan Tidak literal dataset |
Fast facts
- Format: JSON-LD (recommended).
- Fields covered: life sciences, social sciences, ML, civic/government — tidak government-hanya.
- Payoff surface: Dataset Penelusuran, tidak main SERP.
- Tidak Bing equivalent untuk Dataset Penelusuran turned up di ini research.
- Nov 5, 2025: Google documentation explicitly clarified Dataset adalah Dataset-Penelusuran-hanya.
seharusnya I gunakan Dataset schema di semua?
berfungsi down pertanyaan honestly — ini jenis adalah easy untuk misapply.
1. melakukan halaman publish sebuah nyata, data terstruktur collection (research data, civic/government data, sebuah ML training set, journal supplementary data)?
- Tidak — ini adalah prose, sebuah product, sebuah service, atau sebuah arbitrary downloadable file → Dataset schema adalah tidak untuk Anda. gunakan right CreativeWork jenis (artikel untuk prose, Book untuk sebuah book) atau none. jangan force ini.
- Ya → continue.
2. adalah Anda hoping ini mendapatkan Anda sebuah richer listing di wajar Google penelusuran?
- Ya → reset Anda expectations. Dataset schema melakukan tidak melakukan itu. ini feeds Dataset Penelusuran, sebuah terpisah alat. jika sebuah mainstream rich hasil adalah goal, Anda’re looking di wrong schema jenis.
- Tidak — Anda ingin Anda dataset discoverable oleh researchers/data scientists di Dataset Penelusuran → continue; ini adalah persis right play.
3. melakukan Anda memiliki dua diperlukan properties?
nameitu adalah spesifik dan unique (tidak sebuah generic repeat), dandescriptionantara 50 dan 5 000 characters.- Missing either atau out dari range → perbaiki itu pertama; Anda’re tidak eligible jika tidak.
4. dapat Anda tambahkan reuse-critical recommended fields?
- tambahkan
license(menyelesaikan URL) danisAccessibleForFree— untuk ini audience ini adalah near-essential, since pengguna adalah deciding apakah mereka dapat legally reuse data. lalu layer dicreator,identifier,keywords,spatialCoverage,temporalCoverage, dandistribution.
5. sebelum Anda ship:
- Validate JSON-LD, konfirmasi
descriptionadalah di range, konfirmasinametidak sebuah generic duplicate, dan konfirmasilicenseURL resolves. - lalu periksa apakah dataset sebenarnya muncul di Google Dataset Penelusuran — itu’s destination, tidak main SERP.
aturan dari thumb: jika Anda dapat’t poin di sebuah literal dataset pada halaman, berhenti — ini jenis tidak satu Anda ingin.
Bersih vs. rusak Dataset JSON-LD
Quick model sebelum code: Dataset node di bawah mendeskripsikan collection
itself; single object di dalam distribution adalah satu accessible representation
dari ini (schema.org’s DataDownload, equivalent dari DCAT’s dcat:Distribution).
sebuah nyata dataset dapat memiliki several distributions — satu CSV, satu API endpoint, satu
ZIP — setiap potentially dengan -nya own contentUrl dan encodingFormat. See
Advanced tab untuk fuller Dataset → distribution → versi model, including mengapa
license dapat differ oleh distribution.
sebuah bersih, well-formed Dataset snippet
sebuah spesifik name, sebuah description comfortably di 50–5 000 range, sebuah menyelesaikan
license URL, free-access flag, coverage, dan sebuah nyata distribution:
{
"@context": "https://schema.org/",
"@type": "Dataset",
"name": "NOAA Daily Snow Depth — Colorado Front Range, 2010–2024",
"description": "Daily snow depth measurements in centimeters from 42 automated weather stations across Colorado's Front Range, collected between January 2010 and December 2024. Includes station identifiers, elevation, latitude/longitude, and quality-control flags for each reading.",
"url": "https://example.org/datasets/co-front-range-snow-depth",
"keywords": ["snow depth", "Colorado", "Front Range", "climate", "weather stations"],
"creator": {
"@type": "Organization",
"name": "Example Climate Research Institute",
"url": "https://example.org"
},
"license": "https://creativecommons.org/licenses/by/4.0/",
"isAccessibleForFree": true,
"identifier": "https://doi.org/10.1234/co-frontrange-snow-2024",
"temporalCoverage": "2010-01-01/2024-12-31",
"spatialCoverage": {
"@type": "Place",
"name": "Colorado Front Range, USA"
},
"variableMeasured": "snow depth (cm)",
"distribution": [
{
"@type": "DataDownload",
"encodingFormat": "text/csv",
"contentUrl": "https://example.org/datasets/co-front-range-snow-depth.csv"
}
]
}yang sama dataset, rusak
setiap line flagged di bawah adalah sebuah nyata, umum Dataset failure mode:
{
"@context": "https://schema.org/",
"@type": "Dataset",
"name": "Snow depth",
"description": "Snow data.",
"license": "creativecommons.org/licenses/by",
"isAccessibleForFree": "yes"
}apa wrong:
name: "Snow depth"— tepat generic-duplicate masalah Google panggilan out. Hundreds dari “Snow depth” (terjemahan) “Snow depth” datasets exist; tidak ada apa pun distinguishes yours. Encode provider, region, dan time range.description: "Snow data."— far di bawah 50-character minimum. Tulis sebuah nyata summary di 50–5 000 window.license: "creativecommons.org/licenses/by"— sebuah incomplete, non-resolving URL (Tidak scheme, Tidak versi). gunakan penuh URL likehttps://creativecommons.org/licenses/by/4.0/.isAccessibleForFree: "yes"— seharusnya menjadi sebuah booleantrue/false, tidak sebuah string.- Tidak
creator,distribution, atau coverage — technically masih valid dengan hanyaname+ sebuah fixeddescription, tetapi ini dataset memberikan Dataset Penelusuran pengguna hampir tidak ada apa pun untuk evaluate, cite, atau reuse.
Di mana payoff menampilkan up
Remember: sebuah bersih versi dari pertama snippet tidak perubahan bagaimana Anda halaman looks di ordinary Google penelusuran. -nya success menampilkan up di Google Dataset Penelusuran — penelusuran di sana untuk dataset setelah ini adalah terindeks untuk konfirmasi ini surfaced.
alat untuk writing, validating, dan testing Dataset markup
I’d mulai dengan my own Schema Markup Validator sebelum
touching apa pun else. Paste Anda Dataset JSON-LD di dan ini berjalan severity-tiered
structured-data memeriksa terhadap schema.org vocabulary dan Google’s rich-hasil
requirements, catches cross-block @id graph masalah, dan hands back sebuah corrected,
copy-pasteable JSON-LD block — berguna untuk catching persis failure modes ini
artikel covers, like sebuah description di luar 50–5 000 character window atau sebuah
malformed license string.
Rich-hasil Eligibility Checker adalah kedua
berhenti, dan ini adalah satu dibangun secara khusus untuk “am I sebenarnya eligible” (terjemahan) “am I sebenarnya eligible” pertanyaan.
Paste JSON-LD, paste sebuah penuh HTML halaman, atau fetch sebuah langsung URL, dan ini tells Anda per jenis
apakah halaman qualifies — untuk Dataset secara khusus ini memeriksa dua diperlukan
properties (name, description) dan flags recommended ones (creator,
license, distribution.contentUrl, identifier, sameAs, temporalCoverage,
spatialCoverage, variableMeasured, keywords, url) itu penting sebagian besar untuk sebuah
Dataset Penelusuran pengguna deciding apakah untuk reuse Anda data. ini juga carries yang sama
honest framing ini artikel melakukan: Dataset surfaces di Google Dataset Penelusuran rather
daripada sebagai sebuah standard pada-SERP rich hasil, so jangan expect sebuah mainstream-penelusuran preview
card.
jika Anda’re membangun markup dari scratch alih-alih memperbaiki existing markup, Schema Markup Generator covers Dataset among -nya penuh 921 vendored schema.org jenis — browse inherited properties dan yang diharapkan nilai ranges, dan export JSON-LD di whichever dari -nya six output formats Anda perlu. ini tidak akan hold Anda hand melalui Dataset-spesifik gotchas cara eligibility checker melakukan, tetapi ini adalah lebih cepat cara untuk mendapatkan sebuah structurally correct starting poin sebelum Anda jalankan ini melalui lainnya dua alat.
My suggested order untuk sebuah baru Dataset halaman: generate awal JSON-LD dengan Schema Markup Generator, validate ini dengan Schema Markup Validator, lalu konfirmasi eligibility (dan see persis yang recommended fields Anda’re masih missing) dengan Rich-hasil Eligibility Checker — sebelum Anda publish dan tunggu untuk Google Dataset Penelusuran untuk pick ini up.
Proving Anda Dataset markup sebenarnya took effect
Jalankan ini setelah Anda ship atau edit Dataset JSON-LD pada sebuah halaman — setiap satu adalah sebuah lulus/fail periksa dengan sebuah jelas rollback sinyal, tidak sebuah umum health periksa.
sebelum Anda test, mendapatkan penerbitan setup right. Google recommends placing
Dataset markup pada canonical dataset landing halaman — tidak pada setiap halaman itu
merely mentions dataset. jika yang sama dataset adalah described pada lebih daripada satu
halaman (sebuah mirror, sebuah partner situs, sebuah repository record), gunakan sameAs untuk poin di
canonical versi alih-alih duplicating penuh markup di mana-mana. dan tambahkan
dataset’s landing halaman untuk Anda sitemap — Google names ini sebagai sesuatu itu
helps penemuan, tidak sesuatu itu jaminan ini. None dari ini adalah diperlukan untuk
markup untuk validate, tetapi skipping ini adalah sebuah umum alasan jika tidak-bersih Dataset
markup underperforms.
Test 1: JSON-LD structural validity
Test untuk jalankan: paste halaman’s Dataset JSON-LD ke
Schema Markup Validator. Yang diharapkan hasil: Tidak
errors pada Dataset block — name dan description present, description
length di dalam 50–5 000 character window, dan apa pun license/distribution URLs
well-formed. Failure interpretation: sebuah error di sini hampir selalu traces untuk satu
dari three concrete mistakes ini artikel covers — sebuah description di luar
character window, sebuah license string itu tidak sebuah nyata URL, atau sebuah stray
csvw:Table nilai dari sebuah CSV-pada—Web export. Monitoring window: immediate —
ini adalah sebuah syntax periksa, tidak sebuah crawl-dependent sinyal. Rollback trigger: apa pun
error-severity finding; ship corrected JSON-LD validator hands back sebelum
moving untuk berikutnya test.
Test 2: Dataset rich-hasil eligibility
Test untuk jalankan: jalankan yang sama URL atau JSON-LD melalui
Rich-hasil Eligibility Checker dan open
Dataset fitur card. Yang diharapkan hasil: sebuah ✓ eligible verdict pada dua diperlukan
properties, dengan recommended-field list menunjukkan yang dari creator, license,
distribution.contentUrl, identifier, sameAs, temporalCoverage,
spatialCoverage, variableMeasured, keywords, dan url Anda’ve covered.
Failure interpretation: sebuah ✗ berarti satu dari dua diperlukan properties
(name atau description) adalah missing atau empty pada parsed node — periksa untuk sebuah
typo di property name atau sebuah nilai nested di mana checker dapat’t resolve ini.
Monitoring window: immediate, sama sebagai Test 1 — ini tidak bergantung pada Google
memiliki di-crawl halaman namun. Rollback trigger: sebuah ✗ pada either diperlukan property;
jangan pertimbangkan markup shippable until ini clears.
Test 3: Appearance di Google Dataset Penelusuran
Test untuk jalankan: penelusuran untuk Anda dataset’s tepat name (atau situs: Anda domain) di
Google Dataset Penelusuran setelah halaman
memiliki waktu untuk menjadi recrawled dan reindexed. Yang diharapkan hasil: Anda dataset
listing muncul, menunjukkan name, description, dan license Anda set —
confirming markup adalah tidak hanya valid tetapi sebenarnya picked up. Failure
interpretation: jika halaman tidak muncul setelah sebuah reasonable tunggu, periksa Penelusuran
Console untuk crawl/pengindeksan issues pada URL pertama — Dataset Penelusuran draws dari
Google’s regular indeks, so sebuah uncrawled atau noindexed halaman tidak akan tampilkan up regardless
dari bagaimana bersih JSON-LD adalah. Monitoring window: Google’s umum troubleshooting
guidance adalah untuk izinkan several days untuk recrawling dan reindexing sebelum
concluding sesuatu’s wrong — tetapi itu’s troubleshooting guidance, tidak sebuah committed
Dataset Penelusuran inclusion timeline, dan Google tidak jaminan inclusion di semua.
Rollback trigger: ada Tidak fixed deadline itu proves failure. jika Penelusuran
Console menampilkan halaman cleanly terindeks dan cukup time memiliki lulus itu Anda’d
reasonably expect sebuah periksa-di, re-verify canonical-landing-halaman dan sameAs
setup di atas, lalu re-periksa untuk duplicate/generic-name masalah Google
secara khusus flags — sebuah non-unique name adalah sebuah plausible alasan sebuah technically valid
dataset masih tidak stand out di Dataset Penelusuran. Treat non-appearance sebagai sebuah
prompt untuk re-audit Anda setup, tidak proof markup failed.
Uji pemahaman Anda: Dataset Schema
Five quick pertanyaan pada schema.org/Dataset, Dataset Penelusuran pembedaan, dan properties itu penting. Pick sebuah jawaban untuk setiap, lalu periksa.
Resources worth Anda time
My writing pada ini topic
I haven’t published sebuah standalone Dataset schema guide dari my own — so alih-alih poin Anda di sesuatu itu tidak exist, honest move adalah untuk kirim Anda untuk utama sources di bawah dan untuk related structured-data berfungsi pada ini situs. untuk lebih luas vocabulary dan di mana Dataset fits among Creative berfungsi jenis, see Schema Markup dan data terstruktur hubs; untuk machine-readability angle, Schema Markup untuk AI.
dari sekitar industry
- Dataset data terstruktur (Google Search Central) — authoritative reference: diperlukan
name/description, recommended-property list, dan umum-mistakes guidance. - Google Dataset Penelusuran (Google) — sebenarnya destination ini markup feeds; browse ini untuk memahami apa sebuah baik hasil looks like.
- data terstruktur penelusuran gallery (Google) — penuh fitur catalog, berguna untuk seeing itu Dataset sits apart dari pada-SERP rich hasil.
- Apa adalah Schema Markup? cara tambahkan ini & mengapa ini penting (Ahrefs) — sebuah solid umum schema guide.
Log perubahan
Diperbarui 8 Agu 2026.
Ringkasan editorial dan detail perubahan yang tercatat.Detail perubahan
-
Catatan perubahan terperinci saat ini tersedia dalam bahasa Inggris.
Perbandingan lengkap tidak tersedia — tidak ada cuplikan sebelumnya yang diarsipkan untuk revisi ini.
Diperbarui 17 Jul 2026.
Ringkasan editorial dan detail perubahan yang tercatat.Detail perubahan
-
Catatan perubahan terperinci saat ini tersedia dalam bahasa Inggris.
-
Catatan perubahan terperinci saat ini tersedia dalam bahasa Inggris.
-
Catatan perubahan terperinci saat ini tersedia dalam bahasa Inggris.
Perbandingan lengkap tidak tersedia — tidak ada cuplikan sebelumnya yang diarsipkan untuk revisi ini.