Dataset Şeması

schema.org/Dataset işaretlemesinin nasıl uygulanacağı, zorunlu description ve name özellikleri, Dataset şemasının ana web aramasında zengin snippet yerine neden Google'ın ayrı Dataset Search aracını beslediği, bunu gerçekte kimlerin kullanması gerektiği ve Google'ın belirttiği yaygın hatalar.

İlk yayın tarihi: 1 Tem 2026 · Son güncelleme: 9 Ağu 2026 · Advanced
Diller
Bu sayfada 1 kanıt sinyali

Dataset şeması (schema.org/Dataset), bir veri koleksiyonunu Google'ın datasetsearch.research.google.com adresindeki özel Dataset Search aracında görünebilmesi için işaretleyen yapılandırılmış veridir. Google, Kasım 2025'teki bir belge güncellemesinde Dataset yapılandırılmış verilerinin ana Google Arama'ya değil Dataset Search'e yönelik olduğunu açıkladı. Bu işaretleme, normal Google aramalarında gördüğünüz türden bir zengin snippet üretmez; Google'ın kendi belirttiği amaca göre araştırmacılar, veri bilimciler ve benzer kitleler için oluşturduğu ayrı bir hedefi besler. Google'ın güncel Dataset Search profilinde yalnızca iki özellik zorunludur: description (50 ila 5 000 karakter; Dataset Search yalnızca ilk 5 000 karakteri okur) ve name. Dataset Search kullanıcıları verilerin yeniden kullanılabilir görünüp görünmediğini sıklıkla değerlendirdiği için license/isAccessibleForFree burada önem taşır; ancak işaretlemenin kendisi yasal yeniden kullanım haklarını belirlemez. Google, birbirinden ayrıştırılmamış çok sayıdaki Snow depth veri kümesi gibi yinelenen genel adları gerçek bir sorun olarak özellikle belirtir. Bu, araştırma kurumları, .gov/.edu açık veri portalları, ML veri kümesi barındırıcıları ve tamamlayıcı veriler sunan dergiler için niş bir uygulamadır; genel bir SEO sıralama veya zengin sonuç taktiği değildir. Sitenizde yayımlanacak gerçek bir veri kümesi yoksa bu işaretleme size uygun değildir.

TL;DR — schema.org/Dataset işaretlemesi (genellikle JSON-LD), bir veri koleksiyonu sayfasının Google Dataset Search (datasetsearch.research.google.com) içinde keşfedilmesini sağlar. Google Search Central belgelerinde 5 Kasım 2025 tarihinde yapılan güncelleme, Dataset yapılandırılmış verilerinin ana Google Arama için değil, Dataset Search için olduğunu açıkça belirtti. Bu nedenle onu genel SERP zengin snippet’i değil, ayrı bir hedef olarak değerlendirin. Google’ın güncel Dataset Search profili description (50–5 000 karakter; Dataset Search bunun yalnızca ilk 5 000 karakterini okur) ve name alanlarını zorunlu tutar. Dataset Search kullanıcıları yeniden kullanım olanaklarını değerlendirdiği için license ve isAccessibleForFree, çoğu CreativeWork türüne kıyasla burada daha önemlidir. Bununla birlikte lisans, erişim hakları ve yasal haklar ayrı katmanlardır; işaretleme yasal yeniden kullanıma karar vermez (bu, hukuki tavsiye değildir). Google, yinelenen genel adları (birbirinden ayrıştırılmamış çok sayıda “Snow depth” veri kümesi) ve eksik lisans URL’lerini gerçek hayattaki hata biçimleri olarak özellikle belirtir. Bu; yaşam bilimleri, sosyal bilimler, ML ve yurttaşlık/kamu verileri yayımlayanlar için niş bir uygulamadır, genel bir SEO sıralama taktiği değildir. Sitenizde gerçek bir veri kümesi yoksa bu tür size uygun değildir ve hiçbir işaretleme bunu değiştiremez. Evidence for this claim Schema.org Dataset represents a body of structured information and defines dataset-specific metadata properties. Scope: Schema.org Dataset vocabulary. Confidence: high · Verified: Schema.org: Dataset Evidence for this claim Google documents Dataset structured data for dataset discovery and requires page content and markup to describe a dataset; markup does not guarantee appearance. Scope: Current Google Dataset structured-data guidance. Confidence: high · Verified: Google Search Central: Dataset structured data

Dataset şemasının gerçekte yaptığı — Dataset Search ayrımı

Rakip içeriklerin çoğu bu çerçeveyi yanlış kuruyor; bu yüzden açık konuşacağım: Dataset şeması, ana Google web aramasındaki bir zengin sonucu beslemez. Ana SERP’den ayrı, kendi adresinde (datasetsearch.research.google.com) çalışan özel bir araç olan Google Dataset Search’ü besler. Google bunu örtük bırakmak yerine açıkça belirtti: Google Search Central’ın belge güncellemeleri günlüğünde 5 Kasım 2025 tarihli bir kayıt, Dataset yapılandırılmış verilerinin Google Arama’nın kendisi tarafından değil, yalnızca Dataset Search tarafından kullanıldığını açıkladı. Dataset Search, araştırmacıların, veri bilimcilerin ve analistlerin veri bulmaları gerektiğinde başvurduğu araçtır; Dataset şeması da veri kümenizi bu dizine taşıyan sinyaldir. Bu sayfanın başka hiçbir yerinde Dataset’i ana akım bir zengin sonuç olarak adlandırmayacağım; önemli olan yukarıdaki ayrımdır. Evidence for this claim Google currently scopes Dataset structured data to Google Dataset Search and explicitly clarified that it is not used by mainstream Google Search. Scope: web Confidence: high · Verified: Latest Google Search documentation updates

Google’ın kendi çerçevesi zengin snippet’e değil, keşif aracına odaklanır: “Datasets are easier to find in the Dataset Search tool when you provide supporting information such as their name, description, creator and distribution formats as structured data.” Bunu dikkatle okuyun: “Dataset Search aracında daha kolay bulunur” diyor; “Arama’da zengin sonuç kazanır” demiyor. Bu ayrım, makalenin temel noktasıdır.

Zorunlu ve önerilen özellikler

Bunlar, genel schema.org/Dataset söz dağarcığından daha dar olan ve özellikle Google’ın aracının denetlediği unsurları kapsayan Google’ın güncel Dataset Search tüketici profili gereksinimleridir. Google’ın belgeleriyle 2026-07-16 tarihinde karşılaştırılmıştır. Evidence for this claim Schema.org Dataset is a CreativeWork subtype for a body of structured information about topics; Google's Dataset consumer profile is a narrower platform-specific subset of that vocabulary. Scope: web Confidence: high · Verified: Dataset

Google’ın Dataset Search profilinin zorunlu tuttuğu özellikler (ikisi de bulunmalıdır; aksi takdirde uygun sayılmazsınız):

  • name — veri kümesinin başlığı.
  • description50 ile 5 000 karakter arasında olmalıdır. Bu uzunluk aralığı, insanların sıkça takıldığı kesin bir kısıttır: 50 karakterden kısa tek satırlık açıklama doğrulamadan geçmez; 5 000 karakteri aşan devasa bir veri sözlüğü de reddedilir. Dataset Search, bunun gibi metinsel özelliklerin yalnızca ilk 5 000 karakterini okur. Bu sınırın ötesindeki içerik kullanılmadığından önemli bilgileri sona gömmeyin.

Google’ın profilinde önerilen özellikler — ve burada çoğu CreativeWork türüne kıyasla daha fazla önem taşıyanlar:

  • license — tercihen lisansa yönlendiren temiz ve eksiksiz bir URL olarak yeniden kullanım koşulları. Dataset Search kullanıcıları çoğunlukla verilerin kendi amaçları doğrultusunda yeniden kullanılabilir olup olmadığını değerlendirmeye çalışır. Bu nedenle eksik veya belirtilmemiş bir lisans, kozmetik değil gerçek bir sorundur. (“Lisansın” neden hukuki tablonun tamamı olmadığını aşağıda açıklıyorum.)
  • isAccessibleForFree — erişimin ücretsiz olup olmadığı. Gerekçe yine yeniden kullanım değerlendirmesidir.
  • creator, funder, citation — kaynağın geçmişi ve nasıl atıf yapılacağı.
  • identifier — DOI veya kalıcı başka bir kimlik.
  • keywords, variableMeasured — verilerin neleri kapsadığı ve ölçtüğü.
  • spatialCoverage, temporalCoverage — verilerin coğrafi ve zamansal kapsamı.
  • distribution — gerçek indirme/erişim biçimleri (contentUrl ve encodingFormat içeren DataDownload nesneleri).
  • hasPart / isPartOf, sameAs, measurementTechnique, alternateName, version, url.

Google’ın özellikle belirttiği yaygın hatalar

Google’ın belgeleri somut, gerçek hayatta karşılaşılan hata biçimlerini belirtir; bunlar varsayımsal değildir:

  • Yinelenen / genel veri kümesi adları. Klasik örnek, farklı sağlayıcılara ait ve birbirinden ayrıştırılmadan “Snow depth” adı verilmiş çok sayıda veri kümesidir. Bu durum, büyük ölçekte veri kümelerini Dataset Search içinde ayırt edilemez hale getirir. name değerinin benzersizliği, neredeyse tüm diğer şema türlerinden daha fazla önem taşır; sağlayıcıyı, bölgeyi veya zaman aralığını ada dahil edin.
  • Eksik lisans URL’leri. Kesilmiş veya çözümlenmeyen bir lisans bağlantısı, kitlenizin en çok kontrol etmek istediği tek alanı zayıflatır.
  • Beklenmeyen csvw:Table değerleri. Hatalı CSV on the Web meta verileri, belgelenmiş bir hata kaynağıdır. Bununla birlikte DCAT belgeleri, söz konusu uyarının açıkladıkları koşul altında göz ardı edilebileceğini belirtir; bunun geçerli olduğunu varsaymadan önce kendi durumunuzu belgelerle karşılaştırın.

Lisans, erişim hakları ve işaretlemenin karar vermediği konular

Bu noktada çoğu şema açıklamasından daha dikkatli olmak istiyorum. Lisans, erişim hakları ve diğer haklara ilişkin meta veriler, hepsini temsil eden tek bir alan değil, ayrı katmanlardır. Bu ayrım yalnızca schema.org’un kendisinden değil, schema.org/Dataset’in birlikte çalıştığı Veri Kataloğu Söz Dağarcığı DCAT’tan gelir:

  • license, Google’ın Dataset Search profilinin denetlediği yeniden kullanım koşullarını açıklar.
  • Erişim hakları (verilere kimlerin erişebileceği) ve diğer haklar (atıf ve lisansın ötesindeki kısıtlamalar), DCAT’ın lisansla birlikte izlediği ayrı konulardır.
  • Bir veri kümesi veri kümesi düzeyinde bir lisansa, dağıtım düzeyinde ise farklı bir lisansa sahip olabilir (aşağıdaki veri kümesi-dağıtım modeline bakın). DCAT, veri kümesi ve dağıtım düzeyindeki çelişkili lisans beyanlarının yeniden kullanımı değerlendiren kişileri yanıltabileceği konusunda açıkça uyarır. Birden fazla dağıtım yayımlıyorsanız lisanslarının veri kümesi düzeyindeki lisansla uyumlu olduğundan veya kapsamlarının bilinçli ve açık biçimde farklı belirlendiğinden emin olun.

Bunların hiçbiri hukuki tavsiye değildir ve işaretlemenin kendisi yasal yeniden kullanım haklarına karar vermez. Bir license özelliği eklemek, koşullara makinece okunabilir bir yönlendirme sağlar; lisans vermez, haklardan feragat etmez veya çelişkili bir iddiayı çözmez. Yeniden kullanım koşulları bir veri kümesi için gerçekten önemliyse — bu kitle açısından genellikle önemlidir — lisans metnini doğru hazırlayın. Belirsizliğin veya riskin yüksek olduğu durumlarda yalnızca şema alanına güvenmek yerine kullanıcıları gerçek hukuki yönlendirmelere sevk edin.

Bunu gerçekte kimler uygulamalı?

Niş bir türü abartılı biçimde pazarlamak yerine uygunluğu konusunda dürüst olmak istiyorum:

Uygun:

  • Çalışma verileri yayımlayan araştırma kurumları ve .edu siteleri.
  • Kamu kurumlarının / yurttaşlık girişimlerinin açık veri portalları (.gov ve eşdeğerleri).
  • ML / veri bilimi veri kümelerini barındıran Kaggle tarzı depolar.
  • Makalelerin yanında tamamlayıcı veri kümeleri sunan bilimsel dergiler.
  • Bir haberin dayandığı verileri yayımlayan bilim gazeteciliği siteleri.

Uygun değil:

  • Yayımlayacak gerçek bir veri kümesi bulunmayan tipik ticari içerik siteleri, bloglar veya mağazalar. Bunun normal arama trafiğinize yardımcı olan bir sürümü yoktur. Rastgele indirilebilir bir PDF’yi veya elektronik tabloyu Dataset olarak işaretlemek kötüye kullanımdır; Google’ın rehberi, herhangi bir indirilebilir dosyayı değil, gerçek ve yapılandırılmış bir veri koleksiyonunu ifade eder.

Google’ın kendi sözleriyle amaç, araştırma ve veri alanları içinde geniştir: “The purpose of this markup is to improve discovery of datasets from fields such as life sciences, social sciences, machine learning, civic and government data, and more.” Bu çerçeve yaygın bir yanılgıyı ortadan kaldırır: bu, “yalnızca kamu verileri için” değildir. Yaşam bilimlerini, sosyal bilimleri, ML’yi ve yurttaşlık/kamu verilerini kapsar. Yine de kapsamı gerçek veri kümeleriyle sınırlıdır.

Dataset’in şema ailesindeki yeri

Dataset; Article, Book ve medya nesnesi türleri gibi kardeşlerle birlikte Creative Works ailesinde yer alır. Özellikle yapılandırılmış veri koleksiyonlarına yönelik CreativeWork alt türüdür. Yayımladığınız şey düzyazıysa Article; kitapsa Book; sorgulanabilir/indirilebilir bir veri koleksiyonuysa Dataset kullanın. Bunun daha geniş çerçevedeki yerini anlamak için bu makalenin altında bulunduğu Schema Markup ve Structured Data merkezleri iyi bir başlangıç noktasıdır.

Dataset → distribution → version modeli

JSON-LD’yi yazmadan önce kavramsal olarak şunu anlamaya değer: dataset, açıklanan şeyin, yani kavramsal koleksiyonun kendisidir. distribution, bunun erişilebilir bir temsilidir: CSV dışa aktarımı, JSON API veya ZIP arşivi gibi. Tek bir veri kümesinin birkaç dağıtımı olabilir. schema.org terimleriyle distribution özelliği içinde kullanılan DataDownload, DCAT’ın dcat:Distribution öğesinin eşdeğeridir; ilişki aynı, söz dağarcığı farklıdır. Lisans ve erişim bilgilerinin yalnızca veri kümesine göre değil, dağıtıma göre de farklılık gösterebilmesinin ve yukarıdaki bölümde yer alan çakışma uyarısının önemli olmasının nedeni budur. Evidence for this claim A dataset is the described collection; a distribution is an accessible representation or downloadable form. Schema.org DataDownload maps to dcat:Distribution, and one dataset can have multiple distributions. Scope: data catalogs Confidence: high · Verified: Data Catalog Vocabulary (DCAT) - Version 3

Buna ek olarak bir W3C Recommendation olan DCAT 3, aynı temel veri kümesinin zaman içinde güncellenmiş sürümlerini yayımladığınızda yararlı olan resmî sürümleme ve veri kümesi serisi anlamlarını eklerken DCAT 2 ile geriye dönük uyumluluğu korur. Bu özellikleri henüz kullanmıyorsanız sırf DCAT 3 var diye DCAT 2 tarzı meta verileri yükseltmeniz gerekmez.

Add an expert note

Pin an expert quote

New person? Create their unclaimed profile at /admin/experts/ → Pin a quote first.