Tarama Bütçesi
Crawl budget'ın gerçekte ne olduğu — tarama kapasitesi ile tarama talebinin birleşimi — onu neyin tükettiği ve sitenizin bu konuyla ilgilenmenizi gerektirecek kadar büyük olup olmadığını gösteren gerçekçi ölçüt.
Diller
Bu sayfada 1 kanıt sinyali
- İlgili canlı araçLog File Analyzer
Crawl budget, bir arama motorunun sitenizi ne kadar tarayabildiği ve taramak istediğidir — crawl capacity (sunucunuzun kaldırabileceği yük) ile crawl demand (popülerlik ve güncelliğini yitirme) çarpımına karşılık gelir. Bir sıralama faktörü değildir: daha çok taranmak konumları yükseltmez. Çoğu sitenin bunu yönetmesi gerekmez — Mueller, yüz bin URL'nin genellikle fark yaratmayacağını söylüyor; Google'ın kendi rehberi de küçük sitelerin veya sayfaları yayımlandığı gün taranan sitelerin bununla uğraşmamasını belirtiyor. Esas olarak 1 milyon veya daha fazla sayfada, her gün değişen 10 000 veya daha fazla sayfada ya da çok sayıda URL "Discovered – currently not indexed" durumunda beklediğinde önem kazanır. En büyük kaldıraç, bütçenin önemli URL'lere gitmesi için israfı (çok yönlü gezinme, yinelenen içerikler, yumuşak hata sayfaları ve sonsuz alanlar) ortadan kaldırmaktır.
TL;DR — Crawl budget, bir arama motorunun sitenizi taramaya istekli olduğu miktardır. Birbiriyle çarpılan iki şeyden oluşur: sunucunuzun kaldırabileceği miktar ve Google’ın taramak istediği miktar. Daha çok taranmak daha yüksek sıralama sağlamaz — üstelik çoğu site için bu konu sorun bile değildir. Sayfalarınız yayımladığınız gün taranıyorsa crawl budget probleminiz yoktur.
Crawl budget nedir
Bir arama motoru sitenizi taradığında sonsuza kadar taramaz. Belirli bir zaman aralığında URL’lerinizin bir kısmını tarar, sonra devam eder. SEO’ların crawl budget adını verdiği şey bu miktardır.
Bu, arama motorunun sürekli yanıtladığı iki soruya dayanır:
- Ne kadarını tarayabilirim? Sunucunuz yavaşlamadan veya hata vermeye başlamadan önce ancak belirli bir yükü kaldırabilir. Google bunu izler ve geri çekilir. Buna crawl capacity (eski belgelerde crawl rate limit) denir.
- Ne kadarını taramak istiyorum? Popüler sayfalar ve sık değişen sayfalar daha çok taranır. Hiçbir sitenin bağlantı vermediği veya hiç değişmeyen sayfalar seyrek taranır. Buna crawl demand denir.
İkisini çarptığınızda crawl budget’ı elde edersiniz: kabaca Google’ın tarayabildiği ve taramak istediği URL sayısı. Evidence for this claim Google defines crawl budget using crawl capacity limit and crawl demand. Scope: Google Search crawling for larger sites. Confidence: high · Verified: Google: Large site crawl budget guide
Başta yapılması gereken bir ayrım daha var: crawl budget, Google’ın bir URL’yi alıp almadığıyla ilgilidir. Sonra bulduğunu dizine ekleyip eklememesi ayrı ve daha sonraki bir karardır. Bir sayfa taranıp yine de dizine eklenmeyebilir — tarama dizine eklemeyi garanti etmez; yalnızca önce geçmeniz gereken kapıdır.
Önce anlaşılması gereken şey: muhtemelen bunun için endişelenmeniz gerekmiyor
Çoğu makalenin üstünü örttüğü kısım budur. Çoğu sitede crawl budget problemi yoktur. Google bunu doğrudan söylüyor — sayfalarınız yayımlandıkları gün taranıyorsa veya siteniz çok büyük ve hızlı değişen bir site değilse bu konunun tamamını atlayabilirsiniz. Evidence for this claim Google says sites without many rapidly changing pages, or whose pages are crawled the day they publish, generally do not need crawl-budget guidance. Scope: Google's rough applicability guidance, not a guarantee for every site. Confidence: high · Verified: Google: Large site crawl budget guide
Basit bir içgüdüsel kontrol: Google’da birkaç URL’nizi arayın veya Search Console’daki URL Inspection aracını kullanın. Yeni sayfalarınız bir veya iki gün içinde görünüyorsa crawl budget’ınız iyi durumdadır. Zamanınızı bunun yerine içerik ve bağlantılara ayırın.
Bir site yüz binlerce veya milyonlarca sayfaya sahip olduğunda, özellikle bunların çoğu sürekli değişiyorsa (büyük bir e-ticaret mağazası veya büyük bir haber sitesi gibi), crawl budget önem kazanmaya başlar.
Daha çok taranmak daha iyi sıralama anlamına gelmez
Erken ortadan kaldırmaya değer bir mit var: bir sayfanın daha sık taranması onu sonuçlarda yukarı taşımaz. Tarama, motorun sayfanızı bulup indirmesinin yoludur. Sıralanmak için geçmeniz gereken kapıdır — ancak bir kez geçtikten sonra yeniden ne sıklıkta tarandığınız bir sıralama faktörü değildir.
Dolayısıyla amaç “daha çok taranmak” değildir. Amaç, önemsediğiniz sayfaların tarandığından ve motorun zamanını değersiz URL’lerde boşa harcamadığından emin olmaktır.
Crawl budget’ı ne tüketir
Büyük bir siteniz varsa bütçe şunlar tarafından tüketilir:
- Filtreleme ve sıralama URL’leri (çok yönlü gezinme) — bir e-ticaret mağazasındaki her filtre kombinasyonu, birbirine çok benzeyen binlerce URL oluşturabilir.
- Yinelenen sayfalar — aynı içeriğe birden çok URL’den erişilmesi (
wwwile ve olmadan, eklenmiş parametrelerle vb.). - Soft hata sayfaları —
200 OKdurumu döndüren “bulunamadı” sayfaları; bu nedenle motor bunları taramayı sürdürür. - Bozuk yönlendirme zincirleri ve yavaş sayfalar — bunlar her taramanın maliyetini artırır.
Çözüm neredeyse her zaman bütçenin gerçek sayfalara gitmesi için israfı kaldırmaktır — Google’ı “daha çok” taramaya ikna etmeye çalışmak değil.
Tarama kapasitesi ile talebi, kesin boyut eşiklerini, faceted navigation konusunda ne yapılması gerektiğini, Bing’in bunu nasıl farklı ele aldığını ve nasıl ölçüleceğini kapsayan modelin tamamını mı istiyorsunuz? Advanced sekmesine geçin.
Evidence for this claim Google defines crawl budget using crawl capacity limit and crawl demand. Scope: Google Search crawling for larger sites. Confidence: high · Verified: Google: Large site crawl budget guideTL;DR — Crawl budget = crawl capacity limit (sunucunuzun kaldırabileceği yük) × crawl demand (popülerlik + güncelliğini yitirme + algılanan envanter). Bu, bir sıralama sinyali değil, verimlilik meselesidir. Sistem içinde site başına sabit bir kota olarak değil, sunucu yükünün sınırlandırdığı önem temelli bir zamanlama olarak işler. Çoğu site bunu görmezden gelebilir — Mueller, yüz bin URL’nin “usually not enough” olduğunu belirtirken Google, aynı gün taranan sayfalara sahip sitelerin rehberi atlamasını söylüyor. Sorun yaklaşık 1 milyon veya daha fazla sayfada (haftalık değişim), 10 000 veya daha fazla sayfada (günlük değişim) ya da “Discovered – currently not indexed” sayısı hızla arttığında ortaya çıkar. En etkili hamle; çok yönlü gezinme, yinelenen içerikler, yumuşak 404 sayfaları ve sonsuz alanlar gibi israfları azaltarak bütçeyi önemli URL’lerde yoğunlaştırmaktır.
İki faktörlü model
Google bunu net biçimde tanımlar: “The amount of time and resources that Google devotes to crawling a site is commonly called the site’s crawl budget and it’s determined by two main elements: crawl capacity limit and crawl demand.” Gary Illyes’in 2017’deki çerçevesi, hâlâ başvurduğum tek cümlelik açıklamadır: crawl budget, “the number of URLs Googlebot can and wants to crawl.” Evidence for this claim Google defines crawl budget using crawl capacity limit and crawl demand. Scope: Google Search crawling for larger sites. Confidence: high · Verified: Google: Large site crawl budget guide Kapsamı böyle tutun: crawl budget getirmeyi yönetir, dizine eklemeyi değil. Taranan bir URL ayrı bir dizine ekleme kararından geçer — ikisini birleştirmek crawl budget’ın kontrol ettiği şeyi abartır.
Crawl capacity limit (arz tarafı). Bu, “the maximum number of simultaneous parallel connections that Google can use to crawl a site, as well as the time delay between fetches.” olarak tanımlanır. Sunucunuzun durumuna göre değişir. Hızlı ve hatasız yanıtlar verdiğinizde limit yükselir; yavaş yanıtlar, 5xx hataları veya 429 durumları döndürdüğünüzde Googlebot geri çekilir. How Search Works sunumumda aynı hız sınırı tetikleyicilerini sıralıyorum: sunucu kararlılığı, yavaş yanıtlar, 5xx sunucu hataları ve 429 (çok fazla istek). Bu, “yapabilir” tarafıdır.
Crawl demand (talep tarafı). Popülerlik (bir URL’nin ne kadar bağlantı aldığı / ne kadar önemli olduğu) ve eskilik (son taramadan bu yana ne kadar zaman geçtiği, ne sıklıkta değiştiği) tarafından belirlenir. Aynı sunum talebi PageRank’e, sayfanın değişme sıklığına, son taramadan bu yana geçen zamana ve büyük site değişikliklerine ayırır. Kritik nokta, kontrol ettiğiniz başlıca kaldıraç olarak Google’ın algılanan envanteri işaret etmesidir: “Without guidance from you, Google tries to crawl all or most of the URLs that it knows about on your site. If many of these URLs are duplicates, or you don’t want them crawled for some other reason… this wastes a lot of Google crawling time on your site. This is the factor that you can positively control the most.”
Crawl demand comes from popularity, genuine change, and the value of the URL inventory. It orders URLs in a priority queue. Crawl capacity comes from server response speed, stability, and error behavior. It limits how far Googlebot proceeds through that queue. Their interaction is the site's realized crawl budget, not a fixed daily URL quota.
© Patrick Stox LLC · CC BY 4.0 ·
İnsanları şaşırtan birkaç yapısal gerçek:
- Bütçe ana makine adı başına belirlenir. “
https://www.example.com/andhttps://code.example.com/are two different hostnames, and therefore have separate crawl budgets.” Alt alan adları bütçeyi paylaşmaz. - Farklı Googlebot türleri muhtemelen tek bir havuzdan yararlanır. Kendi raporlamamda, görsel, haber, video ve reklam tarayıcılarıyla diğer tarayıcıların site başına aynı bütçeden yararlanıyor gibi göründüğünü görüyorum — bunu kesin olarak ortaya koyan güncel birincil Google kaynağı yok; bu nedenle belgelenmiş bir politika değil, uygulamacı gözlemi olarak değerlendirin. Her hâlükârda, bir türün diğerlerini dışladığından şüpheleniyorsanız Crawl Stats raporunun tarayıcı türüne göre dökümünü kontrol etmeye değer.
Sistem içinde gerçekte nasıl işler: öneme göre zamanlama
“Crawl budget”, SEO’ların oluşturduğu bir şemsiye terimdir. İçerideki süreç host yüküyle sınırlandırılmış zamanlamaya daha yakındır. Illyes’in anlattığı gibi Google’ın zamanlayıcısı “sets a bucket of URLs in importance order and GoogleBot will crawl in that order based on the schedule the host load decided. If Google thinks your server can handle it, it will crawl the whole bucket, if not, it will stop.”
Bu, konunun tamamını yeniden çerçeveler. Düz bir “günde N sayfa” kotası değildir — öncelikli bir kuyruktur ve tarama arama talebini izler. Illyes bir kez daha şöyle der: “If search demand goes down, then that also correlates to the crawl limit going down,” ve “if you want to increase how much we crawl, then you somehow have to convince search that your stuff is worth fetching, which is basically what the scheduler is listening to.” Search Relations ekibi “sabit günlük sayfa kotası” fikrini açıkça bir yanlış anlama olarak nitelendirmiştir.
Sitenizde gerçekten crawl budget problemi var mı?
Bu en değerli bölüm, bu yüzden açık konuşacağım: çoğu sitenin crawl budget için endişelenmesi gerekmez. Google’ın kendi rehberi şu yatıştırmayla başlar: “If your site doesn’t have a large number of pages that change rapidly, or if your pages seem to be crawled the same day that they are published, you don’t need to read this guide. For Google Search specifically, merely keeping your sitemap up to date and checking your index coverage regularly is adequate.” Evidence for this claim Google says sites without many rapidly changing pages, or whose pages are crawled the day they publish, generally do not need crawl-budget guidance. Scope: Google's rough applicability guidance, not a guarantee for every site. Confidence: high · Verified: Google: Large site crawl budget guide
John Mueller somut sayıyı verdi: “100k URLs is usually not enough to affect crawl budget (it’s <1/minute over 3 months).” URL sayınız altı haneli değilse ve sayfalar hızlıca taranıyorsa devam edin.
Önemli olduğu durumlarda Google’ın kabaca verdiği eşikler şunlardır:
- Büyük siteler — içeriği orta sıklıkta (yaklaşık haftalık) değişen 1 milyon+ benzersiz sayfa.
- Orta veya daha büyük siteler — çok hızlı değişen (günlük) içeriğe sahip 10 000+ benzersiz sayfa.
- Search Console’da URL’lerin büyük bir bölümü “Discovered – currently not indexed” olarak sınıflandırılan siteler — bu, Google’ın haberdar olduğu URL’lere ulaşamadığını gösteren uyarı ışığıdır.
Google, “the numbers given here are a rough estimate… not exact thresholds.” uyarısını ekler. Büyük sitelerde bile kendi çalışmamdan bildiğim nüans geçerlidir: genellikle geride kalanlar popüler sayfalarınız değil, yeni, az bağlantı verilmiş veya statik sayfalardır.
Crawl budget sıralamaları etkiler mi? Hayır.
Sıralanmak için tarama gereklidir, ancak tarama bir sıralama sinyali değildir. Google 2017’de şöyle dedi: “An increased crawl rate will not necessarily lead to better positions in Search results. Google uses hundreds of signals to rank the results, and while crawling is necessary for being in the results, it’s not a ranking signal.” Bunu Ahrefs rehberimde de şöyle ifade ediyorum: “More crawling doesn’t mean you’ll rank better, but if your pages aren’t crawled and indexed they aren’t going to rank at all.” Crawl budget’ı baştan sona bir verimlilik problemi olarak görün.
Crawl budget’ı tüketen etkenler
Illyes düşük değerli URL’lerin kanonik listesini “in order of significance” yayımladı:
- Çok yönlü gezinme ve oturum tanımlayıcıları — özellikle URL’leri kombinasyonlar hâlinde çoğaltan e-ticaret filtreleme/sıralama seçenekleri olmak üzere bir numaralı suçlu.
- Site içi yinelenen içerik — klasik teknik varyantlar: HTTP ve HTTPS, www olmayan ve www, sondaki eğik çizginin bulunması veya bulunmaması, büyük ve küçük harf, varsayılan/index sayfaları ve URL parametreleri. (Google’ın kendi iç tahminine göre web’in yaklaşık %60’ı yinelenen içeriktir.)
- Soft hata sayfaları —
200döndüren bu sayfalar sürekli taranır. - Ele geçirilmiş sayfalar.
- Sonsuz alanlar ve proxy’ler — takvimler, yinelenen içerik oluşturan sonsuz kaydırmalı sayfalama ve çok yönlü gezinme kombinasyonları; klasik örümcek tuzağı kalıpları.
- Düşük kaliteli içerik ve spam.
Maliyet somuttur: “Wasting server resources on pages like these will drain crawl activity from pages that do actually have value, which may cause a significant delay in discovering great content on a site.” Bunun üstüne uzun yönlendirme zincirleri “have a negative effect on crawling,” ve yavaş, ağır sayfalar her getirmeyi daha pahalı hâle getirir.
Nasıl optimize edilir
Bütün mesele bütçeyi önemli URL’lerde birleştirmektir:
- Yinelenen içerikleri birleştirin. Google: “Consolidate duplicate content to focus crawling on unique content rather than unique URLs.” Tek bir host, protokol ve sondaki eğik çizgi kuralı seçin; kanonikleştirme uygulayın ve parametreleri yönetin.
- Gerçekten değersiz yolları
robots.txtile engelleyin — ancak yalnızca hiçbir zaman taranmasını istemediğiniz yolları. Çok yönlü gezinme için olağan seçenekler, parametre yollarınırobots.txtiçinde engellemek veya URL’lerin en başta taranabilir olmaması için?yerine#kullanmaktır. - Bütçeden tasarruf etmek için
noindexkullanmayın. Google: “Don’t use noindex, as Google will still request, but then drop the page when it sees a noindex meta tag or header in the HTTP response, wasting crawling time.” İsteğin yine de bir maliyeti vardır. Bir içeriğin hiçbir zaman getirilmesini istemiyorsanız onurobots.txtile engelleyin. robots.txtdosyasının bütçeyi başka sayfalara yeniden tahsis etmesini beklemeyin. “Google won’t shift this newly available crawl budget to other pages unless Google is already hitting your site’s serving limit.” Değersiz URL’leri engellemek iyi bir düzenleme uygulamasıdır; ancak kapasite sınırına ulaşmadığınız sürece boşa çıkan taramalar iyi sayfalarınıza aktarılmaz.- Soft hata sayfalarını düzeltin; kaldırılan sayfalar için gerçek 404/410 durumları döndürün. “A 404 status code is a strong signal not to crawl that URL again.”
- Yönlendirme zincirlerini kısaltın, site haritalarını güncel tutun (doğru
lastmoddeğerleriyle) ve sunucu hızını iyileştirin. - Önemli ve yeni sayfalara giden dahili bağlantıları güçlendirin — tamamen sizin kontrolünüzde olduğundan bu, diğer her şeyden daha kolaydır.
Google’ın gerçekten bütçeyi artırabileceğinizi söylediği iki — yalnızca iki — yol vardır: “Add more server resources… [and] optimize your content’s quality.” Buradaki tuzağa dikkat edin: daha hızlı sunucu kapasite tavanını yükseltir, ancak talep düşükse Google daha az tarar. İkisine de ihtiyacınız var.
Nasıl ölçülür
- GSC > Settings > Crawl Stats raporu — zaman içindeki toplam tarama istekleri, ortalama yanıt süresi, host durumu ve yanıt kodu, dosya türü ve Googlebot türüne göre dökümler. Google’ın sizi nasıl taradığına dair kendi görünümüdür.
- Sunucu günlük dosyası analizi — gerçeğin kendisi. URL kalıbına göre gerçek Googlebot isteklerini görür, böylece tarama israfını ve taranmamış önemli sayfaları bulabilirsiniz. Ters + ileri DNS veya Google’ın yayımlanmış IP aralıklarıyla botun gerçekten Googlebot olduğunu doğrulayın (user-agent’i taklit eden çok sayıda sahte bot vardır).
- GSC’deki “Discovered – currently not indexed” — burada büyüyen yığını bir crawl-budget uyarı ışığı olarak görün: Google URL’leri biliyor, ancak onlara ulaşamıyor.
In a synthetic cohort, product pages are 28 percent of the URL inventory, 24 percent of Googlebot requests, and 52 percent of useful 200 responses. Category pages are 7, 10, and 21 percent. Facet URLs are 45, 61, and 8 percent. Gone URLs are 20, 5, and 0 percent. The figures illustrate comparison logic, not a live log sample.
Bing ve diğer motorlar: “crawl efficiency”
Bing, konuyu bütçe yerine crawl efficiency olarak yeniden çerçeveler. Fabrice Canel’in tanımı şöyledir: “The crawl efficiency is how often we crawl and discover new and fresh content per page crawled.” Amaç “crawl an URL only when the content has been added (URL not crawled before), updated (fresh on-page context or useful outbound links).” Bing’in doğrudan felsefesi: “Less is more for SEO. Never forget that. Less URLs to crawl, better for SEO.”
Bing’in tercih ettiği çözüm IndexNow’dır — değişen URL’leri göndererek bingbot’un keşif amaçlı taramalar yapma ihtiyacını ortadan kaldırır — ve Bing Webmaster Tools’taki Crawl Control özelliğidir; bu özellik, sunucu yükünü korumak için bingbot’un tarama saatlerini planlamanızı sağlar. Burada Google ile Bing arasında kayda değer bir fark vardır: Google, Search Console’daki eski crawl-rate limiter özelliğini kullanımdan kaldırırken Bing tarama zamanlamasını etkin biçimde şekillendirmenize hâlâ izin verir.
Düzeltilmiş crawl budget mitleri
- “Her site crawl budget’ı optimize etmelidir.” Hayır — çoğu site etmemelidir. Aynı gün taranmak ve yüz binden az URL’ye sahip olmak, sorun yaşamadığınız anlamına gelir.
- “Daha çok tarama = daha iyi sıralamalar.” Hayır. Tarama gereklidir ancak bir sıralama sinyali değildir.
- “Bu, sabit bir günlük sayfa kotasıdır.” Hayır — sunucu yüküyle sınırlandırılan, önem temelli bir zamanlamadır.
- “Bütçeden tasarruf etmek için
noindexkullanın.” Hayır — Google önce yine de sayfayı ister. - “Diğer sayfalara daha fazla bütçe vermek için sayfaları
robots.txtiçinde engelleyin.” Sunum limitinize zaten ulaşmadığınız sürece genellikle hayır. - “Daha hızlı bir sunucu tek başına bütçenizi artırır.” Yalnızca kapasite tavanını yükseltir; düşük talep yine daha az tarama demektir.
Bunun parçası olduğu daha geniş süreç — keşif, tarama zamanlayıcısı, oluşturma ve taramanın dizine eklemeden nasıl ayrıldığı — için tarama merkezine bakın. İlgili konuların her biri (tarama hızı, tarama sıklığı, örümcek tuzakları ve günlük dosyası analizi) bu sürecin bir parçasını daha ayrıntılı ele alır.
AI özeti
Advanced sürümün kısaltılmış özeti:
- Crawl budget = crawl capacity limit × crawl demand. Kapasite, sunucunuzun kaldırabileceği yüktür (hızlı ve hatasız yanıtlarda yükselir,
5xx/429durumlarında düşer); talep ise popülerlik + güncelliğini yitirme + algılanan envanterdir. Google’ın tek cümlelik tanımı: “the number of URLs Googlebot can and wants to crawl.” - Bir sıralama faktörü değildir. Sıralanmak için tarama gereklidir ancak daha çok tarama konumları yükseltmez — bu yalnızca bir verimlilik meselesidir.
- Sistem içinde, sunucu yüküyle sınırlandırılan önem temelli bir zamanlamadır — sabit günlük sayfa kotası değil, öncelikli bir kuyruktur. Tarama, arama talebini izler.
- Çoğu sitenin bunu yönetmesi gerekmez. Mueller’a göre yüz bin URL genellikle etkili olacak kadar çok değildir. Google’a göre sayfalar aynı gün taranıyorsa rehberi atlayabilirsiniz. Sorun yaklaşık 1 milyon veya daha fazla sayfada (haftalık değişim), 10 000 veya daha fazla sayfada (günlük değişim) ya da büyük bir “Discovered – currently not indexed” yığını bulunduğunda ortaya çıkar.
- Neyi tüketir (Google’ın sırası): çok yönlü gezinme / oturum kimlikleri, yinelenen içerik, yumuşak hata sayfaları, ele geçirilmiş sayfalar, sonsuz alanlar ve düşük kaliteli içerik; bunlara yönlendirme zincirleri ile yavaş sayfalar da eklenir.
- İsrafı kaldırarak optimize edin: yinelenen içerikleri birleştirin, değersiz yolları
robots.txtiçinde engelleyin (noindexkullanmayın — Google önce yine de istekte bulunur), hatalı bulunamadı sayfalarını düzeltin, yönlendirmeleri kısaltın, site haritalarını temiz tutun ve dahili bağlantıları güçlendirin. Bütçeyi gerçekten artırmanın yalnızca iki yolu vardır: daha fazla sunucu kapasitesi ve daha yüksek içerik kalitesi. - Ölçüm için GSC Crawl Stats, sunucu günlük dosyası analizi ve “Discovered – currently not indexed” raporunu kullanın.
- Bing buna crawl efficiency der (“less is more”) ve Google’ın müdahalesiz yaklaşımının yerine IndexNow ile Crawl Control’ü öne çıkarır.
Resmî belgeler
Arama motorlarının birincil kaynak belgeleri.
- Crawl budget’ınızı optimize edin — kanonik belge (Google’ın crawling-infrastructure belgelerindeki eski “large site owner’s guide” URL’sinden taşındı, son güncelleme Aralık 2025): tarama kapasitesi + talep, kimin ihtiyaç duyduğu, israf listesi ve nasıl optimize edileceği. Buradan başlayın.
- Googlebot için Crawl Budget Ne Anlama Gelir (Gary Illyes, 2017) — ilk çerçeve: crawl rate limit + crawl demand ve düşük değerli URL kategorileri.
- Crawling ve Indexing — robots, site haritaları, kanonikleştirme ve tarama kontrolleri merkezi.
- Crawling December serisi (2024) — Googlebot, HTTP önbellekleme, faceted navigation ve CDN’ler.
Bing / Microsoft
- bingbot serisi: Crawl Efficiency’yi en üst düzeye çıkarma — Bing’in “crawl efficiency” çerçevesi ve kuzey yıldızı.
- bingbot serisi: Crawl Frequency’yi optimize etme — Bing’in yeniden tarama sıklığına karar verme biçimi.
- Bing Webmaster Tools — Crawl Control — bingbot’un hangi saatlerde tarayacağını planlayın.
- IndexNow / indexnow.org — motorların keşif amaçlı taramalara ihtiyaç duymaması için değişen URL’leri gönderin.
Kaynaktan alıntılar
Google ve Bing’den kayda geçmiş ifadeler. Her bağlantı, kaynak sayfadaki alıntı bölümüne atlayan bir derin bağlantıdır.
Google — tanım
- “The amount of time and resources that Google devotes to crawling a site is commonly called the site’s crawl budget and it’s determined by two main elements: crawl capacity limit and crawl demand.” — Google Search Central belgeleri. Alıntıya git
- “Google’s crawlers calculate a crawl capacity limit, which is the maximum number of simultaneous parallel connections that Google can use to crawl a site, as well as the time delay between fetches.” Alıntıya git
- “Taking crawl rate and crawl demand together we define crawl budget as the number of URLs Googlebot can and wants to crawl.” — Gary Illyes, Google (2017). Alıntıya git
Google — ne zaman önemsemeniz gerekmez
- “If your site doesn’t have a large number of pages that change rapidly, or if your pages seem to be crawled the same day that they are published, you don’t need to read this guide.” Alıntıya git
- “100k URLs is usually not enough to affect crawl budget (it’s <1/minute over 3 months).” — John Mueller, Google (2021). Kapsamı oku
Google — neyi kontrol ettiğiniz ve tarama ile sıralama
- “If many of these URLs are duplicates, or you don’t want them crawled for some other reason (removed, unimportant, and so on), this wastes a lot of Google crawling time on your site. This is the factor that you can positively control the most.” Alıntıya git
- “An increased crawl rate will not necessarily lead to better positions in Search results. Google uses hundreds of signals to rank the results, and while crawling is necessary for being in the results, it’s not a ranking signal.” — Gary Illyes, Google (2017). Alıntıya git
Google — israf listesi ve yapılmaması gerekenler
- “Faceted navigation and session identifiers / On-site duplicate content / Soft error pages / Hacked pages / Infinite spaces and proxies / Low quality and spam content” — önem sırasına göre düşük değerli kategoriler. — Gary Illyes, Google (2017). Alıntıya git
- “Consolidate duplicate content to focus crawling on unique content rather than unique URLs.” Alıntıya git
- “Don’t use noindex, as Google will still request, but then drop the page when it sees a noindex meta tag or header in the HTTP response, wasting crawling time.” Alıntıya git
- “Google won’t shift this newly available crawl budget to other pages unless Google is already hitting your site’s serving limit.” Alıntıya git
Gary Illyes, Google — zamanlama ve host yükü (Search Engine Roundtable’ın Stone Temple Soru-Cevap kapsamı aracılığıyla)
- “Host load kind of sets a bucket of URLs in importance order and GoogleBot will crawl in that order based on the schedule the host load decided. If Google thinks your server can handle it, it will crawl the whole bucket, if not, it will stop.” Alıntıya git
Fabrice Canel, Microsoft Bing
- “The crawl efficiency is how often we crawl and discover new and fresh content per page crawled.” Alıntıya git
- “Less is more for SEO. Never forget that. Less URLs to crawl, better for SEO.” Alıntıya git
Crawl-budget optimizasyon kontrol listesi
Yalnızca gerçekten bir bütçe probleminiz olduğunu doğruladıysanız — büyük bir site, aynı gün içinde gerçekleşmeyen taramalar veya giderek büyüyen bir “Discovered – currently not indexed” yığını söz konusuysa — bu adımları uygulamaya değer. Ardından:
- Problemin gerçek olduğunu doğruladım — herhangi bir optimizasyon yapmadan önce GSC Crawl Stats ile “Discovered – currently not indexed” verilerini kontrol ettim.
- Tek bir kanonik kural (host, protokol, sondaki eğik çizgi, harf kullanımı) seçtim ve yinelenen içerikleri bu kurala göre birleştirdim.
- URL parametrelerini yönettim — kanonikleştirdim veya yalnızca yinelenen/düşük değerli varyantlar oluşturanları engelledim.
- Çok yönlü gezinmeyi denetim altına aldım — değersiz filtreleme/sıralama kombinasyonlarını
robots.txtiçinde engelledim veya taranabilir olmamaları için bir#arkasına taşıdım. - Soft hata sayfalarını düzelttim; kalıcı olarak kaldırılan sayfalar için gerçek
404/410döndürüyorum. - Yönlendirme zincirlerini kaldırdım veya kısalttım.
- Site haritalarında yalnızca doğru
lastmoddeğerlerine sahip, kanonik ve dizine eklenebilir URL’ler bulunuyor. - Bütçeden “tasarruf etmek” için
noindexkullanmadım (Google yine de istekte bulunur) verobots.txtengellerinin bütçeyi diğer sayfalara yeniden tahsis etmesini beklemedim. - Önemli ve yeni yayımlanan sayfalara giden dahili bağlantıları güçlendirdim.
- Sunucu yanıt süresini ve sayfa yükleme verimliliğini iyileştirdim.
- (Bing) Değişiklikleri göndermek için IndexNow’u benimsedim; kısıt sunucu yüküyse Crawl Control’ü kullandım.
Zihinsel modeller
1. Bütçe = kapasite × talep. Crawl capacity, sunucunuzun kaldırabileceği miktardır; crawl demand ise popülerlik + eskilik + algılanan envanterdir. İkisinin de bulunması gerekir: talebi düşük hızlı bir sunucu yine daha az taranır, yüksek talep de zorlanan bir sunucuya karşı sınırlanır. Etkili bütçeyi artırmak için neredeyse her zaman “daha fazlasını istemek” yerine israfı kaldırırsınız.
2. “Gerçekten bir problemim var mı?” kontrol noktası. Herhangi bir şeye dokunmadan önce bunu uygulayın:
- Sayfalar yayımlandıkları gün taranıyor mu? → Problem yok. Burada durun.
- Yaklaşık yüz binden az URL mi var (Mueller’ın genel kuralı)? → Neredeyse kesinlikle problem yok.
- Haftalık değişen 1 milyon veya daha fazla sayfa, veya günlük değişen 10 000 veya daha fazla sayfa, veya büyük bir “Discovered – currently not indexed” yığını mı var? → Artık zaman ayırmaya değer.
3. Google’dan daha çok tarama istemeden önce israfı ortadan kaldırın. Bu sayfadaki en etkili fikir budur. Google bildiği her şeyi taramaya çalışır; bunların yarısı yinelenen içeriklerden, çok yönlü gezinme URL’lerinden ve soft hata sayfalarından oluşuyorsa bütçenizi değersiz URL’lere harcıyor demektir. Değersiz URL’leri ortadan kaldırdığınızda bütçe önemli sayfalarda yoğunlaşır — bu, “the factor you can positively control the most.”
4. Tarama ≠ sıralama. Tarama bir kapıdır, skor tablosu değil. Daha çok tarama konumları yükseltmez. Dolayısıyla hedef ham tarama hacmi değil, doğru URL’lerin kapsamıdır.
5. Kota değil, öncelik kuyruğudur. İçeride host yüküyle sınırlandırılmış önem sırasına göre zamanlamadır — düz bir “günde N sayfa” değil, öncelikli bir URL kovasıdır. Daha önemli olarak (bağlantılar, talep) ve getirmeleri boşa harcamayarak kuyrukta yükselirsiniz.
Crawl budget — hızlı başvuru
Neyi tüketir (Google’ın önem sırası)
| # | Kategori | Tipik neden |
|---|---|---|
| 1 | Faceted navigation ve oturum kimlikleri | URL’leri çoğaltan e-ticaret filtre/sıralama kombinasyonları |
| 2 | Site içi yinelenen içerik | www/www olmayan, HTTP/HTTPS, eğik çizgi, harf durumu, index, parametreler |
| 3 | Soft hata sayfaları | 200 döndüren “Bulunamadı” sayfaları |
| 4 | Hacklenmiş sayfalar | Enjekte edilmiş spam URL’leri |
| 5 | Sonsuz alanlar ve proxy’ler | Takvimler, sonsuz kaydırma, faceted kombinasyonları |
| 6 | Düşük kaliteli ve spam içerik | Zayıf/otomatik oluşturulmuş sayfalar |
Ayrıca uzun yönlendirme zincirleri ile yavaş/ağır sayfalar her getirmenin maliyetini artırır.
Bunu önemsemeniz gerçekten gerekiyor mu?
- Aynı gün tarama → hayır.
- < yaklaşık yüz bin URL (Mueller) → neredeyse kesinlikle hayır.
- Haftalık değişen 1 milyon veya daha fazla sayfa, günlük değişen 10 000 veya daha fazla sayfa ya da büyük bir “Discovered – currently not indexed” yığını → evet.
İşe yarayan çözümler
- Yinelenen içerikleri birleştirin / kanonikleştirin.
- Değersiz yolları (çok yönlü gezinme URL’leri, parametreler)
robots.txtiçinde engelleyin — bütçeden “tasarruf etmek” için aslanoindexkullanmayın. - Soft hata sayfalarını düzeltin; gerçek
404/410döndürün. - Yönlendirme zincirlerini kısaltın; sunucuyu hızlandırın.
- Site haritalarını temiz tutun; dahili bağlantıları güçlendirin.
Bütçeyi artırmanın yalnızca iki yolu vardır (Google): daha fazla sunucu kapasitesi ve daha yüksek içerik kalitesi. Biri olmadan diğeri yetmez.
Bing: Buna “crawl efficiency” der — IndexNow ile gönderin, Crawl Control ile zamanlayın.
Crawl budget’ı ölçme ve yönetme araçları
- Google Search Console — Crawl Stats report (Settings → Crawl Stats) — Google’ın kendi görünümü: zaman içindeki toplam istekler, ortalama yanıt süresi, host durumu ve yanıt koduna, dosya türüne ve Googlebot türüne göre dökümler. Buradan başlayın.
- GSC “Discovered – currently not indexed” (Pages report) — Google’ın bildiği ancak taramadığı URL’ler için uyarı ışığıdır.
- Sunucu günlük dosyası analizi — botların gerçekte hangi URL’lere ne sıklıkta istek gönderdiğine ilişkin kesin kaynaktır. Araçlar: Screaming Frog Log File Analyser veya günlükleri BigQuery’ye / bir günlük platformuna aktarın. (Bkz. log file analysis.)
- Ahrefs Site Audit / Screaming Frog SEO Spider — yinelenen URL’leri, yönlendirme zincirlerini, soft hata sayfalarını, engellenmiş URL’leri ve tuzak benzeri çok yönlü gezinme alanlarını ortaya çıkarmak için bir taramayı simüle edin.
- Ahrefs Webmaster Tools — doğruladığınız siteler için ücretsiz tarama + denetim.
- URL Inspection (GSC) — tek bir URL’nin aynı gün taranıp taranmadığını hızla kontrol edin.
- Bing Webmaster Tools — Crawl Control — kısıt sunucu yüküyse bingbot’un taramasını saatlere göre planlayın.
Crawl-budget probleminiz var mı?
Should you work on crawl budget now?
Aylık crawl-budget sağlık kontrolü
- Her ay aynı raporlama dönemi için arama tarayıcısı isteklerini sunucu günlüklerinden dışa aktarın.
- İstekleri durum koduna, dizine, sayfa türüne ve URL’nin dizine eklenebilir olup olmadığına göre ayırın.
- Yüksek hacimli parametre kalıplarını, yinelenen yolları, yönlendirmeleri, soft hata sayfalarını ve sunucu hatalarını inceleyin.
- Değerli şablonların tarama payını önceki dönemle karşılaştırın ve lansmanları veya geçişleri açıklamalarla işaretleyin.
- Her yeni israf kalıbına bir sorumlu ve kontrol yöntemi atayın: bağlantılar, parametreler, yönlendirmeler, kanonikleştirme, kaldırma veya sunucu onarımı.
- Etkilenen kalıbı bir sonraki günlük döneminde yeniden kontrol edin; değerli URL’ler erişimlerini koruduğunda ve israf sitenin kendi taban çizgisine göre azaldığında SOP tamamlanmış olur.
Crawl-budget hataları
- Daha yüksek istek sayısının peşine düşmek. Daha çok tarama sıralamaları iyileştirmez. Bunun yerine önemli URL’lerin ihtiyaç duyulduğunda taranıp taranmadığını izleyin.
- İsrafı yalnızca robots.txt içinde engellemek. Bu, URL’lerin keşfedilmiş olmasını veya onları oluşturan bağlantıların düzeltilmesini sağlamadan getirmeyi durdurabilir. Uygun olduğunda tarama yollarını kaldırın ve envanteri birleştirin.
- Her derlemede her site haritasının
lastmoddeğerini güncellemek. Sahte güncellik, tarayıcılara sinyale güvenmemeyi öğretir. Yalnızca anlamlı sayfa güncellemelerinde değiştirin. - URL kalıplarını ayarlarken sunucu hatalarını görmezden gelmek. Kapasite problemi yararlı taramayı sınırlar. Önce zaman aşımlarını ve 5xx yanıtlarını düzeltin.
- Her hariç tutulan URL’yi israf saymak. Bazı dizine eklenmemiş kaynaklar oluşturmayı veya keşfi destekler. Her şeyi engellemeden önce amacını sınıflandırın.
Komut: crawl-log israfını sınıflandırın
URL, şablon, durum, bot, istek sayısı, bayt ve dizine eklenebilirlik sütunlarını içeren günlükten türetilmiş bir CSV yapıştırın. Önce sorgu değerlerini veya kullanıcı verilerini kaldırın.
Act as a technical SEO analyst. Classify each URL pattern as valuable crawling, necessary support crawling, redirect/error waste, duplicate/parameter waste, or unclear. Do not infer intent from the URL alone: list the evidence needed for every unclear row. Rank patterns by crawler requests and bytes, propose the safest control, and state what could break if that control is wrong. Return a table plus a short validation plan.Komut: crawl-budget teşhisine meydan okuyun
Review the crawl-budget diagnosis below. Separate evidence of capacity, demand, discovery, and URL-inventory problems. Flag claims that confuse crawling with indexing or rankings. Then give the three smallest tests that would confirm or reject the diagnosis. Do not invent thresholds; use changes against the site's own baseline.
[PASTE DIAGNOSIS AND OBSERVATIONS] Bir erişim günlüğündeki tarayıcı durum kodlarını özetleyin
Doğrulanmış tarayıcı trafiğinize göre bot kalıbını ayarladıktan sonra bunu nginx/Apache tarzı bir günlük üzerinde çalıştırın:
awk 'BEGIN{IGNORECASE=1} /Googlebot|bingbot/ {print $9}' access.log | sort | uniq -c | sort -nrPowerShell’de:
Select-String -Path .\access.log -Pattern 'Googlebot|bingbot' | ForEach-Object { if ($_.Line -match '"\s(\d{3})\s') { $Matches[1] } } | Group-Object | Sort-Object Count -DescendingSorgu parametresi ailelerini çıkarın
İlk sorgu parametresi adını yakalamak için bu regex’i bir tarayıcı dışa aktarımında veya metin düzenleyicisinde kullanın:
\?([^=&]+)(?:=[^&]*)?Grup 1 parametre adıdır. Yüksek istek sayıları otomatik olarak engellenecek URL’leri değil, incelenmesi gereken kalıpları belirler.
Kendinizi sınayın: Crawl budget
Zaman ayırmaya değer kaynaklar
İlgili yazılarım
- Crawl Budget için Ne Zaman Endişelenmelisiniz? — bu konudaki kapsamlı Ahrefs rehberim; optimizasyon ayrıntıları ve faceted navigation kararlarıyla.
- “Discovered – currently not indexed” Nasıl Düzeltilir — aynı zamanda crawl-budget uyarı ışığı olan GSC sinyali.
- Teknik SEO için Başlangıç Rehberi — crawl budget’ın büyük resimdeki yeri.
- Kurumsal SEO Stratejileri — gerçekten buna ihtiyaç duyan büyük sitelerin azınlığı için.
Konuşmalarım
- How Search Works (SlideShare) — crawl demand ile crawl rate limit modeline dair anlatımım. (Sürekli geçerli uyarı: “This is my understanding of systems… not going to be 100% complete or accurate.”)
Sektörden kaynaklar
- Google’ın Crawling December serisi (resmîdir ve çok yönlü gezinme dâhil olmak üzere taramayı açıklayan en iyi toplu kaynaklardan biridir).
- Google explains what “crawl budget” means for webmasters (Barry Schwartz, Search Engine Land, 2017) — Google’ın ilk crawl-budget yazısının sade İngilizce özeti; “most sites don’t need to worry” bağlamı için yararlıdır.
- Gary Illyes Explains The Difference Between Crawl Budget, Scheduling & Host Load (Search Engine Roundtable) — bunun sabit bir kota değil, öncelik kuyruğu olduğunu gösteren “importance-order bucket” / host-load çerçevesinin kaynağı.
- Google: 100,000 URLs Usually Won’t Impact Crawl Budget (Search Engine Roundtable, 2021) — Mueller’ın somut 100 000 referansı ve <1/minute-over-3-months bağlamı.
- Google’s Crawling Priorities: Insights From Analyst Gary Illyes (Search Engine Journal) — “fixed daily page quota” iddiasının çürütülmesini ve “convince search your stuff is worth fetching” yaklaşımını ele alır.
- The five infrastructure gates behind crawl, render, and index (Search Engine Land) — Fabrice Canel’in “Less is more for SEO” alıntısının ve Bing’in crawl-efficiency yaklaşımının kaynağı.
- bingbot Series: Optimizing Crawl Frequency (Bing Webmaster Blog, Fabrice Canel) — Bing’in yeniden tarama sıklığına nasıl karar verdiğini açıklar; Maximizing Crawl Efficiency yazısının eşlikçisidir.
- r/TechSEO — tarama/dizine ekleme hata ayıklama topluluğu.
Alıntılanmaya değer istatistikler
- Yüz bin URL genellikle etkili olacak kadar çok değildir. John Mueller’ın somut referansı: “100k URLs is usually not enough to affect crawl budget (it’s <1/minute over 3 months).” Crawl-budget endişesini azaltmak için en yararlı tek sayıdır. Kaynak
- Önem kazanmaya başladığı eşikler: yaklaşık haftalık değişen 1 milyon veya daha fazla sayfa ya da günlük değişen 10 000 veya daha fazla sayfa (Google’ın yaklaşık tahminleridir, kesin eşikler değildir). Kaynak
- Web’in yaklaşık %60’ı yinelenen içeriktir — Google’ın iç tahmini; yinelenen URL’lerin crawl budget’ı bu kadar güvenilir biçimde tüketmesinin nedeni budur. Kaynak
Crawl efficiency için sürekli izlenecek KPI
Crawl budget, Google’ın size verdiği bir sayı değildir — bunu Googlebot’un isteklerini gerçekte nereye harcadığından çıkarırsınız. KPI dağılımdır: taramanın ne kadarı dizine eklenmesini istediğiniz sayfalara, ne kadarı saf israfa gidiyor? (Önce dürüstlük kontrolü: bu yalnızca ölçekte önemlidir — Google, crawl budget’ın esas olarak yaklaşık 1 milyon+ sayfalı veya çok sayıda otomatik oluşturulan URL üreten orta boy siteler için kaygı olduğunu söylüyor. Küçük, statik bir site bu metriği tamamen atlayabilir.)
Tarama dağılımı — değerli isteklere karşı boşa harcanan istekler
- Metrik — Doğrulanmış Googlebot isteklerinin önemli, dizine eklenebilir URL’lere ve boşa harcanan URL’lere (yinelenenler, parametreli/faceted URL’ler, kanonik olmayan varyantlar, yönlendirme adımları, 4xx/5xx) giden payları.
- Size ne söyler — Tarama kapasitenizin sıralanabilecek sayfalara harcanıp harcanmadığını gösterir. Artan israf payı, sorun sıralamalara yansımadan önce keşif/dizine ekleme gecikmesinin öncü göstergesidir.
- Nasıl elde edilir — Sunucu günlüklerini Log File Analyzer üzerinden işleyin ve doğrulanmış Googlebot isteklerini URL sınıfına göre ayırın; sonuçları GSC Crawl Stats raporuyla (toplam istekler, yanıta göre dağılım, dosya amacı, host durumu) doğrulayın.
- Kıyaslama / gerçekçi aralık — Duruma bağlıdır — URL mimarinize bağlı olduğu için dürüst ve evrensel bir “israf %‘si” yoktur. Kendi taban çizginizi oluşturun ve israf payını zaman içinde azaltın; sinyal, uydurulmuş mutlak bir sayı değil trenddir.
- Sıklık — Aylık; ayrıca yapısal bir değişikliğin (yeni facet’ler, bir migrasyon) hemen ardından veya Crawl Stats isteklerde ya da 4xx/5xx yanıtlarında ani bir sıçrama gösterdiğinde daha sık. Boşa harcanan tarama öncü bir metriktir; dizine eklenen sayfa sayıları onu geriden izler.
Değişiklik günlüğü
9 Ağu 2026 tarihinde güncellendi.
Editoryal özet ve kaydedilen değişiklik ayrıntıları.Değişiklik ayrıntıları
-
Ayrıntılı değişiklik notları şu anda İngilizce olarak mevcut.
Tam karşılaştırma kullanılamıyor — bu sürüm için önceki anlık görüntü arşivlenmemiş.
8 Ağu 2026 tarihinde güncellendi.
Editoryal özet ve kaydedilen değişiklik ayrıntıları.Değişiklik ayrıntıları
-
Ayrıntılı değişiklik notları şu anda İngilizce olarak mevcut.
Tam karşılaştırma kullanılamıyor — bu sürüm için önceki anlık görüntü arşivlenmemiş.
27 Tem 2026 tarihinde güncellendi.
Editoryal özet ve kaydedilen değişiklik ayrıntıları.Değişiklik ayrıntıları
-
Ayrıntılı değişiklik notları şu anda İngilizce olarak mevcut.
Tam karşılaştırma kullanılamıyor — bu sürüm için önceki anlık görüntü arşivlenmemiş.
17 Tem 2026 tarihinde güncellendi.
Editoryal özet ve kaydedilen değişiklik ayrıntıları.Değişiklik ayrıntıları
-
Ayrıntılı değişiklik notları şu anda İngilizce olarak mevcut.
-
Ayrıntılı değişiklik notları şu anda İngilizce olarak mevcut.
-
Ayrıntılı değişiklik notları şu anda İngilizce olarak mevcut.
Tam karşılaştırma kullanılamıyor — bu sürüm için önceki anlık görüntü arşivlenmemiş.