Tarama
Arama motorlarının web'i nasıl keşfedip indirdiği: Googlebot ve Bingbot, URL keşfi, tarama planlayıcısı, oluşturma ve taramanın dizine ekleme ile sıralamadan farkı. Taramayla ilgili her şeyin merkezi.
Diller
Bu sayfada 1 kanıt sinyali
- Bağlantılı kaynak verilerigooglebot.json
Tarama, aramanın ilk aşamasıdır (tarama → dizine ekleme → sunma): Googlebot ve Bingbot gibi botlar, sayfaların oluşturulabilmesi, dizine eklenebilmesi ve sıralanabilmesi için URL'leri keşfeder ve sayfaları indirir. Arama sonuçlarında görünmek için gereklidir ancak bir sıralama faktörü değildir; ayrıca hem dizine eklemeden hem de oluşturmadan farklıdır. Çoğu sitenin tarama bütçesini yönetmesi gerekmez; tarama aksadığında gerçekte ne olduğunu sunucu günlükleri gösterir. Bu merkez, sürecin tamamını açıklar ve sizi ayrıntılı incelemelere yönlendirir.
TL;DR — Tarama, arama motorlarının sayfalarınızı bulup indirme yöntemidir. Bir bot (Google için Googlebot, Bing için Bingbot) URL’leri keşfetmek üzere bağlantıları izler ve site haritalarını okur, ardından sayfaları getirir. Bir sayfanın arama sonuçlarında görünebilmesi için önce taranması gerekir; ancak sık taranmak daha yüksek sıralama sağlamaz.
Tarama nedir?
Arama motorları web’de sizin gibi gezinmez. Sayfaları ziyaret eden, içeriklerini indiren ve daha fazla sayfa bulmak için bağlantıları izleyen tarayıcı, bot veya örümcek adlı otomatik programlar gönderirler. Google’ın tarayıcısı Googlebot, Bing’inki ise Bingbot’tur.
Bunu sırasıyla üç adım olarak düşünün:
- Tarama — bot bir URL keşfeder ve sayfayı indirir.
- Dizine ekleme — motor sayfayı işler ve sonuçlarda gösterebileceği her şeyi içeren dev bir veritabanına kaydeder.
- Sunma (sıralama) — biri arama yaptığında motor, dizindeki en iyi eşleşmeleri seçip sıralar. Evidence for this claim Google describes Search as three stages: crawling, indexing, and serving results. Scope: Google Search's documented processing model; it does not guarantee that a page reaches every stage. Confidence: high · Verified: Google Search Central: In-depth guide to how Google Search works
Tarama ilk adımdır. Bir sayfa hiç taranmazsa dizine eklenemez; dizine eklenmezse de sıralamaya giremez. Dolayısıyla tarama önemlidir; ancak bir puan tablosu değil, geçilmesi gereken bir kapıdır.
Tarayıcılar sayfalarınızı nasıl bulur?
İki temel yöntem vardır:
- Bağlantıları izleme. Bir bot bir sayfayı taradığında sayfadaki bağlantıları alır ve bu URL’leri daha sonra tarayacağı listeye ekler. Yeni sayfaların bulunmasını sağlayan şey iyi bir iç bağlantı yapısıdır.
- Site haritaları. XML site haritası, arama motorlarının her şeyi bağlantılar üzerinden keşfetmek zorunda kalmaması için doğrudan onlara sunduğunuz URL listesidir.
Bir sayfanın değiştiğini motora etkin biçimde bildirdiğiniz “push” seçenekleri de vardır; bunları aşağıda ele alacağız. Ancak işin çoğunu bağlantılar ve site haritaları yapar.
Arama motorlarının sitenizi taramasına nasıl yardımcı olabilirsiniz?
- Önemli sayfalarınıza diğer sayfalardan, özellikle ana sayfanızdan ve ana gezinme menünüzden bağlantı verin.
- Google Search Console ve Bing Webmaster Tools üzerinden bir XML site haritası gönderin.
- Bulunmasını istediğiniz sayfaları yanlışlıkla engellemeyin (
robots.txtdosyanızı kontrol edin). - Sunucunuzu hızlı ve sağlıklı tutun; yavaşsa veya hata veriyorsa botlar geri çekilir ve daha az tarama yapar.
Çoğu kişinin yanlış anladığı nokta
Tarama, sıralama değildir. Daha sık taranmak sonuçlarda yükselmenizi sağlamaz.
Ayrıca bir sayfayı robots.txt ile engellemek onu Google’dan kaldırmaz;
yalnızca Google’ın sayfayı okumasını önler. Bir sayfayı gerçekten kaldırmak
istiyorsanız taranmasına izin verip bir noindex etiketi ekleyin. (Engellemenin
bu yönünü kendim test ettim; Gelişmiş sürüme bakın.) Evidence for this claim robots.txt controls crawler access and is not a reliable way to keep a URL out of Google. Scope: Google Search behavior for URLs blocked by robots.txt; blocked URLs may still be indexed when discovered elsewhere. Confidence: high · Verified: Google Search Central: Introduction to robots.txt
Tarama planlayıcısının çalışma biçimini, bayt sınırlarını ve tarama-dizine ekleme-sıralama ayrımını içeren daha ayrıntılı sürümü mü istiyorsunuz? Gelişmiş sekmesine geçin.
TL;DR — Tarama, aramanın üç aşamasından ilkidir (tarama → dizine ekleme → sunma). Botlar URL’leri pull (bağlantılar + site haritaları) ve push (IndexNow, Indexing API) yöntemleriyle keşfeder; ardından sunucunuzun sağlığına göre hızını düşüren algoritmik bir programa göre getirir. JavaScript’in oluşturulması ayrı bir adımdır. Tarama, sıralamaya girmek için gereklidir ancak kendi başına bir sıralama sinyali değildir ve dizine eklemeden farklıdır; robots ile engellenmiş bir sayfa yine de dizine eklenebilir. Çoğu sitenin tarama bütçesini yönetmesi gerekmez; gerçekte ne olduğunu günlükler gösterir.
Tarama, üç aşamanın ilkidir
Three stages run left to right. Crawl: a bot discovers a URL and downloads the page. Index: the engine processes the page and stores eligible information. Serve or rank: the best indexed matches are ordered for a query. The Crawl stage is highlighted, and a note says not every page advances through every stage.
© Patrick Stox LLC · CC BY 4.0 ·
Google süreç hakkında açık konuşur: “Google Search works in three stages, and not all pages make it through each stage” — tarama, dizine ekleme ve sunma. “not all pages make it” bölümü, teknik SEO’daki bütün meselenin özüdür. Bir sayfa taranıp dizine eklenmeyebilir veya dizine eklenip hiçbir sorgu için sunulmayabilir. Bu aşamaları zihninizde ayrı tutmak, buradaki en yararlı düşünce modelidir. Evidence for this claim Google describes Search as three stages: crawling, indexing, and serving results. Scope: Google Search's documented processing model; it does not guarantee that a page reaches every stage. Confidence: high · Verified: Google Search Central: In-depth guide to how Google Search works
Taramayı gerçekte kim yapar?
“Googlebot” tek bir programmış gibi görünür. Öyle değildir. How Search Works sunumumda onu; masaüstü, mobil, görsel, haber, video ve reklam gibi uzmanlaşmış tarayıcılar ailesini çalıştıran 1 000+ sistem olarak tanımlıyorum. İsteklerin çoğu Mountain View kaynaklıdır. Hepsi aynı tarama bütçesi havuzundan yararlanır; bu nedenle kontrolden çıkan bir görsel veya parametre taraması, gerçek içeriğinizin taranmasına ayrılan kaynakları tüketebilir.
Üstelik artık yalnızca arama motorlarından söz etmiyoruz. Cloudflare Radar verileri üzerine yaptığım analizde (Meet the New Web Crawlers), hâlâ en çok arama motoru botları tarama yapıyor; ancak AI botları kesin biçimde ikinci sırada ve önümüzdeki birkaç yıl içinde onları geçme yolunda. Günlüklerinizi okuyorsanız oyuncu kadrosunun değiştiğini göreceksiniz.
Tarayıcılar URL’leri nasıl keşfeder?
Two discovery routes feed one crawl queue. Pull discovery includes following links and sitemaps. Push discovery includes IndexNow for Bing, Yandex, and other participating engines but not Google for general pages; the Google Indexing API for JobPosting and BroadcastEvent pages; and change notifications through sitemap lastmod, RSS, and WebSub.
© Patrick Stox LLC · CC BY 4.0 ·
Keşif hem pull hem de push yöntemiyle gerçekleşir:
- Pull — bağlantılar. Google: “Other pages are discovered when Google extracts a link from a known page to a new page.” Bu nedenle hiçbir bağlantının yönelmediği yetim sayfaların bulunması zordur.
- Pull — site haritaları. “Still other pages are discovered when you submit a list of pages (a sitemap) for Google to crawl.”
- Push — değişiklik bildirimleri. Yeniden taranmayı beklemek yerine motora bir
şeyin değiştiğini bildirirsiniz: IndexNow (Bing, Yandex ve diğerleri; Google
bunu genel sayfalar için kullanmaz) ve Google’ın Indexing API’si (resmî
olarak yalnızca
JobPostingveBroadcastEventsayfaları için). Site haritalarındakilastmod, RSS ve WebSub da push seçeneklerini tamamlar.
Google bu sürecin tamamına “URL discovery.” adını verir.
Tarayıcılar sayfaları nasıl getirir?
- Program algoritmiktir. “Googlebot uses an algorithmic process to determine which sites to crawl, how often, and how many pages to fetch from each site.” Onu etkileyebilirsiniz; ancak siz belirleyemezsiniz.
- Tarama ölçülüdür. Botlar sitenizi çökertmemek için kendi hızlarını sınırlar:
“they try not to crawl the site too fast to avoid overloading it… HTTP
500 errors mean ‘slow down.’” Taramayı geçici olarak yavaşlatmanın arkasındaki
mekanizma budur:
503/429döndürdüğünüzde Googlebot bir veya iki günlüğüne geri çekilir; sonsuza kadar değil. - Bir bayt sınırı vardır. Google’ın Mart 2026 tarihli Inside Googlebot güncellemesine göre Googlebot, URL başına yaklaşık 2 MB getirir (eski 15 MB sınırından daha düşük); PDF’ler için 64 MB’a kadar izin verilir. Sınır aşılırsa getirme işlemi reddedilmez, kesilir; yalnızca indirilen bölüm dizine eklenmek üzere aktarılır. Kritik içeriğiniz 2 MB’lık şişkinliğin altında kalıyorsa bu önemlidir.
- Önbellekleme yeniden tarama maliyetini azaltır. Google’ın tarayıcıları, değişmeyen kaynakların her defasında yeniden getirilmemesi için koşullu istekler ve önbellekleme kullanır. Google, oluşturma kaynakları için kesin bir önbellek süresi yayımlamaz. Bu nedenle kod değişiklikleri için sabit bir yenileme aralığı varsaymayın; anında yansıma değil, bir miktar gecikme bekleyin. Evidence for this claim Googlebot algorithmically determines which sites to crawl, how often to crawl them, and how many pages to fetch. Scope: web Confidence: high · Verified: In-Depth Guide to How Google Search Works
Oluşturma, tarama değildir
Bu ayrım insanların sürekli kafasını karıştırır. “During the crawl, Google renders the page and
runs any JavaScript it finds using a recent version of Chrome.” Oluşturma, HTML’yi
getirmekten farklı bir adımdır. Oluşturucu (Web Rendering Service) durumsuzdur;
yüklemeler arasında depolama alanı ve çerezler temizlenir, izin istemleri reddedilir
ve service worker’lar kabul edilmez. İçeriğiniz yalnızca bir tıklamadan veya gerçek
bir <a href> bağlantısı olmayan JS tabanlı gezinmeden sonra görünüyorsa keşif ve
oluşturma sorunları bekleyin. (Konunun tamamı için
JavaScript SEO makalesine bakın.)
Tarama, dizine ekleme ve sıralama
Bu sayfadaki en önemli ayrımlar şunlardır:
- Tarama ≠ sıralama. Sonuçlarda yer almak için tarama gereklidir; ancak tarama bir sıralama sinyali değildir. Daha yüksek tarama hızı konumlarınızı yükseltmez. Tarama bütçesi yalnızca bir verimlilik meselesidir.
- Tarama ≠ dizine ekleme.
robots.txtile engellediğiniz bir sayfa, başka sayfalar ona bağlantı veriyorsa yine de dizine eklenebilir. Google yalnızca içeriği veya sayfaya koyduğunuz herhangi birnoindexetiketini göremez. Indexed, though blocked by robots.txt makalesinde belirttiğim gibi: “crawling and indexing are two different things.” Bir sayfayı gerçekten kaldırmak için taramaya izin veripnoindexekleyin; sayfayı engellemeyin.
Engelleme tarafını doğrudan test ettim. The Story of Blocking 2 High-Ranking Pages With Robots.txt makalesinde sıralamaya giren iki sayfamızı engelledim. Sonuç şuydu: “We lost a position here or there and all of the featured snippets for the pages… I expected a lot more impact, but the world didn’t end.” Çıkardığım sonuç hâlâ geçerli: “Don’t block pages you want indexed. It hurts. Not as bad as you might think it does — but it still hurts.”
Tarama nasıl denetlenir?
robots.txt, dizine eklemeyi değil taramayı denetler. “A robots.txt file tells search engine crawlers which URLs the crawler can access on your site.” Bunu, botları düşük değerli alanlardan uzak tutmak için kullanın; dizinden çıkarma aracı olarak değil.- Site mimarisi ve iç bağlantılar, sayfaların ne kadar derinde bulunduğunu ve keşfedilip keşfedilmeyeceğini belirler (bkz. tarama derinliği).
- Tarama hızı denetimleri. Google, Search Console’daki manuel tarama hızı kaydırıcısını 2024’ün başında kullanımdan kaldırdı. Artık sunucunuzun yanıtlarına ve daha düşük bir otomatik alt sınıra dayanıyor. Bing, Bing Webmaster Tools’ta hâlâ manuel bir Crawl Control tablosu sunuyor (bkz. tarama hızı). Evidence for this claim robots.txt controls crawler access and is not a reliable way to keep a URL out of Google. Scope: Google Search behavior for URLs blocked by robots.txt; blocked URLs may still be indexed when discovered elsewhere. Confidence: high · Verified: Google Search Central: Introduction to robots.txt
Tarama verimliliği ve tarama bütçesi
Her iki motor da taramayı bir verimlilik meselesi olarak ele alır. Gary Illyes, Google tarafını tarama hızı sınırı + tarama talebi (popülerlik ve güncelliğini yitirme) şeklinde açıklar. Bing’den Fabrice Canel ise bunu “crawl efficiency north star … to crawl a URL only when the content has been added … updated.” diye tanımlar.
Rahatlatıcı kısmı şu: Çoğu sitenin bunu dert etmesi gerekmez. Google bunu açıkça söyler: Sitenizde hızla değişen çok sayıda sayfa yoksa veya sayfalarınız yayımlandığı gün taranıyorsa “you don’t need to read this guide.” Konu, haftalık değişen 1M+ veya günlük değişen 10k+ sayfa civarında önem kazanmaya başlar (bkz. tarama bütçesi ve tarama sıklığı). Evidence for this claim Sites without many rapidly changing pages, or whose new pages are crawled the day they are published, generally do not need crawl-budget management. Scope: large websites Confidence: high · Verified: Optimize your crawl budget
Tarama aksadığında bunu nasıl anlarsınız?
Bir düzeltmeye girişmeden önce gerçekte hangi aşamanın bozuk olduğunu belirleyin; belirtiler ve çözümler her aşamada farklıdır:
-
Hiç keşfedilmemiş mi? Sayfaya hiçbir bağlantı yönelmiyordur ve sayfa site haritanızda yoktur. İç bağlantıları ve site haritası kapsamını düzeltin; bkz. tarama derinliği ve tarama sıklığı.
-
Keşfedilmiş ama hiç getirilmemiş mi? Sunucu hataları, zaman aşımları veya
robots.txtengeli botları geri çeviriyordur. GSC Tarama İstatistikleri’ni ve günlüklerinizi kontrol edin; bkz. tarama bütçesi ve tarama hızı. -
Getirilmiş ama yanlış oluşturulmuş mu? İçerik, Googlebot’un yapmayacağı bir tıklamaya veya yalnızca JS ile çalışan gezinmeye bağlıdır ya da WRS zaman aşımına uğruyordur. Oluşturmaya özgü hata türleri için JavaScript SEO’ya bakın.
-
Getirilmiş ve oluşturulmuş ama hâlâ dizine eklenmemiş mi? Bu, dizinin verdiği ayrı bir karardır. Bunu tarama sorunu olarak ele almak yerine Dizine Ekleme merkezine bakın.
-
Günlük dosyası analizi temel gerçektir. Sunucu günlükleriniz, botların tam olarak hangi URL’lere eriştiğini, bunu ne sıklıkta yaptığını ve hangi durum kodlarını aldığını gösterir. Boşa harcanan taramayı saptamanın ve botların hiç ulaşmadığı sayfaları bulmanın en iyi yoludur (bkz. günlük dosyası analizi).
-
Örümcek tuzakları — takvimler, fasetli gezinme, oturum kimlikleri veya göreli bağlantı patlamalarından doğan sonsuz URL alanları — tarama bütçenizi gereksiz URL’lerde sessizce tüketir (bkz. örümcek tuzakları).
Sonraki adım: tarama konu kümesi
Bu merkez bir haritadır. Aşağıdaki her konu kendi başına ayrıntılı bir incelemedir:
Tarama verimliliği — ne kadar ve ne sıklıkta?
- Tarama bütçesi — nedir (kapasite + talep), neler bütçeyi boşa harcar ve gerçekte kimlerin önemsemesi gerekir?
- Tarama hızı — botlar ne kadar hızlı getirir, GSC hız kaydırıcısı neden kaldırıldı ve günümüzde tarama nasıl hızlandırılır veya yavaşlatılır?
- Tarama sıklığı — Google’ın bir sayfayı daha erken yeniden taramasını neler
sağlar (popülerlik, güncelliğini yitirme, doğru
lastmod) ve neler sağlamaz? - Tarama derinliği — tıklama derinliği ile tarama geçiş derinliği arasındaki fark ve önemli sayfaların neden ana sayfaya yakın olması gerektiği.
Tarayıcıları tanıyın — sayfalarınızı gerçekte kim getiriyor?
- Tarayıcı — web tarayıcısı (bot, örümcek) nedir ve tümünün yürüttüğü getir → ayrıştır → izle döngüsü nasıl çalışır?
- User agent — botun kendisini tanıttığı user-agent dizesi ve robots.txt belirteci nedir; neden yalnızca bu dizeye güvenemezsiniz?
- Googlebot — Google’ın tarayıcısı: Smartphone ve Desktop, oluşturma ve doğrulama yöntemleri.
- Bingbot — Microsoft’un tarayıcısı, farklılıkları ve Bing dışında beslediği yüzeyler.
- AI tarayıcıları — AI şirketlerinin botları (eğitim, AI araması ve kullanıcı tarafından tetiklenen getiriciler) ve bunları denetleme yöntemleri.
Tarama sorunlarını teşhis etme
- Günlük dosyası analizi — gerçek botları doğrulama ve neleri taradıklarını okuma.
- Örümcek tuzakları (tarayıcı tuzakları) — sonsuz URL üreten kalıplar ve bunları düzeltme yöntemleri.
Yukarıdaki her konu, bu merkezin altında yer alan ayrı bir ayrıntılı incelemedir; kenar çubuğunda da bulunurlar.
Giden bağlantılarınızı nitelemek, taramayla kesişen ilgili bir sayfa içi denetimdir. Bunlar Google’a bir bağlantıyı tarayıp taramamasını değil, bağlantıya nasıl davranacağını bildirir: nofollow (başlangıçtaki genel seçenek, artık bir ipucu) ile ücretli/reklam bağlantıları ve kullanıcılar tarafından oluşturulan bağlantılar için rel=sponsored ve rel=ugc. Üçü de sayfa içi meta etiketleri kümesinde yer alır.
En başta bulunmak, ilişkili ancak ayrı bir aşamadır. Arama motorlarının URL’lerinizi nasıl keşfettiği — iç bağlantılar, site haritaları (XML, site haritası dizini, görsel ve video) ve IndexNow ile Google Indexing API push protokolleri (her birinin gerçekte ne işe yaradığı ve Google’ın neden IndexNow kullanmadığı) — artık kendi Keşif merkezinde yer alıyor. Daha geniş konu için How Search Works sayfasına bakın.
AI özeti
Gelişmiş sürümün özetlenmiş açıklaması:
- Tarama = aramanın ilk aşaması (tarama → dizine ekleme → sunma). Sıralamaya girmek için gereklidir ancak bir sıralama sinyali değildir; dizine ekleme ve oluşturmadan farklıdır.
- Keşif = pull + push: bağlantılar ve site haritaları (pull); IndexNow ve Indexing API (push). Google buna “URL discovery.” adını verir.
- Getirme algoritmik ve ölçülüdür: Google neyin, ne sıklıkta ve kaç sayfanın
getirileceğine karar verir;
5xx/429yanıtlarında hızı düşürür (“slow down”). Googlebot 2026 itibarıyla URL başına yaklaşık 2 MB getirir (PDF’lerde 64 MB’a kadar) ve sınırdan sonrasını keser. - Oluşturma ayrıdır: JS, durumsuz ve başsız bir Chrome’da çalışır. Google, yeniden tarama maliyetini azaltmak için kaynakları önbelleğe alır ancak kesin bir süre yayımlamaz; bu nedenle değişiklikler gecikmeli yansıyabilir.
- Tarama ≠ dizine ekleme: robots ile engellenmiş bir sayfa, bağlantılar üzerinden
yine de dizine eklenebilir. Sayfayı kaldırmak için
noindexkullanın ve taramaya izin verin. Patrick’in engelleme deneyi, engellenen sayfaların sıralamalarını büyük ölçüde koruduğunu gösterdi — “but it still hurts.” - Tarama bütçesi = kapasite + talep (popülerlik + güncelliğini yitirme). Çoğu sitenin bunu yönetmesi gerekmez.
- Günlüklerle teşhis edin; bütçeyi boşa harcayan örümcek tuzaklarına dikkat edin. AI botları artık tarama trafiğinin büyük ve büyüyen bir bölümünü oluşturuyor.
Resmî belgeler
Arama motorlarının birincil kaynak niteliğindeki belgeleri.
- In-Depth Guide to How Google Search Works — tarama → dizine ekleme → sunma genel görünümü, URL keşfi ve tarama planlayıcısı.
- Crawling and Indexing — robots, site haritaları, standartlaştırma ve tarama denetimleri merkezi.
- Introduction to robots.txt — robots.txt dosyasının ne yaptığı ve ne yapmadığı.
- Optimize your crawl budget — tarama kapasitesi + talep ve buna kimlerin ihtiyaç duyduğu.
- Overview of Google crawlers and fetchers — tüm Google user-agent’ları ve yayımlanan IP aralıkları.
- Inside Googlebot (March 2026) — güncel bayt sınırları ve tarama mimarisi.
- Googlebot and the 15 MB thing (2022) — değişikliği göstermek için yararlı olan eski sınır.
- Crawling December series (2024) — Googlebot, HTTP önbellekleme, fasetli gezinme ve CDN’ler.
Bing / Microsoft
- bingbot Series: Maximizing Crawl Efficiency — Bing’in tarama tanımı ve “crawl efficiency north star” yaklaşımı.
- Bing Webmaster Tools — Crawl Control — Bingbot’un hızını ve zamanlamasını ayarlama.
- IndexNow / indexnow.org — değişen URL’leri anında bildirmeye yarayan push protokolü.
Kaynaktan alıntılar
Google ve Bing’in kayda geçmiş açıklamaları. Her bağlantı, kaynak sayfadaki alıntılanan bölüme doğrudan gider.
Google — taramanın çalışma biçimi
- “Google Search works in three stages, and not all pages make it through each stage.” — Google Search Central belgeleri. Alıntıya git
- “Other pages are discovered when Google extracts a link from a known page to a new page… Still other pages are discovered when you submit a list of pages (a sitemap) for Google to crawl. This process is called ‘URL discovery’.” Alıntıya git
- “Googlebot uses an algorithmic process to determine which sites to crawl, how often, and how many pages to fetch from each site.” Alıntıya git
- “They try not to crawl the site too fast to avoid overloading it. This mechanism is based on the responses of the site (for example, HTTP 500 errors mean ‘slow down’).” Alıntıya git
- “During the crawl, Google renders the page and runs any JavaScript it finds using a recent version of Chrome.” Alıntıya git
Google — robots.txt, tarama bütçesi
- “A robots.txt file tells search engine crawlers which URLs the crawler can access on your site.” — Google Search Central belgeleri. Alıntıya git
- “Taking crawl capacity and crawl demand together, Google defines a site’s crawl budget as the set of URLs that Google can and wants to crawl.” Alıntıya git
- “If your site doesn’t have a large number of pages that change rapidly, or if your pages seem to be crawled the same day that they are published, you don’t need to read this guide.” Alıntıya git
Gary Illyes, Google (Search Engine Land’in Google’ın 2017 tarihli tarama bütçesi gönderisini kelimesi kelimesine aktarması aracılığıyla)
- Tarama hızı sınırı “the number of simultaneous parallel connections Googlebot may use to crawl the site, as well as the time it has to wait between the fetches.” anlamına gelir. Tarama talebini popülerlik ve güncelliğini yitirme belirler. Haberi okuyun
Fabrice Canel, Microsoft Bing
- “Crawling is the process by which bingbot discovers new and updated documents or content to be added to Bing’s searchable index.” Alıntıya git
- “Our crawl efficiency north star is to crawl a URL only when the content has been added (URL not crawled before), updated (fresh on-page context or useful outbound links).” Alıntıya git
Tarama sağlığı kontrol listesi
Arama motorlarının önemli içerikleri bulup getirebildiğini doğrulamak için hızlı bir kontrol:
- Önemli sayfalara taranabilir bir yerden bağlantı veriliyor (yetim sayfa yok).
-
robots.txt, dizine eklenmesini istediğiniz hiçbir şeyi engellemiyor ve site içi arama sonuçları gibi düşük değerli alanları engelliyor. - XML site haritası Google Search Console’a ve Bing Webmaster Tools’a
gönderilmiş; yalnızca standart, dizine eklenebilir URL’leri listeliyor ve
doğru bir
lastmodiçeriyor. - Sunucu hızlı ve kararlı yanıtlar döndürüyor;
5xx/zaman aşımı sayısı çok az (sunucunuz zorlandığında botlar yavaşlar). - Dizinden çıkarmak için
robots.txtkullanmıyorsunuz; bu, taramaya izin verildiğindenoindexetiketinin görevidir. - Sonsuz URL üreten örümcek tuzakları yok (takvimler, fasetler, oturum kimlikleri).
- GSC Tarama İstatistikleri, yanıt kodu sıçramaları ve ortalama yanıt süresi bakımından incelendi.
- Sunucu günlükleri, boşa harcanan tarama ve taranmamış önemli URL’ler için kontrol edildi.
- JS’ye bağımlı içeriğe yalnızca tıklamayla çalışan gezinme yerine gerçek
<a href>bağlantılarıyla ulaşılabiliyor.
Düşünce modelleri
1. Süreç hattı — tarama → oluşturma → dizine ekleme → sunma. Her aşama bir filtredir ve “not all pages make it through each stage.” Bir sayfa performans göstermiyorsa herhangi bir şeyi değiştirmeden önce hangi aşamada başarısız olduğunu belirleyin: Tarandı mı? Oluşturuldu mu? Dizine eklendi mi? Sorgu için sunuldu mu?
2. Üç “eşit değildir” kuralı. Bunları ayrı tutarsanız taramayla ilgili kafa karışıklığının çoğu ortadan kalkar:
- Tarama ≠ dizine ekleme (engellenmiş sayfalar bağlantılar üzerinden yine de dizine eklenebilir)
- Tarama ≠ sıralama (tarama hızı bir sıralama sinyali değildir)
- Tarama ≠ oluşturma (JS ayrı ve önbelleğe alınabilir bir adımda çalışır)
3. Keşif = pull + push.
Pull: bağlantılar + site haritaları. Push: IndexNow / Indexing API / lastmod. Bir
sayfa bulunmuyorsa onu hangi kanalın taşıması gerektiğini ve herhangi bir şeyin
gerçekten o sayfaya bağlantı verip vermediğini sorun.
4. Tarama bütçesi = kapasite + talep. Kapasite, sunucunuzun kaldırabileceği yüktür; talep ise popülerlik + güncelliğini yitirmedir. Etkili bütçeyi, Google’ın “daha fazla” tarama yapmasını sağlamaya çalışmaktan çok israfı ortadan kaldırarak (tuzaklar, yinelenenler, gereksiz parametreler) yükseltirsiniz.
5. Bir sayfayı kaldırma karar kuralı.
Aramadan kaldırmak mı istiyorsunuz? Taramaya izin verin + noindex. Botların
bir alanı tamamen atlamasını mı istiyorsunuz ve dizine eklenmesini önemsemiyor
musunuz? robots.txt disallow. Dizinden çıkarmak için asla disallow kullanmayın.
Taramayı denetleme — hızlı başvuru
Her denetim gerçekte ne yapar?
| Denetim | Taramayı durdurur mu? | Dizine eklemeyi durdurur mu? | Kullanım amacı |
|---|---|---|---|
robots.txt disallow | Evet | Hayır | Botları düşük değerli URL alanlarından uzak tutma |
noindex (meta/header) | Hayır (taranabilir olmalı) | Evet | Bir sayfayı dizinden kaldırma |
rel=canonical | Hayır | Birleştirir, zorlamaz | Tercih edilen yinelenen sürümü gösterme |
Bağlantılarda nofollow | İzlemeyi caydırır | Hayır | Bir bağlantıyı onaylamama / taranmasını istememe |
rel="sponsored" / rel="ugc" | İpucu (nofollow gibi) | Hayır | Ücretli/reklam bağlantılarını ve kullanıcılar tarafından oluşturulan bağlantıları etiketleme |
5xx / 503 / 429 | Geçici olarak yavaşlatır | Hayır | Googlebot’a kısa süreli “slow down” sinyali verme |
Botların önemsediği durum kodları
200— başarıyla getirildi.301/308— kalıcı yönlendirme (birleştirir).404/410— kaldırılmıştır; zamanla dizinden çıkar (410biraz daha hızlıdır).429/500/503— “slow down” / daha sonra dene; sürerse tarama azalır.
Kısa bilgiler
- Googlebot getirme sınırı: URL başına ~2 MB (PDF’ler 64 MB); sınırdan sonrası kesilir.
- GSC’deki manuel tarama hızı kaydırıcısı: kaldırıldı (Oca 2024) — artık sunucu sinyalleri kullanılıyor.
- Bing’deki karşılığı: Bing Webmaster Tools’taki Crawl Control tablosu.
- IndexNow: Bing/Yandex/diğerleri — Google değil. Indexing API: Google, yalnızca JobPosting + BroadcastEvent.
Bir botun gerçekten Googlebot olduğunu doğrulama
Çok sayıda trafik kaynağı Googlebot olduğunu iddia eder. Bunu ters + ileri DNS kontrolüyle doğrulayın. Google kestirme bir yöntem yayımlamaz; sahte user-agent’lar yaygındır.
Aynı kontrolü elle de yapabilirsiniz:
macOS / Linux
# 1) Reverse DNS the IP from your logs — it should end in googlebot.com or google.com
host 66.249.66.1
# → 1.66.249.66.in-addr.arpa domain name pointer crawl-66-249-66-1.googlebot.com
# 2) Forward DNS that hostname back — it must resolve to the same IP
host crawl-66-249-66-1.googlebot.com
# → crawl-66-249-66-1.googlebot.com has address 66.249.66.1Windows
nslookup 66.249.66.1
nslookup crawl-66-249-66-1.googlebot.comTers arama bir Google alan adıyla bitmiyorsa veya ileri arama özgün IP ile eşleşmiyorsa bu Googlebot değildir. Ayrıca Google’ın yayımladığı IP aralıklarıyla da karşılaştırabilirsiniz (googlebot.json).
Güvenli bir robots.txt başlangıç noktası
User-agent: *
Disallow: /search # internal search result pages
Disallow: /*?*sort= # sort-order parameter spaces
Allow: /
Sitemap: https://example.com/sitemap.xmlUnutmayın: Disallow, dizine eklemeyi değil taramayı engeller; bir sayfayı
sonuçlardan kaldırmak için kullanmayın.
Taramayı görmeye ve yönetmeye yönelik araçlar
- Google Search Console — Tarama İstatistikleri raporu — Google’ın sitenizi nasıl taradığına ilişkin kendi görünümü: zaman içindeki istekler, yanıt kodları, ortalama yanıt süresi, dosya türü ve Googlebot türü.
- Bing Webmaster Tools — tarama bilgileri, Crawl Control ve Site Scan.
- Sunucu günlük dosyası analizi — temel gerçek. Araçlar: Screaming Frog Log File Analyser veya günlükleri BigQuery’ye / bir günlük platformuna aktarma. (Bkz. günlük dosyası analizi.)
- Tarayıcılar / site denetimleri — Ahrefs Site Audit ve Screaming Frog SEO Spider bir taramayı simüle ederek derinliği, yönlendirme zincirlerini, engellenmiş URL’leri ve tuzağa benzeyen kalıpları ortaya çıkarır.
- Ahrefs Webmaster Tools — doğruladığınız siteler için ücretsiz tarama + denetim.
- URL Inspection (GSC) — tek bir URL’nin nasıl tarandığını, oluşturulduğunu ve dizine eklendiğini kontrol etme.
Zaman ayırmaya değer kaynaklar
İlgili yazılarım
- The Beginner’s Guide to Technical SEO — taramanın büyük resimdeki yeri.
- The Story of Blocking 2 High-Ranking Pages With Robots.txt — tarama ile sıralama ilişkisine dair birinci elden deneyim.
- Indexed, though blocked by robots.txt — engellenmiş sayfaların neden yine de dizine eklendiği.
- Robots.txt and SEO: Everything You Need to Know.
- JavaScript SEO Issues & Best Practices — oluşturma tarafı.
- Meet the New Web Crawlers: AI Bots Are Closing in on Search Engine Bots.
Konuşmalarım
- How Search Works (SlideShare) — tarama, oluşturma, dizine ekleme ve sıralamayı anlattığım sunum. (Süregelen uyarım geçerlidir: “This is my understanding of systems… not going to be 100% complete or accurate.”)
Başkalarından
- r/TechSEO — tarama/dizin sorunlarını ayıklamaya yönelik topluluk.
- Google’ın Crawling December serisi (resmî ve tarama açıklamalarının en iyi derli toplu koleksiyonu).
- Google Explains Crawl Budget for Webmasters (Search Engine Land) — Gary Illyes’in özgün tarama bütçesi gönderisinin, tarama hızı sınırı + tarama talebi tanımlarıyla birlikte kelimesi kelimesine aktarımı.
- Googlebot Crawl Budget Explained (Search Engine Journal) — tarama kapasitesi ve talep modelinin sade dille açıklaması.
- Google Explains Googlebot Byte Limits and Crawling Architecture (Search Engine Journal) — Mart 2026 tarihli “Inside Googlebot” güncellemesinin kapsamı; URL başına 2 MB, PDF’ler için 64 MB ve kesme davranışı.
- How Bingbot Works: Discovering, Crawling, Extracting, Indexing (Search Engine Journal) — Fabrice Canel bağlamıyla tarama sürecinin Bing tarafı.
- Googlebot File Size Limit (DebugBear) — bir sayfa Googlebot’un getirme sınırını aştığında ne olduğunu açıklar (reddetme değil, kesme).
Podcast’ler
- Search Off the Record (Google Search Relations) — How Googlebot crawls the web. Gary Illyes ve Martin Splitt, Googlebot’un geçmişi, bugünü ve geleceğini; birleşik tarama altyapısını, HTTP/1.1 ile HTTP/2’yi, koşullu istekleri ve bayt sınırlarını ele alıyor. Dinleyin
Videolar
- Google Search Central (YouTube) — How Google Search Works serisi ve JavaScript SEO videoları dâhil Martin Splitt’in tarama/oluşturma açıklamaları. Kanal
Alıntılanmaya değer istatistikler
- AI botları arama botlarına yaklaşıyor. Cloudflare Radar analizime göre hâlâ en çok arama motoru tarayıcıları tarama yapıyor; ancak AI botları açık ara #2 ve birkaç yıl içinde onları geçme hızında ilerliyor. Kaynak
- Bing, daha önce hiç görülmemiş on milyarlarca normalleştirilmiş URL’yi her gün keşfediyor. Bu, motorların yoğun biçimde filtrelediği keşif sorununun ölçeğini gösteriyor (Fabrice Canel, Microsoft Bing, 2022). Haber
- ~140M sitenin en çok hangi tarayıcıları engellediği — Xibeijia Guan ile yaptığım çalışmadaki robots.txt engelleme oranı verileri; açık web’in botlara nasıl geçit verdiğini anlamak için yararlıdır. Kaynak
- Bayt sınırı: URL başına ~2 MB (PDF’ler 64 MB) — Google’ın Mart 2026 itibarıyla belgelediği Googlebot getirme sınırı (15 MB’tan düşürüldü). Kaynak
Kendinizi sınayın: Tarama
Arama motorlarının sayfaları nasıl keşfedip getirdiğine ilişkin beş kısa soru. Her biri için bir yanıt seçin, ardından kontrol edin.
Değişiklik günlüğü
9 Ağu 2026 tarihinde güncellendi.
Editoryal özet ve kaydedilen değişiklik ayrıntıları.Değişiklik ayrıntıları
-
Ayrıntılı değişiklik notları şu anda İngilizce olarak mevcut.
Tam karşılaştırma kullanılamıyor — bu sürüm için önceki anlık görüntü arşivlenmemiş.
8 Ağu 2026 tarihinde güncellendi.
Editoryal özet ve kaydedilen değişiklik ayrıntıları.Değişiklik ayrıntıları
-
Ayrıntılı değişiklik notları şu anda İngilizce olarak mevcut.
Tam karşılaştırma kullanılamıyor — bu sürüm için önceki anlık görüntü arşivlenmemiş.
17 Tem 2026 tarihinde güncellendi.
Editoryal özet ve kaydedilen değişiklik ayrıntıları.Değişiklik ayrıntıları
-
Ayrıntılı değişiklik notları şu anda İngilizce olarak mevcut.
-
Ayrıntılı değişiklik notları şu anda İngilizce olarak mevcut.
-
Ayrıntılı değişiklik notları şu anda İngilizce olarak mevcut.
Tam karşılaştırma kullanılamıyor — bu sürüm için önceki anlık görüntü arşivlenmemiş.