Web Crawler'ları

Bir web crawler'ın (spider, bot) gerçekte ne olduğunu, fetch → parse → queue döngüsünün nasıl çalıştığını ve taramanın neden dizine ekleme, rendering veya sıralamayla aynı olmadığını öğrenin.

İlk yayın tarihi: 24 Haz 2026 · Son güncelleme: 9 Ağu 2026 · Advanced
Diller
Bu sayfada 2 kanıt sinyali

Web crawler'lar — spider veya bot olarak da adlandırılır — sayfaları getiren, bağlantıları çıkaran ve ziyaret edilecek yeni URL'leri kuyruğa ekleyerek arama motorunun dizinini besleyen otomatik programlardır. Mekanik döngü discover → fetch → parse → schedule biçimindedir ve sürekli yinelenir. Tarama üç aşamanın ilkidir (crawl → index → serve) ve sıralama için ön koşuldur, sıralama faktörü değildir: Daha fazla tarama konumlarınızı yükseltmez. Tarama ayrıca dizine ekleme ve rendering'den farklıdır. Güvenilir crawler'lar robots.txt kurallarına uyar ve hızlarını sınırlar; bugün yalnızca arama motorları söz konusu değildir — AI botları trafiğin büyük ve büyüyen bir bölümünü oluşturur. Arama motorlarına özgü ayrıntılar için Googlebot, Bingbot, AI crawler'ları ve user-agent ile ilgili sayfalara bakın.

TL;DR — Crawler (spider, bot), URL’leri döngü içinde keşfeden, getiren, ayrıştıran ve yeniden zamanlayan otomatik bir programdır. Google’ın kendi ifadesiyle crawler, “downloads text, images, and videos from pages it found on the internet with automated programs called crawlers.” Mekanizma; URL kuyruğu olan frontier, HTML’yi indiren fetch, bağlantılarla içeriği çıkaran parse ve sırada neyin, hangi hızda getirileceğine karar veren bir scheduler bileşeninden oluşur. Scheduler, sunucunuzun durumuna göre hızı sınırlar. JavaScript rendering ayrı bir adımdır. Tarama, sıralamaya girebilmek için gereklidir ancak bir sıralama sinyali değildir ve dizine eklemeden farklıdır; robots ile engellenmiş bir sayfa yine de dizine eklenebilir. Ayrıca 2026’da web’i tarayanlar yalnızca arama motorları değildir: AI botları trafiğin büyük ve hızla büyüyen bir bölümünü oluşturur.

Crawler gerçekte nedir?

Google’ın tanımı son derece açıktır: “downloads text, images, and videos from pages it found on the internet with automated programs called crawlers.” Google’ın kendi sözlüğündeki ifade daha da kapsamlıdır: “a crawler is a generic term for any program that is used to automatically discover and scan websites.” Crawler, spider, bot, spiderbot: aynı kavramın farklı adlarıdır. Evidence for this claim Google defines a crawler as an automated program that discovers and scans websites and describes Googlebot as its web crawler. Scope: Google crawler terminology. Confidence: high · Verified: Google: Googlebot overview

Taramanın önemli olmasının nedeni işlem hattıdır. Google bunu açıkça belirtir: “Google Search works in three stages, and not all pages make it through each stage” — tarama, dizine ekleme ve sunma. Tarama ilk kapıdır. Hiç taranmayan bir sayfa dizine eklenemez; dizine eklenmeyen bir sayfa da sıralamaya giremez.

Bir crawler mekanik olarak nasıl çalışır?

Markalaşmayı bir kenara bırakırsak bağlantıları izleyen crawler’ların çoğu aynı döngünün bir sürümünü çalıştırır: discover → fetch → parse → schedule → repeat. Bu, crawler davranışını anlamak için yararlı bir zihinsel modeldir; şimdiye kadar geliştirilmiş her crawler’ın bu aşamaları tamamen aynı biçimde uyguladığı anlamına gelmez.

Frontier (kuyruk). Crawler rastgele dolaşmaz. Bildiği ancak henüz ziyaret etmediği URL’lerden oluşan bir kuyruk — crawl frontier — tutar. Bir scheduler, sırada hangi URL’nin kuyruktan alınacağına karar verir. Crawler, bilinen başlangıç URL’lerinden oluşan bir başlangıç kümesiyle yola çıkar ve yeni URL’ler keşfettikçe kuyruğu büyütür. Google keşfi şöyle açıklar: “Other pages are discovered when Google extracts a link from a known page to a new page… Still other pages are discovered when you submit a list of pages (a sitemap) for Google to crawl. This process is called ‘URL discovery.’” Evidence for this claim Google discovers URLs through links from known pages and through submitted sitemaps. Scope: Google URL discovery; sitemap submission does not guarantee crawling or indexing. Confidence: high · Verified: Google: How Search works

Getirme (fetch). Crawler bir HTTP isteği gönderir, sunucu da sayfayı döndürür. Bu adımda ham HTML indirilir; JavaScript ve CSS gibi kaynaklar ayrı olarak, çoğu zaman daha sonra getirilir. Bing’den Fabrice Canel tüm bu sürecin amacını açıkça şöyle ifade eder: “Crawling is the process by which bingbot discovers new and updated documents or content to be added to Bing’s searchable index.”

Ayrıştırma (parse). Getirilen HTML; bağlantıları, metinleri, başlıkları, görselleri ve meta verileri çıkarmak için ayrıştırılır. Yeni bulunan URL’ler standartlaştırılıp frontier’a geri eklenir; döngünün sürmesini sağlayan budur.

Zamanlama (schedule). Neyin, ne sıklıkla ve her ziyarette kaç sayfanın getirileceğine siz değil, algoritmalar karar verir. Google: “Googlebot uses an algorithmic process to determine which sites to crawl, how often, and how many pages to fetch from each site.” Popüler ve sık değişen sayfalar daha erken yeniden ziyaret edilir; az bilinen ve statik sayfalar ise nadiren yeniden ziyaret edilir. (Bu zamanlamanın nasıl belirlendiği — tarama bütçesi, tarama hızı ve tarama sıklığı — bu kümede ayrı ayrı ayrıntılı biçimde ele alınır.) Evidence for this claim Googlebot algorithmically determines which sites to crawl, how often, and how many pages to fetch. Scope: web Confidence: high · Verified: In-Depth Guide to How Google Search Works

“Googlebot” tek bir program değildir

Çoğu açıklamanın gözden kaçırdığı nokta budur. “Googlebot” tek bir programmış gibi görünür; ancak öyle değildir. How Search Works sunumumda bunu; masaüstü, mobil, görsel, haber, video ve reklam gibi alanlarda özelleşmiş crawler ailesini çalıştıran ve tamamı aynı tarama bütçesi havuzundan yararlanan 1 000’den fazla sistem olarak tanımlıyorum. Gary Illyes de içeriden aynı noktaya dikkat çekmiştir: Bu ad, Shopping, AdSense ve diğer birçok Google ürününün farklı user-agent adları altında isteklerini yönlendirdiği merkezi bir tarama platformu için aslında yanıltıcıdır. Dolayısıyla loglarınızı okurken tek bir botu değil, aynı etiketi paylaşan bir filoyu izlersiniz. (Arama motoruna özgü ayrıntılar Googlebot ve Bingbot başlıklarında yer alır.)

Nezaket — crawler’lar sitenizi devre dışı bırakmaktan nasıl kaçınır?

Kurallara uygun çalışan bir crawler hızını bilinçli olarak sınırlar. Google: “They try not to crawl the site too fast to avoid overloading it. This mechanism is based on the responses of the site (for example, HTTP 500 errors mean ‘slow down’).” Taramayı geçici olarak yavaşlatmanın ardındaki mekanizma da budur: sürekli 5xx/429 yanıtları Googlebot’un bir veya iki günlüğüne geri çekilmesini sağlar; sonsuza kadar değil. Nezaket isteğe bağlı bir incelik değildir. Crawler’ların çalıştığı ölçekte, sunucuları aşırı istekle web’den düşürmelerini engelleyen tek şey budur.

Robots.txt — standart tarama kontrolü

robots.txt, fiilî erişim kontrolü standardıdır. Google: “A robots.txt file tells search engine crawlers which URLs the crawler can access on your site.” İki noktayı birbirinden ayırmak gerekir:

  • Dizine eklemeyi değil, taramayı kontrol eder. İzin vermediğiniz bir sayfa, başka sayfalardan bağlantı alıyorsa yine de dizine eklenebilir. Google yalnızca içeriği veya sayfaya koyduğunuz herhangi bir noindex etiketini göremez. Indexed, though blocked by robots.txt yazımda belirttiğim gibi: “crawling and indexing are two different things.” Bir sayfayı gerçekten kaldırmak için onu engellemeyin; taranmasına izin verip noindex ekleyin.
  • Güvenilir crawler’lar buna uyar, kötü niyetli aktörler uymaz. Googlebot, Bingbot, Ahrefsbot ve benzerleri robots.txt kurallarına uyar; birçok scraper ve güvenilir olmayan bot ise bunları tamamen görmezden gelir. Bu bir uzlaşıdır, yaptırım mekanizması değildir.

Engellemenin etkisini doğrudan test ettim. The Story of Blocking 2 High-Ranking Pages With Robots.txt çalışmasında sıralamaya giren iki sayfamızı yaklaşık beş ay boyunca engelledim. Sayfalar tüm featured snippet’lerini ve özel başlıklarını kaybetti; sonuçlarda “no information is available” gösterildi. Tıklamalar, yalnızca konum değişikliğinin açıklayabileceğinden daha fazla düştü, ancak tahmini trafik neredeyse hiç değişmedi. Çıkardığım sonuç geçerliliğini koruyor: Dizine eklenmesini istediğiniz sayfaları engellemeyin. Zarar verir. Düşündüğünüz kadar büyük bir zarar vermeyebilir; ancak yine de zarar verir.

Tarama ≠ dizine ekleme ≠ rendering ≠ sıralama

En fazla kafa karışıklığına yol açan ayrımlar şunlardır:

  • Tarama ≠ dizine ekleme. Tarama, getirme + indirme işlemidir; dizine ekleme ise anlama + saklama işlemidir. Bir sayfa taranıp dizine eklenmeyebilir; Google sayfayı dâhil etmemeyi seçebilir. Engellenmiş bir sayfa da hiç okunmadan dizine eklenebilir. “Indexing isn’t guaranteed; not every page that Google processes will be indexed.”
  • Tarama ≠ rendering. HTML’yi getirmek ve JavaScript’ini çalıştırmak iki farklı adımdır. “During the crawl, Google renders the page and runs any JavaScript it finds using a recent version of Chrome,” ancak rendering, ilk getirme işleminin gerisinde kalabilen ayrı bir kuyrukta gerçekleşir. İçeriğiniz yalnızca JavaScript çalıştıktan sonra görünüyorsa HTML ile aynı geçişte kullanılamaz.
  • Tarama ≠ sıralama. Daha sık taranmak bir sıralama sinyali değildir. Tarama hızı yalnızca verimlilikle ilgilidir; bu nedenle çoğu sitenin tarama bütçesini yönetmesine hiç gerek yoktur.

Crawler türleri (genel bakış)

Burada kısa tutuyoruz; her türün ayrıntılı bir kardeş konusu vardır:

  • Arama motoru crawler’ları — Googlebot, Bingbot. Arama sonuçlarını mümkün kılan dizinleri oluştururlar.
  • AI / LLM crawler’ları — GPTBot, ClaudeBot, CCBot ve AI modellerini eğitmek veya çalıştırmak için web içeriği toplayan diğerleri. Hızla büyüyorlar (aşağıya bakın).
  • SEO denetim crawler’ları — Teknik sorunları ortaya çıkarmak için taramayı simüle eden Ahrefs Site Audit, Screaming Frog ve benzeri araçlar.
  • Kullanıcı tarafından tetiklenen getiriciler — İstek üzerine tek bir talepte bulunan araçlar (Google’ın URL Inspection aracı ve Rich Results Test gibi). Bunlar otonom crawler değildir.

Şu anda web’i kimler tarıyor?

Artık yalnızca arama motorları söz konusu değil. Cloudflare Radar verileri üzerine yaptığım analizde (Meet the New Web Crawlers) arama motoru botları hâlâ en fazla taramayı yapıyor, ancak AI botları açık biçimde ikinci sırada. Buradaki ölçeği abartmak zordur: Yalnızca Bing, daha önce hiç görmediği on milyarlarca normalize edilmiş URL’yi her gün keşfeder (Fabrice Canel). Arama motorlarının gerçekten getirecekleri URL’lere agresif biçimde öncelik vermek zorunda olmasının nedeni tam olarak budur.

Bir crawler’ın iddia ettiği kimliğe sahip olduğu nasıl doğrulanır?

Her bot user-agent dizesine “Googlebot” yazabilir; bu nedenle yalnızca dizeye güvenmeyin. Gerçek kontrol, ters + ileri DNS sorgusudur (Scripts sekmesine bakın): Loglarınızdaki IP için ters DNS sorgusu yapın, adresin bir googlebot.com / google.com ana makine adına çözümlendiğini doğrulayın; ardından bu ana makine için ileri DNS sorgusu yaparak aynı IP’yi gösterdiğini doğrulayın. Google ayrıca IP aralıklarını yayımlar. Arama motorlarına özgü tüm user-agent ayrıntıları user-agent başlığında yer alır.

Bundan sonra nereye gitmeli?

Bu, genel kavramları ele alan sayfadır. Ayrıntılar için:

  • Googlebot — Google’ın crawler’ı: user-agent’lar, mobil öncelikli tarama, rendering ve Search Console Crawl Stats.
  • Bingbot — Bing’in crawler’ı: Crawl Control ve IndexNow.
  • AI crawler’ları — GPTBot, ClaudeBot, CCBot ve yeni agentic botlar.
  • User-agent — user-agent dizesinin ne olduğu ve nasıl okunacağı.
  • Crawling hub — işlem hattının tamamının yanı sıra tarama bütçesi, tarama hızı, tarama sıklığı, tarama derinliği, spider trap’ler ve log dosyası analizi.

Add an expert note

Pin an expert quote

New person? Create their unclaimed profile at /admin/experts/ → Pin a quote first.