Web Crawler'ları
Bir web crawler'ın (spider, bot) gerçekte ne olduğunu, fetch → parse → queue döngüsünün nasıl çalıştığını ve taramanın neden dizine ekleme, rendering veya sıralamayla aynı olmadığını öğrenin.
Diller
Bu sayfada 2 kanıt sinyali
- Bağlantılı kaynak verilerigooglebot.json
- İlgili canlı araçrobots.txt Tester
Web crawler'lar — spider veya bot olarak da adlandırılır — sayfaları getiren, bağlantıları çıkaran ve ziyaret edilecek yeni URL'leri kuyruğa ekleyerek arama motorunun dizinini besleyen otomatik programlardır. Mekanik döngü discover → fetch → parse → schedule biçimindedir ve sürekli yinelenir. Tarama üç aşamanın ilkidir (crawl → index → serve) ve sıralama için ön koşuldur, sıralama faktörü değildir: Daha fazla tarama konumlarınızı yükseltmez. Tarama ayrıca dizine ekleme ve rendering'den farklıdır. Güvenilir crawler'lar robots.txt kurallarına uyar ve hızlarını sınırlar; bugün yalnızca arama motorları söz konusu değildir — AI botları trafiğin büyük ve büyüyen bir bölümünü oluşturur. Arama motorlarına özgü ayrıntılar için Googlebot, Bingbot, AI crawler'ları ve user-agent ile ilgili sayfalara bakın.
TL;DR — Web crawler, web sayfalarını ziyaret eden, bunları indiren ve daha fazla sayfa bulmak için bağlantıları izleyen otomatik bir programdır. “Crawler”, “spider” ve “bot” aynı anlama gelir. Arama motorları, sayfalarınızı bulup arama sonuçlarında gösterebilmek için crawler’ları kullanır. Ancak bir sayfanın dizine eklenip sıralanabilmesi için önce taranması gerekir ve daha sık taranmak daha üst sıralarda yer almasını sağlamaz.
Crawler nedir?
Bir web crawler, web’de otomatik olarak gezinen bir yazılımdır. Bir sayfayı ziyaret eder, içeriğini indirir, bağlantıları alır ve ardından bu bağlantıları da ziyaret eder. Bu işlem milyarlarca sayfa boyunca tekrar tekrar sürer.
Tam olarak aynı şeyi ifade eden üç adla karşılaşırsınız: crawler, spider ve bot. Bu terimler birbirinin yerine kullanılabilir. Google’ın crawler’ına Googlebot, Bing’inkine ise Bingbot denir. Evidence for this claim Google defines a crawler as an automated program that discovers and scans websites and describes Googlebot as its web crawler. Scope: Google crawler terminology. Confidence: high · Verified: Google: Googlebot overview
Arama motorları crawler’lara ihtiyaç duyar çünkü bir sayfayı önce bulup indirmeden arama sonuçlarında gösteremezler. Crawler ham malzemeyi oluşturur; arama motorunun dizini ise bir sorgu yazdığınızda aradığı devasa veritabanıdır.
Crawler, scraper ile aynı şey değildir. Crawler’ın görevi geniş ölçekte keşiftir: web’in büyük bir bölümündeki veya tamamındaki bağlantıları izler. Scraper’ın görevi ise veri çıkarmaktır: önceden yönlendirildiği sayfalardan belirli veri parçalarını alır. Uygulamada bu ayrım bulanıklaşır; birçok araç hem sayfaları bulmak için tarama yapar hem de her sayfadan ihtiyaç duyduğu verileri çıkarır.
Crawler sayfalarınızı nasıl bulur?
Başlıca iki şekilde:
- Bağlantıları izleyerek. Bir crawler sayfayı indirdiğinde sayfadaki bağlantıları okur ve bu yeni URL’leri yapılacaklar listesine ekler. Yeni sayfalar, iyi bir iç bağlantı yapısı sayesinde keşfedilir.
- Sitemap’ler aracılığıyla. XML sitemap, doğrudan arama motorlarına sunduğunuz URL listenizdir ve URL’lerin keşfedilmesine yardımcı olabilir. Evidence for this claim Google discovers URLs through links from known pages and through submitted sitemaps. Scope: Google URL discovery; sitemap submission does not guarantee crawling or indexing. Confidence: high · Verified: Google: How Search works
Önemli olan üç adım
Arama sabit bir sırayla çalışır:
- Tarama (crawl) — bir bot URL’yi bulur ve sayfayı indirir.
- Dizine ekleme (index) — arama motoru sayfayı işler ve veritabanına kaydeder.
- Sunma (sıralama) — biri arama yaptığında arama motoru en iyi eşleşmeleri getirir ve sıralar.
Tarama ilk adımdır. Bir sayfa hiç taranmazsa dizine eklenemez; dizine eklenmezse sıralamaya giremez. Dolayısıyla tarama, geçmeniz gereken bir kapıdır; ancak bir puan tablosu değildir. Daha fazla taranmak, sonuçlarda daha üst sıralara çıkmanızı sağlamaz.
The search pipeline has three stages: crawl, index, and serve. Crawl is highlighted as the stage where a bot discovers and fetches a page. The page must still be processed and selected for the index before it can become eligible to be served in search results. Not every page passes every stage.
© Patrick Stox LLC · CC BY 4.0 ·
İnsanların yanlış anladığı nokta
Bir sayfayı robots.txt içinde engellemek onu Google’dan kaldırmaz. robots.txt, crawler’a yalnızca “don’t read this” der. Başka siteler sayfaya bağlantı veriyorsa sayfa yine de sonuçlarda yer alabilir. Bir sayfayı gerçekten kaldırmak istiyorsanız taranmasına izin verip bunun yerine bir noindex etiketi eklemelisiniz.
İşin mekanik yönünü — crawl queue, fetch ve parse süreçlerini, rendering’in neden ayrı bir adım olduğunu ve gerçek bir crawler’ı sahtesinden nasıl ayırt edeceğinizi — öğrenmek ister misiniz? Advanced sekmesine geçin.
TL;DR — Crawler (spider, bot), URL’leri döngü içinde keşfeden, getiren, ayrıştıran ve yeniden zamanlayan otomatik bir programdır. Google’ın kendi ifadesiyle crawler, “downloads text, images, and videos from pages it found on the internet with automated programs called crawlers.” Mekanizma; URL kuyruğu olan frontier, HTML’yi indiren fetch, bağlantılarla içeriği çıkaran parse ve sırada neyin, hangi hızda getirileceğine karar veren bir scheduler bileşeninden oluşur. Scheduler, sunucunuzun durumuna göre hızı sınırlar. JavaScript rendering ayrı bir adımdır. Tarama, sıralamaya girebilmek için gereklidir ancak bir sıralama sinyali değildir ve dizine eklemeden farklıdır; robots ile engellenmiş bir sayfa yine de dizine eklenebilir. Ayrıca 2026’da web’i tarayanlar yalnızca arama motorları değildir: AI botları trafiğin büyük ve hızla büyüyen bir bölümünü oluşturur.
Crawler gerçekte nedir?
Google’ın tanımı son derece açıktır: “downloads text, images, and videos from pages it found on the internet with automated programs called crawlers.” Google’ın kendi sözlüğündeki ifade daha da kapsamlıdır: “a crawler is a generic term for any program that is used to automatically discover and scan websites.” Crawler, spider, bot, spiderbot: aynı kavramın farklı adlarıdır. Evidence for this claim Google defines a crawler as an automated program that discovers and scans websites and describes Googlebot as its web crawler. Scope: Google crawler terminology. Confidence: high · Verified: Google: Googlebot overview
Taramanın önemli olmasının nedeni işlem hattıdır. Google bunu açıkça belirtir: “Google Search works in three stages, and not all pages make it through each stage” — tarama, dizine ekleme ve sunma. Tarama ilk kapıdır. Hiç taranmayan bir sayfa dizine eklenemez; dizine eklenmeyen bir sayfa da sıralamaya giremez.
Bir crawler mekanik olarak nasıl çalışır?
Markalaşmayı bir kenara bırakırsak bağlantıları izleyen crawler’ların çoğu aynı döngünün bir sürümünü çalıştırır: discover → fetch → parse → schedule → repeat. Bu, crawler davranışını anlamak için yararlı bir zihinsel modeldir; şimdiye kadar geliştirilmiş her crawler’ın bu aşamaları tamamen aynı biçimde uyguladığı anlamına gelmez.
Frontier (kuyruk). Crawler rastgele dolaşmaz. Bildiği ancak henüz ziyaret etmediği URL’lerden oluşan bir kuyruk — crawl frontier — tutar. Bir scheduler, sırada hangi URL’nin kuyruktan alınacağına karar verir. Crawler, bilinen başlangıç URL’lerinden oluşan bir başlangıç kümesiyle yola çıkar ve yeni URL’ler keşfettikçe kuyruğu büyütür. Google keşfi şöyle açıklar: “Other pages are discovered when Google extracts a link from a known page to a new page… Still other pages are discovered when you submit a list of pages (a sitemap) for Google to crawl. This process is called ‘URL discovery.’” Evidence for this claim Google discovers URLs through links from known pages and through submitted sitemaps. Scope: Google URL discovery; sitemap submission does not guarantee crawling or indexing. Confidence: high · Verified: Google: How Search works
Getirme (fetch). Crawler bir HTTP isteği gönderir, sunucu da sayfayı döndürür. Bu adımda ham HTML indirilir; JavaScript ve CSS gibi kaynaklar ayrı olarak, çoğu zaman daha sonra getirilir. Bing’den Fabrice Canel tüm bu sürecin amacını açıkça şöyle ifade eder: “Crawling is the process by which bingbot discovers new and updated documents or content to be added to Bing’s searchable index.”
Ayrıştırma (parse). Getirilen HTML; bağlantıları, metinleri, başlıkları, görselleri ve meta verileri çıkarmak için ayrıştırılır. Yeni bulunan URL’ler standartlaştırılıp frontier’a geri eklenir; döngünün sürmesini sağlayan budur.
Zamanlama (schedule). Neyin, ne sıklıkla ve her ziyarette kaç sayfanın getirileceğine siz değil, algoritmalar karar verir. Google: “Googlebot uses an algorithmic process to determine which sites to crawl, how often, and how many pages to fetch from each site.” Popüler ve sık değişen sayfalar daha erken yeniden ziyaret edilir; az bilinen ve statik sayfalar ise nadiren yeniden ziyaret edilir. (Bu zamanlamanın nasıl belirlendiği — tarama bütçesi, tarama hızı ve tarama sıklığı — bu kümede ayrı ayrı ayrıntılı biçimde ele alınır.) Evidence for this claim Googlebot algorithmically determines which sites to crawl, how often, and how many pages to fetch. Scope: web Confidence: high · Verified: In-Depth Guide to How Google Search Works
“Googlebot” tek bir program değildir
Çoğu açıklamanın gözden kaçırdığı nokta budur. “Googlebot” tek bir programmış gibi görünür; ancak öyle değildir. How Search Works sunumumda bunu; masaüstü, mobil, görsel, haber, video ve reklam gibi alanlarda özelleşmiş crawler ailesini çalıştıran ve tamamı aynı tarama bütçesi havuzundan yararlanan 1 000’den fazla sistem olarak tanımlıyorum. Gary Illyes de içeriden aynı noktaya dikkat çekmiştir: Bu ad, Shopping, AdSense ve diğer birçok Google ürününün farklı user-agent adları altında isteklerini yönlendirdiği merkezi bir tarama platformu için aslında yanıltıcıdır. Dolayısıyla loglarınızı okurken tek bir botu değil, aynı etiketi paylaşan bir filoyu izlersiniz. (Arama motoruna özgü ayrıntılar Googlebot ve Bingbot başlıklarında yer alır.)
Nezaket — crawler’lar sitenizi devre dışı bırakmaktan nasıl kaçınır?
Kurallara uygun çalışan bir crawler hızını bilinçli olarak sınırlar. Google: “They try not to crawl the site too fast to avoid overloading it. This mechanism is based on the responses of the site (for example, HTTP 500 errors mean ‘slow down’).” Taramayı geçici olarak yavaşlatmanın ardındaki mekanizma da budur: sürekli 5xx/429 yanıtları Googlebot’un bir veya iki günlüğüne geri çekilmesini sağlar; sonsuza kadar değil. Nezaket isteğe bağlı bir incelik değildir. Crawler’ların çalıştığı ölçekte, sunucuları aşırı istekle web’den düşürmelerini engelleyen tek şey budur.
Robots.txt — standart tarama kontrolü
robots.txt, fiilî erişim kontrolü standardıdır. Google: “A robots.txt file tells search engine crawlers which URLs the crawler can access on your site.” İki noktayı birbirinden ayırmak gerekir:
- Dizine eklemeyi değil, taramayı kontrol eder. İzin vermediğiniz bir sayfa, başka sayfalardan bağlantı alıyorsa yine de dizine eklenebilir. Google yalnızca içeriği veya sayfaya koyduğunuz herhangi bir
noindexetiketini göremez. Indexed, though blocked by robots.txt yazımda belirttiğim gibi: “crawling and indexing are two different things.” Bir sayfayı gerçekten kaldırmak için onu engellemeyin; taranmasına izin veripnoindexekleyin. - Güvenilir crawler’lar buna uyar, kötü niyetli aktörler uymaz. Googlebot, Bingbot, Ahrefsbot ve benzerleri
robots.txtkurallarına uyar; birçok scraper ve güvenilir olmayan bot ise bunları tamamen görmezden gelir. Bu bir uzlaşıdır, yaptırım mekanizması değildir.
Engellemenin etkisini doğrudan test ettim. The Story of Blocking 2 High-Ranking Pages With Robots.txt çalışmasında sıralamaya giren iki sayfamızı yaklaşık beş ay boyunca engelledim. Sayfalar tüm featured snippet’lerini ve özel başlıklarını kaybetti; sonuçlarda “no information is available” gösterildi. Tıklamalar, yalnızca konum değişikliğinin açıklayabileceğinden daha fazla düştü, ancak tahmini trafik neredeyse hiç değişmedi. Çıkardığım sonuç geçerliliğini koruyor: Dizine eklenmesini istediğiniz sayfaları engellemeyin. Zarar verir. Düşündüğünüz kadar büyük bir zarar vermeyebilir; ancak yine de zarar verir.
Tarama ≠ dizine ekleme ≠ rendering ≠ sıralama
En fazla kafa karışıklığına yol açan ayrımlar şunlardır:
- Tarama ≠ dizine ekleme. Tarama, getirme + indirme işlemidir; dizine ekleme ise anlama + saklama işlemidir. Bir sayfa taranıp dizine eklenmeyebilir; Google sayfayı dâhil etmemeyi seçebilir. Engellenmiş bir sayfa da hiç okunmadan dizine eklenebilir. “Indexing isn’t guaranteed; not every page that Google processes will be indexed.”
- Tarama ≠ rendering. HTML’yi getirmek ve JavaScript’ini çalıştırmak iki farklı adımdır. “During the crawl, Google renders the page and runs any JavaScript it finds using a recent version of Chrome,” ancak rendering, ilk getirme işleminin gerisinde kalabilen ayrı bir kuyrukta gerçekleşir. İçeriğiniz yalnızca JavaScript çalıştıktan sonra görünüyorsa HTML ile aynı geçişte kullanılamaz.
- Tarama ≠ sıralama. Daha sık taranmak bir sıralama sinyali değildir. Tarama hızı yalnızca verimlilikle ilgilidir; bu nedenle çoğu sitenin tarama bütçesini yönetmesine hiç gerek yoktur.
Crawler türleri (genel bakış)
Burada kısa tutuyoruz; her türün ayrıntılı bir kardeş konusu vardır:
- Arama motoru crawler’ları — Googlebot, Bingbot. Arama sonuçlarını mümkün kılan dizinleri oluştururlar.
- AI / LLM crawler’ları — GPTBot, ClaudeBot, CCBot ve AI modellerini eğitmek veya çalıştırmak için web içeriği toplayan diğerleri. Hızla büyüyorlar (aşağıya bakın).
- SEO denetim crawler’ları — Teknik sorunları ortaya çıkarmak için taramayı simüle eden Ahrefs Site Audit, Screaming Frog ve benzeri araçlar.
- Kullanıcı tarafından tetiklenen getiriciler — İstek üzerine tek bir talepte bulunan araçlar (Google’ın URL Inspection aracı ve Rich Results Test gibi). Bunlar otonom crawler değildir.
Şu anda web’i kimler tarıyor?
Artık yalnızca arama motorları söz konusu değil. Cloudflare Radar verileri üzerine yaptığım analizde (Meet the New Web Crawlers) arama motoru botları hâlâ en fazla taramayı yapıyor, ancak AI botları açık biçimde ikinci sırada. Buradaki ölçeği abartmak zordur: Yalnızca Bing, daha önce hiç görmediği on milyarlarca normalize edilmiş URL’yi her gün keşfeder (Fabrice Canel). Arama motorlarının gerçekten getirecekleri URL’lere agresif biçimde öncelik vermek zorunda olmasının nedeni tam olarak budur.
Bir crawler’ın iddia ettiği kimliğe sahip olduğu nasıl doğrulanır?
Her bot user-agent dizesine “Googlebot” yazabilir; bu nedenle yalnızca dizeye güvenmeyin. Gerçek kontrol, ters + ileri DNS sorgusudur (Scripts sekmesine bakın): Loglarınızdaki IP için ters DNS sorgusu yapın, adresin bir googlebot.com / google.com ana makine adına çözümlendiğini doğrulayın; ardından bu ana makine için ileri DNS sorgusu yaparak aynı IP’yi gösterdiğini doğrulayın. Google ayrıca IP aralıklarını yayımlar. Arama motorlarına özgü tüm user-agent ayrıntıları user-agent başlığında yer alır.
Bundan sonra nereye gitmeli?
Bu, genel kavramları ele alan sayfadır. Ayrıntılar için:
- Googlebot — Google’ın crawler’ı: user-agent’lar, mobil öncelikli tarama, rendering ve Search Console Crawl Stats.
- Bingbot — Bing’in crawler’ı: Crawl Control ve IndexNow.
- AI crawler’ları — GPTBot, ClaudeBot, CCBot ve yeni agentic botlar.
- User-agent — user-agent dizesinin ne olduğu ve nasıl okunacağı.
- Crawling hub — işlem hattının tamamının yanı sıra tarama bütçesi, tarama hızı, tarama sıklığı, tarama derinliği, spider trap’ler ve log dosyası analizi.
AI özeti
Advanced sürümün kısa özeti:
- Crawler = spider = bot. Üç ad da aynı şeyi ifade eder: Web sitelerini “automatically discover[s] and scan[s] websites,” biçiminde keşfedip tarayan ve arama motorlarının dizine ekleyip sıralayabilmesi için sayfaları indiren otomatik bir program.
- Mekanik döngü discover → fetch → parse → schedule → repeat şeklindedir. Bilinen ancak ziyaret edilmemiş URL’lerin kuyruğu olan frontier, bir scheduler bileşenini besler. Her fetch HTML’yi indirir, parse işlemi bağlantılarla içeriği çıkarır ve yeni URL’ler kuyruğa geri döner. Google, bağlantılar ve sitemap’ler üzerinden yapılan keşfe “URL discovery” der.
- Tarama üç aşamanın ilkidir (crawl → index → serve) ve “not all pages make it through each stage.” Sıralamaya girmek için gereklidir ancak bir sıralama sinyali değildir.
- Tarama ≠ dizine ekleme ≠ rendering ≠ sıralama. Dizine ekleme garanti değildir; JavaScript rendering ayrı ve daha sonraki bir adımdır; robots ile engellenmiş bir sayfa bağlantılar aracılığıyla yine de dizine eklenebilir.
- “Googlebot” tek bir program değil, bir filodur — birçok Google ürününün farklı user-agent’lar altında isteklerini yönlendirdiği merkezi bir tarama platformudur.
- Güvenilir crawler’lar nazik davranır ve
robots.txtkurallarına uyar (5xx/429durumunda hızı sınırlar — “slow down”); kötü niyetli aktörler ve birçok scraper uymaz. - Artık yalnızca arama motorları yok. AI botları hacim bakımından açık biçimde #2 konumundadır ve arama botlarına yaklaşmaktadır; yalnızca Bing her gün on milyarlarca yeni URL görür.
- Bir crawler’ı yalnızca user-agent dizesiyle değil, reverse + forward DNS ile doğrulayın.
Resmî dokümantasyon
Arama motorlarının birincil kaynak niteliğindeki dokümantasyonu.
- In-Depth Guide to How Google Search Works — tarama → dizine ekleme → sunma genel görünümü, URL keşfi ve tarama zamanlayıcısı.
- Overview of Google crawlers and fetchers — crawler tanımı, tüm Google user-agent’ları ve yayımlanan IP aralıkları.
- Googlebot — iki Googlebot varyantı (Smartphone ve Desktop) ve teknik davranışları.
- Introduction to robots.txt — robots.txt dosyasının ne yaptığı ve ne yapmadığı.
- Optimize your crawl budget — tarama kapasitesi + talebi ve buna gerçekten kimlerin ihtiyaç duyduğu.
Bing / Microsoft
- bingbot Series: Maximizing Crawl Efficiency — Bing’in tarama tanımı ve “crawl efficiency north star” yaklaşımı.
Kaynaktan alıntılar
Google ve Bing’in kayda geçmiş açıklamaları. Her bağlantı, kaynak sayfadaki alıntılanan bölüme doğrudan gider.
Google — crawler nedir ve nasıl çalışır?
- “Google downloads text, images, and videos from pages it found on the internet with automated programs called crawlers.” — Google Search Central dokümanları. Alıntıya git
- “Google Search works in three stages, and not all pages make it through each stage.” Alıntıya git
- “Other pages are discovered when Google extracts a link from a known page to a new page… Still other pages are discovered when you submit a list of pages (a sitemap) for Google to crawl. This process is called ‘URL discovery’.” Alıntıya git
- “Googlebot uses an algorithmic process to determine which sites to crawl, how often, and how many pages to fetch from each site.” Alıntıya git
- “They try not to crawl the site too fast to avoid overloading it. This mechanism is based on the responses of the site (for example, HTTP 500 errors mean ‘slow down’).” Alıntıya git
- “During the crawl, Google renders the page and runs any JavaScript it finds using a recent version of Chrome.” Alıntıya git
Google — robots.txt
- “A robots.txt file tells search engine crawlers which URLs the crawler can access on your site.” — Google Search Central dokümanları. Alıntıya git
Fabrice Canel, Microsoft Bing
- “Crawling is the process by which bingbot discovers new and updated documents or content to be added to Bing’s searchable index.” Alıntıya git
- “Our crawl efficiency north star is to crawl an URL only when the content has been added (URL not crawled before), updated (fresh on-page context or useful outbound links).” Alıntıya git
Crawler’ların görevini yapabildiğinden emin olun — kontrol listesi
Botların önemli içerikleri bulabildiğini, getirebildiğini ve okuyabildiğini doğrulamak için hızlı bir kontrol:
- Önemli sayfalara taranabilir bir yerden bağlantı veriliyor; orphan page yok. Crawler’lar URL’leri bağlantılar aracılığıyla keşfeder.
- Keşfin yalnızca bağlantılara bağlı kalmaması için bir XML sitemap gönderilmiş.
-
robots.txt, dizine eklenmesini istediğiniz hiçbir şeyi engellemiyor; hiç taranmasını istemediğiniz düşük değerli alanları ise engelliyor. - Dizinden kaldırmak amacıyla
robots.txtkullanmıyorsunuz; taramaya izin verildiğinde bu görevnoindexetiketine aittir. - Sunucu hızlı ve kararlı yanıtlar döndürüyor; botlar
5xx/429yanıtlarında yavaşlar (“slow down”). - JS’ye bağımlı içeriğe yalnızca tıklamayla çalışan gezinme yerine gerçek
<a href>bağlantılarıyla erişilebiliyor; rendering ayrı ve daha sonraki bir adımdır. - Loglarınızdaki botların yalnızca user-agent dizelerine güvenilmiyor; reverse + forward DNS ile gerçek oldukları doğrulanıyor.
Zihinsel modeller
1. Döngü — discover → fetch → parse → schedule → repeat. Bağlantıları izleyen crawler’ların çoğu bu döngünün bir sürümünü çalıştırır. Frontier, crawler’ın bildiği URL’leri tutar; scheduler sıradakini seçer; fetch işlemi URL’yi indirir; parse işlemi ise frontier’a geri beslenecek bağlantıları çıkarır. Bir sayfa taranmıyorsa hangi adımın başarısız olduğunu sorun: Sayfa hiç keşfedildi mi, yani frontier’a girdi mi? Scheduler tarafından daha düşük öncelikli hâle mi getiriliyor?
2. İşlem hattı — crawl → index → serve. Her aşama bir filtredir ve “not all pages make it through each stage.” Bir sayfa beklenen performansı göstermediğinde herhangi bir şeyi değiştirmeden önce hangi aşamada başarısız olduğunu bulun.
3. “Eşit değildir” kümesi. Bu dört kavramı birbirinden ayırırsanız crawler’larla ilgili kafa karışıklığının çoğu ortadan kalkar:
- Tarama ≠ dizine ekleme (engellenmiş bir sayfa bağlantılar aracılığıyla yine de dizine eklenebilir)
- Tarama ≠ rendering (JavaScript ayrı ve daha sonraki bir adımda çalışır)
- Tarama ≠ sıralama (crawl rate bir sıralama sinyali değildir)
- “Googlebot” ≠ tek program (tek bir platform üzerinden yönlendirilen bir filodur)
4. Bir sayfayı kaldırmaya yönelik karar kuralı.
Arama sonuçlarından kaldırmak mı istiyorsunuz? Taramaya izin verin + noindex ekleyin. Botların bir alanı tamamen atlamasını istiyor ve dizine eklenmesini önemsemiyor musunuz? robots.txt ile disallow uygulayın. Dizinden kaldırmak için asla disallow kullanmayın.
Crawler — kısa başvuru
Üç ad, tek şey: crawler = spider = bot (spiderbot). Birbirlerinin yerine kullanılabilirler.
Döngü: discover (frontier) → fetch (HTML’yi indir) → parse (bağlantıları + içeriği çıkar) → schedule (sıradakine karar ver) → repeat.
İşlem hattı: crawl → index → serve. Tarama ilk kapıdır; “not all pages make it through each stage.”
“Eşit değildir” ayrımları:
| Ayrım | Anlamı |
|---|---|
| Tarama ≠ dizine ekleme | Engellenmiş bir sayfa bağlantılar aracılığıyla yine de dizine eklenebilir; dizine ekleme garanti değildir |
| Tarama ≠ rendering | JavaScript ayrı ve daha sonraki bir adımda çalışır |
| Tarama ≠ sıralama | Daha fazla tarama konumları yükseltmez; bu bir sıralama sinyali değildir |
| ”Googlebot” ≠ tek program | Tek bir platform üzerinden yönlendirilen crawler filosu |
Nezaket: Crawler’lar hızlarını sınırlar; sürekli 5xx/429 = “slow down.”
Kontrol: robots.txt, dizine eklemeyi değil taramayı kontrol eder; dizinden kaldırmak için kullanmayın. Güvenilir crawler’lar buna uyar; birçok scraper uymaz.
Crawler doğrulama: Yalnızca user-agent dizesine asla güvenmeyin; reverse + forward DNS kullanın.
Genel görünüm (2026): En fazla taramayı arama motoru botları yapıyor; AI botları hızla yükselen #2 konumunda ve yalnızca Bing her gün on milyarlarca yeni URL keşfediyor.
Bir botun gerçekten iddia ettiği crawler olduğunu doğrulayın
User-agent dizesini taklit etmek son derece kolaydır; bu nedenle tek güvenilir kontrol DNS’tir. Googlebot için reverse + forward DNS sorgusunun bir Google alan adına ve ardından aynı IP’ye çözümlendiğini doğrulayın.
macOS / Linux
# 1) Reverse DNS the IP from your logs — it should end in googlebot.com or google.com
host 66.249.66.1
# → 1.66.249.66.in-addr.arpa domain name pointer crawl-66-249-66-1.googlebot.com
# 2) Forward DNS that hostname back — it must resolve to the same IP
host crawl-66-249-66-1.googlebot.com
# → crawl-66-249-66-1.googlebot.com has address 66.249.66.1Windows
nslookup 66.249.66.1
nslookup crawl-66-249-66-1.googlebot.comReverse lookup sonucu bir Google alan adıyla bitmiyorsa veya forward lookup özgün IP ile eşleşmiyorsa bu gerçekten Googlebot değildir. IP’yi Google’ın yayımladığı aralıklarla da karşılaştırabilirsiniz: googlebot.json. Aynı reverse-then-forward yöntemi, diğer güvenilir crawler’ları kendi yayımlanmış hostname’lerine göre doğrulamak için de kullanılabilir.
Crawler erişimini ve etkinliğini incelemeye yönelik araçlar
- Robots.txt Tester — Bir tarama boşluğunu scheduling sorunu olarak değerlendirmeden önce belirli bir crawler’ın URL istemesine izin verilip verilmediğini test edin.
- Log File Analyzer — Hangi crawler’ların sunucuya gerçekten eriştiğini, hangi URL’leri istediğini ve hangi durum kodlarını aldığını görün.
- HTTP Header Checker — Yönlendirmeler ve header’larda gönderilen crawler yönergeleri dâhil olmak üzere crawler’ın aldığı yanıtı inceleyin.
- Render Gap Analyzer — Bir crawler sayfayı getirebildiği hâlde önemli içerik client-side rendering’e bağlıysa ham ve render edilmiş HTML’yi karşılaştırın.
Kendinizi sınayın: web crawler’ları
Zaman ayırmaya değer kaynaklar
İlgili yazılarım
- What Is Googlebot & How Does It Work? — Google’ın crawler filosuna ilişkin ayrıntılı inceleme.
- Indexed, though blocked by robots.txt — Engellenmiş sayfaların neden yine de dizine eklendiği (crawl ≠ index).
- The Story of Blocking 2 High-Ranking Pages With Robots.txt — Tarama ile sıralama arasındaki ilişkiye dair birinci taraf deneyim.
- When Should You Worry About Crawl Budget? — Tarama verimliliğinin gerçekten ne zaman önemli olduğu.
- Meet the New Web Crawlers: AI Bots Are Closing in on Search Engine Bots — Değişen crawler ortamı.
Konuşmalarım
- How Search Works (SlideShare) — Tarama, rendering, dizine ekleme ve sıralamaya ilişkin anlatımım. (Standart sorumluluk reddi geçerlidir: “This is my understanding of systems… not going to be 100% complete or accurate.”)
Başkalarından
- Search Off the Record — “What is a web crawler, really?” — Gary Illyes ve Lizzi Sassman, crawler’ın ne olduğunu ve “Googlebot is a misnomer” görüşünü ele alıyor.
- Search Off the Record — “Crawling smarter, not harder” (Ep. 79) — Gary Illyes ve John Mueller; crawl budget, scheduler ve sitelerin 90%+ bölümünün neden bunu dert etmesine gerek olmadığını ele alıyor.
- Google Search Central Blog — Crawling December resources (2024) — Google’ın taramanın temellerine ilişkin kendi seçilmiş ayrıntılı içerik dizisi.
- Search Engine Journal — Google’s Crawling Priorities: Insights From Gary Illyes — Illyes’in kaliteden ödün vermeden taramayı azaltma hedefini ele alıyor.
- Search Engine Land — Google explains what “crawl budget” means for webmasters — Google’ın crawl capacity ve crawl demand kavramlarını ilk kez tanımladığı 2017 tarihli özgün haber.
- Wikipedia — Web crawler — Resmî bilgisayar bilimi terminolojisi (frontier, politeness policy) ve tarihçe için yararlı.
- r/TechSEO — Tarama ve dizine ekleme sorunlarını gidermeye yönelik topluluk.
Alıntılamaya değer istatistikler
- AI botları arama botlarına yaklaşıyor. Cloudflare Radar analizime göre arama motoru crawler’ları hâlâ en fazla taramayı yapıyor, ancak AI botları hacim bakımından açık biçimde #2 konumunda. Kaynak
- Bing, daha önce hiç görülmemiş on milyarlarca normalize edilmiş URL’yi her gün keşfediyor. Bu, arama motorlarının agresif biçimde filtrelediği keşif sorununun ölçeğini gösteriyor (Fabrice Canel, Microsoft Bing, 2022). Haber
Değişiklik günlüğü
9 Ağu 2026 tarihinde güncellendi.
Editoryal özet ve kaydedilen değişiklik ayrıntıları.Değişiklik ayrıntıları
-
Ayrıntılı değişiklik notları şu anda İngilizce olarak mevcut.
Tam karşılaştırma kullanılamıyor — bu sürüm için önceki anlık görüntü arşivlenmemiş.
8 Ağu 2026 tarihinde güncellendi.
Editoryal özet ve kaydedilen değişiklik ayrıntıları.Değişiklik ayrıntıları
-
Ayrıntılı değişiklik notları şu anda İngilizce olarak mevcut.
Tam karşılaştırma kullanılamıyor — bu sürüm için önceki anlık görüntü arşivlenmemiş.
17 Tem 2026 tarihinde güncellendi.
Editoryal özet ve kaydedilen değişiklik ayrıntıları.Değişiklik ayrıntıları
-
Ayrıntılı değişiklik notları şu anda İngilizce olarak mevcut.
-
Ayrıntılı değişiklik notları şu anda İngilizce olarak mevcut.
-
Ayrıntılı değişiklik notları şu anda İngilizce olarak mevcut.
Tam karşılaştırma kullanılamıyor — bu sürüm için önceki anlık görüntü arşivlenmemiş.