AI Tarayıcı Günlük Analizi
Sunucu veya CDN günlüklerini nasıl çekip AI bot etkinliğini analiz edeceğiniz — GPTBot, ClaudeBot ve PerplexityBot'u sahteciliğe karşı doğrulama, araç seçimi ve tarama sıklığı, tarama-ve-işleme ile durum kodlarını okuma.
Diller
Bu sayfada 1 kanıt sinyali
- Bağlantılı kaynak verileri`openai.com/gptbot.json`
AI tarayıcı günlük analizi, kendi birinci taraf günlüklerinizle (satıcı paneli değil) hangi iddia edilen AI botlarının sitenizi istediğini ve sunucunun ne döndürdüğünü inceleme yöntemidir. Doğrulama sağlayıcıya özeldir: OpenAI botlara özel IP aralığı dosyaları yayınlar ve Anthropic güncel bir ortak bots.json listesi yayınlar; güncel resmi doğrulama yöntemi olmayan bir kullanıcı ajanı, doğrulanmış bir kimlik değil, bir iddiadır. Ham HTML bağımlılığını, her büyük AI tarayıcısının JavaScript çalıştırmadığını iddia etmek yerine gözlemlenen bir risk olarak değerlendirin; varlık istek desenleri evrensel bir işleme sözleşmesini değil, ölçülen örneği tanımlar. Tarama sıklığı hala alıntıyı tahmin etmez — erişim gerekli ancak yeterli değildir. Araçlar grep'ten Screaming Frog LFA'ya, ELK/Splunk'a ve BigQuery/Cloudflare'a kadar ölçeklenir.
TL;DR — AI tarayıcı günlük analizi, OpenAI’nin GPTBot’u veya Anthropic’in ClaudeBot’u gibi hangi AI botlarının sitenizi gerçekten ziyaret ettiğini, bunu ne sıklıkta yaptığını ve hangi içeriği aldığını görmek için sunucunuzun ham erişim günlüklerini incelemektir. Bunu kaydeden tek yer günlüklerinizdir. Google Search Console AI botlarını göstermez; Google Analytics ise botların kendisini değil, yalnızca bağlantıya tıklayıp sitenize gelen kişileri görür. Ancak bir sorun vardır: Trafiğin büyük bölümü ünlü bir AI botu olduğunu iddia etse de gerçekte değildir; bu nedenle yalnızca ada güvenemezsiniz.
Günlük dosyası nedir
Sunucu erişim günlükleri, sunucuya ulaşan istekleri kaydeder; yapılandırıldığında kullanıcı aracısı, zaman, yol ve yanıt ayrıntılarını içerir. Evidence for this claim Server access logs record requests and can include fields such as request path, status, referrer, and user agent. Scope: Apache HTTP Server logging; available fields depend on server configuration. Confidence: high · Verified: Apache: Log files Satıcı tarayıcı belgeleri kullanıcı aracılarını tanımlar, ancak tek başına bir dize isteği yapanın gerçek olduğunu kanıtlamaz. Evidence for this claim OpenAI publishes user-agent tokens and controls for several of its crawlers. Scope: OpenAI's documented crawlers; a user-agent string is not proof of downstream training, retrieval, citation, or use. Confidence: high · Verified: OpenAI: Crawlers
Bir kişinin tarayıcısı, Googlebot veya GPTBot gibi herhangi bir istemci sunucunuzdan bir sayfa istediğinde, sunucunuz bir günlük dosyasına bir satır yazar. Her satır; zamanı, ziyaretçinin IP adresini, ne istediğini, ziyaretçinin kendisini tanımlamak için kullandığı “kullanıcı aracısını” (GPTBot gibi bir etiket) ve sunucunuzun döndürdüğü yanıt kodunu (200 başarı, 404 bulunamadı vb.) kaydeder.
AI tarayıcı günlük analizi, bu satırları okuyup yalnızca AI botlarıyla ilgili olanları filtrelemektir. Başka hiçbir yolla kesin olarak yanıtlayamayacağınız şu soruları yanıtlar:
- Bir AI botu sitemi gerçekten ziyaret etti mi?
- Hangi sayfaları getirdi, hangi önemli sayfaları görmezden geldi?
- Bu gerçek bot muydu, yoksa onu taklit eden bir şey mi?
- Ne aldı: gerçek içeriğimi mi, yoksa bir hata sayfasını mı?
AI botlarının tamamını ve her birinin ne işe yaradığını (eğitim botları, arama botları ve “bu sayfayı hemen getir” botları) öğrenmek istiyorsanız bu ayrı bir konudur; bkz. AI tarayıcıları. Bu sayfa nasıl yapılacağına odaklanır: günlüklerin alınması ve okunması.
Panolarınız neden bunu kapsamıyor
- Google Search Console bir Tarama İstatistikleri raporu sunar, ancak bu rapor yalnızca Googlebot ile ilgilidir. GPTBot, ClaudeBot veya PerplexityBot hakkında hiçbir şey göstermez.
- Google Analytics (GA4) yalnızca bir bağlantıya tıklayarak sitenize gelen ve bir “yönlendiren” bilgisi taşıyan ziyaretçileri kaydeder. Sayfanızı arka planda getiren bir tarayıcı burada hiç görünmez.
Dolayısıyla gerçeğin asıl kaynağı günlüklerdir. Botu başka hiçbir sistem görmez.
Yeni başlayanların kaçırdığı tek şey
Günlüklerinizde GPTBot etiketinin bulunması, isteğin gerçekten OpenAI’den geldiğini kanıtlamaz. Herkes bir isteğe istediği kullanıcı aracısı dizesini ekleyebilir; bu, bir zarfın üzerine dönüş adresi yazmaya benzer. Birçok kazıyıcı, meşru görünmek için trafiğinde ünlü bir botun adını kullanır. Emin olmanın tek yolu, ziyaretçinin IP adresini AI şirketinin yayınladığı gerçek adresler listesiyle karşılaştırmaktır. Bu doğrulama adımı, analizin doğru yapılmasının temelidir ve Gelişmiş sekmesi süreci adım adım açıklar.
TL;DR — Apache/Nginx veya CDN erişim günlüklerinizi alın, ardından dört işlem yapın: doğrulayın (kullanıcı aracısını eşleştirin ve IP’yi her operatörün yayınladığı listeyle doğrulayın; sahtecilik oranları HUMAN Security’nin %5,7’lik ölçümünden Duane Forrester’ın kendi testindeki %81,8’e kadar değişmektedir); ölçeğe göre bir araç seçin (grep → Screaming Frog Log File Analyser → ELK/Splunk → BigQuery/Cloudflare); bota göre tarama sıklığını, ziyaret edilen sayfaları, tarama-işleme farkını ve durum kodlarını ölçün; son olarak dürüstçe yorumlayın — içeriğin alınması gerekli ama yeterli değildir, dolayısıyla “daha fazla tarama = daha fazla alıntı” iddiası kanıtlanmış değildir. Bu yöntem; botların ne olduğunu ele alan AI tarayıcıları, tıklama tarafını ele alan AI trafik atıflaması ve alınan → bahsedilen → alıntılanan çerçevesinin ilk aşamasını gözlemleyen LLM görünürlüğü konularının tamamlayıcısıdır.
Bu makalenin kapsadığı — ve kapsamadığı
Günlükler istekleri gösterir, içeriğin eğitim, erişim veya bir yanıt için kullanılıp kullanılmadığını değil. Evidence for this claim Server access logs record requests and can include fields such as request path, status, referrer, and user agent. Scope: Apache HTTP Server logging; available fields depend on server configuration. Confidence: high · Verified: Apache: Log files Mümkün olduğunda sağlayıcı tarafından yayınlanan mekanizmaları kullanarak botları doğrulayın ve atıflamayı sınırlı kanıt olarak değerlendirin. Evidence for this claim OpenAI publishes user-agent tokens and controls for several of its crawlers. Scope: OpenAI's documented crawlers; a user-agent string is not proof of downstream training, retrieval, citation, or use. Confidence: high · Verified: OpenAI: Crawlers
İlgili AI tarayıcıları makalesi, botlara göre hazırlanmış tabloyu, üç kategorili sınıflandırmayı (eğitim / AI araması / kullanıcı tarafından tetiklenen getirme), Google-Extended’ın bot değil belirteç olması ayrımını ve robots.txt tariflerini zaten kapsıyor. Bunları burada yeniden türetmiyorum. AI trafik atıflaması, GA4/yönlendiren tarafını, yani botun geri gönderdiği trafiği ele alır. Bu makale huninin diğer tarafıyla, yani botun aldığı içerikle ilgilidir. LLM görünürlüğü ise alınan → bahsedilen → alıntılanan çerçevesini kapsar; günlük analizi yalnızca alınan aşamasını gözlemlemenizi sağlar, sonrasını değil.
Bu, klasik SEO günlük dosyası analizinin AI çağındaki devamıdır. Ahrefs’in How to Do an SEO Log File Analysis başlıklı çalışmasını incelediğimde boyutlar; tarama sıklığı, taranan URL’ler, durum kodları ve botların Google’ın yayınladığı IP’lerle doğrulanmasıydı. Burada da aynı iskelet kullanılıyor; ancak çoğunlukla JavaScript işlemeyen, sürekli taklit edilen ve düzenli bir akış yerine düzensiz patlamalar hâlinde tarama yapan bir bot grubuna uygulanıyor.
Adım 1 — Günlüklerinizi alın
Günlükleriniz şu iki yerden birinde veya her ikisinde bulunur:
- Kaynak sunucu günlükleri. Apache (
access.log), Nginx (access.log) veya uygulama sunucunuz. Her satır en azından zaman damgası, istemci IP’si, istek yöntemi + yolu, durum kodu, bayt sayısı, yönlendiren ve kullanıcı aracısı içerir. - CDN / uç günlükleri. Cloudflare, Fastly, Akamai vb. arkasındaysanız bot trafiğinin büyük bölümü uçta yanıtlanır ve kaynak sunucunuza hiç ulaşmayabilir. Bu nedenle uç günlüğü daha eksiksiz bir kayıttır. Cloudflare bunu Logpush (ve bir GraphQL API’si), Fastly ise gerçek zamanlı günlük akışı yoluyla sunar.
AI bot analizi için gerçekten ihtiyaç duyduğunuz alanlar şunlardır: zaman damgası, istemci IP’si, kullanıcı aracısı, istek yolu, durum kodu ve tercihen bayt sayısı ile yönlendiren.
Pratikteki sorun saklama süresidir. Birçok barındırma sağlayıcısı günlükleri yalnızca birkaç gün tutar. Lauren Busby’nin Search Engine Land yazısı çözümü doğrudan açıklar: zamanlanmış bir çekim, kısa bir zaman aralığını zaman içinde analiz edilebilir hâle getirir. n8n gibi bir iş akışı aracında oluşturulan veya betikle çalışan zamanlanmış bir SFTP işi, kısa saklama süresini zaman içinde gerçekten analiz edebileceğiniz bir veri kümesine dönüştürmek için yeterlidir (Busby, SEL). Bunu verilere ihtiyaç duymadan önce kurun.
Başlangıçtan itibaren göz önünde bulundurmanız gereken önemli bir sınırlama vardır: Busby’nin ifade ettiği gibi günlük dosyaları sitenize neyin ulaştığını gösterir, ancak neyin ulaşmaya çalıştığını her zaman göstermez (SEL); üst katmanda engellenen veya yanıtlanan istekler günlüklerde hiç görünmeyebilir.
Adım 2 — Kullanıcı aracısına güvenmeden önce doğrulayın
AI bot günlük analizini klasik sürümden ayıran ve rakip rehberlerin çoğunun atladığı adım budur. Kullanıcı aracısı dizeleri son derece kolay taklit edilebilir. Sorunun boyutunu gösteren iki bağımsız veri noktası şöyledir:
- HUMAN Security, iyi bilinen 16 AI tarayıcısından biri olduğunu iddia eden iki haftalık trafiği analiz etti ve trafiğin %5,7’sinin sahte olduğunu belirledi; bu, yaklaşık her 18 istekten 1’idir (SEJ aracılığıyla aktarıldı).
- Duane Forrester, aynı kontrolü kendi günlüklerinde gerçekleştirdi ve çok daha kötü bir sonuç buldu. Canlı getirme adlarından birini taşıyan 33 isteğin altısı satıcının yayınladığı bir IP’den geldi, yirmi yedisi ise gelmedi. Bu, kontrol edebildiği isteklerde %81,8 sahtecilik oranı anlamına geliyordu (SEJ). Googlebot sonucu daha da kötüydü: Googlebot adını taşıyan 799 isteğin yalnızca 107’si doğrulanmış bir Google adresinden gelmişti; kalan yaklaşık %87 Google’a ait değildi (SEJ).
Bunları farklı örneklemlerden ve yöntemlerden gelen yönlendirici bilgiler olarak ele alın, evrensel bir sayı olarak değil. Daha da önemlisi, bir sağlayıcının doğrulama yöntemini her bota genellemeyin. Bazı operatörler adres aralıklarını yayınlar; diğerleri, güncel bir genel aralık veya DNS doğrulama sözleşmesi olmadan kullanıcı aracısı belirteçlerini belgeler (SEJ).
Doğrulama yöntemi:
- Kullanıcı aracısı dizesini eşleştirin. GPTBot kendisini
Mozilla/5.0 AppleWebKit/537.36 (KHTML, like Gecko); compatible; GPTBot/1.3; +https://openai.com/gptbotolarak tanımlar; OAI-SearchBot ve ChatGPT-User kendi belirteçlerini taşır (OpenAI bot belgeleri). - Varsa sağlayıcının güncel resmî doğrulama yöntemini kullanın. OpenAI
openai.com/gptbot.json,searchbot.jsonvechatgpt-user.jsondosyalarını sunar. Anthropic’in güncel tarayıcı belgeleri, yayınladığı listedeki bir adresin tarayıcının Anthropic’ten geldiğini gösterdiğini belirtir. Sağlayıcıya özgü bu güncel yöntemi kullanın; bunu evrensel bir bot doğrulama kuralı olarak genellemeyin. - Bir yedek yöntem uydurmayın. Ters ve ileri DNS doğrulaması yalnızca sağlayıcı beklenen ana bilgisayar adı kalıbını ve doğrulama prosedürünü yayınladığında o sağlayıcı için geçerlidir. Genel bir PTR eşleşmesi, iddia edilen bot kimliğini değil yalnızca DNS üzerindeki kontrolü kanıtlar. Screaming Frog Log File Analyser, mevcut olduğu durumlarda herkese açık biçimde doğrulanmış listeleri uygulayabilir; içe aktarım sırasında doğrulama özelliği, botların gerçekliğini doğrulamak için herkese açık biçimde doğrulanmış IP listelerini sorgular (Screaming Frog).
Doğrulama, hassas politika kararlarına ve olay müdahalesine temel oluşturmalıdır. Tarama politikası için sağlayıcının belgelediği robots belirtecini tercih edin; ağ kontrollerini kötüye kullanım veya güvenlik vakaları için kullanın ve bunları robots uyumluluğundan ayrı olarak sınıflandırın.
Adım 3 — Aracınızı seçin
Aracı işin ölçeğine göre seçin; kabaca ücretsizden ücretliye, ham gerçek veriden yönetilen çözümlere doğru:
- grep / PowerShell — hızlı bir tek seferlik sayım ve doğrulama bilincine sahip bir filtre. AI tarayıcılar makalesi temel bot sayım kod parçacığını içerir; buradaki Scripts sekmesi bunu IP doğrulama, durum kodu dökümü ve tarama-ile-işleme algılama ile genişletir.
- Screaming Frog Log File Analyser — yerleşik AI bot ön ayarlarına (GPTBot, OAI-SearchBot, ChatGPT-User, ClaudeBot, Claude-User, PerplexityBot, Perplexity-User, CCBot) ve bir “Verify Bots When Importing” geçişine sahip bir masaüstü içe aktarıcı. Response Codes sekmesi URL başına 2XX/3XX/4XX/5XX’i ayırır, User Agents sekmesi bot başına istekleri ve hata oranlarını gösterir, URLs sekmesi Num Events’e (en çok getirilen sayfalar) göre sıralar ve IPs sekmesi şüpheli kaynakları araştırmanıza olanak tanır (öğretici).
- ELK Stack (Elasticsearch / Logstash / Kibana) veya Splunk — tek seferlik içe aktaran bir masaüstü aracı çok yavaşladığında veya periyodik dışa aktarmalar yerine sürekli izleme istediğinizde, panolar ve uyarılarla sürekli, daha büyük ölçekli alım için.
- BigQuery — uzun vadeli saklama ve ölçekte SQL sorgulama için, genellikle Cloudflare Logpush veya Cloudflare’in
httpRequestsAdaptiveGroupsveri kümesinden zamanlanmış bir GraphQL çekmesiyle beslenir; böylece düz dosyaları yeniden içe aktarmadan bot etkinliğini sayfa, tarih ve durum koduna göre sorgulayabilirsiniz. - Cloudflare AI Crawl Control (Cloudflare arkasındaki siteler için) — kendi hattınızı oluşturmadan tarayıcı etkinliği ve istek modelleri, bot doğrulama ve yönerge uyumluluk takibi için yönetilen bir panel (belgeler).
Adım 4 — Ne ölçülmeli ve nasıl okunmalı
Bota göre tarama sıklığı. Her bot adı için günlük/haftalık istek sayısı. AI botları düzenli akışlar hâlinde değil, ani patlamalar hâlinde tarama yapar. WISLR’ın 48 günlük CDN günlüğü vaka çalışmasında GPTBot haftalarca hiç görünmedi, ardından tek bir haftada 187 istek yaptı; bunların 152’si üç dakikalık bir patlama sırasında gerçekleşti ve hız dakikada 114 istekle zirveye ulaştı (WISLR). Sıklığı yalnızca toplam sayı olarak değil, bir davranış örüntüsü olarak değerlendirin.
Hangi sayfalar ziyaret ediliyor, hangi önemli sayfalar edilmiyor? İstek sayısına göre sıralayın. Busby, AI tarayıcılarının genellikle yüzeyde kaldığını belirtir; yalnızca ana sayfa, birincil gezinme sayfaları ve az sayıdaki üst düzey URL ile sınırlı kalmaları yaygındır (SEL). Alıntılanma açısından en önemli olabilecek derin sayfalara gelindiğinde istekler keskin biçimde azalır. Günlüklerde hiç görünmeyen derin bir sayfa alınamaz.
Ham HTML bağımlılığı — ölçün, genellemeyin. Sağlayıcı belgeleri GPTBot, OAI-SearchBot, ChatGPT-User, ClaudeBot, PerplexityBot ve diğer aracılar için ortak bir JavaScript işleme sözleşmesi sunmaz. Yine de gözlemlenen bir işaret yararlı olabilir: WISLR örneğinde ChatGPT-User yalnızca HTML getirdi; görseller, CSS veya JS dosyaları için hiç istek yapmadı. Googlebot ve OAI-SearchBot ise görselleri de aldı (WISLR). Günlükleriniz AI botlarının ham HTML’si neredeyse boş bir JS kabuğundan oluşan sayfalara sürekli istek yaptığını gösteriyorsa bu, kontrol edilebilir bir bağımlılık riskidir; her sağlayıcının daima böyle davrandığının kanıtı değildir. Sunulan HTML’yi sonuçlarla veya sağlayıcıya özgü getirme testleriyle karşılaştırın. (İşleme temelleri için JavaScript SEO’ya bakın.)
Durum kodları / engellenen istekler dökümü. Şunları izleyin: 200 (başarılı), 304 (değiştirilmedi — verimli yeniden tarama), 404 (botun izlediği bozuk bağlantılar) ve 403/429 (engellendi / hız sınırına takıldı). Busby, günlük dosyalarının tarayıcıların sorun yaşadığı noktaları; özellikle 403 yanıtlarını (engellenen istekler) ve 429 yanıtlarını (hız sınırlaması) ortaya çıkardığını belirtir (SEL). Engellemenin kasıtlı mı yoksa yanlışlıkla mı uygulandığını kontrol edin.
robots.txt ve llms.txt isteklerini kendi sinyalleri olarak ele alın. Hangi botların taramadan önce /robots.txt dosyasını hiç kontrol etmediğini çapraz referanslayın — WISLR örneğinde, GPTBot ve Meta-WebIndexer 48 gün boyunca bunu hiç kontrol etmedi — ve yasaklanan yolların yine de ziyaret edilip edilmediğini kontrol edin. WISLR ayrıca bu 48 gün boyunca herhangi bir yapay zeka botundan /llms.txt dosyasına sıfır istek kaydetti (WISLR); bu, AI tarayıcılar makalesinde ele alınan yaklaşık %97 oranında okunmama bulgusuyla tutarlıdır. Günlüklerinizde llms.txt isteklerini, onun “çalıştığının” kanıtı olarak beklemeyin.
Daha fazla tarama daha fazla alıntı anlamına mı gelir? Dürüst olun.
“Daha çok taranırsanız daha çok alıntılanırsınız” iddiasını destekleyen yerleşik bir veri yoktur. İçeriğin alınması, alıntılanmak için gerekli bir ön koşuldur ancak yeterli olmaktan çok uzaktır. Sayfalar; istemci tarafında işleme, ödeme duvarları, zayıf veya yinelenen içerik ya da modelin alma/sıralama aşamasında daha iyi bir kaynağa yenilme gibi nedenlerle sürekli tarandıkları hâlde hiç alıntılanmayabilir. Temel çerçeve LLM görünürlüğü makalesinde yer alır: alınan → bahsedilen → alıntılanan. Günlük analizi yalnızca ilk aşamayı gözlemler.
Döngüyü dürüstçe tamamlamanın yolu, tarama girdisi tarafını (günlüklerinizi) alıntı çıktısı tarafıyla eşleştirmektir. Bing’in AI Performance raporu (genel önizleme, Şubat 2026), alıntı verilerini grounding sorgularıyla, yani AI’ın ürettiği yanıtlarda kaynak gösterilen içeriği alırken kullandığı anahtar ifadelerle birlikte sunan ilk resmî araçtır (Bing Webmaster Blog). Günlükler neyin alındığını; grounding sorguları ve alıntı sayıları ise bunun sonucunda ne olduğunu gösterir. Bunların hiçbiri tek başına resmin tamamını sunmaz. Bu katmanların nasıl bir araya geldiğini görmek için ölçüm ve raporlama merkezine bakın.
Gizli tarama sorunu
Doğrulama tek seferlik bir denetim değildir. Seer Interactive’den Clint Spaulding’e göre, engellendikten sonra gizli tarayıcılar genel tarayıcı başlıkları ve ilgisiz IP’ler altında yeniden ortaya çıkabilir — bu oturumlar günlüklerde insan gibi görünür; bu da oturum sayılarının şişirilmesine, bot trafiğinin eksik sayılmasına ve GEO segmentasyonunun daha az güvenilir hale gelmesine neden olur (Seer). Onun net özeti: bu gizli tarayıcıları göremezseniz, etkilerini ölçemezsiniz. Günlük analizinin tek bir geçiş değil, periyodik yeniden doğrulama ve yeniden temel belirleme gerektirmesinin nedeni tam olarak budur.
AI özeti
Gelişmiş sürümün kısa özeti:
- AI tarayıcı günlük analizi = AI bot istekleri için ham sunucu/CDN günlüklerini okumak ve birinci taraf verilerle hangi botların size ulaştığını, gerçek olup olmadıklarını ve ne aldıklarını doğrulamak. GSC (yalnızca Googlebot) ve GA4 (yalnızca yönlendiren) bunu görmez.
- Kapsam: bu yöntemdir. Botların ne olduğu AI tarayıcıları bölümünde; tıklama tarafı AI trafik atıflaması bölümünde; alınan → bahsedilen → alıntılanan çerçeve LLM görünürlüğü bölümünde (günlükler yalnızca alınanı gözlemler).
- Doğrulanmış kimliği iddia edilen bir kullanıcı aracısından ayırın. Kullanıcı aracıları sahtedir — HUMAN Security
16 botta %5,7 ölçtü; Duane Forrester canlı getirme isteklerinde %81,8 sahte olduğunu kendi test etti
(Googlebot için %87). UA’yı eşleştirin ve kaynak IP’yi, varsa operatörün güncel resmi listesine karşı kontrol edin (örneğin,
openai.com/gptbot.jsonveya Anthropic’inclaude.com/crawling/bots.jsondosyası). Genel bir ters-DNS yedeği icat etmeyin. - Ölçeğe göre araçlar: grep → Screaming Frog LFA (AI ön ayarları + içe aktarımda doğrulama) → ELK/Splunk → BigQuery / Cloudflare AI Crawl Control.
- Ölçün: bota göre tarama sıklığı (patlamalı, örn. WISLR’ın 3 dakikada 152 GPTBot isteği), isabet edilen sayfalar, ham-HTML bağımlılığı (WISLR’ın ChatGPT-User örneği sıfır görsel/CSS/JS getirdi), durum kodları (403/429) ve robots.txt/llms.txt istekleri (WISLR 48 günde sıfır llms.txt isabeti kaydetti).
- Tarama ≠ alıntı. Alım gerekli ancak yeterli değildir — “daha fazla tarama = daha fazla alıntı” kanıtlanmamıştır. Döngüyü kapatmak için günlükleri Bing’in grounding sorgularıyla eşleştirin.
- Periyodik olarak yeniden doğrulayın — engellenen gizli tarayıcılar insan gibi görünerek yeniden ortaya çıkar.
Resmî belgeler
Birincil kaynaklar: bot operatörlerinin kendi doğrulama dosyaları ve platform belgeleri.
OpenAI
- OpenAI botlar / tarayıcılar dokümanları — GPTBot, OAI-SearchBot, ChatGPT-User, OAI-AdsBot için kullanıcı aracısı dizeleri ve davranışı.
- Doğrulama için yayınlanmış IP listeleri: gptbot.json, searchbot.json, chatgpt-user.json, adsbot.json.
Anthropic
- Anthropic web’den veri tarar mı? — güncel bot adları, amaçları, robots kontrolleri ve yayınlanmış listesindeki bir adresin bir Anthropic tarayıcısını gösterdiği ifadesi.
- Anthropic tarayıcı IP listesi — ClaudeBot, Claude-SearchBot ve Claude-User için güncel ortak doğrulama kaynağı.
- Tarama İstatistikleri raporu — Google’ın kendi tarama etkinliği görünümü (yalnızca Googlebot; üçüncü taraf AI botlarını kapsamaz, bu yüzden onlar için ham günlükler gerekir).
Cloudflare
- AI Crawl Control — AI tarayıcı etkinliği, bot doğrulama ve yönerge uyumu için yönetilen kontrol paneli.
Bing / Microsoft
- Bing Webmaster Tools’ta AI Performansını Tanıtıyoruz (Genel Önizleme) — günlük analizinin alıntı sonucu karşılığı: Toplam Alıntılar, Ortalama Alıntılanan Sayfalar, Grounding Sorguları ve sayfa düzeyinde alıntı etkinliği.
Kaynaktan alıntılar
Operatörlerden ve adı geçen uygulayıcılardan kayıt altına alınmış ifadeler.
Anthropic — güncel kapsam
- Anthropic’in güncel destek sayfası ClaudeBot, Claude-SearchBot ve Claude-User’ı ayırt eder, robots kontrollerinin nasıl uygulandığını belgeler ve yayınlanmış listesindeki bir adresin bir Anthropic tarayıcısını gösterdiğini söyler. Kaynak
Lauren Busby, Trebletree Kurucu Ortağı — Search Engine Land
- “Log files are the closest thing to that missing layer. They don’t summarize or interpret activity. They record it — every request, every URL, every crawler.” (Türkçe çeviri) “Günlük dosyaları, eksik olan bu katmana en yakın şeydir. Etkinliği özetlemez veya yorumlamaz; her isteği, her URL’yi ve her tarayıcıyı kaydeder.”
- “Tools like Screaming Frog Log File Analyzer make it possible to process that data quickly.” (Türkçe çeviri) “Screaming Frog Log File Analyzer gibi araçlar bu verileri hızla işlemeyi mümkün kılar.”
- AI tarayıcılarının erişim derinliği hakkında: “It’s common to see them limited to top-level pages – the homepage, primary navigation, and a small number of high-level URLs.” (Türkçe çeviri) “Bunların üst düzey sayfalarla — ana sayfa, birincil gezinme ve az sayıda üst düzey URL ile — sınırlı kaldığını görmek yaygındır.”
- Günlüklerin ortaya çıkardığı sorunlar hakkında: “Log files also surface where crawlers encounter issues. This includes: 403 responses (blocked requests). 429 responses (rate limiting).” (Türkçe çeviri) “Günlük dosyaları, tarayıcıların nerede sorunla karşılaştığını da gösterir. Buna 403 yanıtları (engellenen istekler) ve 429 yanıtları (hız sınırlaması) dahildir.”
- Saklama süresi hakkında: “A scheduled SFTP job – whether built in a workflow tool like n8n, or scripted – is enough to turn a short retention window into something you can actually analyze over time.” (Türkçe çeviri) “n8n gibi bir iş akışı aracında oluşturulan veya betikle çalışan zamanlanmış bir SFTP işi, kısa saklama süresini zaman içinde gerçekten analiz edebileceğiniz bir veri kümesine dönüştürmek için yeterlidir.”
- Sınırlama hakkında: “Log files show you what reached your site. They don’t always show you what tried to.” (Türkçe çeviri) “Günlük dosyaları sitenize neyin ulaştığını gösterir; neyin ulaşmaya çalıştığını her zaman göstermez.” Kaynak
Duane Forrester — Search Engine Journal
- “Of 33 requests carrying one of those live-fetch names. Six came from an IP the vendor publishes. Twenty-seven did not. That is an 81.8% spoof rate among the requests I could check.” (Türkçe çeviri) “Canlı getirme adlarından birini taşıyan 33 isteğin altısı satıcının yayınladığı bir IP’den geldi; yirmi yedisi gelmedi. Kontrol edebildiğim isteklerde sahtecilik oranı %81,8’di.”
- “The real check is not complicated. The major operators publish the actual IP addresses their bots use, as plain files you can open right now, and a request is legitimate only if the name matches and the address sits inside the published list.” (Türkçe çeviri) “Gerçek kontrol karmaşık değildir. Büyük operatörler botlarının kullandığı gerçek IP adreslerini hemen açabileceğiniz düz dosyalar hâlinde yayınlar; bir istek ancak ad eşleşiyor ve adres yayınlanan listede bulunuyorsa meşrudur.”
- Ölçeği göstermek için Googlebot hakkında: “Of 799 requests carrying the Googlebot name, only 107 came from a verified Google address. The other 692, roughly 87%, were not Google.” (Türkçe çeviri) “Googlebot adını taşıyan 799 isteğin yalnızca 107’si doğrulanmış bir Google adresinden geldi. Diğer 692 istek, yani yaklaşık %87’si Google’a ait değildi.”
- Eylem çağrısı: “Do not take my numbers; take the method… Pull a date range, match the names, verify the IPs against the published lists, and find your real fraction.” (Türkçe çeviri) “Benim sayılarımı değil, yöntemi alın: Bir tarih aralığı çekin, adları eşleştirin, IP’leri yayınlanan listelerle doğrulayın ve kendi gerçek oranınızı bulun.” Kaynak
Clint Spaulding, Kıdemli Teknik SEO Yöneticisi, Seer Interactive
- “Once blocked, stealth crawlers can reappear under generic browser headers and unrelated IPs.” (Türkçe çeviri) “Gizli tarayıcılar engellendikten sonra genel tarayıcı başlıkları ve ilgisiz IP’ler altında yeniden ortaya çıkabilir.”
- “These sessions look human in logs. That means session counts get inflated, bot traffic gets undercounted, and GEO segmentation becomes less trustworthy.” (Türkçe çeviri) “Bu oturumlar günlüklerde insan trafiği gibi görünür. Bu yüzden oturum sayıları şişer, bot trafiği eksik sayılır ve GEO segmentasyonu daha az güvenilir hâle gelir.”
- “If you can’t see these stealth crawlers, you can’t measure their impact.” (Türkçe çeviri) “Bu gizli tarayıcıları göremiyorsanız etkilerini ölçemezsiniz.” Kaynak
Screaming Frog — Log File Analyser eğitimi (ürün belgesi)
- İçe aktarım sırasında doğrulama hakkında: “Search engine bots are often spoofed, and this performs a lookup against publicly confirmed IP lists to confirm they are genuine.” (Türkçe çeviri) “Arama motoru botları sıkça taklit edilir; bu işlem, gerçek olduklarını doğrulamak için herkese açık biçimde doğrulanmış IP listelerini sorgular.”
- “If you see high request volumes from IPs that don’t verify, you’re likely dealing with fake bot traffic that should be blocked at server level.” (Türkçe çeviri) “Doğrulanmayan IP’lerden yüksek istek hacmi görüyorsanız büyük olasılıkla sunucu düzeyinde engellenmesi gereken sahte bot trafiğiyle karşı karşıyasınız.” Kaynak
Bing Webmaster Tools — AI Performance raporu (Şubat 2026 genel önizlemesi)
- Grounding Queries: “Shows the key phrases the AI used when retrieving content that was referenced in AI-generated answers.” (Türkçe çeviri) “Yapay zekânın, yapay zekâ tarafından oluşturulan yanıtlarda atıf yapılan içeriği getirirken kullandığı temel ifadeleri gösterir.”
- Total Citations: “Shows the total number of citations that are displayed as sources in AI-generated answers during the selected time frame.” (Türkçe çeviri) “Seçilen zaman aralığında yapay zekâ tarafından oluşturulan yanıtlarda kaynak olarak gösterilen toplam alıntı sayısını gösterir.” Kaynak
”Bu yapay zeka botu isteği gerçek mi ve bununla ilgili ne yapmalıyım?”
Tek bir şüpheli log satırını — veya tüm bir botun trafiğini — bu akıştan geçirin. Bu, 2. Adımdaki doğrulama mantığının bir akışa dönüştürülmüş halidir.
Yapay zekâ tarayıcı günlüğü analizi kontrol listesi
Günlükleri çekmekten okumaya kadar tekrarlanabilir bir geçiş:
- Günlükler ihtiyacınız olan alanlarla kaydediliyor: zaman damgası, istemci IP’si, kullanıcı aracısı, istek yolu ve durum kodu (bayt sayısı + yönlendiren de yararlıdır).
- Doğru katmandan veri alıyorsunuz: Cloudflare/Fastly arkasındaysanız CDN/uç günlüklerini kullanın (bot trafiğinin büyük bölümü kaynak sunucuya hiç ulaşmaz).
- Zamanlanmış bir çekim (SFTP/n8n/betik), saklama süresi dolmadan verileri alıyor; böylece yalnızca son birkaç güne değil geçmiş verilere de sahip oluyorsunuz.
- Her AI bot isteği doğrulanıyor: kullanıcı aracısı eşleştiriliyor ve kaynak IP, operatörün yayınladığı listeyle kontrol ediliyor. Ters DNS yalnızca sağlayıcı bunu resmî bir doğrulama yöntemi olarak belgelemişse kullanılıyor.
- Sahte veya doğrulanmamış istekler AI tarama metriklerinizden çıkarılıyor ve adı geçen botun trafiği olarak sayılmıyor.
- Bot başına tarama sıklığı için temel değer oluşturuldu (ani patlamalar ile düzenli örüntüler izleniyor).
- En çok getirilen sayfalar belirlendi ve önemli derin sayfaların gerçekten taranıp taranmadığı doğrulandı.
- Tarama-işleme farkı kontrol edildi: AI botları, içeriği JS ile işlenen sayfalarda yalnızca HTML mi alıyor? (Bunu ham HTML bağımlılığı testi olarak kaydedin; sağlayıcı davranışı aracıya özgüdür ve belgelenmemiş olabilir.)
- Durum kodları incelendi:
200/304sağlıklı;404bozuk bağlantı;403/429ise kasıtlı olduğu doğrulanmış veya düzeltilmiş durumda. - robots.txt isteğinin varlığı kontrol edildi (botlar taramadan önce dosyayı getiriyor mu?) ve izin verilmeyen yollarda beklenmedik istek olmadığı doğrulandı.
- “İşe yarıyor mu?” sonucuna varmadan önce alıntı tarafı verileriyle (Bing grounding sorguları / GSC AI özellikleri) eşleştirme yapıldı.
- Yeniden doğrulama planlandı; bu tek seferlik bir denetim değildir (gizli tarayıcılar insan gibi görünerek yeniden ortaya çıkabilir).
AI tarayıcı günlük analizi hızlı başvuru kılavuzu
Doğrulama dosyaları (bunları yer imlerine ekleyin)
| Operatör | Yayınlanan IP dosyası | Notlar |
|---|---|---|
| OpenAI — GPTBot | openai.com/gptbot.json | Eğitim tarayıcısı |
| OpenAI — OAI-SearchBot | openai.com/searchbot.json | Yapay zekâ arama dizinleyici |
| OpenAI — ChatGPT-User | openai.com/chatgpt-user.json | Kullanıcı tarafından tetiklenen getirme |
| OpenAI — OAI-AdsBot | openai.com/adsbot.json | Reklamlar |
| Anthropic — tüm adlandırılmış botlar | claude.com/crawling/bots.json | Paylaşılan güncel sağlayıcı listesi; UA ve kaynak adresi eşleştirin |
| Google (karşılaştırma için) | googlebot.json (developers.google.com) | Yalnızca Googlebot — GSC Tarama İstatistikleri bunu kapsar |
İzlenecek durum kodları
| Kod | Anlam | Yorum |
|---|---|---|
200 | Tamam | Bot sayfayı aldı |
304 | Değiştirilmedi | İyi — verimli yeniden tarama |
403 | Yasak | Engellendi — bu kasıtlı mı? |
404 | Bulunamadı | Botun takip ettiği bozuk bağlantı |
429 | Çok Fazla İstek | Hız sınırı — bunu kastettiğinizi kontrol edin |
5xx | Sunucu hatası | Sunucu zorlanıyor — botlar geri çekilir |
Doğrulayın, güvenmeyin
- Yalnızca kullanıcı aracısı = doğrulanmamış. UA’yı ve sağlayıcı tarafından yayınlanan doğrulama verilerini mevcut olduğunda eşleştirin; aksi takdirde belirsizliği koruyun.
- Doğada görülen sahtecilik oranları: %5,7 (HUMAN, 16 bot) → %81,8 (Forrester’ın canlı getirme günlükleri); aynı denetimde %87 sahte Googlebot.
Ham-HTML bağımlılık göstergesi
- Yalnızca HTML getiren ve sıfır
.js/.css/görsel isteği olan bir bot, gözlemlenen bir getirme desenidir. JS’ye bağımlı bir sayfada bu bir risk sinyalidir, evrensel bir yetenek kanıtı değildir.
Hızlı gerçekler
- Tarama sıklığı ≠ alıntı olasılığı. Getirme gereklidir, yeterli değildir.
- Tarama politikası için belgelenmiş robots belirteçlerini kullanın; ağ engellemeyi ayrı bir kötüye kullanım/güvenlik kontrolü olarak tutun.
Yapay zekâ tarayıcı günlüğü analizi için komut dosyaları
Yapay zekâ tarayıcıları makalesi temel “bot isabetlerini say” kod parçacığını içerir. Bunlar daha da ileri gider: çıkarma, doğrulama, durum kodu dökümü ve tarama-ve-işleme algılama.
1. Her yapay zekâ botu satırını çıkarın (grep + regex)
macOS / Linux — yaygın yapay zekâ kullanıcı aracıları üzerinde tek bir alternasyon:
# Pull all AI-bot requests from a combined-format access log
grep -Ei 'GPTBot|OAI-SearchBot|ChatGPT-User|ClaudeBot|Claude-User|Claude-SearchBot|PerplexityBot|Perplexity-User|Applebot|Amazonbot|Bytespider|CCBot|Meta-ExternalAgent' \
access.log > ai-bots.log
# Count requests per bot (which token, how many hits)
grep -Eoi 'GPTBot|OAI-SearchBot|ChatGPT-User|ClaudeBot|Claude-User|PerplexityBot|Perplexity-User|CCBot|Bytespider' \
access.log | sort | uniq -c | sort -rnWindows PowerShell:
Select-String -Path .\access.log -Pattern 'GPTBot|OAI-SearchBot|ChatGPT-User|ClaudeBot|PerplexityBot|CCBot|Bytespider' |
ForEach-Object { ($_ -match '(GPTBot|OAI-SearchBot|ChatGPT-User|ClaudeBot|PerplexityBot|CCBot|Bytespider)') | Out-Null; $Matches[1] } |
Group-Object | Sort-Object Count -Descending | Select-Object Count, Name2. İddia edilen bir GPTBot IP’sini OpenAI’nin yayınlanan listesine karşı doğrulayın
Kullanıcı aracısı tek başına hiçbir şeyi kanıtlamaz — IP’yi kontrol edin. Bu, OpenAI’nin listesini çeker ve günlüklerinizdeki bir IP’nin yayınlanmış herhangi bir CIDR aralığına düşüp düşmediğini test eder:
# Requires jq and (for CIDR math) grepcidr — brew/apt install both
IP="203.0.113.45" # the IP from your log line
curl -s https://openai.com/gptbot.json \
| jq -r '.prefixes[].ipv4Prefix // .prefixes[].ipv6Prefix' \
| while read -r cidr; do
echo "$IP" | grepcidr "$cidr" >/dev/null 2>&1 && echo "VERIFIED in $cidr"
done
# No output = the IP is NOT in OpenAI's published range → treat as spoofed.Anthropic için güncel https://claude.com/crawling/bots.json listesini getirin ve jq yolunu belgelenmiş yapısına göre ayarlayın. Başka bir operatör güncel bir doğrulama akışı yayınlamıyorsa, sonucu iddia edilen bir kullanıcı aracısı olarak saklayın.
3. Ters + ileri DNS yedeği (liste dışı IP’ler)
Bunu yalnızca adlandırılmış sağlayıcı beklenen bir ana bilgisayar adı soneki ve ters-artı-ileri doğrulama prosedürü yayınladığında kullanın. Bu, bot kimliğinin genel bir kanıtı değildir:
IP="203.0.113.45"
HOST=$(host "$IP" | awk '/pointer/ {print $NF}' | sed 's/\.$//')
echo "PTR: $HOST"
host "$HOST" | grep -q "$IP" && echo "FORWARD-CONFIRMED" || echo "MISMATCH → suspect"4. Bot başına durum kodu dökümü
Botların karşılaştığı 403/429 engellerini ve bulunamadı hatalarını tespit edin:
# For GPTBot: tally status codes (combined log format; $9 is the status)
grep -i 'GPTBot' access.log | awk '{print $9}' | sort | uniq -c | sort -rn
# → e.g. "812 200 / 47 404 / 15 403" — the 403s are worth investigating5. Ham HTML bağımlılık sinyali — bot hangi dosya türlerini getiriyor?
İddia edilen bir bot yalnızca .html// çekiyor ve asla .js/.css/görsel çekmiyorsa ve içeriğiniz JS ile işleniyorsa, bu araştırılması gereken bir bağımlılık sinyalidir:
# What extensions is ChatGPT-User actually requesting?
grep -i 'ChatGPT-User' access.log \
| awk '{print $7}' \
| grep -oE '\.(html?|js|css|png|jpe?g|webp|svg|woff2?)(\?|$)' \
| sort | uniq -c | sort -rn
# All HTML, zero subresources = compare the raw body with provider-specific outcomes.6. Chrome DevTools Konsolu — canlı bir sayfada AI getiricilerini tespit edin
Bu bir günlük sorgusu değildir; ancak sayfanın ham HTML’de sunduklarıyla JS çalıştıktan sonra sunduklarını, dolayısıyla bir AI botunun neleri görüp göremeyebileceğini hızla karşılaştırmanızı sağlar. Şunu Konsol’a yapıştırın:
// Compare rendered text length to what's in the initial HTML source.
// A big gap means most content depends on JS; provider behavior must be verified separately.
(async () => {
const raw = await (await fetch(location.href, { cache: "no-store" })).text();
const rawText = new DOMParser().parseFromString(raw, "text/html").body.innerText.trim().length;
const renderedText = document.body.innerText.trim().length;
console.log({ rawText, renderedText, jsDependentRatio: +(1 - rawText / renderedText).toFixed(2) });
})();
// jsDependentRatio near 1 = almost all content is JS-injected; flag dependency, not invisibility.7. Yer imi betiği — tüm botların IP listelerini aynı anda açın
Hızlı bir arama için doğrulama dosyalarını sekmelerde açmak üzere bunu yer imi olarak sürükleyin:
javascript:(function(){["https://openai.com/gptbot.json","https://openai.com/searchbot.json","https://openai.com/chatgpt-user.json","https://claude.com/crawling/bots.json"].forEach(u=>window.open(u,"_blank"));})(); SOP: aylık AI tarayıcı günlüğü incelemesi
Belirli aralıklarla uygulanacak yinelenen bir prosedürdür (çoğu site için aylık; AI trafiği sizin için önemliyse haftalık). Her uygulamada karşılaştırılabilir bir temel oluşturur.
Hazırlık
- Son incelemenizden bu yana geçen günlük penceresini doğru katmandan çekin (bir CDN arkasındaysanız CDN/kenar günlükleri, aksi takdirde kaynak günlükleri). Planlanan SFTP/n8n çekiminin gerçekten çalıştığını doğrulayın — buradaki boşluklar trend çizgilerini sessizce bozar.
- Kayıt aracınıza yükleyin (periyodik içe aktarmalar için Screaming Frog LFA; bir boru hattındaysanız BigQuery/ELK).
Doğrulayın (asla atlamayın)
3. Her sağlayıcının yayınladığı güncel doğrulama kaynağını (gptbot.json, searchbot.json, chatgpt-user.json, adsbot.json ve Anthropic’in claude.com/crawling/bots.json) yenileyin — bunlar değişir.
4. İçe aktarımda doğrulamayı etkinleştirin (Screaming Frog) veya her AI-bot isteğine karşı IP-CIDR kontrolünü (Komut Dosyaları sekmesi) çalıştırın.
5. Trafiği doğrulanmış ve doğrulanmamış olarak bölün. Doğrulanmamış oranı raporlayın — bu, bu dönemdeki sahtecilik oranınızdır. Bir sıçrama başlı başına bir bulgudur.
Ölçün (yalnızca doğrulanmış trafik)
6. Bot başına tarama sıklığını önceki dönemle karşılaştırın — yeni botları, kaybolan botları ve ani artışları not edin.
7. En çok getirilen sayfalar; öncelikli/derin sayfaların hiç taranıp taranmadığını doğrulayın.
8. 2–3 JS ağırlıklı şablonda ham HTML bağımlılığı spot kontrolü (botlar yalnızca HTML mi çekiyor?).
9. Bot başına durum kodu dökümü; yeni 403/429/404 kümelerini araştırın.
10. robots.txt / llms.txt istek varlığı ve engellenen yollara yapılan isabetler.
Raporlayın ve harekete geçin 11. Dönemin rakamlarını sürekli güncellediğiniz bir çalışma sayfasına kaydedin (bota göre doğrulanmış istekler, sahtecilik yüzdesi, en çok getirilen sayfalar ve hata kümeleri); böylece anlık görüntüler yerine eğilimleri görebilirsiniz. 12. Görünürlük hakkında sonuca varmadan önce verileri alıntı tarafı verileriyle (Bing grounding sorguları / GSC AI özellikleri) eşleştirin. 13. Somut düzeltme görevleri oluşturun: kasıtlı ve yanlışlıkla uygulanan engeller, JS işleme boşlukları, bozuk bağlantılar ve doğrulanmış taklitçiler için kesin kullanıcı aracısı kuralları.
Döngü notu: doğrulamayı her dönem yeniden çalıştırın — “bilinen iyi” bir IP listesini önbelleğe almayın. Gizli tarayıcılar yeni IP’ler ve genel tarayıcı UA’ları altında yeniden ortaya çıkar.
Uygulama kılavuzu: “GPTBot (veya ClaudeBot) 403 / 429 hataları alıyor; bunun kasıtlı olup olmadığını bilmiyorum”
Yaygın bir olay için sıralı müdahale kılavuzu: Doğrulanmış bir AI botu günlüklerinizde hatalarla karşılaşıyor. Adımları sırayla uygulayın.
Adım 1 — Önce gerçek bot olduğunu doğrulayın. Her şeyden önce, adı geçen sağlayıcının güncel resmî doğrulama yöntemini kullanın. Böyle bir yöntem yoksa kimlik doğrulanmamış olarak kalır; onu sessizce gerçek kabul etmeyin veya sahte olarak sınıflandırmayın. 403 yanıtı yine de WAF’ınızın görevini yerine getirdiğini gösterebilir.
Adım 2 — Kesin yanıtı ve nereden geldiğini belirleyin.
O bot için durum kodu dökümünü çekin (Komut Dosyaları sekmesi). 403 (engellendi),
429 (hız sınırı) veya 503 mi? Engellemenin CDN/WAF’ınızda mı, sunucu
ayarlarınızda mı yoksa robots.txt ile ilgili kurallarda mı olduğunu not edin.
Adım 3 — Karar verin: engelleme kasıtlı mı?
- Bu botu engellemek istediniz (ör. devre dışı bıraktığınız bir eğitim tarayıcısı) → 403 tasarlandığı gibi çalışıyor. Belgelenen robots politikasını, ağ düzeyindeki kötüye kullanım/güvenlik kuralından ayrı tutun. Bitti.
- Engellemek istemediniz (ör. OAI-SearchBot / PerplexityBot ve AI arama görünürlüğü istiyorsunuz) → devam edin.
Adım 4 — Yanlışlıkla uygulanan kuralı bulun.
Yaygın nedenler arasında aşırı kapsamlı bir WAF “bot” kuralı, ani patlamalarla tarama yapan bir bot için fazla düşük belirlenmiş hız sınırı (WISLR’ın dakikada 114 isteğe ulaşan GPTBot artışını hatırlayın; dakika başına sınır meşru patlamalarda tetiklenebilir), unuttuğunuz bir robots.txt engeli veya operatörün adres aralıklarını yakalayan bir coğrafi/ASN engeli bulunur.
Adım 5 — Hassas biçimde düzeltin. Doğrulanmış botu kullanıcı aracısı + yayınlanmış IP aralığına göre izin listesine alın veya yalnızca bu doğrulanmış bot için hız sınırı tavanını yükseltin. Herkes için korumayı gevşetmeyin.
Adım 6 — Düzeltmeyi günlüklerde doğrulayın.
Dağıtımdan sonra o bot için günlükleri yeniden çekin. Önemsediğiniz sayfalarda
403/429 kümesinin 200/304’e dönüştüğünü görmek istersiniz.
Adım 7 — Temeli yeniden alın ve izleyin. Çalışma sayfanızdaki değişikliği not edin. Sonraki dönemde yeniden kontrol edin — ve botu gerçekten engellemek istediyseniz farklı bir kullanıcı aracısı altında tekrar ortaya çıkmasına karşı dikkatli olun (gizli tarama).
Yanlış sonuçlara yol açan günlük analizi hataları
Her biri sahadan bir inanç, neden yanlış olduğu ve bunun yerine ne yapılması gerektiğidir.
Efsane: “robots.txt’im bir botu engelliyorsa, günlüklerimde olmaz / sorun değildir.”
Neden yanlış: robots.txt bir istektir, uygulama değildir. Kullanıcı tarafından
tetiklenen getiriciler kendilerini açıkça hariç tutar ve bazı tarayıcıların
engellemeleri atladığı bildirilmiştir (Perplexity gizli taraması, Cloudflare Ağustos
2025). Engelleme tamamen yok sayılabilir.
Bunun yerine: Kuralın onurlandırılıp onurlandırılmadığını kontrol etmek için
günlükleri kullanın — engellenen yollara isabetleri ve botun /robots.txt
istemini yapıp yapmadığını arayın.
Efsane: “Günlüklerimde GPTBot / ClaudeBot kullanıcı aracısı görüyorsam istek gerçekten OpenAI / Anthropic’ten gelmiştir.” Neden yanlış: Kullanıcı aracıları son derece kolay taklit edilebilir. HUMAN Security 16 bot genelinde %5,7 sahte trafik ölçerken Duane Forrester kendi canlı getirme isteklerinde %81,8 sahte trafik buldu. Bunun yerine: Kullanıcı aracısını eşleştirin ve varsa operatörün güncel resmî doğrulama yöntemini kullanın; aksi durumda kimliği doğrulanmamış olarak etiketleyin.
Efsane: “Daha fazla AI tarayıcı isabeti = alıntılanma olasılığının artması.” Neden yanlış: Bunu destekleyen yerleşik nedensel/korelasyonel veri yoktur. Alım gerekli ancak yeterli değildir — yoğun şekilde taranan sayfalar sürekli olarak alıntılanmadan kalır. Bunun yerine: Günlükleri yalnızca alınan aşamaya görünürlük olarak ele alın ve bunları alıntı tarafı verileriyle (Bing grounding sorguları, GSC AI özellikleri) eşleştirin.
Efsane: “Her AI tarayıcısı aynı işleme davranışına sahiptir.” Neden yanlış: Sağlayıcılar ortak bir JavaScript/alt kaynak sözleşmesi yayınlamaz ve gözlemlenen davranış aracıya ve örnekleme göre değişir. Bunun yerine: Ham yanıtı işlenmiş sayfayla karşılaştırın, adı belirtilen botun alt kaynak isteklerini inceleyin ve sonucu evrensel bir özellik olarak değil gözlemlenen davranış olarak etiketleyin.
Efsane: “AI botları en azından llms.txt dosyamı kontrol ediyor.”
Neden yanlış: WISLR’ın 48 günlük örneği, herhangi bir AI botundan sıfır
/llms.txt isteği kaydetti; bu, AI tarayıcıları makalesindeki ~%97 okunmamış
bulgusuyla tutarlıdır.
Bunun yerine: llms.txt isteklerini beklenen doğrulama olarak ele almayın;
botların gerçekte ne getirdiğini ölçün.
Efsane: “Ağ engelleme ve robots politikası aynı kontroldür.” Neden yanlış: robots tarama tercihlerini iletir; bir güvenlik duvarı ağ erişimini uygular ve ilgisiz trafiği etkileyebilir. Bunun yerine: Politika için belgelenmiş kullanıcı aracısı kuralını kullanın ve ağ engellemeyi ayrıca gerekçelendirilmiş kötüye kullanım/güvenlik yanıtı için ayırın.
Gerçek vakalar
Duane Forrester — kendi loglarında kendi test ettiği sahtecilik oranları. Forrester bu yöntemi kendi sitesinde uyguladı ve sonuçları yayınladı. 33 canlı getirme isteğinden yalnızca 6’sı satıcı tarafından yayınlanan bir IP’den geldi — %81,8 sahtecilik oranı; 799 Googlebot adlı istekten yalnızca 107’si doğrulandı — kabaca %87’si sahte (SEJ). Öncesi: kullanıcı aracısına güvenerek, “AI asistanı” trafiği gerçek görünüyordu. Sonrası: adları yayınlanan IP listeleriyle eşleştirince, çoğunun kimlik taklidi olduğu ortaya çıktı. Sonuç: yöntem, onun belirli rakamlarından daha önemli — dediği gibi, kendi tarih aralığınızı çekin ve gerçek oranınızı bulun.
WISLR — 48 günlük CDN günlükleri ve tarama-işleme işareti.
Tony Castillo, 48 gün boyunca 288 566 CDN günlük satırını (12 099 AI/bot isteği) analiz etti (WISLR). Somut bulgular şunlardı: GPTBot haftalarca görünmedi, ardından üç dakika içinde 152 istek yaptı (zirve dakikada 114 istek); ChatGPT-User hiç görsel, CSS veya JS getirmedi, yalnızca HTML aldı; ayrıca tüm dönem boyunca /llms.txt için hiç istek yapılmadı. Öncesi: Düzenli tarama ve JS işleyebilen botlar varsayılabilirdi. Sonrası: Günlükler ani patlamalar hâlinde ve yalnızca HTML alan bir davranış gösterdi. Bu n=1, yani tek bir sitenin verisidir; yine de gerçek bir analizin neleri ortaya çıkarabileceğini açıkça gösterir. Çıkarım: Sıfır JS isteği örüntüsü, tarama-işleme kontrolünün temelindeki doğrudan kanıttır.
Cloudflare — tarama-yönlendirme oranı, ağ ölçeğinde. Cloudflare’in toplu verileri, taramanın trafiğe ne kadar az dönüştüğünü gösteriyor: Anthropic’in bir web sitesine yönlendirdiği her ziyaretçi için, tarayıcıları zaten on binlerce sayfayı ziyaret etmiş durumda (Cloudflare). Öncesi: yoğun taramanın etkileşim anlamına geldiği sezgisi. Sonrası: ağ ölçeğinde oran dengesiz — eğitim artık AI-bot etkinliğinin çoğunluğunu yönlendiriyor ve eğitim botlarının trafiği geri göndermesi hiç amaçlanmıyor (Cloudflare). Sonuç: sıfır yönlendirme ile yoğun şekilde taranan bir sayfa normaldir, başarı işareti değil — bu yüzden tarama sıklığı tam olarak bir alıntı öngörücüsü değildir.
Kullanıma hazır AI istemleri
AI tarayıcı günlük analizini hızlandırmak amacıyla bir LLM ile kullanabileceğiniz kopyala-yapıştır istemleri. Çıktıyı daima ham günlüklerle tutarlılık açısından kontrol edin; LLM’ler gerçek dışı sonuçlar üretebilir ve uydurulmuş bir IP eşleşmesine güvenen doğrulama hattı, hiç doğrulama yapılmamasından daha kötüdür.
Doğrulama bilincine sahip bir log ayrıştırıcı taslağı
Write a Python script that parses combined-format Nginx access logs and, for each
request whose user-agent matches a known AI bot (GPTBot, OAI-SearchBot,
ChatGPT-User, ClaudeBot, Claude-User, PerplexityBot, Perplexity-User, CCBot,
Bytespider), does the following:
1. Extract timestamp, client IP, request path, status code, user-agent.
2. Fetch and cache OpenAI's current IP lists (gptbot.json, searchbot.json,
chatgpt-user.json, adsbot.json) and Anthropic's current bots.json list.
3. Mark an OpenAI or Anthropic request VERIFIED only if the user-agent matches AND
the client IP falls inside the matching provider-published ranges; mark providers
without an official method UNVERIFIED, not spoofed.
4. Output two CSVs: verified requests and unverified ("spoofed") requests.
5. Print a summary: verified vs. unverified count per bot, and the top 20 fetched
paths (verified only).
Do NOT count unverified requests in any per-bot metric. Add clear comments.Durum kodu + tarama-ve-render raporunu özetle
I'll paste a table of AI-bot log data (columns: bot, path, status_code,
file_extension). Produce:
- A per-bot status-code breakdown, flagging any 403/429/404 clusters.
- A raw-HTML dependency read: for each bot, the ratio of HTML requests to
JS/CSS/image requests, and a note on whether the bot appears to fetch only HTML
in this sample. Treat HTML-only on a JS-rendered page as a dependency risk, not
proof of a universal no-JavaScript capability.
Keep every conclusion tied to a number from the data — do not infer beyond it.
DATA:
[paste]Şüpheli bir IP’yi önceliklendir
A request in my logs claims to be [BOT NAME] from IP [IP ADDRESS]. Walk me through
verifying it: which operator IP-list file to check, how to test whether the IP is
in range, and the reverse+forward DNS fallback if it's not on a published list.
Tell me explicitly what result means "verified" vs. "treat as spoofed." Do not
guess whether this specific IP is legitimate — give me the steps to check. AI tarayıcı log analizi için araçlar
Kabaca ücretsiz/ham gerçek veriden ücretli/yönetilen çözümlere doğru:
- grep / PowerShell — en hızlı bot isteği sayısı ve doğrulama bilinçli bir filtre elde etmenin yoludur; ham erişim günlüğü üzerinde çalışır. Sıfır kurulum; Scripts sekmesine bakın.
- Screaming Frog Log File Analyser — yerleşik AI-bot ön ayarları ve “Verify Bots When Importing” geçişi ile genel olarak doğrulanmış IP listelerini kontrol eden masaüstü içe aktarıcı. Response Codes, User Agents, URLs (Num Events’e göre sırala) ve IPs sekmeleri. Periyodik içe aktarımlar için en iyisi.
- ELK Stack (Elasticsearch / Logstash / Kibana) veya Splunk — masaüstü içe aktarımı çok yavaş olduğunda veya sürekli izleme istediğinizde sürekli alım, panolar ve uyarılar.
- BigQuery — uzun vadeli saklama ve ölçekte SQL; genellikle Cloudflare Logpush veya
httpRequestsAdaptiveGroupsüzerinden zamanlanmış bir GraphQL çekme ile beslenir. - Cloudflare AI Crawl Control — Cloudflare arkasındaki siteler için: kendi hattınız olmadan yönetilen tarayıcı etkinliği, bot doğrulama ve yönerge uyumluluk görünümleri.
- Google Search Console — Crawl Stats — AI botları için değil (yalnızca Googlebot), ancak ham günlüklerden AI botları için yeniden oluşturduğunuz tarayıcı + yanıt kodu kırılımının modeli.
- Bing Webmaster Tools — AI Performance — alıntı sonucu karşılığı: temel sorgularını ve alıntı sayılarını tarama girişi günlüklerinizle eşleştirerek döngüyü kapatın.
Gece boyunca iddia edilen AI-bot trafik artışları
Belirti: Ünlü bir tarayıcı kullanıcı aracısı taşıyan istekler aniden artar. Olası neden: Taklit, izleme trafiği veya gerçek bir tarama değişikliği. Çözüm: Trafiği ilgili operatöre atfetmeden önce kaynak IP’leri operatörün güncel ve yayınlanmış doğrulama yöntemiyle kontrol edin; ardından ASN, yol, durum ve zamana göre bölümlere ayırın.
Günlükler taramayı gösteriyor ancak içerik asla alıntılanmıyor
Belirti: doğrulanmış botlar görünür alıntı kazanımları olmadan sayfaları getirir. Olası neden: tarama yalnızca uygunluk kanıtıdır; alma ve yanıt seçimi ayrıdır. Çözüm: botun anlamlı HTML aldığını doğrulayın, ardından tarama sayısını sıralama olarak ele almadan dizinlenebilirliği, pasaj kalitesini, sorgu uyumunu ve site dışı doğrulamayı değerlendirin.
Her istek 200 döndürüyor gibi görünüyor
Belirti: eksik URL’ler ve engellenen içerik başarı olarak kaydedilir. Olası neden: bir uygulama kabuğu, CDN kuralı veya özel hata sayfası yumuşak 404 döndürür. Çözüm: yanıt gövdelerini ve son başlıkları örnekleyin, ardından yalnızca duruma güvenmek yerine durum işlemeyi onarın.
Doğrulanmış botlar boş bir kabuk alıyor
Belirti: Tarayıcı içeriği işliyor, ancak günlüklerle eşleştirilen getirme istekleri çok az yararlı HTML alıyor. Olası neden: Sayfa, tarayıcının çalıştırmadığı istemci tarafı JavaScript’e bağımlıdır. Çözüm: Ham çıktıyla işlenmiş çıktıyı karşılaştırın; kritik içerik ve bağlantıları SSR, statik işleme veya başka bir güvenilir sunum stratejisiyle HTML içinde sunun.
AI tarayıcı günlükleri için metrikler
| Metrik | Size ne söyler | Nasıl çekilir | Kıyaslama veya gerçekçi aralık | Sıklık |
|---|---|---|---|---|
| Operatör tarafından doğrulanan istekler | Sahte filtreleme sonrası gerçek tarama hacmi | Kullanıcı aracısı ve operatör doğrulama kanıtlarını eşleştirin, ardından istekleri toplayın | Sitenin kendi taban çizgisini kullanın; hacimler siteye ve operatöre göre değişir | Haftalık veya aylık |
| Benzersiz başarılı kanonik URL’ler | Ulaşılan faydalı sayfaların genişliği | İstenen URL’leri normalleştirin, son durumu/kanonikliği birleştirin ve doğrulanmış başarıları sayın | Toplam URL varyantlarıyla değil, uygun envanterle karşılaştırın | Aylık |
| Durum kodu dağılımı | Tarama israfı, erişim hataları ve eksik içerik | Doğrulanmış istekleri son yanıt durumuna ve yol sınıfına göre gruplayın | Beklenmeyen değişiklikleri araştırın; evrensel bir oran icat etmeyin | Haftalık |
| Teslim edilen bayt veya önemli HTML | Başarılı isteklerin faydalı içerik içerip içermediği | Yanıt boyutunu/gövdesini örnekleyin veya uygulama telemetrisini birleştirin | Şablon taban çizgisine göre karşılaştırın; tek başına 200 kodu yetersizdir | Sürüm ve aylık |
| Taramadan yönlendirmeye ilişki | Doğrulanmış taramanın gözlemlenebilir ziyaretlerle çakışıp çakışmadığı | Bot günlüklerini zaman içinde ayrı kodlanmış AI yönlendirmeleriyle karşılaştırın | Korelasyon tanımlayıcıdır, alıntı veya nedensellik kanıtı değildir | Aylık |
Zamanınıza değer kaynaklar
İlgili yazılarım
- SEO Günlük Dosyası Analizi Nasıl Yapılır (Ahrefs, Patrick Stox & Michal Pecánek tarafından incelendi) — bu makalenin AI öncesi dönem şablonu olan ve AI’ya özel devamı niteliğindeki makale: ne ölçülür, araçlar ve bot doğrulaması.
- Günlük Dosyası Analizi Nedir? (Ahrefs sözlüğü) — tanımsal eşlikçi.
- Yeni Web Tarayıcılarıyla Tanışın: AI Botları Arama Motoru Botlarına Yaklaşıyor — AI bot tarama payına ilişkin Cloudflare Radar analizim.
- Yaklaşık 140 Milyon Web Sitesinin En Çok Engellediği AI Botları — açık web genelinde robots.txt engelleme oranı verileri.
- AI Arama Trafiğimizin %80’i Ana Sayfa, Ürün Sayfaları ve Ücretsiz Araçlara Gidiyor — AI etkinliğinin sayfa türü düzeyinde analizi, “hangi sayfaların tarandığı”nın karşılığı.
Konuşmalarım
- Arama Nasıl Çalışır (SlideShare) — günlüklerinizde botların ne yaptığını anlamak için yararlı bir arka plan sunan; tarama, işleme, dizine ekleme ve sıralama anlatımım. (Genel uyarı geçerlidir: Bu, sistemleri nasıl anladığımı yansıtır; %100 eksiksiz veya doğru olduğu garanti edilmez.)
Sektörden haberler
- Yapay zekâ tarayıcıları ve arama görünürlüğü için log dosyası analizi neden önemlidir — Lauren Busby (Trebletree), Search Engine Land: “loglar eksik katmandır,” saklama penceresi ve 403/429 çerçevesi.
- “Yapay Zekâ Asistanı” Trafiğimin %81,8’i Sahteydi. Googlebot Rakamı Daha Kötüydü — Duane Forrester, Search Engine Journal: öne çıkan birinci taraf doğrulama vaka çalışması ve yöntemi.
- Perplexity, Gizli Yapay Zekâ Taraması ve GEO ile Log Dosyası Analizi Üzerindeki Etkileri — Clint Spaulding, Seer Interactive: engellenen botların neden insan gibi görünerek yeniden ortaya çıktığı.
- Log Dosyası Analizöründe Yapay Zekâ Botları Nasıl İzlenir — Screaming Frog: içe aktarımda doğrulama özellikli pratik araç anlatımı.
- Tarama-tıklama farkı: Yapay zekâ botları, eğitim ve yönlendirmeler hakkında Cloudflare verileri — Cloudflare: ağ düzeyinde tarama-yönlendirme oranları ve eğitim-ile-arama ayrımı.
- Anthropic web’den veri tarar mı? — Anthropic’in güncel bot amacı ve robots kontrol belgeleri.
- OpenAI botları / tarayıcı belgeleri — doğrulama için kullanıcı aracısı dizeleri ve yayınlanan IP dosyaları.
Alıntı yapmaya değer istatistikler
- Sahtecilik oranı — 16 yapay zekâ tarayıcısında %5,7. HUMAN Security’nin 16 bilinen yapay zekâ tarayıcısından biri olduğunu iddia eden trafik üzerindeki iki haftalık analizi, yaklaşık her 18 istekten 1’inin sahte olduğunu buldu (satıcı kaynaklı, SEJ üzerinden aktarıldı).
- Sahtecilik oranı — bir uygulayıcının kendi loglarında %81,8. Duane Forrester’ın kendi yürüttüğü denetim, 33 canlı getirme isteğinden 27’sinin satıcıların yayınlamadığı IP’lerden geldiğini buldu; Googlebot rakamı ~%87 sahteydi (SEJ).
- Tarama-yönlendirme, ClaudeBot ile OpenAI. Cloudflare’in verileri (25 Mayıs – 1 Haziran 2026 haftası) ClaudeBot’u yönlendirme başına ~11 122 sayfa taraması ve OpenAI’i ~857:1 olarak gösterdi; Googlebot ise yaklaşık 5:1 (Cloudflare).
- Eğitim, yapay zekâ botu etkinliğinin çoğunu yönlendiriyor. Cloudflare’e göre eğitim artık yapay zekâ botu etkinliğinin neredeyse %80’ini yönlendiriyor; bir yıl önceki %72’den artışla — sıfır yönlendirmeli yoğun taramanın neden normal olduğuna dair bağlam (Cloudflare).
- Gerçek bir log penceresi: 288 566 satır, 12 099 bot isteği, 48 gün. WISLR’ın vaka çalışması — GPTBot’un 3 dakikada 152 istek patlaması ve ChatGPT-User’ın sıfır görsel/CSS/JS getirmesiyle (WISLR).
Kendinizi test edin: Yapay Zekâ Tarayıcı Log Analizi
Yapay zekâ botu loglarını çekme ve okuma hakkında beş hızlı soru. Her biri için bir yanıt seçin, ardından kontrol edin.
Değişiklik günlüğü
22 Ağu 2026 tarihinde güncellendi.
Editoryal özet ve kaydedilen değişiklik ayrıntıları.Değişiklik ayrıntıları
-
Ayrıntılı değişiklik notları şu anda İngilizce olarak mevcut.
Tam karşılaştırma kullanılamıyor — bu sürüm için önceki anlık görüntü arşivlenmemiş.
9 Ağu 2026 tarihinde güncellendi.
Editoryal özet ve kaydedilen değişiklik ayrıntıları.Değişiklik ayrıntıları
-
Ayrıntılı değişiklik notları şu anda İngilizce olarak mevcut.
Tam karşılaştırma kullanılamıyor — bu sürüm için önceki anlık görüntü arşivlenmemiş.
8 Ağu 2026 tarihinde güncellendi.
Editoryal özet ve kaydedilen değişiklik ayrıntıları.Değişiklik ayrıntıları
-
Ayrıntılı değişiklik notları şu anda İngilizce olarak mevcut.
Tam karşılaştırma kullanılamıyor — bu sürüm için önceki anlık görüntü arşivlenmemiş.
3 Ağu 2026 tarihinde güncellendi.
Editoryal özet ve kaydedilen değişiklik ayrıntıları.Değişiklik ayrıntıları
-
Ayrıntılı değişiklik notları şu anda İngilizce olarak mevcut.
Tam karşılaştırma kullanılamıyor — bu sürüm için önceki anlık görüntü arşivlenmemiş.