Crawlery AI

Trzy rodzaje crawlerów AI — boty treningowe, indeksujące wyszukiwanie AI i pobieracze uruchamiane przez użytkownika — najważniejsze nazwane boty oraz sposoby kontrolowania każdego z nich bez szkody dla SEO.

Opublikowano po raz pierwszy: 24 cze 2026 · Ostatnia aktualizacja: 9 sie 2026 · Advanced
Języki
2 sygnałów dowodowych na tej stronie

Crawlery AI dzielą się na trzy kategorie, a ich mylenie jest podstawowym błędem: (1) boty treningowe i ulepszające modele, takie jak GPTBot, ClaudeBot i CCBot; (2) crawlery wyszukiwania AI, takie jak OAI-SearchBot, PerplexityBot i Applebot; oraz (3) pobieracze uruchamiani przez użytkownika, tacy jak ChatGPT-User, Perplexity-User i Claude-User. Kontrole są zależne od operatora i agenta: zablokowanie GPTBot nie blokuje OAI-SearchBot, a OAI-AdsBot ma osobny zakres reklamowy. Google-Extended i Applebot-Extended to tokeny produktu/kontroli, nie niezależne crawlery. Google-Extended obejmuje ulepszanie modeli Gemini/Vertex i grounding, ale nie uwzględnienie w Google Search, ranking, AI Overviews ani AI Mode; Applebot-Extended kontroluje użycie w bazowych modelach Apple bez usuwania stron z wyszukiwarki Apple. llms.txt pozostaje propozycją, a nie szeroko przyjętym standardem kontroli.

OpenAI mówi, że ustawienia GPTBot, OAI-SearchBot i ChatGPT-User są niezależne. Evidence for this claim OpenAI publishes separate controls for GPTBot, OAI-SearchBot, and ChatGPT-User, and says each setting is independent. Scope: OpenAI-declared crawlers and user agents; their purposes and robots behavior are platform-specific. Confidence: high · Verified: OpenAI: Crawlers Anthropic osobno wskazuje ClaudeBot, Claude-SearchBot i Claude-User oraz opisuje obsługę robots.txt. Evidence for this claim Anthropic documents ClaudeBot, Claude-SearchBot, and Claude-User separately and says its bots honor robots.txt directives. Scope: Anthropic-declared bots; user-initiated retrieval has additional product-specific conditions. Confidence: high · Verified: Anthropic: Bot information

TL;DR — Crawlery AI dzielą się na trzy kategorie, a ich mylenie jest błędem, który popełnia niemal każdy. Boty treningowe (GPTBot, ClaudeBot, CCBot, Bytespider, Amazonbot, Meta-ExternalAgent) pobierają dane do budowy korpusów modeli. Boty wyszukiwania AI (OAI-SearchBot, PerplexityBot, Applebot, Amzn-SearchBot) budują indeks cytowań. Pobieracze uruchamiani przez użytkownika (ChatGPT-User, Perplexity-User, Claude-User) pobierają stronę na żywo, gdy ktoś zada pytanie. Każdy ma własny user-agent i własną regułę robots.txt, więc zablokowanie GPTBot nie dotyka OAI-SearchBot. Google-Extended i Applebot-Extended to tokeny, nie boty — nie crawlują, tylko wyłączają Cię z trenowania/groundingu. Blokowanie botów treningowych nie wpływa na pozycje w Google (Google tak mówi, a dane empiryczne to potwierdzają); blokowanie botów wyszukiwania AI zmniejsza widoczność w odpowiedziach AI. Debata o robots.txt jest realna w przypadku pobieraczy użytkownika (operatorzy twierdzą, że „może nie mieć zastosowania”) i Perplexity (zgłaszane skryte crawlowanie). llms.txt to propozycja, w dużej mierze nieczytana i nieprzyjęta przez największych operatorów.

Trzy kategorie — kręgosłup całego tematu

Classify the purpose before writing the rule: training, AI-search visibility, and live user fetching are separate decisions. Źródło: /technical-seo/how-search-works/crawling/crawler/ai-crawlers/

Training crawlers such as GPTBot, ClaudeBot, and CCBot collect data for model corpora. AI-search crawlers such as OAI-SearchBot and PerplexityBot build indexes used for answers and citations. User-triggered agents such as ChatGPT-User and Claude-User fetch a page for a live request. Blocking one category does not automatically block the others.

© Patrick Stox LLC · CC BY 4.0 ·

Każdy nazwany bot AI należy do jednego z trzech koszyków. Właściwa kategoria rozstrzyga każdą późniejszą decyzję (blokować go? zezwolić? co stanie się z moim SEO?).

1. Crawlery treningowe / zbierające dane. Crawlują na dużą skalę, aby budować korpusy do trenowania i dostrajania LLM-ów. To boty, które większość wydawców chce blokować, a ich zablokowanie nie wpływa na pozycje w wyszukiwarce. Należą do nich: GPTBot (OpenAI), ClaudeBot (Anthropic), CCBot (Common Crawl), Bytespider (ByteDance), Amazonbot (Amazon), Meta-ExternalAgent (Meta), AI2Bot (Allen Institute), cohere-training-data-crawler (Cohere), Diffbot, Timpibot (Timpi) i webzio-extended (Webz.io). Są też dwa tokeny kontrolne, które NIE są osobnymi crawlerami — Google-Extended i Applebot-Extended — omówione poniżej.

2. Crawlery wyszukiwania AI / indeksujące. Budują aktualny indeks używany do odpowiadania na zapytania z cytatami i odsyłaczami do Ciebie. Ich zablokowanie może usunąć Cię z wyników wyszukiwania AI. Należą do nich: OAI-SearchBot (OpenAI — odrębny od GPTBot), PerplexityBot (Perplexity), Applebot (Apple — zasila podpowiedzi Spotlight/Siri/Safari) oraz Amzn-SearchBot (Amazon).

3. Pobieracze uruchamiani przez użytkownika / na żądanie. Pobierają konkretną stronę na żywo, bo użytkownik zadał pytanie, a nie dlatego, że bot sam przemierza sieć. Operatorzy zazwyczaj twierdzą, że robots.txt nie wiąże pobrania zainicjowanego przez użytkownika — to obszar sporny. Należą do nich: ChatGPT-User (OpenAI), Perplexity-User (Perplexity), Claude-User i Claude-SearchBot (Anthropic), Amzn-User (Amazon, dla Alexy) oraz Meta-ExternalFetcher (Meta).

Pełna tabela z tokenami user-agentów i informacją o zgodności z robots.txt znajduje się w karcie Cheat Sheets — to centralny element tego artykułu.

Pułapka „token, nie bot” (Google-Extended i Applebot-Extended)

To najbardziej niezrozumiany fakt w tej dziedzinie, więc ujmę go precyzyjnie. Google-Extended i Applebot-Extended niczego nie crawlują. Nie mają niezależnego user-agenta i nie generują ruchu crawlującego. Są tokenami kontroli robots.txt, które zmieniają to, co istniejące crawle mogą robić z Twoją treścią.

  • Google-Extended kontroluje użycie treści do ulepszania aplikacji Gemini i generatywnych modeli Vertex AI, w tym do groundingu poza Google Search. Nie kontroluje AI Overviews ani AI Mode w Google Search — te korzystają z dostępu Googlebota. Google mówi wprost: “Google-Extended does not impact a site’s inclusion in Google Search nor is it used as a ranking signal in Google Search.” (tłumaczenie) „Google-Extended nie wpływa na uwzględnienie witryny w Google Search ani nie jest używany jako sygnał rankingowy w Google Search.” Zablokowanie go nie robi nic Googlebotowi ani Twoim pozycjom.
  • Applebot-Extended działa tak samo w Apple. Apple stwierdza: “Applebot-Extended does not crawl webpages. Webpages that disallow Applebot-Extended can still be included in search results.” (tłumaczenie) „Applebot-Extended nie crawluje stron internetowych. Strony z zakazem dla Applebot-Extended nadal mogą trafić do wyników wyszukiwania.” Wyłącza Cię z trenowania modeli bazowych Apple (Apple Intelligence) — Twoje strony nadal pojawiają się w Spotlight/Siri dzięki rzeczywistemu crawlerowi, Applebot.

Zatem Disallow: Google-Extended i Disallow: Applebot-Extended to mechanizmy kontroli użycia produktu, a nie niezależne blokady crawlowania. Opublikowane zakresy tych tokenów nie usuwają stron z odpowiednich indeksów wyszukiwania, ale tokeny nie są zamienne i nie należy obu skracać do określenia „bot treningowy”.

Najwięksi operatorzy, bot po bocie

OpenAI prowadzi cztery zadeklarowane, niezależne boty: GPTBot (trening — “used to make our generative AI foundation models more useful and safe” (tłumaczenie) „używany do tego, aby nasze bazowe modele generatywnej AI były bardziej użyteczne i bezpieczne”), OAI-SearchBot (wyszukiwanie — “used to surface websites in search results in ChatGPT’s search features” (tłumaczenie) „używany do wyświetlania witryn w wynikach wyszukiwania funkcji wyszukiwania ChatGPT”), ChatGPT-User (pobieracz użytkownika — “used for certain user actions in ChatGPT” (tłumaczenie) „używany do określonych działań użytkownika w ChatGPT”) oraz OAI-AdsBot (niezależny zakres reklam, a nie bot treningowy ani crawler indeksu wyszukiwania). Zdanie z polityki OpenAI jest wzorem dla całej tej dziedziny: “Each bot setting is independent, allowing webmasters granular control over how their content interacts with different OpenAI systems.” (tłumaczenie) „Każde ustawienie bota jest niezależne, co pozwala webmasterom szczegółowo kontrolować interakcję ich treści z różnymi systemami OpenAI.” Zablokowanie GPTBot “signals that future data from these materials should be excluded from model training datasets” (tłumaczenie) „sygnalizuje, że przyszłe dane z tych materiałów powinny zostać wykluczone ze zbiorów treningowych modeli”; zablokowanie OAI-SearchBot oznacza, że witryna “won’t appear in ChatGPT search results.” (tłumaczenie) „nie pojawi się w wynikach wyszukiwania ChatGPT”.

Anthropic prowadzi trzy boty: ClaudeBot (trening), Claude-SearchBot (indeksowanie wyszukiwania) i Claude-User (pobieranie użytkownika). Anthropic stwierdza, że jego boty “respect ‘do not crawl’ signals by honoring industry standard directives in robots.txt” (tłumaczenie) „respektują sygnały „nie crawluj”, przestrzegając standardowych dla branży dyrektyw w robots.txt”. Bieżąca strona pomocy wskazuje również wspólną opublikowaną listę adresów IP do weryfikacji botów Anthropic. Ta lista specyficzna dla operatora jest dowodem tożsamości, a nie uniwersalną regułą weryfikacji IP lub reverse DNS dla każdego bota.

Google — kluczowy fakt to ten opisany wyżej: Google-Extended jest tokenem, nie botem. Google prowadzi również Google-CloudVertexBot (crawluje na żądanie właściciela witryny dla agentów Vertex AI; nie wpływa na ranking) oraz agenty uruchamiane przez użytkownika, takie jak Gemini-Deep-Research i Google-NotebookLM.

Apple prowadzi Applebot (rzeczywisty crawler zasilający podpowiedzi Spotlight/Siri/Safari, który “may also be used to help train Apple foundation models” (tłumaczenie) „może być również używany do pomocy w trenowaniu bazowych modeli Apple”) oraz token Applebot-Extended. Zablokowanie Applebota usuwa Cię z wyszukiwania Apple; zablokowanie Applebot-Extended tylko wyłącza trenowanie.

Perplexity deklaruje dwa boty: PerplexityBot (wyszukiwanie/cytowania — wyraźnie “not used to crawl content for AI foundation models” (tłumaczenie) „nieużywany do crawlowania treści na potrzeby bazowych modeli AI”, więc Perplexity nie ma zadeklarowanego crawlera treningowego) oraz Perplexity-User (pobieranie użytkownika). Dokumentacja mówi, że Perplexity-User “generally ignores robots.txt rules” (tłumaczenie) „zwykle ignoruje reguły robots.txt”, ponieważ pobranie inicjuje użytkownik. Perplexity jest również bohaterem zgłaszanej sprawy dotyczącej skrytego crawlowania — zobacz kontrowersję poniżej.

Amazon prowadzi trzy boty i jest tu użytecznym wyjątkiem: Amazonbot (ulepsza produkty i “may be used to train Amazon AI models” (tłumaczenie) „może być używany do trenowania modeli AI Amazon”), Amzn-SearchBot (wyszukiwanie) oraz Amzn-User (pobrania użytkownika Alexy). Z dokumentacji Amazon wynika, że Amzn-SearchBot i Amzn-User wyraźnie NIE crawlują na potrzeby trenowania generatywnych modeli AI — twierdzenie „wszystkie firmy AI pobierają dane do treningu” jest więc mitem. Amazon respektuje także metatag noarchive o szczególnym znaczeniu: „nie używaj strony do trenowania modelu” — to rzadki sposób wyłączenia treningu na poziomie pojedynczej strony.

Obsługa robots.txt przez Amazon ma dwie nietypowe krawędzie operacyjne: crawlery mogą używać kopii robots.txt zapisanej w pamięci podręcznej w ciągu poprzednich 30 dni, a Amazon mówi, że jeśli nie można pobrać pliku, jego crawlery zachowują się tak, jakby plik nie istniał. Nie oznacza to, że nieudane pobranie audytowe dowodzi, iż Amazon zobaczył stan zezwalający na wszystko; audyt i Amazon mogą docierać do hosta w różnych momentach albo innymi ścieżkami sieciowymi.

Evidence for this claim Amazon says its crawlers may use a robots.txt copy cached within the previous 30 days. Scope: Amazon crawler behavior only; a current audit fetch cannot identify which cached copy Amazon used. Confidence: high · Verified: Amazon: Amazonbot Evidence for this claim Amazon says its crawlers behave as if robots.txt does not exist when they cannot fetch it. Scope: Amazon crawler behavior only; a tool-side fetch failure is not proof that Amazon observed the same failure. Confidence: high · Verified: Amazon: Amazonbot

Meta prowadzi Meta-ExternalAgent (trening/indeksowanie dla Llama i Meta AI), Meta-ExternalFetcher (pobieranie użytkownika) oraz osobno Facebookbot (podglądy odsyłaczy — nie crawler AI). Zablokowanie Meta-ExternalAgent nie wpływa na podglądy odsyłaczy na Facebooku.

Common Crawl (CCBot) jest prowadzony przez fundację non-profit utrzymującą otwarte archiwum sieci. To ukryta warstwa: zbiór danych Common Crawl służył do trenowania ChatGPT, Claude, LLaMA i wielu innych modeli — zatem zablokowanie CCBot ma dalsze skutki dla modeli, które nigdy nie crawlują Twojej witryny bezpośrednio. Common Crawl ostrzega również, że podszywający się napastnicy fałszują CCBot.

ByteDance (Bytespider) jest najbardziej agresywny: deklaruje przestrzeganie robots.txt, lecz szeroko zgłaszano jego naruszanie przy bardzo dużym wolumenie żądań. Warto znać także: AI2Bot (Allen Institute, modele otwarte / zbiór Dolma), Cohere, Diffbot (ekstrakcja danych strukturalnych, których wynik zasila wiele dalszych procesów AI) oraz Timpibot / webzio-extended.

Czy boty AI rzeczywiście przestrzegają robots.txt?

W przypadku crawlerów treningowych i wyszukiwawczych najwięksi operatorzy (OpenAI, Anthropic, Google, Apple, Amazon) deklarują w dokumentacji, że przestrzegają robots.txt. Obszarem spornym są pobieracze uruchamiane przez użytkownika, bo kilku operatorów wprost twierdzi, że robots.txt może nie mieć zastosowania, gdy żądanie zainicjowała osoba — OpenAI mówi, że “these actions are initiated by a user, robots.txt rules may not apply” (tłumaczenie) „te działania są inicjowane przez użytkownika, więc reguły robots.txt mogą nie mieć zastosowania”; Perplexity mówi, że Perplexity-User “generally ignores robots.txt rules.” (tłumaczenie) „zwykle ignoruje reguły robots.txt”. To deklarowana polityka, a nie naruszenie.

Kontrowersja wokół Perplexity to główny spór; oznaczę ją jako zgłoszoną, a nie rozstrzygniętą. W czerwcu 2024 r. Wired i programista Robb Knight zgłosili, że Perplexity uzyskiwało treści z witryn, które je zablokowały, najwyraźniej używając nieujawnionych adresów IP. W sierpniu 2025 r. Cloudflare poinformował, że Perplexity używało skrytego user-agenta podszywającego się na macOS pod Chrome, zmieniało IP i ASN-y, aby omijać blokady, oraz pobierało treści z nowo utworzonych domen testowych z pełnym Disallow: / — po czym Cloudflare usunął Perplexity z listy zweryfikowanych botów. Przedstawiaj to jako udokumentowane doniesienia tych źródeł; własna dokumentacja Perplexity nadal utrzymuje, że PerplexityBot przestrzega robots.txt.

Ponieważ niektóre boty w pewnym zakresie ignorują robots.txt, Cloudflare stał się praktyczną warstwą egzekwowania — blokowaniem na poziomie sieci, przełącznikiem „AI Scrapers and Crawlers” jednym kliknięciem, zarządzanym robots.txt, śledzeniem naruszeń robots.txt i wersją beta pay-per-crawl. Od lipca 2025 r. nowe domeny Cloudflare domyślnie blokują znane crawlery AI.

Jak kontrolować crawlery AI

  • robots.txt per user-agent to główna dźwignia i działa szczegółowo: zablokowanie GPTBot nie blokuje OAI-SearchBot ani ChatGPT-User. Receptury robots.txt (blokowanie wszystkich botów treningowych oraz botów wyszukiwania AI) znajdują się w karcie Scripts.
  • Tokeny treningoweGoogle-Extended i Applebot-Extended — wyłączają trenowanie Gemini/Apple Intelligence bez kosztu dla wyszukiwania.
  • Metatag noarchive Amazon jest wyłączeniem treningu na poziomie pojedynczej strony.
  • Cloudflare AI Crawl Control — blokowanie, zezwalanie i naliczanie opłat na poziomie sieci, a także zarządzany robots.txt i dyrektywy Content Signals (search, ai-input, ai-train); domyślnie search=yes, ai-train=no.
  • llms.txt to propozycja (Jeremy Howard / Answer.AI, wrzesień 2024), nie przyjęty standard — najwięksi crawlery go nie respektują. To wyselekcjonowana mapa Markdown przeznaczona do odczytu w czasie wnioskowania, ale badanie Ahrefs obejmujące 137 tys. witryn wykazało, że 97% opublikowanych plików llms.txt nie otrzymuje żadnych żądań, a żaden duży dostawca LLM nie przyjął go formalnie. Traktuj go jako narzędzie dokumentacyjne, nie narzędzie wyszukiwania AI.
  • Społecznościowy projekt ai.robots.txt utrzymuje obszerny plik Disallow: /, zawierający ponad 150 user-agentów botów AI — przydatne źródło przy blokowaniu zbiorczym.

Polityka crawlerów stawiająca na widoczność

W przypadku publicznej witryny edukacyjnej lub komercyjnej, która chce być widoczna w wyszukiwaniu AI, moją domyślną polityką jest:

  1. Zezwalaj konwencjonalnym crawlerom wyszukiwarek, które zasilają wybrane przez Ciebie powierzchnie wyszukiwania, w tym Googlebot i Bingbot.
  2. Zezwalaj udokumentowanym crawlerom wyszukiwania/indeksowania AI, takim jak OAI-SearchBot, Claude-SearchBot i PerplexityBot na publicznych treściach.
  3. Zezwalaj zamierzonym pobraniom kierowanym przez użytkownika, takim jak ChatGPT-User, Claude-User i Perplexity-User, pamiętając, że operatorzy różnie traktują robots.txt. Evidence for this claim OpenAI publishes separate controls for GPTBot, OAI-SearchBot, and ChatGPT-User, and says each setting is independent. Scope: OpenAI-declared crawlers and user agents; their purposes and robots behavior are platform-specific. Confidence: high · Verified: OpenAI: Crawlers Evidence for this claim Anthropic documents ClaudeBot, Claude-SearchBot, and Claude-User separately and says its bots honor robots.txt directives. Scope: Anthropic-declared bots; user-initiated retrieval has additional product-specific conditions. Confidence: high · Verified: Anthropic: Bot information Evidence for this claim Perplexity documents PerplexityBot for search indexing separately from Perplexity-User for user-requested fetches, with different robots behavior. Scope: Perplexity-declared crawlers and published IP ranges; a user-agent string alone does not verify identity. Confidence: high · Verified: Perplexity: Crawlers
  4. Podejmij osobną decyzję dotyczącą praw do dostępu treningowego/rozwoju modeli. GPTBot, ClaudeBot, Google-Extended i inne mechanizmy treningowe nie muszą mieć tej samej polityki co wyszukiwanie. Zezwalaj na nie tylko wtedy, gdy takie użycie jest zgodne z Twoją polityką publikacji.
  5. Chroń prywatne i operacyjne ścieżki uwierzytelnianiem. Trzymaj /admin/, podglądy, dane kont i niepubliczne API za autoryzacją po stronie serwera; Disallow jest tylko preferencją dla crawlera.
  6. Weryfikuj tożsamość przed pominięciem kontroli WAF. Łącz udokumentowany user-agent z aktualnymi zakresami IP dostawcy, weryfikacją reverse DNS albo obsługiwanym uwierzytelnianiem bota. Nigdy nie twórz szerokiej reguły zezwalającej WAF wyłącznie na podstawie podatnego na podszywanie user-agenta.

Nie dodawaj osobnej grupy user-agenta tylko po to, aby zapisać Allow: /, chyba że powtórzysz każdą restrykcję, która nadal ma dotyczyć tego crawlera. W regułach dopasowania robots określona grupa może zastąpić grupę wieloznaczną, zamiast dziedziczyć jej wykluczenia prywatnych ścieżek — zależy to od parsera operatora. Najprostszy bezpieczny plik to często jedna niezależnie bezpieczna grupa * oraz wąsko określone wyłączenia treningowe.

W przypadku tej witryny bieżąca polityka publiczna to jawne zezwolenie na wyszukiwanie, AI input i trening AI, przy jednoczesnym wykluczeniu ścieżek administracyjnych, podglądów, API, pułapek i bram. Pozostawiłbym dozwolone wyszukiwanie i pobieranie zainicjowane przez użytkownika. Zmieniłbym ai-train=yes wyłącznie jako decyzję dotyczącą praw redakcyjnych — nie jako taktykę widoczności AI — ponieważ nie ma potwierdzonej korzyści cytowania z dostępu treningowego.

Dostęp crawlera AI to nie gotowość na AI

Reguła zezwalająca dowodzi co najwyżej, że zadeklarowana polityka robots pozwala określonemu agentowi zażądać URL-a. Nie dowodzi, że operator przestrzega polityki, pobrał stronę, wyrenderował ją, wydobył ważne informacje, umieścił je w kontekście modelu, zacytował stronę ani wykonał działanie.

Trzymaj osobno pięć warstw:

WarstwaPytanieDowód
UprawnienieCzy ten nazwany agent może zażądać URL-a według zadeklarowanej polityki?Efektywny test robots i dostępu sieciowego
EkstrahowalnośćCzy ważna treść jest obecna w stabilnym tekście, odsyłaczach, metadanych lub danych strukturalnych?Surowy i wyrenderowany przechwyt z ekstrakcją pól
RenderowanieCzy treść przetrwa rzeczywiste możliwości przeglądarki/JavaScript agenta?Dowód pobrania specyficzny dla dostawcy, a w przeciwnym razie jawnie opisana granica testu
OperacyjnośćCzy agent może rozpoznać i bezpiecznie wywołać zamierzone działanie?Udokumentowany kontrakt narzędzia/interfejsu i kontrolowany test end-to-end
Gotowość handlowaCzy tożsamość, cena, dostępność, polityka, realizacja, koszyk i checkout są zgodne?Uzgodnienie feedu, strony, backendu i zamówienia

Checker dostępu crawlera powinien więc dla polityki raportować allowed, blocked albo indeterminate, a nie „AI ready”. Udany request w logu dowodzi, że wystąpiło żądanie; nie jest dowodem, że strona została użyta w odpowiedzi. Prawidłowa deklaracja feedu lub narzędzia również nie dowodzi, że publiczna strona renderuje się poprawnie ani że checkout może zrealizować przedstawioną ofertę.

Zobacz Jak działa wyszukiwanie AI dla warstw pobierania i cytowania oraz Optymalizację zakupów AI dla gotowości katalogu i transakcji. Rozdzielenie warstw sprawia, że środek zaradczy jest konkretny: popraw politykę dostępu przy blokadzie, wynik strony przy problemie z ekstrakcją, renderowanie przy brakującym stanie, kontrakt interfejsu przy problemie z operacyjnością albo dane handlowe przy nieudanym zakupie.

W przypadku stron e-commerce test ekstrahowalności powinien sprawdzać, czy podstawowa tożsamość produktu i wybrana oferta — SKU, identyfikator grupy, cena, waluta i dostępność — istnieją w odpowiedzi początkowej oraz nadal są zgodne po renderowaniu. Standard surowej i wyrenderowanej strony produktu definiuje to, co powinno być widoczne po stronie serwera; samo uprawnienie crawlera nic nie mówi o tym kontrakcie.

Mit, który kosztuje Cię ruch: trening ≠ wyszukiwanie AI

Oto rzecz, którą trzeba zrozumieć. Blokowanie botów treningowych to nie to samo co blokowanie botów wyszukiwania AI. To osobne reguły robots.txt o przeciwnych konsekwencjach:

  • Zablokowanie botów treningowych (GPTBot, ClaudeBot, CCBot, Bytespider oraz tokenów Google-Extended/Applebot-Extended) → nie wpływa na pozycje w Google, co potwierdzają Google i empiryczne dane wydawców. Po prostu wyłączasz się z trenowania modeli.
  • Zablokowanie botów wyszukiwania AI (OAI-SearchBot, PerplexityBot) → tracisz widoczność w odpowiedziach ChatGPT i Perplexity. To rzeczywisty kompromis, a nie bezpłatna korzyść.

Jeśli zablokujesz zbyt szeroko — na przykład regułą obejmującą OAI-SearchBot, choć chodziło Ci tylko o zatrzymanie treningu — możesz po cichu usunąć się z wyszukiwania AI. Precyzyjnie określ, jakiej kategorii dotyczy każda reguła.

Dlaczego wydawcy w ogóle blokują boty: umowa społeczna

Powód całej tej debaty sprowadza się do ruchu. Jak ująłem to w mojej analizie botów AI, “there’s a cost to bots crawling your websites and there’s a social contract between search engines and website owners, where search engines add value by sending referral traffic to websites. Google sends traffic (for now), so they don’t get blocked.” (tłumaczenie) „Crawlowanie witryn przez boty ma koszt, a między wyszukiwarkami i właścicielami witryn istnieje umowa społeczna: wyszukiwarki dodają wartość, wysyłając witrynom ruch z odsyłaczy. Google wysyła ruch (na razie), więc nie jest blokowane.” Crawlery AI jak dotąd przeważnie nie odsyłają ruchu — a dane uzasadniają ten niepokój. W mojej analizie Cloudflare Radar boty AI są już zdecydowanie drugim crawlerem za wyszukiwarkami i zmierzają do ich wyprzedzenia. Więcej w karcie Stats.

Ujawnienie: jestem byłym pracownikiem Ahrefs i otrzymuję bezpłatny dostęp do Ahrefs. Powiązana analiza crawlerów to moja opublikowana praca z tamtego okresu; Ahrefs nie recenzuje ani nie zatwierdza obecnych wniosków redakcyjnych tej witryny.

W sprawie szerszego procesu, w który to się wpisuje — odkrywania, harmonogramu crawlowania, renderowania oraz różnic między crawlowaniem i indeksowaniem — zobacz hub crawlowania oraz sąsiednie tematy o crawlerach ogólnie, user-agentach, Googlebocie, Bingbocie i robots.txt.

Add an expert note

Pin an expert quote

New person? Create their unclaimed profile at /admin/experts/ → Pin a quote first.