Kontroler dostępu robotów AI

Free, no signup. “Am I letting ChatGPT, Claude, Perplexity, and Google’s AI read this page — and did I mean to?” Enter a URL and get the answer for every major AI crawler, with the exact robots.txt rule that decided it.

Five separate tests · registry 2026-07-29

Crawler access is only the first layer

Permission

Is the crawler allowed?

Extractability

Are useful facts present in raw HTML?

Renderability

Does JavaScript successfully expose them?

Operability

Can an agent identify and use semantic controls?

Commerce readiness

Do page, schema, feed and checkout facts agree?

HTML remains primary. llms.txt, UCP, and other protocol files are optional distribution layers and cannot compensate for inaccessible or unextractable HTML.

Validate a protocol response

Upload verified-bot log evidence

Expected columns: crawler, timestamp, url, status, verification. A user-agent string alone is never treated as verified identity.

No log evidence uploaded.

robots.txt is advisory, not a lock. It tells cooperating crawlers what you prefer — it does not enforce anything. Some crawlers below are reported to ignore it (flagged ⚠). To actually stop a crawler, block it at your CDN/WAF and verify it's genuine by IP.

Kontrole są uruchamiane na naszym serwerze; pobieramy podany adres URL i nie przechowujemy wyników. Anonimowe liczniki wyników poszczególnych uruchomień mogą być wykorzystywane do badań zbiorczych; adresy URL, domeny, adresy IP i identyfikatory nigdy nie są uwzględniane, a statystyki nie są publikowane poniżej 100 uruchomień.

Opinia
Zgłoś błąd

Coś nie działa w Kontroler dostępu robotów AI? Opisz, co się stało — zgłoszenie trafi bezpośrednio do prywatnej kolejki weryfikacji, a nie na publiczną listę.

Dane, które zostaną wysłane
 Dane wejściowe narzędzia, przesłane pliki, wklejone źródła, pełne wyniki, parametry zapytania i fragmenty URL nie są dołączane automatycznie. Możesz edytować lub usunąć zaznaczony powyżej fragment. Metadane przeglądarki i ochrony przed nadużyciami są przetwarzane w celu zapobiegania spamowi. 
Set your posture → robots.txt block

Pick what to block; copy the generated rules into your robots.txt.

  

Blocking here means “documented posture,” not enforcement — a cooperating crawler will honor it; a hostile one may not.

Crawler roster last reviewed . Data is hand-maintained and editable (src/data/ai-crawlers.json).

O tym narzędziu

Wprowadź adres URL, aby dla każdego crawlera sprawdzić, co plik robots.txt zezwala pobierać lub blokuje, która reguła wygrywa oraz czy istnieje plik llms.txt.

Funkcje

  • Udokumentowana lista botów wyszukiwania, cytowania i trenowania modeli.
  • Silnik dopasowywania robots.txt pokazujący zwycięską regułę i jej wiersz źródłowy.
  • Ustawienia rozdzielające pobieranie, cytowanie i trenowanie oraz generator reguł do skopiowania.
  • Jawne objaśnienie różnicy między deklarowaną polityką a rzeczywistą blokadą sieciową.

Jak to działa

Kontrola pobiera wskazany plik robots.txt, stosuje reguły według ich rzeczywistego pierwszeństwa dla każdego user-agenta, a następnie pokazuje werdykt, dyrektywę i zwycięski wiersz. Ograniczenia specyficzne dla operatorów oraz kontrole strony pozostają oddzielne.

Ograniczenia

  • robots.txt ma charakter doradczy: współpracujący operator może go przestrzegać, ale nieuczciwy może go zignorować.
  • Ciąg user-agent nie dowodzi tożsamości żądania; w razie potrzeby należy zweryfikować dowody sieciowe.
  • Obecność llms.txt ma charakter informacyjny i nie zmienia werdyktu dostępu.

Częste pytania

Czy zablokowanie GPTBot powstrzyma ChatGPT przed cytowaniem mojej witryny?

Nie samo w sobie. GPTBot jest robotem treningowym OpenAI; zablokowanie go wyłącza treść z przyszłego trenowania modeli, ale nie zatrzymuje robotów wyszukiwania, które pobierają strony, aby odpowiadać na pytania i cytować źródła. Są to OAI-SearchBot, używany do wyników i cytowań w wyszukiwaniu ChatGPT, oraz ChatGPT-User, który pobiera stronę po kliknięciu łącza przez użytkownika. Aby nie pojawiać się w odpowiedziach ChatGPT, trzeba byłoby zablokować także je; kontroler wymienia je osobno w sekcji pobierania treści i cytowania odpowiedzi.

Czy mogę zrezygnować z Google AI Overviews za pomocą robots.txt?

Nie ma osobnego robota dla AI Overviews, a Google nie oferuje pełnej rezygnacji wyłącznie z tej funkcji przy zachowaniu strony bez zmian w zwykłym wyszukiwaniu. Zablokowanie Googlebot uniemożliwia przeszukiwanie, ale samo nie gwarantuje usunięcia znanego adresu URL z wyników. Kontrole fragmentów wpływają też na zwykłe wyniki. Google-Extended osobno kontroluje trenowanie i ugruntowanie Gemini/Vertex, a nie wyszukiwanie ani podsumowania AI.

Czy robots.txt rzeczywiście zatrzyma crawler AI?

robots.txt jest wskazówką, a nie blokadą. Informuje współpracujące roboty o Twoich preferencjach, ale niczego nie wymusza. Rzetelni dostawcy go respektują, lecz niektóre roboty według zgłoszeń pomijają zasady; kontroler oznacza je polskim ostrzeżeniem. Aby faktycznie zatrzymać robota, trzeba go zablokować w CDN lub WAF i zweryfikować autentyczność żądania na podstawie IP, zamiast ufać tekstowemu identyfikatorowi przeglądarki.

Dlaczego robot jest oznaczony jako „nieweryfikowalny”?

Etykieta możliwości weryfikacji odzwierciedla, czy dostawca publikuje sposób sprawdzenia deklaracji robota: aktualne zakresy IP albo odwrotny DNS z potwierdzeniem w przód, czyli FCrDNS, zestawione z listą narzędzia do weryfikacji botów. Sam tekstowy identyfikator zawsze można podszyć. Anthropic publikuje obecnie oficjalną listę adresów IP robotów pod claude.com/crawling/bots.json, więc ruch Claude można sprawdzić względem opublikowanego zakresu; to nie jest to samo co potwierdzenie odwrotnego DNS.

Czy plik llms.txt zmienia którykolwiek z tych werdyktów?

Nie. llms.txt jest proponowaną konwencją społecznościową i nie ma dokumentacji, by którykolwiek główny crawler AI go czytał, więc jego obecność lub brak nie wpływa na zezwolenie ani blokadę. Kontroler informuje o istnieniu llms.txt w domenie wyłącznie pomocniczo; każdy werdykt dostępu wynika tylko z robots.txt.

Następny krokGenerator robots.txt — generate the corrected version. Wskazówki są dostępne po angielsku.