Permission
Is the crawler allowed?
Free, no signup. “Am I letting ChatGPT, Claude, Perplexity, and Google’s AI read this page — and did I mean to?” Enter a URL and get the answer for every major AI crawler, with the exact robots.txt rule that decided it.
Is the crawler allowed?
Are useful facts present in raw HTML?
Does JavaScript successfully expose them?
Can an agent identify and use semantic controls?
Do page, schema, feed and checkout facts agree?
HTML remains primary. llms.txt, UCP, and other protocol files are optional distribution layers and cannot compensate for inaccessible or unextractable HTML.
Expected columns: crawler, timestamp, url, status, verification. A user-agent string alone is never treated as verified identity.
No log evidence uploaded.
Kontrole są uruchamiane na naszym serwerze; pobieramy podany adres URL i nie przechowujemy wyników. Anonimowe liczniki wyników poszczególnych uruchomień mogą być wykorzystywane do badań zbiorczych; adresy URL, domeny, adresy IP i identyfikatory nigdy nie są uwzględniane, a statystyki nie są publikowane poniżej 100 uruchomień.
+ zapisuje bieżącą witrynę lub stronę. Użyj ☆ obok dowolnej zapisanej witryny, strony lub listy, aby dodać ją do ulubionych. Historia ostatnich kontroli pojawi się poniżej.
Cel uzupełniony na podstawie lokalnych wyborów.
Zapisane cele, nazwane listy i podsumowania ostatnich kontroli pozostają tylko w tej przeglądarce.
nosnippet, max-snippet, and data-nosnippet can limit preview/use but also affect normal Search snippets. Google-Extended only controls Gemini/Vertex training and grounding, not Search or Overviews.
nosnippet can block content from generative-model context without preventing title-based discovery, while Bing documents AI-answer/training effects for noarchive and noindex. Use the page audit or extension to inspect those meta and HTTP-header directives.
These fetch pages to answer questions and cite sources. Blocking a cooperating crawler can prevent that crawler from accessing the page, but it does not guarantee absence from every answer or citation.
These collect pages for model training. A provider's documented robots control governs future crawling; it does not remove content already collected or guarantee deletion from an existing training dataset.
Pick what to block; copy the generated rules into your robots.txt.
Blocking here means “documented posture,” not enforcement — a cooperating crawler will honor it; a hostile one may not.
Crawler roster last reviewed . Data is hand-maintained and editable (src/data/ai-crawlers.json).
Wprowadź adres URL, aby dla każdego crawlera sprawdzić, co plik robots.txt zezwala pobierać lub blokuje, która reguła wygrywa oraz czy istnieje plik llms.txt.
Kontrola pobiera wskazany plik robots.txt, stosuje reguły według ich rzeczywistego pierwszeństwa dla każdego user-agenta, a następnie pokazuje werdykt, dyrektywę i zwycięski wiersz. Ograniczenia specyficzne dla operatorów oraz kontrole strony pozostają oddzielne.
Nie samo w sobie. GPTBot jest robotem treningowym OpenAI; zablokowanie go wyłącza treść z przyszłego trenowania modeli, ale nie zatrzymuje robotów wyszukiwania, które pobierają strony, aby odpowiadać na pytania i cytować źródła. Są to OAI-SearchBot, używany do wyników i cytowań w wyszukiwaniu ChatGPT, oraz ChatGPT-User, który pobiera stronę po kliknięciu łącza przez użytkownika. Aby nie pojawiać się w odpowiedziach ChatGPT, trzeba byłoby zablokować także je; kontroler wymienia je osobno w sekcji pobierania treści i cytowania odpowiedzi.
Nie ma osobnego robota dla AI Overviews, a Google nie oferuje pełnej rezygnacji wyłącznie z tej funkcji przy zachowaniu strony bez zmian w zwykłym wyszukiwaniu. Zablokowanie Googlebot uniemożliwia przeszukiwanie, ale samo nie gwarantuje usunięcia znanego adresu URL z wyników. Kontrole fragmentów wpływają też na zwykłe wyniki. Google-Extended osobno kontroluje trenowanie i ugruntowanie Gemini/Vertex, a nie wyszukiwanie ani podsumowania AI.
robots.txt jest wskazówką, a nie blokadą. Informuje współpracujące roboty o Twoich preferencjach, ale niczego nie wymusza. Rzetelni dostawcy go respektują, lecz niektóre roboty według zgłoszeń pomijają zasady; kontroler oznacza je polskim ostrzeżeniem. Aby faktycznie zatrzymać robota, trzeba go zablokować w CDN lub WAF i zweryfikować autentyczność żądania na podstawie IP, zamiast ufać tekstowemu identyfikatorowi przeglądarki.
Etykieta możliwości weryfikacji odzwierciedla, czy dostawca publikuje sposób sprawdzenia deklaracji robota: aktualne zakresy IP albo odwrotny DNS z potwierdzeniem w przód, czyli FCrDNS, zestawione z listą narzędzia do weryfikacji botów. Sam tekstowy identyfikator zawsze można podszyć. Anthropic publikuje obecnie oficjalną listę adresów IP robotów pod claude.com/crawling/bots.json, więc ruch Claude można sprawdzić względem opublikowanego zakresu; to nie jest to samo co potwierdzenie odwrotnego DNS.
Nie. llms.txt jest proponowaną konwencją społecznościową i nie ma dokumentacji, by którykolwiek główny crawler AI go czytał, więc jego obecność lub brak nie wpływa na zezwolenie ani blokadę. Kontroler informuje o istnieniu llms.txt w domenie wyłącznie pomocniczo; każdy werdykt dostępu wynika tylko z robots.txt.