Tester robots.txt

1. robots.txt
2. Pages to test
3. Bots

Działa w całości w Twojej przeglądarce — nic, co wklejasz, nie jest przesyłane ani zapisywane. The server is only used to fetch a site's robots.txt or sitemap (browsers can't — no CORS). Anonimowe liczniki wyników poszczególnych uruchomień mogą być wykorzystywane do badań zbiorczych; adresy URL, domeny, adresy IP i identyfikatory nigdy nie są uwzględniane, a statystyki nie są publikowane poniżej 100 uruchomień.

Opinia
Zgłoś błąd

Coś nie działa w Tester robots.txt? Opisz, co się stało — zgłoszenie trafi bezpośrednio do prywatnej kolejki weryfikacji, a nie na publiczną listę.

Dane, które zostaną wysłane
 Dane wejściowe narzędzia, przesłane pliki, wklejone źródła, pełne wyniki, parametry zapytania i fragmenty URL nie są dołączane automatycznie. Możesz edytować lub usunąć zaznaczony powyżej fragment. Metadane przeglądarki i ochrony przed nadużyciami są przetwarzane w celu zapobiegania spamowi. 

O tym narzędziu

Sprawdź adresy URL względem reguł robots.txt dla wybranych crawlerów i zobacz dokładną regułę Allow lub Disallow, która rozstrzygnęła każdą komórkę. Możesz pobrać aktywny plik dla danego originu albo wkleić projekt i porównać proponowane zmiany.

Funkcje

  • Macierz adres URL × crawler z dokładną zwycięską regułą i wyróżnieniem jej w pliku.
  • Pobieranie pliku robots.txt osobno dla każdego wprowadzonego originu oraz lokalny tryb wklejania projektu.
  • Kontrola składni, wykrywanie konfliktów z mapą witryny i porównanie proponowanej wersji.
  • Gotowy audyt botów AI, obejmujący między innymi GPTBot, ClaudeBot i Google-Extended.

Jak to działa

Parser grupuje reguły według user-agenta, znajduje dla każdego adresu URL najdłuższą pasującą ścieżkę i rozstrzyga remisy zgodnie z semantyką Google. Plik jest przypisany do originu, dlatego pełne adresy z różnych subdomen używają osobnych plików /robots.txt.

Ograniczenia

  • Kontrola odtwarza dopasowywanie robots.txt w stylu Google i ocenia możliwość crawlowania, a nie indeksowalność. Disallow nie zastępuje noindex ani uwierzytelniania.
  • Pobierana wersja może zależeć od user-agenta lub regionu. Zachowanie crawlerów innych niż Google nie jest tutaj wnioskowane, a w trybie wklejania ten sam projekt jest stosowany do każdego adresu URL.

Częste pytania

Czy plik robots.txt uniemożliwia zindeksowanie strony?

Nie. Disallow blokuje przeszukiwanie, a nie indeksowanie. Jeśli inne strony prowadzą do zablokowanego adresu URL, Google nadal może go zindeksować, zwykle bez fragmentu opisu. Aby wykluczyć stronę z indeksu, zezwól na jej crawlowanie i dodaj tag meta noindex lub nagłówek X-Robots-Tag. Nie możesz jednocześnie jej blokować, ponieważ wtedy Google nigdy nie zobaczy noindex.

Czy kolejność reguł w robots.txt ma znaczenie?

Nie dla Google. Google stosuje najbardziej szczegółową regułę, czyli najdłuższą pasującą ścieżkę, niezależnie od jej miejsca w pliku, dlatego Allow może zastąpić wcześniejsze Disallow. Narzędzie dopasowuje reguły w ten sam sposób. Niektóre inne crawlery stosują pierwszą pasującą regułę, więc zapisuj reguły jednoznacznie.

Jaka jest różnica między Disallow a noindex?

Disallow w robots.txt informuje crawlery, aby nie pobierały adresu URL. noindex w tagu meta lub nagłówku HTTP na stronie informuje, aby nie przechowywały go w indeksie. Rozwiązują różne problemy, a ich połączenie przynosi odwrotny skutek: zablokowana strona nie jest pobierana, więc jej noindex pozostaje niewidoczny.

Czy zablokowanie CSS lub JavaScript w robots.txt szkodzi SEO?

Może szkodzić. Google renderuje strony, aby je zrozumieć, więc brak możliwości pobrania potrzebnych plików CSS i JS może prowadzić do błędnej oceny układu, treści lub dostosowania do urządzeń mobilnych. Zezwól na zasoby niezbędne do renderowania stron i blokuj tylko rzeczywiście zbędne ścieżki.

Jak zablokować crawlery AI za pomocą robots.txt?

Dodaj grupę user-agent dla każdego bota AI, na przykład GPTBot, Google-Extended, ClaudeBot, CCBot i PerplexityBot, z regułą Disallow: /. Użyj przycisku audytu crawlerów AI, aby je wczytać i potwierdzić zgodność reguł. Pamiętaj, że przestrzeganie robots.txt jest dobrowolne: renomowane boty go respektują, ale nie jest to kontrola dostępu.

Następny krokGenerator robots.txt — generate a replacement robots.txt with the directives you meant to ship. Wskazówki są dostępne po angielsku.