Tester robots.txt
Działa w całości w Twojej przeglądarce — nic, co wklejasz, nie jest przesyłane ani zapisywane. The server is only used to fetch a site's robots.txt or sitemap (browsers can't — no CORS). Anonimowe liczniki wyników poszczególnych uruchomień mogą być wykorzystywane do badań zbiorczych; adresy URL, domeny, adresy IP i identyfikatory nigdy nie są uwzględniane, a statystyki nie są publikowane poniżej 100 uruchomień.
+ zapisuje bieżącą witrynę lub stronę. Użyj ☆ obok dowolnej zapisanej witryny, strony lub listy, aby dodać ją do ulubionych. Historia ostatnich kontroli pojawi się poniżej.
Utwórz nazwaną listę
Cel uzupełniony na podstawie lokalnych wyborów.
Paszport witryny Kontekst lokalny tej zapisanej witryny
Dane lokalne
Zapisane cele, nazwane listy i podsumowania ostatnich kontroli pozostają tylko w tej przeglądarce.
Identical rows are grouped — click a row's count to expand. Click any cell to see the exact rule that decided it. On mobile, scroll the table sideways.
Why this verdict and how to verify it
Oceń to narzędzie
O tym narzędziu
Sprawdź adresy URL względem reguł robots.txt dla wybranych crawlerów i zobacz dokładną regułę Allow lub Disallow, która rozstrzygnęła każdą komórkę. Możesz pobrać aktywny plik dla danego originu albo wkleić projekt i porównać proponowane zmiany.
Funkcje
- Macierz adres URL × crawler z dokładną zwycięską regułą i wyróżnieniem jej w pliku.
- Pobieranie pliku robots.txt osobno dla każdego wprowadzonego originu oraz lokalny tryb wklejania projektu.
- Kontrola składni, wykrywanie konfliktów z mapą witryny i porównanie proponowanej wersji.
- Gotowy audyt botów AI, obejmujący między innymi GPTBot, ClaudeBot i Google-Extended.
Jak to działa
Parser grupuje reguły według user-agenta, znajduje dla każdego adresu URL najdłuższą pasującą ścieżkę i rozstrzyga remisy zgodnie z semantyką Google. Plik jest przypisany do originu, dlatego pełne adresy z różnych subdomen używają osobnych plików /robots.txt.
Ograniczenia
- Kontrola odtwarza dopasowywanie robots.txt w stylu Google i ocenia możliwość crawlowania, a nie indeksowalność. Disallow nie zastępuje noindex ani uwierzytelniania.
- Pobierana wersja może zależeć od user-agenta lub regionu. Zachowanie crawlerów innych niż Google nie jest tutaj wnioskowane, a w trybie wklejania ten sam projekt jest stosowany do każdego adresu URL.
Częste pytania
Czy plik robots.txt uniemożliwia zindeksowanie strony?
Nie. Disallow blokuje przeszukiwanie, a nie indeksowanie. Jeśli inne strony prowadzą do zablokowanego adresu URL, Google nadal może go zindeksować, zwykle bez fragmentu opisu. Aby wykluczyć stronę z indeksu, zezwól na jej crawlowanie i dodaj tag meta noindex lub nagłówek X-Robots-Tag. Nie możesz jednocześnie jej blokować, ponieważ wtedy Google nigdy nie zobaczy noindex.
Czy kolejność reguł w robots.txt ma znaczenie?
Nie dla Google. Google stosuje najbardziej szczegółową regułę, czyli najdłuższą pasującą ścieżkę, niezależnie od jej miejsca w pliku, dlatego Allow może zastąpić wcześniejsze Disallow. Narzędzie dopasowuje reguły w ten sam sposób. Niektóre inne crawlery stosują pierwszą pasującą regułę, więc zapisuj reguły jednoznacznie.
Jaka jest różnica między Disallow a noindex?
Disallow w robots.txt informuje crawlery, aby nie pobierały adresu URL. noindex w tagu meta lub nagłówku HTTP na stronie informuje, aby nie przechowywały go w indeksie. Rozwiązują różne problemy, a ich połączenie przynosi odwrotny skutek: zablokowana strona nie jest pobierana, więc jej noindex pozostaje niewidoczny.
Czy zablokowanie CSS lub JavaScript w robots.txt szkodzi SEO?
Może szkodzić. Google renderuje strony, aby je zrozumieć, więc brak możliwości pobrania potrzebnych plików CSS i JS może prowadzić do błędnej oceny układu, treści lub dostosowania do urządzeń mobilnych. Zezwól na zasoby niezbędne do renderowania stron i blokuj tylko rzeczywiście zbędne ścieżki.
Jak zablokować crawlery AI za pomocą robots.txt?
Dodaj grupę user-agent dla każdego bota AI, na przykład GPTBot, Google-Extended, ClaudeBot, CCBot i PerplexityBot, z regułą Disallow: /. Użyj przycisku audytu crawlerów AI, aby je wczytać i potwierdzić zgodność reguł. Pamiętaj, że przestrzeganie robots.txt jest dobrowolne: renomowane boty go respektują, ale nie jest to kontrola dostępu.
Typowe problemy i sposoby ich naprawy
- Ostrzeżenie Dyrektywa jest błędnie zapisana Poprawka: Popraw pisownię dyrektywy na obsługiwaną nazwę, aby roboty jej nie ignorowały.
- Ostrzeżenie Użyto nieobsługiwanej dyrektywy noindex Poprawka: Usuń noindex z pliku robots.txt i zamiast tego użyj znacznika meta robots lub nagłówka X-Robots-Tag na adresach URL dostępnych dla robotów.
- Informacja Google ignoruje dyrektywę Crawl-delay Poprawka: Usuń Crawl-delay dla Google i zarządzaj szybkością indeksowania Googlebota za pomocą Search Console lub możliwości serwera.
- Błąd Reguła występuje przed jakąkolwiek grupą user-agent Poprawka: Przenieś regułę pod wiersz User-agent grupy robota, którego ma dotyczyć.
- Ostrzeżenie Wiersz nie zawiera separatora w postaci dwukropka Poprawka: Dodaj brakujący dwukropek między nazwą dyrektywy a wartością, aby parsery mogły odczytać wiersz.
- Informacja Nieznana dyrektywa jest ignorowana Poprawka: Usuń niestandardową dyrektywę albo zastąp ją obsługiwaną dyrektywą robots.txt wyrażającą zamierzoną regułę indeksowania.
- Informacja Grupa robotów nie zawiera reguł Poprawka: Dodaj do tej grupy zamierzone reguły Allow lub Disallow albo usuń grupę, aby robot mógł przejść do grupy wieloznacznej.
- Błąd Wzorzec reguły nigdy nie może zostać dopasowany Poprawka: Rozpocznij wzorzec ścieżki od / lub *, aby dopasowanie mogło zacząć się na początku ścieżki adresu URL.
- Ostrzeżenie Kotwica dolara znajduje się wewnątrz wzorca Poprawka: Przenieś $ na koniec wzorca, jeśli ma zakotwiczać ścieżkę, albo usuń go, jeśli nie zamierzano użyć dosłownego znaku dolara.
- Informacja Dyrektywa User-agent jest podzielona między grupy Poprawka: Połącz reguły tego samego user-agent w jedną grupę, aby obowiązująca polityka była jasna i łatwa w utrzymaniu.
- Błąd Adres URL mapy witryny nie jest bezwzględny Poprawka: Zastąp względne położenie mapy witryny w pełni kwalifikowanym adresem URL zawierającym `https://` i nazwę hosta.
- Błąd Plik robots przekracza 500 KiB Poprawka: Zmniejsz plik robots.txt poniżej 500 KiB, konsolidując wzorce i usuwając zbędne reguły przed punktem obcięcia stosowanym przez Google.
- Informacja Plik robots jest pusty Poprawka: Pozostaw plik pusty, jeśli całe indeksowanie jest świadomie dozwolone; w przeciwnym razie dodaj jawne grupy user-agent i minimalny zestaw wymaganych reguł.
- Błąd Testowany adres URL jest zablokowany dla wybranego robota Poprawka: Usuń lub zawęź zwycięską regułę Disallow albo dodaj bardziej szczegółową regułę Allow, gdy testowany adres URL powinien być dostępny dla robota.