Analizator plików logów
Free, no signup. Server logs answer a question your analytics can't: what are crawlers actually doing on your site. Drop one in and see crawl budget by bot and by section, how much is wasted on 404s and redirects, how AI crawlers compare to search engines, and which requests are impostors faking a crawler user-agent.
Handles nginx / Apache (combined & common), IIS / W3C Extended, and JSON logs (incl. Cloudflare Logpush) — format auto-detected. Crawler ranges updated 24 days ago.
Działa w całości w Twojej przeglądarce — nic, co wklejasz, nie jest przesyłane ani zapisywane. Spot-checking a suspicious IP against the Googlebot Verifier sends only that IP to our server. Anonimowe liczniki wyników poszczególnych uruchomień mogą być wykorzystywane do badań zbiorczych; adresy URL, domeny, adresy IP i identyfikatory nigdy nie są uwzględniane, a statystyki nie są publikowane poniżej 100 uruchomień.
Paszport witryny Kontekst lokalny tej zapisanej witryny
Dane lokalne
Zapisane cele, nazwane listy i podsumowania ostatnich kontroli pozostają tylko w tej przeglądarce.
Who's crawling you
Requests grouped by crawler type. AI crawlers and search engines want different things from your site. "Other / unclassified" is everything with no known crawler user-agent — human browsers and untracked tools.
Crawl over time
Daily crawl requests by crawler type across the log's date range.
Crawl budget by bot
Each crawler seen in the log: how many requests, how it was verified, and how much of its crawl hit redirects or errors (excluding 304 revalidation).
Spoofer report
Requests that sent a crawler's user-agent from an IP outside that operator's published ranges — likely impostors. robots.txt won't stop these (impostors ignore it); block by IP or ASN. Spot-check any IP for the real network owner via forward-confirmed reverse DNS — this is the one action that leaves your browser (a single lookup to our verifier API).
Crawler × page-type matrix
Where each recognized crawler concentrates requests across inferred page cohorts. Cell intensity represents request count; the label also shows wasted requests.
Crawl budget by section
Where crawlers spend their time on your site (bot traffic only). High waste in a section means crawlers are burning budget on broken or redirecting URLs there.
Most-wasted URLs
Individual URLs where crawlers hit redirects or errors most often (excluding 304 revalidation) — the highest-leverage fixes for crawl budget.
AI-invented URL candidates
Observed 404/410 requests with an AI crawler or known AI-assistant referrer. This is the primary evidence mode: a row is a candidate, not proof that a model invented it — it may be a deleted or migrated URL. Suggested destinations compare only against the sitemap/URL list you supplied above.
Optional URL probe simulation
Ask the site’s open-model simulator for plausible paths, then check their live status. This is explicitly a simulation, never observed assistant output; log evidence above is stronger.
Expected URLs vs crawler requests
Recommendations
Oceń to narzędzie
O tym narzędziu
Serwerowy dziennik dostępu pokazuje, jak crawlery naprawdę zachowują się w Twojej witrynie. Przeanalizuj budżet crawlowania według robota i sekcji, straty na błędach 404 i przekierowaniach, porównanie crawlerów AI z wyszukiwarką oraz żądania podszywające się pod user-agenta.
Formaty nginx, Apache, IIS/W3C i JSON są analizowane lokalnie w przeglądarce; nic nie jest przesyłane, a wyniki opisują zachowanie podczas crawlowania, nie indeksowanie.
Funkcje
- Budżet crawlowania według robota z liczbą zweryfikowanych, podszywających się i nieweryfikowalnych żądań, mieszanką statusów oraz procentem strat.
- Podział crawlerów wyszukiwania, AI i treningowych według sekcji oraz dziennego przebiegu w czasie.
- Raport podszywaczy z kontrolą odwrotnego DNS i ASN dla podejrzanych adresów IP, w tym weryfikacją Googlebot.
- Ranking rekomendacji z kopiowalnymi liniami robots.txt oraz eksportem CSV robotów i zmarnowanych adresów URL.
Jak to działa
Upuść jeden lub kilka plików logów w polu przesyłania albo wczytaj dane demonstracyjne. Format jest wykrywany automatycznie, duże pliki są strumieniowane, a każda linia otrzymuje cechy robota, adresu IP, statusu i ścieżki. Następnie narzędzie oblicza budżet, straty i trendy, sprawdza podejrzane adresy IP na żywo oraz przypisuje konkretne poprawki.
Ograniczenia
- Narzędzie widzi tylko żądania zapisane przez serwer i nie wyjaśnia, dlaczego crawler wybrał dany adres URL ani czy został on zaindeksowany.
- Crawler, dla którego operator nie publikuje zakresów adresów IP, pozostaje nieweryfikowalny, zamiast otrzymać ocenę prawdziwy lub fałszywy.
- Sekcje są wywnioskowane ze ścieżek URL, więc jakość grupowania zależy od struktury witryny; raport opisuje zachowanie podczas crawlowania, a nie wyniki indeksowania.
Częste pytania
Czy moje pliki logów są gdzieś przesyłane?
Nie. Analiza działa całkowicie w przeglądarce przez Web Worker: plik jest czytany z dysku i lokalnie przetwarzany partiami. Wyjątkiem jest opcjonalna kontrola pojedynczego IP w raporcie podszywania, która wysyła sam adres IP do API weryfikującego FCrDNS i ASN. Zamknięcie karty usuwa dane.
Jakie formaty logów są obsługiwane?
Typ pliku jest wykrywany automatycznie. Obsługiwane są formaty `combined` i `common` nginx oraz Apache, IIS / W3C Extended i logi JSON, w tym Cloudflare Logpush. Można dodać wiele plików, a duże logi są przetwarzane partiami.
Jak odróżnia prawdziwy crawler od podszywającego się?
Każde żądanie jest dopasowywane do znanego crawlera według identyfikatora robota, a źródłowe IP jest porównywane z opublikowanymi zakresami IP operatora — listami odświeżanymi co tydzień, których używa Weryfikator Googlebot. Googlebot wysłany z adresu IP spoza zakresów Google jest oznaczany jako prawdopodobne podszycie. Niektórzy operatorzy, na przykład ByteDance z robotem Bytespider, nie publikują zakresów, więc takie żądania są oznaczane jako nieweryfikowalne.
Co jest uznawane za zmarnowany budżet crawlowania?
Każde żądanie crawlera zakończone przekierowaniem, poza użytecznym 304 bez zmian, błędem 4xx, np. 404 lub 410, albo błędem serwera 5xx. Narzędzie agreguje straty według bota, sekcji i URL.
Czy mogę zablokować podszywających się przez robots.txt?
Nie. Podszywający się używają identyfikatora robota właśnie po to, by ignorować robots.txt, więc Disallow nie działa. Blokuj ich po IP lub ASN na warstwie brzegowej albo zaporze. robots.txt nadaje się do prawdziwych crawlerów marnujących budżet; sekcja Rekomendacje tworzy odpowiednie linie Disallow.
Typowe problemy i sposoby ich naprawy
- Ostrzeżenie Deklaracja robota znajduje się poza opublikowanym zakresem operatora Poprawka: Traktuj robota jako niezweryfikowanego i blokuj go lub badaj, dopóki jego adres IP nie będzie zgodny z opublikowanym zakresem operatora.
- Ostrzeżenie Robot zużywa żądania na nieprzydatne adresy URL Poprawka: Zablokuj lub oznacz kanonicznie mało wartościowe adresy z parametrami, filtrami, wyszukiwaniem i duplikatami, a następnie wzmocnij linki do adresów priorytetowych.
- Ostrzeżenie Robot wielokrotnie otrzymuje odpowiedzi błędów Poprawka: Napraw lub przekieruj najczęściej żądane adresy zwracające 4xx/5xx i usuń linki wewnętrzne do adresów, które mają pozostać usunięte.
- Wymaga sprawdzenia Robot napotyka zbyt wiele przekierowań Poprawka: Zaktualizuj linki wewnętrzne i wpisy mapy witryny do końcowych adresów URL oraz skróć łańcuchy przekierowań do jednego etapu.
- Wymaga sprawdzenia Robot odwiedza stronę o adresie URL spoza oczekiwanego zbioru Poprawka: Dodaj wykryty adres do kanonicznego zestawu linków wewnętrznych i mapy witryny albo przekieruj lub usuń go, jeśli jest niezamierzony.
- Wymaga sprawdzenia Oczekiwany ważny adres URL nie ma wizyt robota Poprawka: Dodaj dostępne dla robotów linki wewnętrzne i kanoniczny wpis mapy witryny, a następnie sprawdź bariery robots i uwierzytelniania.
- Ostrzeżenie Aktywność robota istotnie spada Poprawka: Porównaj datę spadku ze zmianami robots, statusów, mapy witryny, wdrożenia i pojemności serwera, a następnie przywróć objętą ścieżkę.
- Wymaga sprawdzenia Aktywność robota istotnie rośnie Poprawka: Zidentyfikuj wzorzec adresów powodujący wzrost i ogranicz nowo ujawnione parametry, pułapki, przekierowania lub zduplikowane ścieżki.
- Wymaga sprawdzenia Czasy odpowiedzi dla robota są długie Poprawka: Buforuj lub optymalizuj najwolniejsze punkty końcowe i zmniejsz opóźnienie źródła przed zażądaniem ponownego indeksowania.