Analizator plików logów

Free, no signup. Server logs answer a question your analytics can't: what are crawlers actually doing on your site. Drop one in and see crawl budget by bot and by section, how much is wasted on 404s and redirects, how AI crawlers compare to search engines, and which requests are impostors faking a crawler user-agent.

Handles nginx / Apache (combined & common), IIS / W3C Extended, and JSON logs (incl. Cloudflare Logpush) — format auto-detected. Crawler ranges updated 24 days ago.

Drop your access log here
or ·
Multiple files allowed. Big logs stream in chunks.

Działa w całości w Twojej przeglądarce — nic, co wklejasz, nie jest przesyłane ani zapisywane. Spot-checking a suspicious IP against the Googlebot Verifier sends only that IP to our server. Anonimowe liczniki wyników poszczególnych uruchomień mogą być wykorzystywane do badań zbiorczych; adresy URL, domeny, adresy IP i identyfikatory nigdy nie są uwzględniane, a statystyki nie są publikowane poniżej 100 uruchomień.

Opinia
Zgłoś błąd

Coś nie działa w Analizator plików logów? Opisz, co się stało — zgłoszenie trafi bezpośrednio do prywatnej kolejki weryfikacji, a nie na publiczną listę.

Dane, które zostaną wysłane
 Dane wejściowe narzędzia, przesłane pliki, wklejone źródła, pełne wyniki, parametry zapytania i fragmenty URL nie są dołączane automatycznie. Możesz edytować lub usunąć zaznaczony powyżej fragment. Metadane przeglądarki i ochrony przed nadużyciami są przetwarzane w celu zapobiegania spamowi. 

O tym narzędziu

Serwerowy dziennik dostępu pokazuje, jak crawlery naprawdę zachowują się w Twojej witrynie. Przeanalizuj budżet crawlowania według robota i sekcji, straty na błędach 404 i przekierowaniach, porównanie crawlerów AI z wyszukiwarką oraz żądania podszywające się pod user-agenta.

Formaty nginx, Apache, IIS/W3C i JSON są analizowane lokalnie w przeglądarce; nic nie jest przesyłane, a wyniki opisują zachowanie podczas crawlowania, nie indeksowanie.

Funkcje

  • Budżet crawlowania według robota z liczbą zweryfikowanych, podszywających się i nieweryfikowalnych żądań, mieszanką statusów oraz procentem strat.
  • Podział crawlerów wyszukiwania, AI i treningowych według sekcji oraz dziennego przebiegu w czasie.
  • Raport podszywaczy z kontrolą odwrotnego DNS i ASN dla podejrzanych adresów IP, w tym weryfikacją Googlebot.
  • Ranking rekomendacji z kopiowalnymi liniami robots.txt oraz eksportem CSV robotów i zmarnowanych adresów URL.

Jak to działa

Upuść jeden lub kilka plików logów w polu przesyłania albo wczytaj dane demonstracyjne. Format jest wykrywany automatycznie, duże pliki są strumieniowane, a każda linia otrzymuje cechy robota, adresu IP, statusu i ścieżki. Następnie narzędzie oblicza budżet, straty i trendy, sprawdza podejrzane adresy IP na żywo oraz przypisuje konkretne poprawki.

Ograniczenia

  • Narzędzie widzi tylko żądania zapisane przez serwer i nie wyjaśnia, dlaczego crawler wybrał dany adres URL ani czy został on zaindeksowany.
  • Crawler, dla którego operator nie publikuje zakresów adresów IP, pozostaje nieweryfikowalny, zamiast otrzymać ocenę prawdziwy lub fałszywy.
  • Sekcje są wywnioskowane ze ścieżek URL, więc jakość grupowania zależy od struktury witryny; raport opisuje zachowanie podczas crawlowania, a nie wyniki indeksowania.

Częste pytania

Czy moje pliki logów są gdzieś przesyłane?

Nie. Analiza działa całkowicie w przeglądarce przez Web Worker: plik jest czytany z dysku i lokalnie przetwarzany partiami. Wyjątkiem jest opcjonalna kontrola pojedynczego IP w raporcie podszywania, która wysyła sam adres IP do API weryfikującego FCrDNS i ASN. Zamknięcie karty usuwa dane.

Jakie formaty logów są obsługiwane?

Typ pliku jest wykrywany automatycznie. Obsługiwane są formaty `combined` i `common` nginx oraz Apache, IIS / W3C Extended i logi JSON, w tym Cloudflare Logpush. Można dodać wiele plików, a duże logi są przetwarzane partiami.

Jak odróżnia prawdziwy crawler od podszywającego się?

Każde żądanie jest dopasowywane do znanego crawlera według identyfikatora robota, a źródłowe IP jest porównywane z opublikowanymi zakresami IP operatora — listami odświeżanymi co tydzień, których używa Weryfikator Googlebot. Googlebot wysłany z adresu IP spoza zakresów Google jest oznaczany jako prawdopodobne podszycie. Niektórzy operatorzy, na przykład ByteDance z robotem Bytespider, nie publikują zakresów, więc takie żądania są oznaczane jako nieweryfikowalne.

Co jest uznawane za zmarnowany budżet crawlowania?

Każde żądanie crawlera zakończone przekierowaniem, poza użytecznym 304 bez zmian, błędem 4xx, np. 404 lub 410, albo błędem serwera 5xx. Narzędzie agreguje straty według bota, sekcji i URL.

Czy mogę zablokować podszywających się przez robots.txt?

Nie. Podszywający się używają identyfikatora robota właśnie po to, by ignorować robots.txt, więc Disallow nie działa. Blokuj ich po IP lub ASN na warstwie brzegowej albo zaporze. robots.txt nadaje się do prawdziwych crawlerów marnujących budżet; sekcja Rekomendacje tworzy odpowiednie linie Disallow.

Następny krokGenerator robots.txt — generate the corrected version. Wskazówki są dostępne po angielsku.