Googlebot i SEO
Czym właściwie jest Googlebot — Smartphone vs Desktop, evergreen Chromium, stringi user-agent, weryfikacja zakresów IP, limity bajtów oraz rozróżnienie crawl vs rank.
Języki
1 sygnał dowodowy na tej stronie
- Powiązane działające narzędzierobots.txt Tester
Googlebot to robot indeksujący Google — oprogramowanie, które pobiera strony, aby Google mogło je indeksować i pozycjonować. Występuje w dwóch wariantach, które dzielą jeden token robots.txt: Googlebot Smartphone (podstawowy, w ramach indeksowania mobile-first) i Googlebot Desktop. Działa na evergreen Chromium i renderuje JavaScript w osobnej, późniejszej kolejce (crawl ≠ render). Crawling nie jest czynnikiem rankingowym, a zablokowanie Googlebota w robots.txt nie jest tym samym co deindeksacja — zablokowany URL może być nadal indeksowany tylko jako URL. User-agent jest trywialnie podrabiany, więc weryfikuj przez odwrotny + zwykły DNS lub opublikowane zakresy IP Google. 'Googlebot' to tak naprawdę część Google Search w znacznie większej platformie crawlingowej.
Evidence for this claim Googlebot is Google's crawler, with smartphone and desktop crawler types that share the same product token. Scope: Current Googlebot crawler and user-agent documentation. Confidence: high · Verified: Google Search Central: Googlebot Evidence for this claim A claimed Google crawler can be verified using reverse and forward DNS or Google's published IP ranges. Scope: Google's current crawler-verification methods. Confidence: high · Verified: Google Search Central: Verify GooglebotTL;DR — Googlebot to robot indeksujący Google — program, który odwiedza Twoje strony, pobiera je i przekazuje dalej, aby Google mogło je indeksować i pozycjonować. Są dwa typy (jeden dla smartfonów i jeden dla komputerów), a ten dla smartfonów wykonuje większość pracy. Bycie indeksowanym jest warunkiem pojawienia się w wynikach wyszukiwania — ale częstsze indeksowanie nie podnosi Twojej pozycji.
Czym jest Googlebot
Google nie przegląda sieci w taki sposób, jak Ty. Wysyła zautomatyzowany program — crawlera, czyli bota — który odwiedza strony, pobiera ich zawartość i podąża za linkami, aby znaleźć kolejne strony. Ten program to Googlebot. (Odpowiednikiem Binga jest Bingbot.)
Opisuję to prosto w moim przewodniku Ahrefs o Googlebot: “Googlebot is the web crawler used by Google to gather the information needed and build a searchable index of the web.” (tłumaczenie) „Googlebot to robot indeksujący używany przez Google do zbierania niezbędnych informacji i budowania przeszukiwalnego indeksu sieci.” Wszystko, co Google pokazuje w wynikach wyszukiwania, zaczyna się od pobrania strony przez Googlebota.
Tak naprawdę są dwa Googleboty
Googlebot występuje w dwóch wariantach:
- Googlebot Smartphone — udaje osobę korzystającą z telefonu. To główny wariant. Google w większości patrzy na mobilną wersję Twojej strony (nazywa się to mobile-first indexing), więc większość indeksowania pochodzi od bota dla smartfonów.
- Googlebot Desktop — udaje osobę korzystającą z komputera stacjonarnego. Wykonuje mniejszą część indeksowania.
Jest pewien haczyk: w pliku robots.txt (pliku, który mówi botom, gdzie mogą
chodzić) oba mają tę samą nazwę — Googlebot. Więc nie możesz powiedzieć
robots.txt „wpuść desktopowego, ale nie mobilnego”. To wszystko albo nic.
Czy Googlebot uruchamia JavaScript?
Tak. Googlebot używa najnowszej wersji Chrome pod maską, więc może czytać nowoczesne strony oparte na JavaScript. Jak ująłem to w moim przewodniku o Googlebot: “Googlebot is evergreen, meaning it sees websites as users would in the latest Chrome browser.” (tłumaczenie) „Googlebot jest evergreen, co oznacza, że widzi strony tak, jak użytkownicy w najnowszej przeglądarce Chrome.” Ale uruchamianie tego JavaScriptu odbywa się później, w osobnym kroku — nie w momencie pierwszego pobrania Twojej strony.
Dwie rzeczy, które ludzie mylą
- Indeksowanie to nie pozycjonowanie. Częstsze indeksowanie nie podniesie Twojej pozycji w wynikach. Indeksowanie to po prostu sposób, w jaki Google znajduje i pobiera Twoją stronę — to brama, przez którą musisz przejść, a nie tablica wyników.
- Zablokowanie Googlebota w
robots.txtnie usuwa Cię z Google. To tylko zatrzymuje Google przed czytaniem strony. Jeśli inne strony linkują do niej, URL może nadal pojawiać się w wynikach (tylko bez użytecznego opisu). Aby faktycznie trzymać stronę poza wynikami, pozwól Google ją zaindeksować i dodaj tagnoindex.
Chcesz wersję techniczną — dokładne stringi user-agenta, jak zweryfikować prawdziwego Googlebota, limity bajtów i kolejkę renderowania? Przełącz się na zakładkę Advanced.
Evidence for this claim Googlebot is Google's crawler, with smartphone and desktop crawler types that share the same product token. Scope: Current Googlebot crawler and user-agent documentation. Confidence: high · Verified: Google Search Central: Googlebot Evidence for this claim A claimed Google crawler can be verified using reverse and forward DNS or Google's published IP ranges. Scope: Google's current crawler-verification methods. Confidence: high · Verified: Google Search Central: Verify GooglebotTL;DR — Googlebot to robot indeksujący Google Search, podzielony na Smartphone (główny, mobile-first) i Desktop, które dzielą jeden token
Googlebotw robots.txt — nie możesz ich targetować osobno. Używa evergreen Chromium i renderuje JavaScript w osobnej, późniejszej kolejce (indeksowanie ≠ renderowanie). Indeksowanie jest wymagane do pozycjonowania, ale nie jest sygnałem rankingowym, a URL zablokowany przez robots może nadal być indeksowany tylko jako URL. Zweryfikuj go przez odwrotny + zwykły DNS do domeny Google lub przeciwko opublikowanym zakresom IP Google — user-agent jest trywialnie podrabiany. A „Googlebot” to tak naprawdę tylko fragment platformy indeksującej skierowany do wyszukiwarki.
Czym Googlebot naprawdę jest
Google jest precyzyjne co do nazwy: “Googlebot is the generic name for two types of web crawlers used by Google Search.” (tłumaczenie) „Googlebot to ogólna nazwa dwóch typów robotów indeksujących używanych przez Google Search.” Te dwa typy to Googlebot Smartphone („mobilny robot indeksujący, który symuluje użytkownika na urządzeniu mobilnym”) i Googlebot Desktop („robot indeksujący na komputer, który symuluje użytkownika na komputerze”).
To nie jest jeden mały program działający na jednej maszynie. “Googlebot działa na tysiącach maszyn,” jak opisuję to w moim przewodniku po Googlebot, “to one decydują, jak szybko i co przeszukiwać na stronach internetowych,” rozproszonych po centrach danych na całym świecie, ale wychodzących głównie z adresów IP w USA. Odkrywanie odbywa się głównie przez linki — Google znajduje nowe adresy URL “przede wszystkim z linków osadzonych w wcześniej przeszukanych stronach” — oraz przez mapy witryn. (Aby uzyskać pełny obraz odkrywania i planowania, to zadanie przeszukiwania.)
Smartfon vs komputer stacjonarny — i dlaczego jest “smartfon-pierwszy”
W ramach indeksowania mobile-first przeszukiwarka smartfonów jest główną. Google: “Dla większości witryn Google Search indeksuje przede wszystkim wersję mobilną treści. W związku z tym większość żądań przeszukiwania Googlebota będzie wykonywana przez przeszukiwarkę mobilną, a mniejszość przez przeszukiwarkę stacjonarną.” Indeksowanie mobile-first jest kompletne dla wszystkich witryn od października 2023 r., więc praktyczna zasada brzmi: jeśli treść nie jest widoczna dla agenta smartfonowego, nie jest indeksowana. Dopasuj treść, dane strukturalne, metadane i tagi robots na mobile i desktop.
Zagwozdka z robots.txt: “Oba typy przeszukiwarek przestrzegają tego samego tokena produktu (tokena user-agenta) w robots.txt, więc nie można selektywnie kierować ani do Googlebot Smartphone, ani Googlebot Desktop za pomocą robots.txt.” Jedynym sposobem na rozróżnienie jest odczytanie nagłówka żądania HTTP user-agent we własnej logice po stronie serwera. (Aby poznać mechanikę tego formatu nagłówka, zobacz indeksowanie mobile-first i user-agent.)
Ciągi user-agent
Token produktu robots.txt dla obu to po prostu Googlebot. Pełne ciągi UA różnią się:
Googlebot Desktop:
Mozilla/5.0 AppleWebKit/537.36 (KHTML, like Gecko; compatible; Googlebot/2.1; +http://www.google.com/bot.html) Chrome/W.X.Y.Z Safari/537.36Googlebot Smartphone:
Mozilla/5.0 (Linux; Android 6.0.1; Nexus 5X Build/MMB29P) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/W.X.Y.Z Mobile Safari/537.36 (compatible; Googlebot/2.1; +http://www.google.com/bot.html)W.X.Y.Z to placeholder dla bieżącej wersji Chrome, która zmienia się wraz z aktualizacją evergreen Chromium Googlebota. Nie ufaj jednak samemu ciągowi — można go łatwo sfałszować (patrz weryfikacja poniżej).
Evergreen Chromium i kolejka renderowania
To rozróżnienie, które najbardziej dezorientuje ludzi: przeszukiwanie i renderowanie to osobne kroki. Googlebot używa “evergreen wersji Chromium” i stał się evergreen w maju 2019 r. (przeskakując ze starego Chrome 41 do bieżącej stabilnej wersji), dlatego teraz obsługuje ES6+, IntersectionObserver, Web Components i nowoczesny CSS. Ale nie wykonuje Twojego JavaScriptu w momencie pobrania HTML.
Google: “Googlebot kolejkuje wszystkie strony z kodem statusu HTTP 200 do renderowania, chyba że meta tag robots lub nagłówek mówi Google, aby nie indeksować strony. Strona może pozostać w tej kolejce przez kilka sekund, ale może to potrwać dłużej. Gdy zasoby Google na to pozwolą, headless Chromium renderuje stronę i wykonuje JavaScript.” Usługa renderowania (WRS) zachowuje się jak nowoczesna przeglądarka, ale ma dziwactwa, o których warto wiedzieć: jest w zasadzie bezstanowa — pamięć lokalna/sesyjna i ciasteczka są czyszczone między ładowaniami stron — nie pobiera obrazów ani filmów (aby oszczędzić przepustowość), agresywnie buforuje (i może ignorować Twoje nagłówki buforowania) oraz nie obsługuje WebSockets ani WebRTC. Jeśli Twoja treść pojawia się dopiero po kliknięciu lub nawigacji sterowanej JS, która nie jest prawdziwym linkiem <a href>, spodziewaj się problemów z renderowaniem. (Głębiej w renderowaniu.)
Limity bajtów
Googlebot nie pobiera nieograniczonej ilości danych z każdego adresu URL. Zgodnie z aktualizacją Inside Googlebot z marca 2026 r. pobiera on mniej więcej pierwsze 2 MB dowolnego adresu URL (w tym nagłówek HTTP) oraz do 64 MB w przypadku pliku PDF. Ta liczba jest ruchomym celem — sam Google opisuje to tak: “this limit is not set in stone and may change over time as the web evolves and HTML pages grow in size,” (tłumaczenie) „ten limit nie jest wyryty w kamieniu i może się zmieniać w miarę ewolucji sieci i wzrostu rozmiaru stron HTML”, a wcześniejsza dokumentacja podawała 15 MB (co okazało się szerszym domyślnym limitem infrastruktury, a nie liczbą Search). Praktyczny wniosek pozostaje aktualny niezależnie od tego: wszystko, co znajduje się poza tym progiem, po prostu nie jest pobierane — “to Googlebot, they simply don’t exist.” (tłumaczenie) „dla Googlebota po prostu nie istnieją”. Trzymaj kluczowe treści i znaczniki powyżej tej granicy.
Przykład błędu: kanoniczny adres URL istnieje, ale Googlebot nigdy go nie otrzymuje
Wyobraź sobie szablon produktu zwracający 2,4 MB kodu HTML. Aplikacja serializuje ogromny obiekt stanu produktu i ładunek rekomendacji w pobliżu początku dokumentu; kanoniczny adres URL, opis produktu, dane strukturalne i linki do powiązanych produktów pojawiają się dopiero mniej więcej przy bajcie 2 180 000. Przeglądarka pobiera całą odpowiedź, więc podgląd kodu źródłowego wygląda poprawnie. Googlebot Search zatrzymuje się w okolicach udokumentowanego limitu 2 MB, więc te późniejsze sygnały nie istnieją w pobranym zasobie.
Diagnozuj odpowiedź w kolejności bajtów, nie tylko w wyrenderowanym DOM:
curl -sS -D response-headers.txt -o page.html https://example.com/product
wc -c response-headers.txt page.html
LC_ALL=C grep -abo 'rel="canonical"' page.html
LC_ALL=C grep -abo 'application/ld+json' page.htmlLokalne liczby bajtów są przybliżone, ponieważ pośrednicy dostarczania i obsługa odpowiedzi mogą się różnić, ale odpowiadają na użyteczne pierwsze pytanie: czy kluczowe sygnały znajdują się wygodnie wcześnie, czy też blisko lub poza granicą? Rozwiązaniem jest usunięcie lub odroczenie zbyt dużych danych osadzonych w tekście oraz wczesne wysyłanie niezbędnych metadanych, głównej treści i linków do przeszukiwania — a nie przenoszenie tego samego balastu i liczenie na zmianę progu.
Jak Googlebot pobiera strony — grzecznie
- Szybkość indeksowania jest algorytmiczna i samoograniczająca. “For most sites, Googlebot shouldn’t access your site more than once every few seconds on average.” (tłumaczenie) „W przypadku większości witryn Googlebot nie powinien uzyskiwać dostępu do Twojej witryny częściej niż raz na kilka sekund średnio.” Przyspiesza lub zwalnia w zależności od kondycji Twojego serwera.
- Kody statusu są dźwignią. Zwrócenie
429,500lub503informuje Googlebota, aby zwolnił — ale wpływa to na całą nazwę hosta, a nie tylko na adresy URL z błędami, i działa tylko przez dzień lub dwa, zanim ciągłe błędy zaczną usuwać strony z indeksu. John Mueller: “I’d only expect the crawl rate to react that quickly if they were returning 429 / 500 / 503 / timeouts,” (tłumaczenie) „Spodziewałbym się, że szybkość indeksowania zareaguje tak szybko tylko wtedy, gdy zwracają 429 / 500 / 503 / przekroczenia czasu,” oraz “404s are generally fine & once discovered, Googlebot will retry them anyway.” (tłumaczenie) „404 są zwykle w porządku, a gdy zostaną wykryte, Googlebot i tak je ponowi.” crawl-delayjest ignorowany. Google w ogóle nie przetwarza niestandardowej dyrektywycrawl-delayw robots.txt. (Bing honoruje ją — to jedna z prawdziwych różnic między Googlebotem a Bingbotem.)- Indeksowanie śledzi zapotrzebowanie na indeksowanie, a nie płaski limit — pojemność (co Twój serwer może udźwignąć) plus zapotrzebowanie (popularność i nieaktualność). Dla większości witryn to nie problem; zaczyna być odczuwalne dopiero przy prawdziwej skali. Pełne omówienie znajduje się w budżecie indeksowania.
Weryfikacja, że to naprawdę Googlebot
Nagłówek user-agent jest “often spoofed by other crawlers” (tłumaczenie) „często podszywany przez inne roboty indeksujące” — więc sam w sobie niczego nie dowodzi. Roboty Google identyfikują się na trzy sposoby: nagłówek user-agent, źródłowy adres IP oraz odwrotna nazwa hosta DNS tego adresu IP. Dwie prawdziwe metody weryfikacji:
- Ręczna (jednorazowa). Wykonaj odwrotne DNS źródłowego adresu IP; potwierdź, że rozwiązuje się na nazwę hosta kończącą się na
googlebot.com,google.comlubgoogleusercontent.com(maska wygląda jakcrawl-***-***-***-***.googlebot.com); następnie wykonaj forward DNS tej nazwy hosta i potwierdź, że zwraca oryginalny adres IP. - Automatyczna (na dużą skalę). Dopasuj adres IP do opublikowanych zakresów CIDR Google. Google podzielił je z dawnego pojedynczego pliku
googlebot.jsonna kilka plików JSON według kategorii robota — plik dla Googlebota tohttps://www.gstatic.com/ipranges/common-crawlers.json(stary adres URLgooglebot.jsonnadal przekierowuje do tych samych danych).
Oba znajdują się w zakładce Skrypty, dla macOS/Linux i Windows. Po co? Wiele ruchu podszywa się pod Googlebota, więc logi, które „pokazują Googlebota”, mogą być w dużej mierze oszustami — zweryfikuj, zanim zaufasz.
Googlebot to jeden bot w całej flocie
„Googlebot” to rzeczywiście trochę myląca nazwa. Gary Illyes, marzec 2026: „Mam na myśli, że nazywanie go Googlebotem to myląca nazwa” oraz „Googlebot to nie nasza infrastruktura crawlerów”. Infrastruktura pod spodem, jego słowami, to „oprogramowanie jako usługa, jeśli wolisz. SaaS” — wspólna platforma, z której korzysta wiele produktów Google. To, co widzisz w swoich logach, to wycinek Search: „Kiedy widzisz Googlebota w swoich logach serwera, patrzysz po prostu na Google Search”. Zauważa również, że istnieją „dziesiątki, jeśli nie setki różnych crawlerów”, z których większość jest zbyt mała, aby zawracać sobie nimi głowę przy dokumentacji.
Nazwane boty, które faktycznie spotkasz obok Googlebota, to Googlebot-Image,
Googlebot-Video i Googlebot-News (które dzielą ciągi/tokeny Googlebota),
Storebot-Google oraz Google-InspectionTool (obsługuje narzędzia URL Inspection i Rich
Results). Dwa zachowują się nietypowo: AdsBot ignoruje globalną regułę * w robots.txt
(reguła Disallow: / pod User-agent: * go nie zatrzyma), a
Google-Safety ignoruje robots.txt całkowicie. Crawlery związane z AI —
Google-Extended (kontroluje trenowanie Gemini; nie jest sygnałem rankingowym) i
GoogleOther (crawle R&D, odciążone od Googlebota) — również istnieją, ale
AI crawlers to osobny temat, który omawia je szczegółowo, więc odsyłam tam zamiast
duplikować.
Jak kontrolować Googlebota
Trzy mechanizmy kontroli, trzy różne efekty:
robots.txtzatrzymuje crawlowanie, nie indeksowanie. Używaj go, aby trzymać boty z dala od mało wartościowych przestrzeni URL — nigdy jako narzędzia do deindeksacji.noindexzatrzymuje indeksowanie — ale Googlebot musi mieć możliwość przecrawlować stronę, aby w ogóle zobaczyć tag.- Ochrona hasłem blokuje dostęp całkowicie.
Co prowadzi nas do najbardziej niezrozumianego faktu o Googlebocie: „Istnieje
różnica między crawlowaniem a indeksowaniem; zablokowanie Googlebotowi crawlowania strony
nie zapobiega pojawieniu się adresu URL strony w wynikach wyszukiwania”. Adres URL zablokowany przez robots.txt może nadal zostać zindeksowany tylko jako URL, jeśli coś do niego linkuje. Aby
faktycznie usunąć stronę, pozwól na crawlowanie i dodaj noindex. Opisałem to szczegółowo w
Indexed, though blocked by robots.txt.
Aby poznać szerszy pipeline, w którym żyje Googlebot — odkrywanie URL, harmonogram crawl, renderowanie oraz rozróżnienia crawl-vs-index-vs-rank — zobacz centrum crawlingu oraz How Search Works.
Podsumowanie AI
Skrócona wersja wersji zaawansowanej:
- Googlebot = robot indeksujący wyszukiwarki Google, w dwóch wariantach: Smartphone
(podstawowy, w ramach indeksowania mobile-first) oraz Desktop. Dzielą one jeden
token
Googlebotw robots.txt, więc nie można ich rozdzielić — jedynie przez nagłówek HTTP user-agent. - Mobile-first od października 2023: jeśli treść nie jest widoczna dla agenta Smartphone, nie jest indeksowana.
- Evergreen Chromium, osobna kolejka renderowania: Googlebot używa aktualnego Chromium, ale wykonuje JavaScript później, w bezstanowym kroku renderowania (pamięć/cookies wyczyszczone; brak pobierania obrazów/wideo; agresywne buforowanie). Crawl ≠ render.
- Limit bajtów ~2 MB na URL (PDF 64 MB) od 2026 — treść poza limitem nie jest pobierana. Dokładna liczba „nie jest wyryta w kamieniu”.
- Uprzejme, algorytmiczne pobieranie:
429/5xxoznaczają „zwolnij” (dla całej domeny, krótkoterminowo);crawl-delayjest ignorowane (Bing je honoruje). - Crawling ≠ ranking oraz robots-block ≠ deindeksacja — zablokowany URL może nadal
być indeksowany tylko jako URL. Usuwaj strony za pomocą
noindex(z dozwolonym crawlingiem), nie robots.txt. - Weryfikacja przez odwrotny i zwykły DNS do
*.googlebot.com/*.google.com/*.googleusercontent.comlub względem opublikowanych zakresów IP Google (common-crawlers.json) — user-agent jest trywialnie podrabiany. - „Googlebot” to flota, nie jeden program — część platformy crawlingowej skierowana do wyszukiwarki,
obok Googlebot-Image/Video/News, Google-InspectionTool,
AdsBot (ignoruje
*), Google-Safety (ignoruje robots.txt) oraz botów AI (Google-Extended, GoogleOther — patrz artykuł o botach AI).
Oficjalna dokumentacja
Dokumentacja źródłowa od wyszukiwarek.
- Googlebot — dokumentacja kanoniczna: dwa typy robotów, ciągi UA, limity bajtów oraz kontrola crawl/index. Zacznij tutaj.
- Przegląd robotów i pobieraczy Google — każdy user-agent Google, trzy kategorie robotów oraz opublikowane zakresy IP.
- Typowe roboty Google — pełna referencja ciągów UA i tokenów robots dla Googlebota i jego odpowiedników.
- Weryfikacja robotów i pobieraczy Google — odwrotny/zwykły DNS oraz pliki JSON z zakresami IP.
- Najlepsze praktyki indeksowania mobile-first — dlaczego Smartphone jest podstawowy i co należy utrzymywać spójnie.
- Podstawy JavaScript SEO — renderer evergreen Chromium i kolejka renderowania.
- Jak kody statusu HTTP wpływają na roboty Google — jak
2xx/3xx/4xx/429/5xxzmieniają zachowanie crawl. - Inside Googlebot (marzec 2026) — aktualne limity bajtów i ramy „Googlebot to po prostu Google Search”.
Bing / Microsoft (dla porównania)
- Kontrola crawl Bingbota — ręczne planowanie crawl w Bing oraz wsparcie dla
crawl-delay, którego Googlebot nie ma.
Cytaty ze źródła
Oficjalne wypowiedzi Google. Każdy link to link bezpośredni, który przeskakuje do cytowanego fragmentu na stronie źródłowej.
Google — czym jest Googlebot
- “Googlebot is the generic name for two types of web crawlers used by Google Search.” — Google Search Central docs. Przejdź do cytatu
- “For most sites Google Search primarily indexes the mobile version of the content. As such the majority of Googlebot crawl requests will be made using the mobile crawler, and a minority using the desktop crawler.” Przejdź do cytatu
- “Google uses the mobile version of a site’s content, crawled with the smartphone agent, for indexing and ranking.” Przejdź do cytatu
Google — renderowanie i limity bajtów
- “While Google Search runs JavaScript with an evergreen version of Chromium, there are a few things that you can optimize.” Przejdź do cytatu
- “Googlebot queues all pages with a 200 HTTP status code for rendering, unless a robots meta tag or header tells Google not to index the page.” Przejdź do cytatu
- “Googlebot crawls the first 2MB of a supported file type, and the first 64MB of a PDF file.” Przejdź do cytatu
Google — indeksowanie a indeksowanie
- “There’s a difference between crawling and indexing; blocking Googlebot from crawling a page doesn’t prevent the URL of the page from appearing in search results.” — Google Search Central docs. Przejdź do cytatu
Gary Illyes, Google (relacjonowane przez Search Engine Journal i wpis na blogu Google z marca 2026)
- “I mean, calling it Googlebot, that’s a misnomer.” … “Googlebot is not our crawler infrastructure.” … “it’s software as a service, if you like. SaaS.” Przeczytaj relację
- “When you see Googlebot in your server logs, you are just looking at Google Search.” Przeczytaj relację
John Mueller, Google (via Search Engine Journal’s Reddit coverage)
- “I’d only expect the crawl rate to react that quickly if they were returning 429 / 500 / 503 / timeouts.” … “404s are generally fine & once discovered, Googlebot will retry them anyway.” Przeczytaj relację
Lista kontrolna gotowości Googlebota
Szybkie sprawdzenie, czy Googlebot może znaleźć, pobrać, wyrenderować i poprawnie obsłużyć twoje strony:
- Ważne treści są dostępne przez prawdziwe linki
<a href>(nie tylko klikalne lub nawigacja sterowana JS, której renderer nie może śledzić). - Wersje mobilna i desktopowa są zgodne — ta sama treść, dane strukturalne, metadane i tagi robots (mobile-first oznacza, że widok agenta smartfona jest tym, co się liczy).
- Krytyczne treści i znaczniki znajdują się powyżej limitu pobierania ~2 MB; pliki PDF poniżej 64 MB.
-
robots.txtnie blokuje niczego, co chcesz zindeksować — i nie używasz go do deindeksacji (to zadanienoindex, z dozwolonym crawlingiem). - Serwer zwraca szybkie, stabilne odpowiedzi — minimalne
5xx/429/timeouty, ponieważ te ograniczają crawling w skali całego hosta. - Nie polegasz na
crawl-delay(Google go ignoruje). - Logi serwera są sprawdzane za pomocą zweryfikowanego Googlebota (odwrotne + zgodne DNS lub zakresy IP) — nie surowe dopasowania user-agenta, które podszywają się oszuści.
- Rozumiesz, że zablokowany przez robots URL może być nadal indeksowany tylko jako URL, jeśli jest linkowany.
Googlebot — ściągawka
Dwa typy crawlerów
| Googlebot Smartphone | Googlebot Desktop | |
|---|---|---|
| Symuluje | Użytkownika urządzenia mobilnego | Użytkownika desktopowego |
| Udział w crawlach | Większość (mobile-first) | Mniejszość |
| Token robots.txt | Googlebot | Googlebot (ten sam — nie można rozdzielić) |
| Rozróżnianie przez | Nagłówek HTTP user-agent | Nagłówek HTTP user-agent |
Token produktowy robots.txt (oba): Googlebot
Inne crawler Google, które zobaczysz w logach
| Crawler | Token robots | Uwaga |
|---|---|---|
| Googlebot | Googlebot | Główny crawler wyszukiwarki |
| Googlebot-Image / -Video / -News | Googlebot-Image itd. (lub Googlebot) | Używa ciągów UA Googlebota |
| Google-InspectionTool | Google-InspectionTool (lub Googlebot) | Testy URL Inspection / Rich Results |
| Storebot-Google | Storebot-Google | Zakupy |
| AdsBot | AdsBot-Google | Ignoruje globalną regułę * w robots.txt |
| Google-Safety | — | Całkowicie ignoruje robots.txt |
| GoogleOther / Google-Extended | GoogleOther / Google-Extended | R&D / trening AI — patrz crawlery AI |
Szybkie fakty
- Limit pobierania: ~2 MB na URL (PDF 64 MB), stan na 2026 — powyżej tego nie jest pobierane. („Nie jest wyryte w kamieniu.”)
- Renderuje za pomocą evergreen Chromium, w osobnej, późniejszej kolejce (crawl ≠ render).
crawl-delay: ignorowany przez Google (Bing go honoruje).429/5xx: tymczasowe „zwolnij” — wpływa na cały host.- Weryfikuj przez odwrotne + zgodne DNS lub opublikowane zakresy IP — nigdy sam ciąg UA.
- Crawling nie jest czynnikiem rankingowym; blokada robots nie jest deindeksacją.
Zweryfikuj, że bot to naprawdę Googlebot
Nagłówek user-agent jest trywialnie podrabiany, więc potwierdź przez odwrotne wyszukiwanie DNS (musi kończyć się domeną Google), a następnie zgodne wyszukiwanie DNS (musi rozwiązać się z powrotem do tego samego IP).
macOS / Linux
# 1) Reverse-DNS the IP from your logs — it should end in
# googlebot.com, google.com, or googleusercontent.com
host 66.249.66.1
# → 1.66.249.66.in-addr.arpa domain name pointer crawl-66-249-66-1.googlebot.com
# 2) Forward-DNS that hostname back — it must resolve to the same IP
host crawl-66-249-66-1.googlebot.com
# → crawl-66-249-66-1.googlebot.com has address 66.249.66.1Windows
nslookup 66.249.66.1
nslookup crawl-66-249-66-1.googlebot.comJeśli odwrotne wyszukiwanie nie kończy się domeną Google lub zgodne wyszukiwanie nie pasuje do oryginalnego IP, to nie jest Googlebot.
Weryfikacja na dużą skalę względem zakresów IP Google
W przypadku kontroli na dużą skalę dopasowuj źródłowe IP do opublikowanych zakresów CIDR Google
zamiast wykonywać DNS dla każdego żądania. Google podzielił stary pojedynczy googlebot.json na
kilka plików według kategorii — Googlebot znajduje się w common-crawlers.json:
# Fetch the current Googlebot (common crawlers) ranges
curl -s https://www.gstatic.com/ipranges/common-crawlers.json
# The legacy URL still works and redirects to the same data:
# https://developers.google.com/static/search/apis/ipranges/googlebot.jsonZaładuj prefiksy CIDR z tego JSON i przetestuj każde zalogowane IP pod kątem przynależności, zanim zaufasz jakiemukolwiek trafieniu „Googlebot”.
Zasoby warte Twojego czasu
Moje powiązane artykuły
- What Is Googlebot & How Does It Work? — mój pełny przewodnik Ahrefs o Googlebot, ze szczegółami dotyczącymi indeksowania, kontroli i weryfikacji.
- Meet the New Web Crawlers: AI Bots Are Closing in on Search Engine Bots — jak Googlebot wypada na tle botów AI pod względem udziału i szybkości.
- JavaScript SEO Issues & Best Practices — strona renderowania tego, co robi Googlebot.
- Indexed, though blocked by robots.txt — dlaczego adres URL zablokowany przez robots.txt może nadal być indeksowany.
- The Beginner’s Guide to Technical SEO — gdzie Googlebot wpisuje się w szerszy obraz.
Moje wystąpienia
- How Search Works (SlideShare) — moje omówienie indeksowania, renderowania, indeksowania i rankingu. (Stałe zastrzeżenie ma zastosowanie: “This is my understanding of systems… not going to be 100% complete or accurate.” (tłumaczenie) „To moje rozumienie systemów… nie będzie w 100% kompletne ani dokładne.”)
Od innych
- Seria Google Crawling December — najlepszy skoncentrowany zestaw oficjalnych wyjaśnień dotyczących indeksowania.
- r/TechSEO — społeczność do debugowania indeksowania i indeksu.
- Googlebot: What it is, how it works & how to optimize (Search Engine Land) — dokładny praktyczny przewodnik z redakcyjną głębią SEL; dobry do drugiej opinii na temat podstaw.
- Google explains how crawling works in 2026 (Barry Schwartz, Search Engine Land) — solidny opis posta Gary’ego Illyesa Inside Googlebot z marca 2026, w tym wyjaśnienie limitu 2 MB.
- Google Says They Deploy Hundreds of Undocumented Crawlers (Search Engine Journal) — szczegółowo omawia uwagi Gary’ego Illyesa, że „nazywanie tego Googlebotem to nieporozumienie”.
- Is Google’s Two Waves of Indexing Over? (Onely) — nagrana rozmowa Martina Splitta o kolejce indeksowania i renderowania oraz o tym, jak ta luka się zmniejsza; wciąż najjaśniejsze branżowe omówienie czasu WRS.
- Google Reveals JavaScript Rendering Secrets at Chrome Dev Summit 2018 (Lumar) — szczegółowe notatki o bezstanowym zachowaniu WRS (wyczyść ciasteczka/localStorage, brak pobierania obrazów, brak obsługi WebSockets), które są nadal aktualne.
- From Googlebot to GPTBot: Who’s crawling your site? (blog Cloudflare) — dane Cloudflare Radar dotyczące udziału i szybkości botów, pokazujące, że Googlebot prowadzi w ruchu „dobrych botów”.
- Was That Really a Google Bot Crawling My Site? (Imperva Research) — oparte na danych spojrzenie na podszywanie się pod Googlebota; kontekst, dlaczego weryfikacja DNS ma znaczenie.
Statystyki, które warto cytować
- Googlebot to najszybszy bot indeksujący w sieci. Z mojej analizy danych Cloudflare Radar: “Googlebot is the fastest crawler on the web according to Cloudflare Radar, with Ahrefsbot being the 2nd fastest.” (tłumaczenie) „Googlebot to najszybszy bot indeksujący w sieci według Cloudflare Radar, a Ahrefsbot jest drugim najszybszym.” Źródło
- Boty AI zbliżają się do botów wyszukiwarek. Z mojej analizy Cloudflare Radar, boty wyszukiwarek (w tym Googlebot) nadal indeksują najwięcej, ale boty AI są wyraźną dwójką i są na dobrej drodze, aby je wyprzedzić w ciągu kilku lat. Źródło
- Limit bajtów: ~2 MB na adres URL (PDF 64 MB) — udokumentowany limit pobierania Googlebota według stanu na 2026 r., z wyraźnym zastrzeżeniem, że liczba ta nie jest stała. Źródło
Błędy Googlebota, których należy unikać
Używanie robots.txt do próby usunięcia strony z indeksu. robots.txt zatrzymuje crawlowanie, a nie indeksowanie. URL zablokowany przez robots może nadal pojawiać się w wynikach (indeksowany tylko jako URL), jeśli coś do niego linkuje. Zamiast tego: pozwól Google crawlowac stronę i dodaj tag noindex — to jedyny niezawodny sposób na jej usunięcie.
Próba osobnego targetowania crawlera desktopowego lub smartfonowego w robots.txt. Oba współdzielą pojedynczy token produktu Googlebot, więc reguła napisana dla jednego działa na oba. Zamiast tego: jeśli potrzebujesz różnego zachowania dla urządzeń, przeczytaj nagłówek żądania HTTP user-agent we własnej logice serwerowej — robots.txt nie może dokonać takiego rozróżnienia.
Pozwalanie, aby wersje mobilna i desktopowa strony się rozjechały. Przy indeksowaniu mobile-first widok agenta smartfonowego jest tym, co jest indeksowane i rankowane. Treść, dane strukturalne, metadane lub tagi robots, które istnieją tylko na desktopie, są praktycznie niewidoczne dla Google. Zamiast tego: utrzymuj obie wersje w synchronizacji i sprawdź, co faktycznie widzi agent smartfonowy.
Poleganie na crawl-delay w celu spowolnienia Googlebota. Google w ogóle nie przetwarza niestandardowej dyrektywy crawl-delay — to dźwignia tylko dla Binga. Zamiast tego: zwracaj 429/500/503, jeśli naprawdę potrzebujesz, aby Google się wycofał, pamiętając, że to ogranicza całą nazwę hosta i działa tylko przez dzień lub dwa, zanim ciągłe błędy zaczną usuwać strony z indeksu.
Ufanie ciągowi user-agent Googlebot w logach bez weryfikacji. Nagłówek UA jest trywialnie podrabiany, a sporo ruchu, który twierdzi, że jest Googlebotem, nie jest. Zamiast tego: zweryfikuj za pomocą odwrotnego i zwykłego DNS lub opublikowanych zakresów IP Google, zanim potraktujesz ruch „Googlebot” w analityce jako prawdziwy.
Zakładanie, że nawigacja oparta tylko na JavaScript (procedury obsługi kliknięć, bez prawdziwych <a href>) zostanie odkryta i wyrenderowana jak zwykły link. Googlebot odkrywa URL-e głównie przez linki, a renderowanie odbywa się później w osobnej, bezstanowej kolejce, która nie wyzwala dowolnych interakcji UI. Zamiast tego: udostępnij każdą ważną ścieżkę jako prawdziwy link <a href>, który działa bez JavaScript.
Traktowanie częstotliwości crawlowania jako dźwigni rankingu. Bycie crawlowanym częściej to nie tablica wyników — to tylko brama, przez którą musisz przejść, aby kwalifikować się do rankingu. Zamiast tego: zainwestuj wysiłek w treść i kondycję techniczną, a nie w próby przyciągania większej liczby crawlowań dla samych siebie.
Częste problemy z Googlebotem
Strona jest zablokowana w robots.txt, ale nadal pojawia się w wynikach wyszukiwania
- Przyczyna: robots.txt zatrzymuje tylko crawlowanie, nie indeksowanie. Jeśli inne strony linkują do zablokowanego URL-a, Google może nadal indeksować go tylko jako URL (zwykle bez snippetu/opisu).
- Rozwiązanie: jeśli naprawdę chcesz go usunąć z wyników, zezwól na crawlowanie w
robots.txti dodaj tagnoindex— Googlebot musi być w stanie przeczytać stronę, aby zobaczyć tag. Potwierdź rozwiązanie narzędziem robots-txt-tester i ponownie sprawdź status URL-a po jego ponownym przecrawlowaniu.
Treść renderowana przez JavaScript nie pojawia się w indeksie
- Przyczyna: crawlowanie i renderowanie to osobne kroki. Pobrany HTML jest kolejkowany do renderowania — zwykle sekundy, czasem znacznie dłużej — zanim bezgłowy Chromium wykona JavaScript. Treść zależna od nawigacji tylko po kliknięciu lub nie-
<a href>może nigdy się nie wyrenderować, ponieważ Web Rendering Service nie wyzwala dowolnych interakcji UI. - Rozwiązanie: sprawdź, czy treść istnieje w surowej odpowiedzi HTML w porównaniu z tylko po wykonaniu JS, i upewnij się, że ważne ścieżki to prawdziwe linki
<a href>. Narzędzie render-gap jest stworzone właśnie do tego sprawdzenia — pokazuje lukę między tym, co jest pobierane, a tym, co faktycznie się renderuje.
Logi serwera pokazują dużo ruchu „Googlebot”, który wydaje się podejrzany
- Przyczyna: ciąg znaków user-agenta
Googlebotjest trywialnie podrabiany. Znaczna część ruchu podającego się za Googlebota w surowych logach to oszuści. - Rozwiązanie: zweryfikuj za pomocą odwrotnego DNS (powinien rozwiązywać się do nazwy hosta kończącej się na
googlebot.com,google.comlubgoogleusercontent.com), a następnie DNS w przód z powrotem do tego samego adresu IP, lub porównaj z opublikowanymi zakresami IP Google (common-crawlers.json) do masowych kontroli logów — zobacz zakładkę Skrypty, aby poznać obie metody, lub uruchom pobieranie logów przez narzędzie log-file-analyzer, które automatycznie flaguje sfałszowane trafienia Googlebota.
Wskaźnik indeksowania nagle spadł
- Przyczyna: wskaźnik indeksowania Googlebota jest algorytmiczny i sam się ogranicza — ciągłe odpowiedzi
429,500,503lub przekroczenia czasu mówią mu, aby zwolnił, a to ograniczenie dotyczy całego hosta, nie tylko błędnych adresów URL. - Rozwiązanie: sprawdź ostatnie wskaźniki błędów serwera i kody odpowiedzi za pomocą narzędzia http-status-checker lub logów serwera. Jeśli błędy utrzymują się dłużej niż dzień lub dwa, spodziewaj się, że strony zaczną wypadać z indeksu, a nie tylko wolniejszego indeksowania. Naprawienie źródła błędów
5xx/429przywraca wskaźnik indeksowania — nie ma osobnego „przełącznika odblokowującego”.
Treść, która istnieje tylko na komputerze, nie jest rankingowana
- Przyczyna: przy indeksowaniu mobile-first widok agenta smartfona jest tym, co jest indeksowane i rankingowane. Jeśli treść, dane strukturalne lub metadane istnieją tylko w wersji na komputer, są praktycznie niewidoczne dla Google.
- Rozwiązanie: porównaj, co serwują wersje mobilna i komputerowa — użyj narzędzia mobile-friendly-tester, aby zobaczyć, co renderuje agent smartfona, i przywróć obie wersje do zgodności.
Narzędzia do pracy z Googlebotem
- robots-txt-tester — sprawdź, czy konkretny adres URL jest dozwolony lub zablokowany dla
Googlebot, zanim założysz, że Twójrobots.txtrobi to, co myślisz. - log-file-analyzer — przeanalizuj logi serwera, aby zobaczyć rzeczywistą aktywność indeksowania Googlebota i flaguj ruch, który podaje się za Googlebota, ale nie przechodzi weryfikacji IP/DNS.
- render-gap — porównaj, co pobiera Googlebot, z tym, co faktycznie się renderuje po wykonaniu JavaScriptu, co jest bezpośrednio przydatne do rozróżnienia crawl-vs-render omawianego w tym artykule.
- mobile-friendly-tester — sprawdź, co widzi crawler smartfonów (główny przy indeksowaniu mobile-first) na stronie.
- http-status-checker — potwierdź kody statusu zwracane przez Twój serwer, ponieważ ciągłe odpowiedzi
429/5xxfaktycznie ograniczają wskaźnik indeksowania Googlebota.
Narzędzie zewnętrzne: narzędzie URL Inspection w Google Search Console pokazuje, jak Googlebot ostatnio indeksował i renderował konkretny adres URL, w tym który crawler (mobilny czy komputerowy) go pobrał. Screaming Frog może indeksować witrynę, renderując jako Googlebot, aby porównać surowy HTML z renderowanym wynikiem na dużą skalę.
Quiz
Pięć pytań, aby sprawdzić, co zapamiętałeś o Googlebocie.
Dziennik zmian
Zaktualizowano 28 lip 2026.
Podsumowanie redakcyjne i zapisane szczegóły zmian.Szczegóły zmian
-
Szczegółowe uwagi dotyczące zmian są obecnie dostępne po angielsku.
Pełne porównanie jest niedostępne — dla tej wersji nie zarchiwizowano wcześniejszej migawki.
Zaktualizowano 18 lip 2026.
Podsumowanie redakcyjne i zapisane szczegóły zmian.Szczegóły zmian
-
Szczegółowe uwagi dotyczące zmian są obecnie dostępne po angielsku.
Pełne porównanie jest niedostępne — dla tej wersji nie zarchiwizowano wcześniejszej migawki.