Crawlowanie
Jak wyszukiwarki odkrywają i pobierają sieć — Googlebot i Bingbot, odkrywanie URL-i, harmonogram crawlowania, renderowanie oraz różnice między crawlowaniem, indeksowaniem i rankingiem. Hub poświęcony całemu tematowi crawlowania.
Języki
1 sygnał dowodowy na tej stronie
- Dane źródłowe dostępne przez linkgooglebot.json
Crawlowanie to pierwszy etap wyszukiwania (crawl → indeksowanie → wyświetlenie): boty takie jak Googlebot i Bingbot odkrywają URL-e i pobierają strony, aby można je było wyrenderować, zindeksować i umieścić w rankingu. Jest konieczne, aby pojawić się w wyszukiwaniu, ale nie jest czynnikiem rankingowym — i różni się zarówno od indeksowania, jak i renderowania. Większość witryn nigdy nie musi zarządzać crawl budget; gdy crawlowanie się psuje, źródłem prawdy są logi serwera. Ten hub wyjaśnia cały potok i prowadzi do pogłębionych omówień.
TL;DR — Crawlowanie to sposób, w jaki wyszukiwarki odnajdują i pobierają strony. Bot (Googlebot w Google, Bingbot w Bingu) podąża za linkami i czyta mapy witryn, aby odkrywać URL-e, a następnie je pobiera. Strona musi zostać scrawlowana, zanim może pojawić się w wynikach wyszukiwania — ale częste crawlowanie nie podnosi pozycji.
Czym jest crawlowanie
Wyszukiwarki nie przeglądają sieci tak jak Ty. Wysyłają automatyczne programy — nazywane crawlerami, botami lub spiderami — które odwiedzają strony, pobierają ich zawartość i podążają za linkami, aby znaleźć kolejne strony. Crawler Google to Googlebot, a crawler Binga to Bingbot.
Pomyśl o tym jak o trzech krokach wykonywanych w kolejności:
- Crawl — bot odkrywa URL i pobiera stronę.
- Indeksowanie — wyszukiwarka przetwarza stronę i zapisuje ją w ogromnej bazie wszystkiego, co może pokazać w wynikach.
- Wyświetlenie (ranking) — gdy ktoś szuka, wyszukiwarka pobiera z indeksu najlepsze dopasowania i układa je w kolejności.
Crawlowanie to pierwszy krok. Jeśli strona nigdy nie zostanie scrawlowana, nie może zostać zindeksowana, a jeśli nie jest zindeksowana, nie może uzyskać rankingu. Crawlowanie ma więc znaczenie — ale jest bramką, a nie tablicą wyników.
Jak crawlery znajdują strony
Dwa główne sposoby:
- Podążanie za linkami. Gdy bot crawluje stronę, pobiera znajdujące się na niej linki i dodaje te URL-e do listy stron do kolejnego crawlowania. Dobre linkowanie wewnętrzne pozwala odkrywać nowe strony.
- Mapy witryn. Mapa witryny XML to lista URL-i, którą przekazujesz bezpośrednio wyszukiwarkom, aby nie musiały odkrywać wszystkiego przez linki.
Istnieją też opcje „push”, w których aktywnie informujesz wyszukiwarkę, że strona się zmieniła — więcej na ten temat poniżej — ale większość pracy wykonują linki i mapy witryn.
Jak pomagać wyszukiwarkom w crawlowaniu witryny
- Linkuj ważne strony z innych stron (szczególnie ze strony głównej i głównej nawigacji).
- Prześlij mapę witryny XML w Google Search Console i Bing Webmaster Tools.
- Nie blokuj przypadkowo stron, które chcesz udostępnić do odkrycia (sprawdź swój
robots.txt). - Utrzymuj szybki i sprawny serwer — gdy działa wolno albo zwraca błędy, boty wycofują się i crawlują mniej.
Co większość osób rozumie błędnie
Crawlowanie nie jest rankingiem. Częstsze crawlowanie nie przesunie strony wyżej w wynikach. A zablokowanie strony w robots.txt nie usuwa jej z Google — tylko zatrzymuje Google przed jej odczytaniem. Evidence for this claim robots.txt controls crawler access and is not a reliable way to keep a URL out of Google. Scope: Google Search behavior for URLs blocked by robots.txt; blocked URLs may still be indexed when discovered elsewhere. Confidence: high · Verified: Google Search Central: Introduction to robots.txt Jeśli rzeczywiście chcesz usunąć stronę, pozwól ją crawlować i dodaj tag noindex. (Samodzielnie przetestowałem stronę dotyczącą blokowania — zobacz wersję Advanced.)
Chcesz poznać głębszą wersję, obejmującą działanie harmonogramu crawlowania, limity bajtów oraz rozróżnienie crawl–indeksowanie–ranking? Przejdź do karty Advanced.
TL;DR — Crawlowanie to pierwszy z trzech etapów wyszukiwania (crawl → indeksowanie → wyświetlenie). Boty odkrywają URL-e przez pull (linki i mapy witryn) oraz push (IndexNow i Indexing API), a następnie pobierają je według algorytmicznego harmonogramu, ograniczając tempo zależnie od kondycji serwera. Renderowanie JavaScriptu jest osobnym krokiem. Crawlowanie jest konieczne do uzyskania rankingu, ale samo nie jest sygnałem rankingowym i różni się od indeksowania — strona zablokowana przez robots może nadal zostać zindeksowana. Większość witryn nie musi zarządzać crawl budget; logi pokazują, co faktycznie się wydarzyło.
Crawlowanie to pierwszy z trzech etapów
Three stages run left to right. Crawl: a bot discovers a URL and downloads the page. Index: the engine processes the page and stores eligible information. Serve or rank: the best indexed matches are ordered for a query. The Crawl stage is highlighted, and a note says not every page advances through every stage.
© Patrick Stox LLC · CC BY 4.0 ·
Google mówi o tym wprost: “Google Search works in three stages, and not all pages make it through each stage” (tłumaczenie) „Wyszukiwarka Google działa w trzech etapach i nie wszystkie strony przechodzą przez każdy z nich” — crawlowanie, indeksowanie i wyświetlanie. Evidence for this claim Google describes Search as three stages: crawling, indexing, and serving results. Scope: Google Search's documented processing model; it does not guarantee that a page reaches every stage. Confidence: high · Verified: Google Search Central: In-depth guide to how Google Search works Fragment o tym, że „nie wszystkie strony przechodzą dalej”, jest sednem technicznego SEO. Strona może zostać scrawlowana, ale niezindeksowana, albo zindeksowana, lecz nigdy nie zostać wyświetlona dla danego zapytania. Najbardziej użyteczny model myślowy to utrzymywanie tych etapów jako odrębnych.
Kto faktycznie crawluje
„Googlebot” brzmi jak jeden program. Tak nie jest. W mojej prezentacji How Search Works opisuję go jako ponad 1000 systemów tworzących rodzinę wyspecjalizowanych crawlerów — desktopowego, mobilnego, obrazów, wiadomości, wideo i reklam — z żądaniami w większości pochodzącymi z Mountain View. Wszystkie korzystają z tej samej puli crawl budget, dlatego niekontrolowany crawl obrazów albo parametrów może zagłodzić crawlowanie właściwej treści.
To już nie tylko wyszukiwarki. W analizie danych Cloudflare Radar (Poznaj nowe crawlery internetowe) pokazuję, że boty wyszukiwarek nadal crawlują najwięcej, ale boty AI są zdecydowanie na drugim miejscu i zmierzają do ich wyprzedzenia w ciągu kilku najbliższych lat. Jeśli czytasz logi, obsada się zmieniła.
Jak crawlery odkrywają URL-e
Two discovery routes feed one crawl queue. Pull discovery includes following links and sitemaps. Push discovery includes IndexNow for Bing, Yandex, and other participating engines but not Google for general pages; the Google Indexing API for JobPosting and BroadcastEvent pages; and change notifications through sitemap lastmod, RSS, and WebSub.
© Patrick Stox LLC · CC BY 4.0 ·
Odkrywanie obejmuje zarówno pull, jak i push:
- Pull — linki. Google: “Other pages are discovered when Google extracts a link from a known page to a new page.” (tłumaczenie) „Inne strony są odkrywane, gdy Google wyodrębnia z poznanej strony link do nowej strony”. To dlatego strony osierocone (do których nie prowadzi żaden link) mają trudności z odkryciem.
- Pull — mapy witryn. “Still other pages are discovered when you submit a list of pages (a sitemap) for Google to crawl.” (tłumaczenie) „Jeszcze inne strony są odkrywane, gdy przesyłasz Google listę stron do scrawlowania, czyli mapę witryny”.
- Push — powiadomienia o zmianach. Zamiast czekać na ponowne crawlowanie, informujesz wyszukiwarkę o zmianie: IndexNow (Bing, Yandex i inni — Google nie używa go dla ogólnych stron) oraz Indexing API Google (oficjalnie tylko dla stron
JobPostingiBroadcastEvent).lastmodw mapach witryn, RSS i WebSub uzupełniają opcje push.
Google nazywa cały ten proces “URL discovery.” (tłumaczenie) „procesem odkrywania adresów URL”.
Jak crawlery pobierają strony
- Harmonogram jest algorytmiczny. “Googlebot uses an algorithmic process to determine which sites to crawl, how often, and how many pages to fetch from each site.” (tłumaczenie) „Googlebot używa procesu algorytmicznego, aby ustalić, które witryny crawlować, jak często i ile stron pobierać z każdej z nich”. Masz na niego wpływ, ale go nie ustawiasz.
- Crawlowanie jest uprzejme. “they try not to crawl the site too fast to avoid overloading it… HTTP
500 errors mean ‘slow down.’” (tłumaczenie) „Starają się nie crawlować witryny zbyt szybko, aby jej nie przeciążyć… błędy HTTP 500 oznaczają: zwolnij”. To mechanizm stojący za tymczasowym spowolnieniem crawla — zwróć
503/429, a Googlebot zwolni (na dzień lub dwa, nie na zawsze). - Istnieje limit bajtów. Według aktualizacji Inside Googlebot z marca 2026 Googlebot pobiera około 2 MB na URL (wobec dawnego limitu 15 MB), a PDF-y mogą mieć do 64 MB. Po przekroczeniu limitu pobieranie zostaje ucięte, a nie odrzucone — do indeksowania trafia tylko pobrana część. Ma to znaczenie, jeśli najważniejsza treść znajduje się poniżej 2 MB zbędnego balastu.
- Cache ogranicza koszt ponownego crawlowania. Crawlery Google używają żądań warunkowych i cache, aby nie pobierać ponownie niezmienionych zasobów przy każdym przejściu. Google nie publikuje dokładnego czasu przechowywania zasobów renderowania, więc nie zakładaj stałego okna odświeżania po zmianie kodu — spodziewaj się opóźnienia, a nie natychmiastowego odzwierciedlenia.
Renderowanie to nie crawlowanie
To stale wprowadza ludzi w błąd. “During the crawl, Google renders the page and
runs any JavaScript it finds using a recent version of Chrome.” (tłumaczenie) „Podczas crawlowania Google renderuje stronę i uruchamia znaleziony na niej JavaScript przy użyciu aktualnej wersji Chrome”. Renderowanie jest odrębnym krokiem od pobrania HTML-a. Renderer (Web Rendering Service) jest bezstanowy — między ładowaniami czyści pamięć i cookies, nie udziela zgody na monity uprawnień i odrzuca service workery. Jeśli treść pojawia się dopiero po kliknięciu albo nawigacja sterowana przez JS nie jest prawdziwym linkiem <a href>, spodziewaj się problemów z odkrywaniem i renderowaniem. (Pełne omówienie znajdziesz w JavaScript SEO.)
Crawlowanie a indeksowanie i ranking
Najważniejsze rozróżnienia na tej stronie:
- Crawlowanie ≠ ranking. Crawlowanie jest konieczne, aby strona znalazła się w wynikach, ale nie jest sygnałem rankingowym. Wyższy crawl rate nie podniesie pozycji. Crawl budget to wyłącznie kwestia efektywności.
- Crawlowanie ≠ indeksowanie. Strona zablokowana w
robots.txtmoże nadal zostać zindeksowana, jeśli linkują do niej inne strony — Google po prostu nie widzi treści ani umieszczonego tam tagunoindex. Jak napisałem w artykule Zindeksowano mimo blokady w robots.txt: “crawling and indexing are two different things.” (tłumaczenie) „Crawlowanie i indeksowanie to dwie różne rzeczy”. Aby rzeczywiście usunąć stronę, zezwól na crawlowanie i dodajnoindex— nie blokuj jej.
Bezpośrednio przetestowałem blokowanie. W artykule Historia zablokowania dwóch wysoko pozycjonowanych stron za pomocą robots.txt zablokowałem dwie nasze strony rankingowe. Rezultat: “We lost a position here or there and all of the featured snippets for the pages… I expected a lot more impact, but the world didn’t end.” (tłumaczenie) „Straciliśmy tu czy tam jedną pozycję oraz wszystkie fragmenty z odpowiedzią dla tych stron… Spodziewałem się znacznie większego wpływu, ale świat się nie skończył”. Mój wniosek pozostaje aktualny: “Don’t block pages you want indexed. It hurts. Not as bad as you might think it does — but it still hurts.” (tłumaczenie) „Nie blokuj stron, które chcesz indeksować. To szkodzi — nie tak bardzo, jak można sądzić, ale nadal szkodzi”.
Jak kontrolować crawlowanie
robots.txtkontroluje crawlowanie, a nie indeksowanie. “A robots.txt file tells search engine crawlers which URLs the crawler can access on your site.” (tłumaczenie) „Plik robots.txt informuje crawlery wyszukiwarek, do których URL-i crawler może uzyskać dostęp w witrynie”. Evidence for this claim robots.txt controls crawler access and is not a reliable way to keep a URL out of Google. Scope: Google Search behavior for URLs blocked by robots.txt; blocked URLs may still be indexed when discovered elsewhere. Confidence: high · Verified: Google Search Central: Introduction to robots.txt Używaj go, aby trzymać boty z dala od obszarów o małej wartości — nie jako narzędzia usuwania z indeksu.- Architektura witryny i linki wewnętrzne określają, jak głęboko leżą strony i czy w ogóle zostaną odkryte (zobacz crawl depth).
- Sterowanie tempem crawla. Google wycofało ręczny suwak crawl rate w Search Console (na początku 2024 roku) — teraz opiera się na odpowiedziach serwera i niższym automatycznym minimum. Bing nadal udostępnia ręczną siatkę Crawl Control w Bing Webmaster Tools (zobacz crawl rate).
Efektywność crawlowania i crawl budget
Obie wyszukiwarki traktują crawlowanie jako kwestię efektywności. Gary Illyes opisuje stronę Google jako limit crawl rate + crawl demand (popularność i nieaktualność). Fabrice Canel z Binga nazywa to swoim “crawl efficiency north star … to crawl a URL only when the content has been added … updated.” (tłumaczenie) „głównym celem efektywności crawlowania… aby crawlować URL tylko wtedy, gdy treść została dodana… lub zaktualizowana”.
Dobra wiadomość: większość witryn nie musi się tym przejmować. Google mówi wprost — jeśli witryna nie ma dużej liczby szybko zmieniających się stron albo strony są crawlowane tego samego dnia, w którym zostają opublikowane, “you don’t need to read this guide.” (tłumaczenie) „nie musisz czytać tego przewodnika”. Zaczyna to mieć znaczenie przy około 1 mln+ stron zmieniających się co tydzień albo 10 tys.+ zmieniających się codziennie (zobacz crawl budget i crawl frequency).
Evidence for this claim Sites without many rapidly changing pages, or whose new pages are crawled the day they are published, generally do not need crawl-budget management. Scope: large websites Confidence: high · Verified: Optimize your crawl budgetGdy crawlowanie zawodzi — jak to zobaczyć
Zanim sięgniesz po rozwiązanie, ustal, który etap jest faktycznie zepsuty — objawy i środki zaradcze różnią się na każdym z nich:
-
W ogóle nieodkryta? Nic nie linkuje do strony, a jej brakuje w mapie witryny. Napraw linkowanie wewnętrzne i pokrycie mapy witryny — zobacz crawl depth i crawl frequency.
-
Odkryta, ale nigdy niepobrana? Błędy serwera, przekroczenia czasu lub blokada
robots.txtodwracają boty. Sprawdź GSC Crawl Stats i logi — zobacz crawl budget i crawl rate. -
Pobrana, ale źle wyrenderowana? Treść zależy od kliknięcia albo nawigacji dostępnej tylko przez JS, której Googlebot nie wykona, lub WRS przekracza czas. Zobacz JavaScript SEO, aby poznać tryby awarii związane z renderowaniem.
-
Pobrana i wyrenderowana, ale nadal niezindeksowana? To osobna decyzja indeksu — zobacz hub Indexing, zamiast traktować ją jako problem z crawlowaniem.
-
Analiza plików logów to źródło prawdy. Logi serwera pokazują dokładnie, jakie URL-e boty faktycznie odwiedziły, jak często i jakie otrzymały kody statusu — to najlepszy sposób na wykrycie marnotrawnego crawlowania i znalezienie stron, do których boty nigdy nie docierają (zobacz analizę plików logów).
-
Pułapki spiderów — nieskończone przestrzenie URL-i tworzone przez kalendarze, nawigację fasetową, identyfikatory sesji lub eksplozję linków względnych — po cichu spalają crawl budget na śmieciowych URL-ach (zobacz pułapki spiderów).
Co dalej: klaster crawling
Ten hub jest mapą. Każdy z poniższych tematów to osobne pogłębione omówienie:
Efektywność crawlowania — ile i jak często
- Crawl budget — czym jest (pojemność + popyt), co go marnuje i kto faktycznie musi się nim przejmować.
- Crawl rate — jak szybko boty pobierają strony, dlaczego suwak GSC zniknął oraz jak dziś przyspieszyć lub spowolnić crawl.
- Crawl frequency — co sprawia, że Google szybciej ponownie crawluje stronę (popularność, nieaktualność, poprawne
lastmod), a co nie. - Crawl depth — głębokość kliknięć kontra głębokość przejścia crawla oraz powód, dla którego ważne strony powinny znajdować się blisko strony głównej.
Poznaj crawlery — kto faktycznie pobiera strony
- Crawler — czym jest web crawler (bot, spider) i jaką pętlę pobierz → przeanalizuj → podążaj wykonują wszystkie crawlery.
- User agent — ciąg user-agenta i token robots.txt, którym bot się identyfikuje, oraz powód, dla którego nie można ufać samemu ciągowi.
- Googlebot — crawler Google: Smartphone kontra Desktop, renderowanie i sposoby weryfikacji.
- Bingbot — crawler Microsoftu, różnice względem Googlebota i dodatkowe powierzchnie, które zasila.
- Crawlery AI — boty firm AI (treningowe, wyszukiwania AI i pobierające na żądanie użytkownika) oraz sposoby ich kontrolowania.
Diagnozowanie problemów z crawlowaniem
- Analiza plików logów — weryfikowanie prawdziwych botów i odczytywanie tego, co scrawlowały.
- Pułapki spiderów (pułapki crawlerów) — wzorce generujące nieskończone URL-e i sposoby ich naprawiania.
Każdy z powyższych tematów to osobne pogłębione omówienie zagnieżdżone pod tym hubem — wszystkie znajdują się też w pasku bocznym.
Kwalifikowanie linków wychodzących to powiązana kontrola on-page, która częściowo pokrywa się z crawlowaniem — mówi Google, jak traktować link, a nie czy go crawlować: nofollow (pierwotnie uniwersalny, dziś będący wskazówką), a także rel=sponsored i rel=ugc dla linków płatnych/reklamowych i generowanych przez użytkowników. Wszystkie trzy należą do klastra tagów meta on-page.
Zostanie znalezionym w pierwszej kolejności to powiązany, ale odrębny etap. To, jak wyszukiwarki odkrywają URL-e — linki wewnętrzne, mapy witryn (XML, indeks map, obrazy i wideo) oraz protokoły push IndexNow i Google Indexing API (do czego każdy z nich faktycznie służy i dlaczego Google nie używa IndexNow) — znajduje się teraz we własnym hubie Discovery. Szerszy temat opisuje How Search Works.
Podsumowanie AI
Skrócona wersja karty Advanced:
- Crawlowanie = pierwszy etap wyszukiwania (crawl → indeksowanie → wyświetlenie). Jest konieczne do uzyskania rankingu, ale nie jest sygnałem rankingowym i różni się od indeksowania oraz renderowania.
- Odkrywanie to pull + push: linki i mapy witryn (pull); IndexNow i Indexing API (push). Google nazywa to „URL discovery”.
- Pobieranie jest algorytmiczne i uprzejme: Google decyduje, co, jak często i ile pobiera oraz zwalnia przy
5xx/429(„slow down”). Od 2026 roku Googlebot pobiera około 2 MB na URL (PDF-y do 64 MB), a nadmiar obcina. - Renderowanie jest odrębne: JS działa w bezstanowym headless Chrome; Google korzysta z cache zasobów, aby ograniczyć koszt ponownego crawlowania, ale nie publikuje dokładnego czasu przechowywania, więc zmiany mogą pojawić się z opóźnieniem.
- Crawl ≠ indeks: strona zablokowana przez robots może zostać zindeksowana przez linki; użyj
noindex(pozwalając na crawlowanie), aby ją usunąć. Eksperyment Patricka z blokowaniem pokazał, że zablokowane strony w dużej mierze zachowały ranking — „but it still hurts”. - Crawl budget = pojemność + popyt (popularność + nieaktualność). Większość witryn nie musi nim zarządzać.
- Diagnozuj za pomocą logów; obserwuj pułapki spiderów marnujące budżet. Boty AI stanowią obecnie dużą i rosnącą część ruchu crawlerów.
Oficjalna dokumentacja
Dokumentacja źródłowa wyszukiwarek.
- Pogłębiony przewodnik po działaniu Google Search — omówienie crawl → indeksowanie → wyświetlenie, odkrywanie URL-i i harmonogramu crawlowania.
- Crawlowanie i indeksowanie — hub dotyczący robots, map witryn, kanonikalizacji i kontroli crawlowania.
- Wprowadzenie do robots.txt — co robi robots.txt (i czego nie robi).
- Optymalizacja crawl budget — pojemność + popyt oraz informacja, kto tego potrzebuje.
- Przegląd crawlerów i fetcherów Google — wszystkie user-agenty Google i opublikowane zakresy IP.
- Inside Googlebot (marzec 2026) — aktualne limity bajtów i architektura crawlowania.
- Googlebot i kwestia 15 MB (2022) — starszy limit, przydatny do pokazania zmiany.
- Seria Crawling December (2024) — Googlebot, cache HTTP, nawigacja fasetowa i CDN-y.
Bing / Microsoft
- Seria bingbot: maksymalizacja efektywności crawlowania — definicja crawlowania Binga i jego „north star” efektywności.
- Bing Webmaster Tools — Crawl Control — ustawianie prędkości i harmonogramu Bingbota.
- IndexNow / indexnow.org — protokół push do natychmiastowego sygnalizowania zmienionych URL-i.
Cytaty ze źródła
Wypowiedzi Google i Binga zapisane z przypisaniem autorstwa. Każdy link to deep link prowadzący do cytowanego fragmentu na stronie.
Google — jak działa crawlowanie
- “Google Search works in three stages, and not all pages make it through each stage.” (tłumaczenie) „Wyszukiwarka Google działa w trzech etapach i nie wszystkie strony przechodzą przez każdy z nich” — dokumentacja Google Search Central. Przejdź do cytatu
- “Other pages are discovered when Google extracts a link from a known page to a new page… Still other pages are discovered when you submit a list of pages (a sitemap) for Google to crawl. This process is called ‘URL discovery’.” (tłumaczenie) „Inne strony są odkrywane, gdy Google wyodrębnia link z poznanej strony do nowej; jeszcze inne — gdy przesyłasz listę stron, czyli mapę witryny. Ten proces nazywa się odkrywaniem URL-i”. Przejdź do cytatu
- “Googlebot uses an algorithmic process to determine which sites to crawl, how often, and how many pages to fetch from each site.” (tłumaczenie) „Googlebot używa procesu algorytmicznego, aby ustalić, które witryny crawlować, jak często i ile stron pobierać z każdej z nich”. Przejdź do cytatu
- “They try not to crawl the site too fast to avoid overloading it. This mechanism is based on the responses of the site (for example, HTTP 500 errors mean ‘slow down’).” (tłumaczenie) „Starają się nie crawlować witryny zbyt szybko, aby jej nie przeciążyć. Mechanizm opiera się na odpowiedziach witryny; na przykład błędy HTTP 500 oznaczają: zwolnij”. Przejdź do cytatu
- “During the crawl, Google renders the page and runs any JavaScript it finds using a recent version of Chrome.” (tłumaczenie) „Podczas crawlowania Google renderuje stronę i uruchamia znaleziony na niej JavaScript przy użyciu aktualnej wersji Chrome”. Przejdź do cytatu
Google — robots.txt i crawl budget
- “A robots.txt file tells search engine crawlers which URLs the crawler can access on your site.” (tłumaczenie) „Plik robots.txt informuje crawlery wyszukiwarek, do których URL-i crawler może uzyskać dostęp w witrynie” — dokumentacja Google Search Central. Przejdź do cytatu
- “Taking crawl capacity and crawl demand together, Google defines a site’s crawl budget as the set of URLs that Google can and wants to crawl.” (tłumaczenie) „Łącząc pojemność i zapotrzebowanie na crawlowanie, Google definiuje budżet crawlowania witryny jako zbiór URL-i, które może i chce crawlować”. Przejdź do cytatu
- “If your site doesn’t have a large number of pages that change rapidly, or if your pages seem to be crawled the same day that they are published, you don’t need to read this guide.” (tłumaczenie) „Jeśli witryna nie ma wielu szybko zmieniających się stron albo strony są crawlowane w dniu publikacji, nie musisz czytać tego przewodnika”. Przejdź do cytatu
Gary Illyes, Google (za pośrednictwem dosłownego przedruku wpisu Google o crawl budget w Search Engine Land)
- Limit crawl rate to “the number of simultaneous parallel connections Googlebot may use to crawl the site, as well as the time it has to wait between the fetches.” (tłumaczenie) „liczba równoczesnych połączeń równoległych, których Googlebot może używać do crawlowania witryny, oraz czas oczekiwania między pobraniami”. Crawl demand wynika z popularności i nieaktualności. Przeczytaj omówienie
Fabrice Canel z Microsoft Bing — efektywność crawlowania
- “Crawling is the process by which bingbot discovers new and updated documents or content to be added to Bing’s searchable index.” (tłumaczenie) „Crawlowanie to proces, w którym bingbot odkrywa nowe i zaktualizowane dokumenty lub treści przeznaczone do dodania do przeszukiwalnego indeksu Binga”. Przejdź do cytatu
- “Our crawl efficiency north star is to crawl a URL only when the content has been added (URL not crawled before), updated (fresh on-page context or useful outbound links).” (tłumaczenie) „Naszym głównym celem efektywności crawlowania jest crawlowanie URL-a tylko wtedy, gdy treść została dodana — URL nie był wcześniej crawlowany — albo zaktualizowana, na przykład przez nowy kontekst na stronie lub przydatne linki wychodzące”. Przejdź do cytatu
Lista kontrolna zdrowia crawlowania
Szybki przegląd, aby potwierdzić, że wyszukiwarki mogą znaleźć i pobrać to, co ważne:
- Ważne strony są podlinkowane z miejsca, do którego crawler może dotrzeć (brak stron osieroconych).
-
robots.txtnie blokuje niczego, co chcesz indeksować (a blokuje obszary o małej wartości, takie jak wewnętrzne wyniki wyszukiwania). - Mapa witryny XML jest przesłana zarówno w Google Search Console, jak i w Bing Webmaster Tools, zawiera wyłącznie kanoniczne, indeksowalne URL-e i ma poprawny
lastmod. - Serwer zwraca szybkie, stabilne odpowiedzi — minimalna liczba
5xx/timeoutów (boty zwalniają, gdy serwer ma problemy). - Nie używasz
robots.txtdo próby usuwania z indeksu — do tego służynoindex(przy dozwolonym crawlowaniu). - Nie ma pułapek spiderów generujących nieskończone URL-e (kalendarze, filtry, identyfikatory sesji).
- GSC Crawl Stats jest sprawdzany pod kątem skoków kodów odpowiedzi i średniego czasu odpowiedzi.
- Logi serwera są sprawdzane pod kątem marnotrawstwa crawlowania i ważnych URL-i, do których boty nie docierają.
- Treść zależna od JS jest dostępna przez prawdziwe linki
<a href>, a nie nawigację wymagającą samego kliknięcia.
Modele myślowe
1. Potok — crawl → renderowanie → indeksowanie → wyświetlenie. Każdy etap jest filtrem, a nie wszystkie strony przechodzą przez każdy z nich. Gdy strona nie działa, najpierw ustal, na którym etapie odpada, zanim cokolwiek zmienisz: Czy została scrawlowana? Wyrenderowana? Zindeksowana? Wyświetlona dla zapytania?
2. Trzy „nierówności”. Zachowaj je osobno, a większość zamieszania wokół crawlowania zniknie:
- Crawlowanie ≠ indeksowanie (zablokowane strony mogą zostać zindeksowane przez linki)
- Crawlowanie ≠ ranking (crawl rate nie jest sygnałem rankingowym)
- Crawlowanie ≠ renderowanie (JS działa w osobnym, cachowanym kroku)
3. Odkrywanie = pull + push.
Pull: linki + mapy witryn. Push: IndexNow / Indexing API / lastmod. Jeśli strona nie jest znajdowana, zapytaj, który kanał powinien ją przenosić — i czy w ogóle prowadzi do niej jakiś link.
4. Crawl budget = pojemność + popyt. Pojemność to to, co może przyjąć serwer; popyt to popularność + nieaktualność. Efektywny budżet zwiększysz przede wszystkim przez usuwanie marnotrawstwa (pułapek, duplikatów i śmieciowych parametrów), a nie przez próbę nakłonienia Google do „częstszego” crawlowania.
5. Reguła decyzji o usunięciu strony.
Chcesz usunąć ją z wyszukiwania? Zezwól na crawlowanie + noindex. Chcesz, aby boty całkowicie pomijały obszar (i nie zależy Ci na indeksowaniu)? robots.txt disallow. Nigdy nie używaj disallow do usuwania z indeksu.
Ściąga: kontrolowanie crawlowania
Co faktycznie robi każda kontrola
| Kontrola | Zatrzymuje crawlowanie? | Zatrzymuje indeksowanie? | Użyj do |
|---|---|---|---|
robots.txt disallow | Tak | Nie | Trzymania botów z dala od obszarów URL-i o małej wartości |
noindex (meta/header) | Nie (strona musi być crawlowalna) | Tak | Usunięcia strony z indeksu |
rel=canonical | Nie | Konsoliduje, ale nie wymusza | Wskazania preferowanego duplikatu |
nofollow na linkach | Zniechęca do podążania | Nie | Nieporęczania za link i niezachęcania do jego crawlowania |
rel="sponsored" / rel="ugc" | Wskazówka (jak nofollow) | Nie | Oznaczania linków płatnych/reklamowych i generowanych przez użytkowników |
5xx / 503 / 429 | Tymczasowo spowalnia | Nie | Krótkoterminowego sygnału „zwolnij” dla Googlebota |
Kody statusu ważne dla botów
200— pobrano poprawnie.301/308— przekierowanie stałe (konsoliduje).404/410— usunięto; z czasem wypada z indeksu (410odrobinę szybciej).429/500/503— „zwolnij” / spróbuj później; utrzymujące się błędy = mniej crawlowania.
Szybkie fakty
- Limit pobierania Googlebota: około 2 MB na URL (PDF-y 64 MB), nadmiar zostaje ucięty.
- Ręczny suwak crawl rate w GSC: usunięty (styczeń 2024) — teraz liczą się sygnały serwera.
- Odpowiednik Binga: siatka Crawl Control w Bing Webmaster Tools.
- IndexNow: Bing/Yandex/inne — nie Google. Indexing API: Google, tylko JobPosting + BroadcastEvent.
Jak sprawdzić, czy bot to naprawdę Googlebot
Wiele rodzajów ruchu podaje się za Googlebota. Potwierdź to odwrotnym i następczym sprawdzeniem DNS (Google nie publikuje skrótu — fałszywe user-agenty są częste).
Możesz też wykonać to sprawdzenie ręcznie:
macOS / Linux
# 1) Reverse DNS the IP from your logs — it should end in googlebot.com or google.com
host 66.249.66.1
# → 1.66.249.66.in-addr.arpa domain name pointer crawl-66-249-66-1.googlebot.com
# 2) Forward DNS that hostname back — it must resolve to the same IP
host crawl-66-249-66-1.googlebot.com
# → crawl-66-249-66-1.googlebot.com has address 66.249.66.1Windows
nslookup 66.249.66.1
nslookup crawl-66-249-66-1.googlebot.comJeśli odwrotne wyszukiwanie nie kończy się domeną Google albo wyszukiwanie następcze nie wskazuje pierwotnego adresu IP, to nie jest Googlebot. Możesz też porównać adres z opublikowanymi zakresami IP Google (googlebot.json).
Bezpieczny punkt wyjścia dla robots.txt
User-agent: *
Disallow: /search # internal search result pages
Disallow: /*?*sort= # sort-order parameter spaces
Allow: /
Sitemap: https://example.com/sitemap.xmlPamiętaj: Disallow blokuje crawlowanie, a nie indeksowanie — nie używaj go do usuwania strony z wyników.
Narzędzia do obserwowania i zarządzania crawlowaniem
- Google Search Console — raport Crawl Stats — własny widok Google na to, jak crawluje witrynę: żądania w czasie, kody odpowiedzi, średni czas odpowiedzi, według typu pliku i typu Googlebota.
- Bing Webmaster Tools — informacje o crawlowaniu, Crawl Control i Site Scan.
- Analiza plików logów serwera — źródło prawdy. Narzędzia: Screaming Frog Log File Analyser albo przesyłanie logów do BigQuery / platformy logów. (Zobacz analizę plików logów.)
- Crawlery / audyty witryny — Ahrefs Site Audit i Screaming Frog SEO Spider symulują crawl, ujawniają głębokość, łańcuchy przekierowań, zablokowane URL-e i wzorce przypominające pułapki.
- Ahrefs Webmaster Tools — bezpłatny crawl i audyt dla zweryfikowanych witryn.
- URL Inspection (GSC) — sprawdzanie, jak pojedynczy URL został scrawlowany, wyrenderowany i zindeksowany.
Zasoby warte uwagi
Moje powiązane teksty
- Przewodnik dla początkujących po technicznym SEO — miejsce crawlowania w szerszym obrazie.
- Historia zablokowania dwóch wysoko pozycjonowanych stron za pomocą robots.txt — mój eksperyment z pierwszego źródła o crawl kontra ranking.
- Zindeksowano mimo blokady w robots.txt — dlaczego zablokowane strony nadal bywają indeksowane.
- Robots.txt i SEO: wszystko, co musisz wiedzieć.
- Problemy i dobre praktyki JavaScript SEO — strona renderowania.
- Poznaj nowe crawlery internetowe: boty AI doganiają boty wyszukiwarek.
Moje wystąpienia
- Jak działa wyszukiwarka (SlideShare) — moje omówienie crawlowania, renderowania, indeksowania i rankingów. Obowiązuje moje stałe zastrzeżenie: “This is my understanding of systems… not going to be 100% complete or accurate.” (tłumaczenie) „Tak rozumiem te systemy… opis nie będzie w stu procentach kompletny ani dokładny”.
Od innych autorów
- r/TechSEO — społeczność do debugowania crawlowania i indeksowania.
- Seria Crawling December Google (oficjalna, ale najlepszy skondensowany zestaw wyjaśnień dotyczących crawlowania).
- Google wyjaśnia webmasterom budżet crawlowania (Search Engine Land) — dosłowny przedruk pierwotnego wpisu Gary’ego Illyesa o crawl budget z definicjami crawl rate limit + crawl demand.
- Wyjaśnienie budżetu crawlowania Googlebota (Search Engine Journal) — przystępne wyjaśnienie modelu pojemności i popytu crawlowania.
- Google wyjaśnia limity bajtów Googlebota i architekturę crawlowania (Search Engine Journal) — relacja z aktualizacji Inside Googlebot z marca 2026: 2 MB na URL, PDF-y 64 MB i zachowanie polegające na obcinaniu.
- Jak działa Bingbot: odkrywanie, crawlowanie, wyodrębnianie i indeksowanie (Search Engine Journal) — strona Binga z kontekstem Fabrice’a Canela.
- Limit rozmiaru pliku dla Googlebota (DebugBear) — wyjaśnienie, co dzieje się po przekroczeniu limitu pobierania Googlebota (obcięcie, nie odrzucenie).
Podcasty
- Search Off the Record (zespół Google Search Relations) — Jak Googlebot crawluje sieć. Gary Illyes i Martin Splitt o przeszłości, teraźniejszości i przyszłości Googlebota: ujednolicona infrastruktura crawlowania, HTTP/1.1 kontra HTTP/2, żądania warunkowe i limity bajtów. Posłuchaj
Filmy
- Google Search Central (YouTube) — seria How Google Search Works i wyjaśnienia Martina Splitta dotyczące crawlowania i renderowania, w tym filmy o JavaScript SEO. Kanał
Statystyki warte cytowania
- Boty AI zbliżają się do botów wyszukiwarek. Z mojej analizy Cloudflare Radar wynika, że crawlery wyszukiwarek nadal crawlują najwięcej, ale boty AI są wyraźnym numerem 2 i w ciągu kilku lat mają ich wyprzedzić. Źródło
- Dziesiątki miliardów znormalizowanych URL-i, których wcześniej nie widziano, Bing odkrywa codziennie — to skala problemu odkrywania, który wyszukiwarki agresywnie filtrują (Fabrice Canel, Microsoft Bing, 2022). Omówienie
- Które crawlery blokuje 140 mln witryn — dane o odsetku blokad robots.txt z mojego badania z Xibeijia Guan; przydatne do zrozumienia, jak otwarta sieć kontroluje boty. Źródło
- Limit bajtów: około 2 MB na URL (PDF-y 64 MB) — udokumentowany limit pobierania Googlebota od marca 2026 roku (spadek z 15 MB). Źródło
Sprawdź się: Crawlowanie
Pięć krótkich pytań o tym, jak wyszukiwarki odkrywają i pobierają strony. Wybierz odpowiedź przy każdym pytaniu, a następnie sprawdź wynik.
Dziennik zmian
Zaktualizowano 11 sie 2026.
Podsumowanie redakcyjne i zapisane szczegóły zmian.Szczegóły zmian
-
Szczegółowe uwagi dotyczące zmian są obecnie dostępne po angielsku.
Pełne porównanie jest niedostępne — dla tej wersji nie zarchiwizowano wcześniejszej migawki.
Zaktualizowano 17 lip 2026.
Podsumowanie redakcyjne i zapisane szczegóły zmian.Szczegóły zmian
-
Szczegółowe uwagi dotyczące zmian są obecnie dostępne po angielsku.
-
Szczegółowe uwagi dotyczące zmian są obecnie dostępne po angielsku.
-
Szczegółowe uwagi dotyczące zmian są obecnie dostępne po angielsku.
Pełne porównanie jest niedostępne — dla tej wersji nie zarchiwizowano wcześniejszej migawki.