Crawlowanie

Jak wyszukiwarki odkrywają i pobierają sieć — Googlebot i Bingbot, odkrywanie URL-i, harmonogram crawlowania, renderowanie oraz różnice między crawlowaniem, indeksowaniem i rankingiem. Hub poświęcony całemu tematowi crawlowania.

Opublikowano po raz pierwszy: 22 cze 2026 · Ostatnia aktualizacja: 11 sie 2026 · Advanced
Języki
1 sygnał dowodowy na tej stronie

Crawlowanie to pierwszy etap wyszukiwania (crawl → indeksowanie → wyświetlenie): boty takie jak Googlebot i Bingbot odkrywają URL-e i pobierają strony, aby można je było wyrenderować, zindeksować i umieścić w rankingu. Jest konieczne, aby pojawić się w wyszukiwaniu, ale nie jest czynnikiem rankingowym — i różni się zarówno od indeksowania, jak i renderowania. Większość witryn nigdy nie musi zarządzać crawl budget; gdy crawlowanie się psuje, źródłem prawdy są logi serwera. Ten hub wyjaśnia cały potok i prowadzi do pogłębionych omówień.

TL;DR — Crawlowanie to pierwszy z trzech etapów wyszukiwania (crawl → indeksowanie → wyświetlenie). Boty odkrywają URL-e przez pull (linki i mapy witryn) oraz push (IndexNow i Indexing API), a następnie pobierają je według algorytmicznego harmonogramu, ograniczając tempo zależnie od kondycji serwera. Renderowanie JavaScriptu jest osobnym krokiem. Crawlowanie jest konieczne do uzyskania rankingu, ale samo nie jest sygnałem rankingowym i różni się od indeksowania — strona zablokowana przez robots może nadal zostać zindeksowana. Większość witryn nie musi zarządzać crawl budget; logi pokazują, co faktycznie się wydarzyło.

Crawlowanie to pierwszy z trzech etapów

Crawling is stage one of three. A page must clear each stage before it can rank. Źródło: /technical-seo/how-search-works/crawling/

Three stages run left to right. Crawl: a bot discovers a URL and downloads the page. Index: the engine processes the page and stores eligible information. Serve or rank: the best indexed matches are ordered for a query. The Crawl stage is highlighted, and a note says not every page advances through every stage.

© Patrick Stox LLC · CC BY 4.0 ·

Google mówi o tym wprost: “Google Search works in three stages, and not all pages make it through each stage” (tłumaczenie) „Wyszukiwarka Google działa w trzech etapach i nie wszystkie strony przechodzą przez każdy z nich” — crawlowanie, indeksowanie i wyświetlanie. Evidence for this claim Google describes Search as three stages: crawling, indexing, and serving results. Scope: Google Search's documented processing model; it does not guarantee that a page reaches every stage. Confidence: high · Verified: Google Search Central: In-depth guide to how Google Search works Fragment o tym, że „nie wszystkie strony przechodzą dalej”, jest sednem technicznego SEO. Strona może zostać scrawlowana, ale niezindeksowana, albo zindeksowana, lecz nigdy nie zostać wyświetlona dla danego zapytania. Najbardziej użyteczny model myślowy to utrzymywanie tych etapów jako odrębnych.

Kto faktycznie crawluje

„Googlebot” brzmi jak jeden program. Tak nie jest. W mojej prezentacji How Search Works opisuję go jako ponad 1000 systemów tworzących rodzinę wyspecjalizowanych crawlerów — desktopowego, mobilnego, obrazów, wiadomości, wideo i reklam — z żądaniami w większości pochodzącymi z Mountain View. Wszystkie korzystają z tej samej puli crawl budget, dlatego niekontrolowany crawl obrazów albo parametrów może zagłodzić crawlowanie właściwej treści.

To już nie tylko wyszukiwarki. W analizie danych Cloudflare Radar (Poznaj nowe crawlery internetowe) pokazuję, że boty wyszukiwarek nadal crawlują najwięcej, ale boty AI są zdecydowanie na drugim miejscu i zmierzają do ich wyprzedzenia w ciągu kilku najbliższych lat. Jeśli czytasz logi, obsada się zmieniła.

Jak crawlery odkrywają URL-e

Discovery is both pull and push — Google calls the whole thing “URL discovery.” Źródło: /technical-seo/how-search-works/crawling/

Two discovery routes feed one crawl queue. Pull discovery includes following links and sitemaps. Push discovery includes IndexNow for Bing, Yandex, and other participating engines but not Google for general pages; the Google Indexing API for JobPosting and BroadcastEvent pages; and change notifications through sitemap lastmod, RSS, and WebSub.

© Patrick Stox LLC · CC BY 4.0 ·

Odkrywanie obejmuje zarówno pull, jak i push:

  • Pull — linki. Google: “Other pages are discovered when Google extracts a link from a known page to a new page.” (tłumaczenie) „Inne strony są odkrywane, gdy Google wyodrębnia z poznanej strony link do nowej strony”. To dlatego strony osierocone (do których nie prowadzi żaden link) mają trudności z odkryciem.
  • Pull — mapy witryn. “Still other pages are discovered when you submit a list of pages (a sitemap) for Google to crawl.” (tłumaczenie) „Jeszcze inne strony są odkrywane, gdy przesyłasz Google listę stron do scrawlowania, czyli mapę witryny”.
  • Push — powiadomienia o zmianach. Zamiast czekać na ponowne crawlowanie, informujesz wyszukiwarkę o zmianie: IndexNow (Bing, Yandex i inni — Google nie używa go dla ogólnych stron) oraz Indexing API Google (oficjalnie tylko dla stron JobPosting i BroadcastEvent). lastmod w mapach witryn, RSS i WebSub uzupełniają opcje push.

Google nazywa cały ten proces “URL discovery.” (tłumaczenie) „procesem odkrywania adresów URL”.

Jak crawlery pobierają strony

  • Harmonogram jest algorytmiczny. “Googlebot uses an algorithmic process to determine which sites to crawl, how often, and how many pages to fetch from each site.” (tłumaczenie) „Googlebot używa procesu algorytmicznego, aby ustalić, które witryny craw­lować, jak często i ile stron pobierać z każdej z nich”. Masz na niego wpływ, ale go nie ustawiasz.
  • Crawlowanie jest uprzejme. “they try not to crawl the site too fast to avoid overloading it… HTTP 500 errors mean ‘slow down.’” (tłumaczenie) „Starają się nie craw­lować witryny zbyt szybko, aby jej nie przeciążyć… błędy HTTP 500 oznaczają: zwolnij”. To mechanizm stojący za tymczasowym spowolnieniem crawla — zwróć 503/429, a Googlebot zwolni (na dzień lub dwa, nie na zawsze).
  • Istnieje limit bajtów. Według aktualizacji Inside Googlebot z marca 2026 Googlebot pobiera około 2 MB na URL (wobec dawnego limitu 15 MB), a PDF-y mogą mieć do 64 MB. Po przekroczeniu limitu pobieranie zostaje ucięte, a nie odrzucone — do indeksowania trafia tylko pobrana część. Ma to znaczenie, jeśli najważniejsza treść znajduje się poniżej 2 MB zbędnego balastu.
  • Cache ogranicza koszt ponownego crawlowania. Crawlery Google używają żądań warunkowych i cache, aby nie pobierać ponownie niezmienionych zasobów przy każdym przejściu. Google nie publikuje dokładnego czasu przechowywania zasobów renderowania, więc nie zakładaj stałego okna odświeżania po zmianie kodu — spodziewaj się opóźnienia, a nie natychmiastowego odzwierciedlenia.
Evidence for this claim Googlebot algorithmically determines which sites to crawl, how often to crawl them, and how many pages to fetch. Scope: web Confidence: high · Verified: In-Depth Guide to How Google Search Works

Renderowanie to nie crawlowanie

To stale wprowadza ludzi w błąd. “During the crawl, Google renders the page and runs any JavaScript it finds using a recent version of Chrome.” (tłumaczenie) „Podczas crawlowania Google renderuje stronę i uruchamia znaleziony na niej JavaScript przy użyciu aktualnej wersji Chrome”. Renderowanie jest odrębnym krokiem od pobrania HTML-a. Renderer (Web Rendering Service) jest bezstanowy — między ładowaniami czyści pamięć i cookies, nie udziela zgody na monity uprawnień i odrzuca service workery. Jeśli treść pojawia się dopiero po kliknięciu albo nawigacja sterowana przez JS nie jest prawdziwym linkiem <a href>, spodziewaj się problemów z odkrywaniem i renderowaniem. (Pełne omówienie znajdziesz w JavaScript SEO.)

Crawlowanie a indeksowanie i ranking

Najważniejsze rozróżnienia na tej stronie:

  • Crawlowanie ≠ ranking. Crawlowanie jest konieczne, aby strona znalazła się w wynikach, ale nie jest sygnałem rankingowym. Wyższy crawl rate nie podniesie pozycji. Crawl budget to wyłącznie kwestia efektywności.
  • Crawlowanie ≠ indeksowanie. Strona zablokowana w robots.txt może nadal zostać zindeksowana, jeśli linkują do niej inne strony — Google po prostu nie widzi treści ani umieszczonego tam tagu noindex. Jak napisałem w artykule Zindeksowano mimo blokady w robots.txt: “crawling and indexing are two different things.” (tłumaczenie) „Crawlowanie i indeksowanie to dwie różne rzeczy”. Aby rzeczywiście usunąć stronę, zezwól na crawlowanie i dodaj noindex — nie blokuj jej.

Bezpośrednio przetestowałem blokowanie. W artykule Historia zablokowania dwóch wysoko pozycjonowanych stron za pomocą robots.txt zablokowałem dwie nasze strony rankingowe. Rezultat: “We lost a position here or there and all of the featured snippets for the pages… I expected a lot more impact, but the world didn’t end.” (tłumaczenie) „Straciliśmy tu czy tam jedną pozycję oraz wszystkie fragmenty z odpowiedzią dla tych stron… Spodziewałem się znacznie większego wpływu, ale świat się nie skończył”. Mój wniosek pozostaje aktualny: “Don’t block pages you want indexed. It hurts. Not as bad as you might think it does — but it still hurts.” (tłumaczenie) „Nie blokuj stron, które chcesz indeksować. To szkodzi — nie tak bardzo, jak można sądzić, ale nadal szkodzi”.

Jak kontrolować crawlowanie

  • robots.txt kontroluje crawlowanie, a nie indeksowanie. “A robots.txt file tells search engine crawlers which URLs the crawler can access on your site.” (tłumaczenie) „Plik robots.txt informuje crawlery wyszukiwarek, do których URL-i crawler może uzyskać dostęp w witrynie”. Evidence for this claim robots.txt controls crawler access and is not a reliable way to keep a URL out of Google. Scope: Google Search behavior for URLs blocked by robots.txt; blocked URLs may still be indexed when discovered elsewhere. Confidence: high · Verified: Google Search Central: Introduction to robots.txt Używaj go, aby trzymać boty z dala od obszarów o małej wartości — nie jako narzędzia usuwania z indeksu.
  • Architektura witryny i linki wewnętrzne określają, jak głęboko leżą strony i czy w ogóle zostaną odkryte (zobacz crawl depth).
  • Sterowanie tempem crawla. Google wycofało ręczny suwak crawl rate w Search Console (na początku 2024 roku) — teraz opiera się na odpowiedziach serwera i niższym automatycznym minimum. Bing nadal udostępnia ręczną siatkę Crawl Control w Bing Webmaster Tools (zobacz crawl rate).

Efektywność crawlowania i crawl budget

Obie wyszukiwarki traktują crawlowanie jako kwestię efektywności. Gary Illyes opisuje stronę Google jako limit crawl rate + crawl demand (popularność i nieaktualność). Fabrice Canel z Binga nazywa to swoim “crawl efficiency north star … to crawl a URL only when the content has been added … updated.” (tłumaczenie) „głównym celem efektywności crawlowania… aby craw­lować URL tylko wtedy, gdy treść została dodana… lub zaktualizowana”.

Dobra wiadomość: większość witryn nie musi się tym przejmować. Google mówi wprost — jeśli witryna nie ma dużej liczby szybko zmieniających się stron albo strony są crawlowane tego samego dnia, w którym zostają opublikowane, “you don’t need to read this guide.” (tłumaczenie) „nie musisz czytać tego przewodnika”. Zaczyna to mieć znaczenie przy około 1 mln+ stron zmieniających się co tydzień albo 10 tys.+ zmieniających się codziennie (zobacz crawl budget i crawl frequency).

Evidence for this claim Sites without many rapidly changing pages, or whose new pages are crawled the day they are published, generally do not need crawl-budget management. Scope: large websites Confidence: high · Verified: Optimize your crawl budget

Gdy crawlowanie zawodzi — jak to zobaczyć

Zanim sięgniesz po rozwiązanie, ustal, który etap jest faktycznie zepsuty — objawy i środki zaradcze różnią się na każdym z nich:

  • W ogóle nieodkryta? Nic nie linkuje do strony, a jej brakuje w mapie witryny. Napraw linkowanie wewnętrzne i pokrycie mapy witryny — zobacz crawl depth i crawl frequency.

  • Odkryta, ale nigdy niepobrana? Błędy serwera, przekroczenia czasu lub blokada robots.txt odwracają boty. Sprawdź GSC Crawl Stats i logi — zobacz crawl budget i crawl rate.

  • Pobrana, ale źle wyrenderowana? Treść zależy od kliknięcia albo nawigacji dostępnej tylko przez JS, której Googlebot nie wykona, lub WRS przekracza czas. Zobacz JavaScript SEO, aby poznać tryby awarii związane z renderowaniem.

  • Pobrana i wyrenderowana, ale nadal niezindeksowana? To osobna decyzja indeksu — zobacz hub Indexing, zamiast traktować ją jako problem z crawlowaniem.

  • Analiza plików logów to źródło prawdy. Logi serwera pokazują dokładnie, jakie URL-e boty faktycznie odwiedziły, jak często i jakie otrzymały kody statusu — to najlepszy sposób na wykrycie marnotrawnego crawlowania i znalezienie stron, do których boty nigdy nie docierają (zobacz analizę plików logów).

  • Pułapki spiderów — nieskończone przestrzenie URL-i tworzone przez kalendarze, nawigację fasetową, identyfikatory sesji lub eksplozję linków względnych — po cichu spalają crawl budget na śmieciowych URL-ach (zobacz pułapki spiderów).

Co dalej: klaster crawling

Ten hub jest mapą. Każdy z poniższych tematów to osobne pogłębione omówienie:

Efektywność crawlowania — ile i jak często

  • Crawl budget — czym jest (pojemność + popyt), co go marnuje i kto faktycznie musi się nim przejmować.
  • Crawl rate — jak szybko boty pobierają strony, dlaczego suwak GSC zniknął oraz jak dziś przyspieszyć lub spowolnić crawl.
  • Crawl frequency — co sprawia, że Google szybciej ponownie crawluje stronę (popularność, nieaktualność, poprawne lastmod), a co nie.
  • Crawl depth — głębokość kliknięć kontra głębokość przejścia crawla oraz powód, dla którego ważne strony powinny znajdować się blisko strony głównej.

Poznaj crawlery — kto faktycznie pobiera strony

  • Crawler — czym jest web crawler (bot, spider) i jaką pętlę pobierz → przeanalizuj → podążaj wykonują wszystkie crawlery.
  • User agent — ciąg user-agenta i token robots.txt, którym bot się identyfikuje, oraz powód, dla którego nie można ufać samemu ciągowi.
  • Googlebot — crawler Google: Smartphone kontra Desktop, renderowanie i sposoby weryfikacji.
  • Bingbot — crawler Microsoftu, różnice względem Googlebota i dodatkowe powierzchnie, które zasila.
  • Crawlery AI — boty firm AI (treningowe, wyszukiwania AI i pobierające na żądanie użytkownika) oraz sposoby ich kontrolowania.

Diagnozowanie problemów z crawlowaniem

  • Analiza plików logów — weryfikowanie prawdziwych botów i odczytywanie tego, co scrawlowały.
  • Pułapki spiderów (pułapki crawlerów) — wzorce generujące nieskończone URL-e i sposoby ich naprawiania.

Każdy z powyższych tematów to osobne pogłębione omówienie zagnieżdżone pod tym hubem — wszystkie znajdują się też w pasku bocznym.

Kwalifikowanie linków wychodzących to powiązana kontrola on-page, która częściowo pokrywa się z crawlowaniem — mówi Google, jak traktować link, a nie czy go craw­lować: nofollow (pierwotnie uniwersalny, dziś będący wskazówką), a także rel=sponsored i rel=ugc dla linków płatnych/reklamowych i generowanych przez użytkowników. Wszystkie trzy należą do klastra tagów meta on-page.

Zostanie znalezionym w pierwszej kolejności to powiązany, ale odrębny etap. To, jak wyszukiwarki odkrywają URL-e — linki wewnętrzne, mapy witryn (XML, indeks map, obrazy i wideo) oraz protokoły push IndexNow i Google Indexing API (do czego każdy z nich faktycznie służy i dlaczego Google nie używa IndexNow) — znajduje się teraz we własnym hubie Discovery. Szerszy temat opisuje How Search Works.

Add an expert note

Pin an expert quote

New person? Create their unclaimed profile at /admin/experts/ → Pin a quote first.