Budżet indeksowania

Czym właściwie jest budżet indeksowania — pojemność indeksowania plus zapotrzebowanie na indeksowanie — co go marnuje, oraz uczciwy test, czy Twoja witryna jest wystarczająco duża, aby w ogóle trzeba było się tym przejmować.

Opublikowano po raz pierwszy: 22 cze 2026 · Ostatnia aktualizacja: 11 sie 2026 · Advanced
Języki
1 sygnał dowodowy na tej stronie

Budżet indeksowania to ile wyszukiwarka może i chce zaindeksować Twoją witrynę — pojemność indeksowania (co Twój serwer może udźwignąć) razy zapotrzebowanie na indeksowanie (popularność i nieaktualność). To nie jest czynnik rankingowy: więcej indeksowania nie podniesie pozycji. Większość witryn nigdy nie musi nim zarządzać — Mueller mówi, że 100k URL-i zwykle nie zmieni sytuacji, a oficjalny przewodnik Google zaleca, aby małe witryny lub te indeksowane tego samego dnia nie zawracały sobie tym głowy. Ma to znaczenie głównie przy 1 mln+ stron, 10 tys.+ stron zmieniających się codziennie, lub gdy wiele URL-i znajduje się w statusie „Odkryto – obecnie nieindeksowane”. Największą dźwignią jest usuwanie odpadów (nawigacja fasetowa, duplikaty, miękkie błędy 404s, nieskończone przestrzenie), aby budżet trafiał na URL-e, które mają znaczenie.

TL;DR — Budżet indeksowania = limit wydajności indeksowania (co Twój serwer może obsłużyć) × zapotrzebowanie na indeksowanie (popularność + nieaktualność + postrzegany zasób). To kwestia wydajności, a nie sygnał rankingowy. Wewnętrznie jest to planowanie według ważności ograniczone obciążeniem hosta, a nie płaski limit na witrynę. Większość witryn może to zignorować — Mueller określa 100k URL-i jako „zwykle za mało”, a Google mówi witrynom indeksowanym tego samego dnia, aby pominęły ten przewodnik. Problem pojawia się przy ~1 mln+ stron (zmiany tygodniowe), 10 tys.+ stron (zmiany dzienne) lub gdy liczba „Odkryto – obecnie nieindeksowane” rośnie. Najbardziej efektywne działanie to ograniczanie marnotrawstwa — nawigacja fasetowa, duplikaty, miękkie błędy 404s, nieskończone przestrzenie — aby budżet skupiał się na URL-ach, które mają znaczenie.

Evidence for this claim Google defines crawl budget using crawl capacity limit and crawl demand. Scope: Google Search crawling for larger sites. Confidence: high · Verified: Google: Large site crawl budget guide

Model dwuczynnikowy

Google definiuje to jasno: “The amount of time and resources that Google devotes to crawling a site is commonly called the site’s crawl budget and it’s determined by two main elements: crawl capacity limit and crawl demand.” (tłumaczenie) „Ilość czasu i zasobów, które Google poświęca na indeksowanie witryny, jest powszechnie nazywana budżetem indeksowania witryny i jest określana przez dwa główne elementy: limit wydajności indeksowania i zapotrzebowanie na indeksowanie.” Ujęcie z 2017 roku od Gary’ego Illyesa to zdanie, do którego wciąż wracam: budżet indeksowania to “the number of URLs Googlebot can and wants to crawl.” (tłumaczenie) „liczba URL-i, które Googlebot może i chce craw­lować”. Evidence for this claim Google defines crawl budget using crawl capacity limit and crawl demand. Scope: Google Search crawling for larger sites. Confidence: high · Verified: Google: Large site crawl budget guide Zachowaj ten zakres: budżet indeksowania reguluje pobieranie, a nie indeksowanie. Zaindeksowany URL wciąż przechodzi przez osobną decyzję o indeksowaniu — łączenie tych dwóch rzeczy zawyża zakres kontroli budżetu indeksowania.

Limit wydajności indeksowania (strona podaży). To “the maximum number of simultaneous parallel connections that Google can use to crawl a site, as well as the time delay between fetches.” (tłumaczenie) „maksymalna liczba równoczesnych połączeń równoległych, które Google może wykorzystać do crawlowania witryny, wraz z opóźnieniem między pobraniami”. Zmienia się wraz ze stanem zdrowia Twojego serwera. Odpowiadaj szybko i poprawnie, a limit wzrośnie; serwuj wolne odpowiedzi, błędy 5xx lub 429, a Googlebot się wycofa. W mojej prezentacji How Search Works wymieniam te same wyzwalacze limitów: stabilność serwera, wolne odpowiedzi, błędy serwera 5xx i 429 (zbyt wiele żądań). To jest „może”.

Zapotrzebowanie na indeksowanie (strona popytu). Napędzane przez popularność (jak bardzo linkowany / ważny jest URL) i nieaktualność (jak długo minęło od ostatniego indeksowania, jak często się zmienia). Ta sama prezentacja dzieli popyt na PageRank, częstotliwość zmian strony, czas od ostatniego indeksowania i duże zmiany w witrynie. Co istotne, Google wskazuje postrzegany zasób jako dźwignię, którą kontrolujesz najbardziej: “Without guidance from you, Google tries to crawl all or most of the URLs that it knows about on your site. If many of these URLs are duplicates, or you don’t want them crawled for some other reason… this wastes a lot of Google crawling time on your site. This is the factor that you can positively control the most.” (tłumaczenie) „Bez wskazówek z Twojej strony Google stara się craw­lować wszystkie lub większość URL-i, o których wie w Twojej witrynie. Jeśli wiele z tych URL-i to duplikaty lub nie chcesz, aby były crawlowane z innego powodu… marnuje to dużo czasu crawlowania Google w Twojej witrynie. To jest czynnik, który możesz najbardziej pozytywnie kontrolować.”

Demand sets the priority order; capacity determines how much of that ordered queue Googlebot can actually crawl. Źródło: Google Search Central

Crawl demand comes from popularity, genuine change, and the value of the URL inventory. It orders URLs in a priority queue. Crawl capacity comes from server response speed, stability, and error behavior. It limits how far Googlebot proceeds through that queue. Their interaction is the site's realized crawl budget, not a fixed daily URL quota.

© Patrick Stox LLC · CC BY 4.0 ·

Kilka strukturalnych faktów, które często zaskakują:

  • Budżet jest per nazwa hosta. https://www.example.com/ i https://code.example.com/ to dwie różne nazwy hostów, a zatem mają osobne budżety indeksowania.” (tłumaczenie)https://www.example.com/ i https://code.example.com/ to dwie różne nazwy hostów, a zatem mają osobne budżety indeksowania.” Subdomeny nie współdzielą budżetu.
  • Różne typy Googlebota prawdopodobnie korzystają z jednej puli. W moich własnych raportach obraz, wiadomości, wideo, reklamy i reszta wydają się korzystać z tego samego budżetu per witryna — nie mam aktualnego głównego źródła Google, które dokładnie to potwierdza, więc traktuj to jako obserwację praktyka, a nie udokumentowaną politykę. Tak czy inaczej, warto sprawdzić raport Statystyki indeksowania w podziale na typ robota, jeśli podejrzewasz, że jeden typ wypiera pozostałe.

Czym to naprawdę jest wewnętrznie: planowanie według ważności

„Budżet indeksowania” to termin ukuty przez specjalistów SEO. Wewnętrznie jest bliższy planowaniu ograniczonemu obciążeniem hosta. Jak opisał to Illyes, harmonogram Google „ustawia zestaw URL-i w kolejności ważności, a GoogleBot będzie indeksował w tej kolejności na podstawie harmonogramu ustalonego przez obciążenie hosta. Jeśli Google uzna, że Twój serwer może to obsłużyć, zaindeksuje cały zestaw, jeśli nie, zatrzyma się.” (tłumaczenie) „ustawia zestaw URL-i w kolejności ważności, a GoogleBot będzie indeksował w tej kolejności na podstawie harmonogramu ustalonego przez obciążenie hosta. Jeśli Google uzna, że Twój serwer może to obsłużyć, zaindeksuje cały zestaw, jeśli nie, zatrzyma się.”

To zmienia cały temat. To nie jest płaski limit “dostajesz N stron dziennie” — to priorytetowa kolejka, a indeksowanie podąża za zapotrzebowaniem na wyszukiwanie. Illyes ponownie: “Jeśli zapotrzebowanie na wyszukiwanie spada, to koreluje to również ze spadkiem limitu indeksowania,” i “jeśli chcesz zwiększyć to, ile indeksujemy, to musisz jakoś przekonać wyszukiwarkę, że Twoje treści są warte pobrania, czego zasadniczo słucha scheduler.” Zespół Search Relations wprost nazwał pomysł “stałego dziennego limitu stron” błędnym przekonaniem.

Czy Twoja witryna faktycznie ma problem z budżetem indeksowania?

To najcenniejsza sekcja, więc będę szczery: większość witryn nie musi się martwić budżetem indeksowania. Jak ujmuje to źródło, “most sites don’t need to worry” (tłumaczenie) „większość witryn nie musi się tym martwić”. Własny przewodnik Google zaczyna się od deeskalacji: “Jeśli Twoja witryna nie ma dużej liczby szybko zmieniających się stron lub jeśli Twoje strony wydają się być indeksowane tego samego dnia, w którym są publikowane, nie musisz czytać tego przewodnika. W przypadku Google Search wystarczy aktualizowanie mapy witryny i regularne sprawdzanie pokrycia indeksu.” Evidence for this claim Google says sites without many rapidly changing pages, or whose pages are crawled the day they publish, generally do not need crawl-budget guidance. Scope: Google's rough applicability guidance, not a guarantee for every site. Confidence: high · Verified: Google: Large site crawl budget guide

John Mueller podał konkretną liczbę: “100k URL-i zwykle nie wystarcza, aby wpłynąć na budżet indeksowania (to <1/minutę w ciągu 3 miesięcy).” Jeśli masz mniej niż sześć cyfr URL-i a strony są indeksowane szybko, przejdź dalej.

Kiedy to ma znaczenie, przybliżone progi Google to:

  • Duże witryny — 1 milion+ unikalnych stron z treścią, która zmienia się umiarkowanie często (mniej więcej co tydzień).
  • Średnie lub większe witryny — 10 000+ unikalnych stron z bardzo szybko zmieniającą się treścią (codziennie).
  • Witryny z dużą częścią URL-i sklasyfikowanych jako “Odkryto – obecnie nie zindeksowano” w Search Console — to sygnał ostrzegawczy, że Google wie o URL-ach, do których nie dociera.

Google dodaje zastrzeżenie, że “podane tutaj liczby są przybliżonym szacunkiem… nie dokładnymi progami.” Nawet w przypadku dużych witryn, niuanse z mojej własnej pracy pozostają aktualne: zwykle to nowe, słabo linkowane lub statyczne strony pozostają w tyle — nie te popularne.

Czy budżet indeksowania wpływa na pozycje? Nie.

Indeksowanie jest konieczne do rankowania, ale nie jest sygnałem rankingowym. Google w 2017: “Zwiększona szybkość indeksowania niekoniecznie doprowadzi do lepszych pozycji w wynikach wyszukiwania. Google używa setek sygnałów do rankowania wyników, a chociaż indeksowanie jest konieczne, aby znaleźć się w wynikach, nie jest sygnałem rankingowym.” Ujmuję to tak samo w moim przewodniku Ahrefs: “Więcej indeksowania nie oznacza, że będziesz rankować lepiej, ale jeśli Twoje strony nie są indeksowane i zindeksowane, nie będą rankować wcale.” Traktuj budżet indeksowania jako problem wydajności, kropka.

Co marnuje budżet indeksowania

Illyes opublikował kanoniczną listę URL-i o niskiej wartości dodanej “w kolejności znaczenia”:

  1. Nawigacja fasetowa i identyfikatory sesji — główny winowajca, zwłaszcza kombinacje filtrów/sortowania w e-commerce, które mnożą URL-e kombinatorycznie.
  2. Zduplikowane treści na stronie — klasyczne warianty techniczne: HTTP vs HTTPS, non-www vs www, końcowy ukośnik vs jego brak, wielkie vs małe litery, domyślne/strony indeksowe i parametry URL. (Około 60% sieci to zduplikowane treści, według wewnętrznych szacunków Google.)
  3. Strony z miękkimi błędami — miękkie 404s, które zwracają 200, są nadal indeksowane.
  4. Zhakowane strony.
  5. Nieskończone przestrzenie i proxy — kalendarze, paginacja z nieskończonym przewijaniem, która duplikuje treść, kombinacje fasetowe; klasyczne wzorce pułapek dla robotów.
  6. Treści niskiej jakości i spam.

Koszt jest konkretny: “Marnowanie zasobów serwera na takie strony wyczerpie aktywność indeksowania ze stron, które faktycznie mają wartość, co może spowodować znaczne opóźnienie w odkrywaniu świetnych treści na stronie.” Oprócz listy, długie łańcuchy przekierowań “mają negatywny wpływ na indeksowanie,” a wolne, ciężkie strony sprawiają, że każde pobranie jest droższe.

Jak to zoptymalizować

Cała gra polega na konsolidacji budżetu na URL-ach, które mają znaczenie:

  • Konsoliduj duplikaty. Google: “Consolidate duplicate content to focus crawling on unique content rather than unique URLs.” (tłumaczenie) „Skonsoliduj zduplikowane treści, aby skupić crawlowanie na unikalnej treści, a nie na unikalnych URL-ach”. Wybierz jeden host, jeden protokół, jedną konwencję końcowego ukośnika; kanonizuj; obsługuj parametry.
  • Zablokuj naprawdę bezwartościowe ścieżki za pomocą robots.txt — ale tylko te, których nigdy nie chcesz, aby były indeksowane. W przypadku nawigacji fasetowej zwykle opcje to zablokowanie ścieżek parametrów w robots.txt lub użycie # zamiast ?, aby adresy URL nie były w ogóle indeksowalne.
  • Nie używaj noindex, aby oszczędzić budżet. Google: “Don’t use noindex, as Google will still request, but then drop the page when it sees a noindex meta tag or header in the HTTP response, wasting crawling time.” (tłumaczenie) „Nie używaj noindex: Google nadal pobierze stronę, a następnie odrzuci ją po wykryciu tagu meta noindex lub nagłówka w odpowiedzi HTTP, marnując czas crawlowania”. Żądanie i tak Cię kosztuje. Zablokuj w robots.txt, jeśli nigdy nie chcesz, aby zostało pobrane.
  • Nie oczekuj, że robots.txt przydzieli budżet. “Google won’t shift this newly available crawl budget to other pages unless Google is already hitting your site’s serving limit.” (tłumaczenie) „Google nie przeniesie nowo dostępnego budżetu crawlowania na inne strony, chyba że już osiąga limit obsługi witryny”. Blokowanie śmieci to dobra higiena, ale nie przekazuje zwolnionych odwiedzin Twoim dobrym stronom, chyba że byłeś ograniczony wydajnością.
  • Napraw miękkie błędy 404s; zwracaj prawdziwe 404s/410s dla usuniętych stron. “A 404 status code is a strong signal not to crawl that URL again.” (tłumaczenie) „Kod statusu 404 jest silnym sygnałem, aby nie craw­lować ponownie tego URL-a”.
  • Skracaj łańcuchy przekierowań, aktualizuj mapy witryny (uczciwe lastmod) i popraw szybkość serwera.
  • Wzmacniaj linki wewnętrzne do ważnych i nowych stron — łatwiejsze niż cokolwiek innego, ponieważ masz nad tym pełną kontrolę.

A te dwa — tylko dwa — sposoby, według Google, na faktyczne zwiększenie budżetu: “Add more server resources… [and] optimize your content’s quality.” (tłumaczenie) „Dodaj więcej zasobów serwera… i popraw jakość treści”. Zwróć uwagę na pułapkę: szybszy serwer podnosi limit wydajności, ale jeśli popyt jest niski, Google nadal indeksuje mniej. Potrzebujesz obu.

Jak to zmierzyć

  • GSC > Ustawienia > Raport statystyk indeksowania — całkowita liczba żądań indeksowania w czasie, średni czas odpowiedzi, status hosta oraz podział według kodu odpowiedzi, typu pliku i typu Googlebota. To własny widok Google na to, jak Cię indeksuje.
  • Analiza plików dziennika serwera — prawda podstawowa. Rzeczywiste trafienia Googlebota według wzorca adresu URL, dzięki czemu możesz zobaczyć marnotrawstwo indeksowania i nieindeksowane ważne strony. Zweryfikuj, czy bot to naprawdę Googlebot, poprzez odwrotny + bezpośredni DNS lub opublikowane zakresy IP Google (wiele fałszywych botów podszywa się pod user-agent).
  • “Odkryto – obecnie nieindeksowane” w GSC — traktuj rosnącą liczbę tutaj jako ostrzeżenie o budżecie indeksowania: Google zna adresy URL, ale do nich nie dociera.
Crawl waste appears in the mismatch: facet URLs occupy 45% of the inventory and 61% of requests, but only 8% of useful 200 responses.

In a synthetic cohort, product pages are 28 percent of the URL inventory, 24 percent of Googlebot requests, and 52 percent of useful 200 responses. Category pages are 7, 10, and 21 percent. Facet URLs are 45, 61, and 8 percent. Gone URLs are 20, 5, and 0 percent. The figures illustrate comparison logic, not a live log sample.

Bing i inne wyszukiwarki: “efektywność indeksowania”

Bing przeformułowuje temat jako efektywność indeksowania, a nie budżet. Definicja Fabrice’a Canela: “The crawl efficiency is how often we crawl and discover new and fresh content per page crawled.” (tłumaczenie) „Efektywność crawlowania określa, jak często crawlujemy oraz odkrywamy nową i świeżą treść na każdą scrawlowaną stronę”. Celem jest “crawl an URL only when the content has been added (URL not crawled before), updated (fresh on-page context or useful outbound links).” (tłumaczenie) „craw­lować URL tylko wtedy, gdy treść została dodana — URL nie był wcześniej crawlowany — albo zaktualizowana przez nowy kontekst na stronie lub przydatne linki wychodzące”. Bezpośrednia filozofia Binga: “Less is more for SEO. Never forget that. Less URLs to crawl, better for SEO.” (tłumaczenie) „W SEO mniej znaczy więcej. Nigdy o tym nie zapominaj. Mniej URL-i do crawlowania oznacza lepsze SEO”.

Preferowanym rozwiązaniem Binga jest IndexNow — wypychanie zmienionych adresów URL, aby bingbot nie musiał wykonywać eksploracyjnych indeksowań — oraz Crawl Control w Bing Webmaster Tools, który pozwala zaplanować, kiedy bingbot indeksuje, co do godziny, aby chronić obciążenie serwera. To realna różnica między Google a Bingiem, którą warto odnotować: Google wycofał swój stary limiter szybkości indeksowania w Search Console, podczas gdy Bing nadal pozwala aktywnie kształtować harmonogram indeksowania.

Mity o budżecie indeksowania, poprawione

  • „Każda witryna powinna optymalizować budżet indeksowania.” Nie — większość nie powinna. Crawling tego samego dnia i mniej niż 100k URL-i oznacza, że jesteś w porządku.
  • „Więcej crawl = lepsze pozycje.” Nie. Crawling jest konieczny, ale nie jest sygnałem rankingowym.
  • „To stały dzienny limit stron.” Nie — to planowanie oparte na ważności, ograniczone obciążeniem hosta.
  • „Użyj noindex, aby zaoszczędzić budżet.” Nie — Google nadal najpierw żąda strony.
  • „Zablokuj strony w robots.txt, aby dać innym stronom więcej budżetu.” Generalnie nie, chyba że już osiągasz swój limit serwowania.
  • „Szybszy serwer sam podnosi twój budżet.” Podnosi tylko sufit wydajności; niski popyt nadal oznacza mniej crawl.

Aby zobaczyć szerszy potok, w którym to się znajduje — odkrywanie, harmonogram crawl, renderowanie i jak crawling różni się od indeksowania — zobacz centrum crawl. Tematy pokrewne (szybkość crawl, częstotliwość crawl, pułapki na pająki i analiza plików logów) każdy zagłębia się w jeden element tego.

Add an expert note

Pin an expert quote

New person? Create their unclaimed profile at /admin/experts/ → Pin a quote first.