Budżet indeksowania
Czym właściwie jest budżet indeksowania — pojemność indeksowania plus zapotrzebowanie na indeksowanie — co go marnuje, oraz uczciwy test, czy Twoja witryna jest wystarczająco duża, aby w ogóle trzeba było się tym przejmować.
Języki
1 sygnał dowodowy na tej stronie
- Powiązane działające narzędzieLog File Analyzer
Budżet indeksowania to ile wyszukiwarka może i chce zaindeksować Twoją witrynę — pojemność indeksowania (co Twój serwer może udźwignąć) razy zapotrzebowanie na indeksowanie (popularność i nieaktualność). To nie jest czynnik rankingowy: więcej indeksowania nie podniesie pozycji. Większość witryn nigdy nie musi nim zarządzać — Mueller mówi, że 100k URL-i zwykle nie zmieni sytuacji, a oficjalny przewodnik Google zaleca, aby małe witryny lub te indeksowane tego samego dnia nie zawracały sobie tym głowy. Ma to znaczenie głównie przy 1 mln+ stron, 10 tys.+ stron zmieniających się codziennie, lub gdy wiele URL-i znajduje się w statusie „Odkryto – obecnie nieindeksowane”. Największą dźwignią jest usuwanie odpadów (nawigacja fasetowa, duplikaty, miękkie błędy 404s, nieskończone przestrzenie), aby budżet trafiał na URL-e, które mają znaczenie.
TL;DR — Budżet indeksowania to ilość, jaką wyszukiwarka jest skłonna zaindeksować na Twojej stronie. To dwie rzeczy pomnożone przez siebie: ile Twój serwer może obsłużyć i ile Google chce zaindeksować. Większe indeksowanie nie oznacza wyższych pozycji — a dla większości stron to nieproblem. Jeśli Twoje strony są indeksowane tego samego dnia, w którym je publikujesz, nie masz problemu z budżetem indeksowania.
Czym jest budżet indeksowania
Gdy wyszukiwarka indeksuje Twoją stronę, nie robi tego w nieskończoność. Indeksuje pewną liczbę Twoich adresów URL w danym oknie czasowym, a następnie przechodzi dalej. Ta ilość to właśnie to, co specjaliści SEO nazywają budżetem indeksowania.
Sprowadza się to do dwóch pytań, na które wyszukiwarka stale odpowiada:
- Ile mogę zaindeksować? Twój serwer może przyjąć tylko określoną ilość, zanim zwolni lub zacznie zwracać błędy. Google to obserwuje i wycofuje się. To jest przepustowość indeksowania (starsze dokumenty nazywały to limitem szybkości indeksowania).
- Ile chcę zaindeksować? Popularne strony i strony często zmieniane są indeksowane częściej. Strony, do których nikt nie linkuje lub które się nie zmieniają, są indeksowane rzadko. To jest zapotrzebowanie na indeksowanie.
Pomnóż te dwie rzeczy, a otrzymasz swój budżet indeksowania: w przybliżeniu liczbę adresów URL, które Google może i chce zaindeksować. Evidence for this claim Google defines crawl budget using crawl capacity limit and crawl demand. Scope: Google Search crawling for larger sites. Confidence: high · Verified: Google: Large site crawl budget guide
Jedno rozróżnienie, które warto zrobić na początku: budżet indeksowania dotyczy tego, czy Google w ogóle pobiera adres URL. To, czy następnie indeksuje to, co znajdzie, to osobna, późniejsza decyzja. Strona może być zaindeksowana i nadal nie znaleźć się w indeksie — indeksowanie nie gwarantuje indeksacji, to tylko brama, przez którą musisz przejść.
Najpierw najważniejsze: prawdopodobnie nie musisz się tym martwić
To jest część, którą większość artykułów pomija. Większość stron nie ma problemu z budżetem indeksowania. Google mówi to wprost — jeśli Twoje strony są indeksowane tego samego dnia, w którym są publikowane, lub Twoja strona nie jest ogromna i szybko się zmienia, możesz pominąć cały temat. Evidence for this claim Google says sites without many rapidly changing pages, or whose pages are crawled the day they publish, generally do not need crawl-budget guidance. Scope: Google's rough applicability guidance, not a guarantee for every site. Confidence: high · Verified: Google: Large site crawl budget guide
Prosty test: wyszukaj kilka swoich adresów URL w Google lub użyj narzędzia URL Inspection w Search Console. Jeśli Twoje nowe strony pojawiają się w ciągu dnia lub dwóch, Twój budżet indeksowania jest w porządku. Zamiast tego poświęć czas na treści i linki.
Budżet indeksowania zaczyna mieć znaczenie, gdy strona ma setki tysięcy lub miliony stron, zwłaszcza jeśli wiele z nich stale się zmienia (pomyśl o dużym sklepie ecommerce lub dużej witrynie informacyjnej).
Większe indeksowanie nie oznacza lepszych pozycji
Oto mit, który warto obalić na początku: częstsze indeksowanie strony nie podnosi jej w wynikach. Indeksowanie to tylko sposób, w jaki wyszukiwarka znajduje i pobiera Twoją stronę. To brama, przez którą musisz przejść, aby w ogóle rankingować — ale gdy już przez nią przejdziesz, częstotliwość ponownego indeksowania nie jest czynnikiem rankingowym.
Więc cel nie brzmi „indeksuj więcej”. Celem jest upewnienie się, że strony, na których Ci zależy, są indeksowane, a wyszukiwarka nie marnuje czasu na bezużyteczne adresy URL.
Co marnuje budżet indeksowania
Jeśli masz dużą stronę, budżet jest drenowany przez:
- Adresy URL filtrów i sortowania (nawigacja fasetowa) — każda kombinacja filtrów w sklepie ecommerce może generować tysiące prawie identycznych adresów URL.
- Zduplikowane strony — ta sama treść dostępna pod wieloma adresami URL (z
wwwi bez, z dodanymi parametrami itp.). - Miękkie błędy 404s — strony „nie znaleziono”, które zwracają status
200 OK, więc wyszukiwarka nadal je indeksuje. - Zepsute łańcuchy przekierowań i wolne strony — sprawiają, że każde indeksowanie kosztuje więcej.
Rozwiązaniem jest prawie zawsze usunięcie marnotrawstwa, aby budżet trafiał na prawdziwe strony — a nie próba przekonania Google do indeksowania „więcej”.
Chcesz pełny model — przepustowość indeksowania a zapotrzebowanie, dokładne progi wielkości, co zrobić z nawigacją fasetową, jak Bing podchodzi do tego inaczej i jak to zmierzyć — przełącz się na zakładkę Zaawansowane.
Evidence for this claim Google defines crawl budget using crawl capacity limit and crawl demand. Scope: Google Search crawling for larger sites. Confidence: high · Verified: Google: Large site crawl budget guideTL;DR — Budżet indeksowania = limit wydajności indeksowania (co Twój serwer może obsłużyć) × zapotrzebowanie na indeksowanie (popularność + nieaktualność + postrzegany zasób). To kwestia wydajności, a nie sygnał rankingowy. Wewnętrznie jest to planowanie według ważności ograniczone obciążeniem hosta, a nie płaski limit na witrynę. Większość witryn może to zignorować — Mueller określa 100k URL-i jako „zwykle za mało”, a Google mówi witrynom indeksowanym tego samego dnia, aby pominęły ten przewodnik. Problem pojawia się przy ~1 mln+ stron (zmiany tygodniowe), 10 tys.+ stron (zmiany dzienne) lub gdy liczba „Odkryto – obecnie nieindeksowane” rośnie. Najbardziej efektywne działanie to ograniczanie marnotrawstwa — nawigacja fasetowa, duplikaty, miękkie błędy 404s, nieskończone przestrzenie — aby budżet skupiał się na URL-ach, które mają znaczenie.
Model dwuczynnikowy
Google definiuje to jasno: “The amount of time and resources that Google devotes to crawling a site is commonly called the site’s crawl budget and it’s determined by two main elements: crawl capacity limit and crawl demand.” (tłumaczenie) „Ilość czasu i zasobów, które Google poświęca na indeksowanie witryny, jest powszechnie nazywana budżetem indeksowania witryny i jest określana przez dwa główne elementy: limit wydajności indeksowania i zapotrzebowanie na indeksowanie.” Ujęcie z 2017 roku od Gary’ego Illyesa to zdanie, do którego wciąż wracam: budżet indeksowania to “the number of URLs Googlebot can and wants to crawl.” (tłumaczenie) „liczba URL-i, które Googlebot może i chce crawlować”. Evidence for this claim Google defines crawl budget using crawl capacity limit and crawl demand. Scope: Google Search crawling for larger sites. Confidence: high · Verified: Google: Large site crawl budget guide Zachowaj ten zakres: budżet indeksowania reguluje pobieranie, a nie indeksowanie. Zaindeksowany URL wciąż przechodzi przez osobną decyzję o indeksowaniu — łączenie tych dwóch rzeczy zawyża zakres kontroli budżetu indeksowania.
Limit wydajności indeksowania (strona podaży). To “the maximum number of simultaneous parallel connections that Google can use to crawl a site, as well as the time delay between fetches.” (tłumaczenie) „maksymalna liczba równoczesnych połączeń równoległych, które Google może wykorzystać do crawlowania witryny, wraz z opóźnieniem między pobraniami”. Zmienia się wraz ze stanem zdrowia Twojego serwera. Odpowiadaj szybko
i poprawnie, a limit wzrośnie; serwuj wolne odpowiedzi, błędy 5xx lub 429, a
Googlebot się wycofa. W mojej prezentacji How Search Works wymieniam te same wyzwalacze
limitów: stabilność serwera, wolne odpowiedzi, błędy serwera 5xx i 429 (zbyt wiele
żądań). To jest „może”.
Zapotrzebowanie na indeksowanie (strona popytu). Napędzane przez popularność (jak bardzo linkowany / ważny jest URL) i nieaktualność (jak długo minęło od ostatniego indeksowania, jak często się zmienia). Ta sama prezentacja dzieli popyt na PageRank, częstotliwość zmian strony, czas od ostatniego indeksowania i duże zmiany w witrynie. Co istotne, Google wskazuje postrzegany zasób jako dźwignię, którą kontrolujesz najbardziej: “Without guidance from you, Google tries to crawl all or most of the URLs that it knows about on your site. If many of these URLs are duplicates, or you don’t want them crawled for some other reason… this wastes a lot of Google crawling time on your site. This is the factor that you can positively control the most.” (tłumaczenie) „Bez wskazówek z Twojej strony Google stara się crawlować wszystkie lub większość URL-i, o których wie w Twojej witrynie. Jeśli wiele z tych URL-i to duplikaty lub nie chcesz, aby były crawlowane z innego powodu… marnuje to dużo czasu crawlowania Google w Twojej witrynie. To jest czynnik, który możesz najbardziej pozytywnie kontrolować.”
Crawl demand comes from popularity, genuine change, and the value of the URL inventory. It orders URLs in a priority queue. Crawl capacity comes from server response speed, stability, and error behavior. It limits how far Googlebot proceeds through that queue. Their interaction is the site's realized crawl budget, not a fixed daily URL quota.
© Patrick Stox LLC · CC BY 4.0 ·
Kilka strukturalnych faktów, które często zaskakują:
- Budżet jest per nazwa hosta. „
https://www.example.com/ihttps://code.example.com/to dwie różne nazwy hostów, a zatem mają osobne budżety indeksowania.” (tłumaczenie) „https://www.example.com/ihttps://code.example.com/to dwie różne nazwy hostów, a zatem mają osobne budżety indeksowania.” Subdomeny nie współdzielą budżetu. - Różne typy Googlebota prawdopodobnie korzystają z jednej puli. W moich własnych raportach obraz, wiadomości, wideo, reklamy i reszta wydają się korzystać z tego samego budżetu per witryna — nie mam aktualnego głównego źródła Google, które dokładnie to potwierdza, więc traktuj to jako obserwację praktyka, a nie udokumentowaną politykę. Tak czy inaczej, warto sprawdzić raport Statystyki indeksowania w podziale na typ robota, jeśli podejrzewasz, że jeden typ wypiera pozostałe.
Czym to naprawdę jest wewnętrznie: planowanie według ważności
„Budżet indeksowania” to termin ukuty przez specjalistów SEO. Wewnętrznie jest bliższy planowaniu ograniczonemu obciążeniem hosta. Jak opisał to Illyes, harmonogram Google „ustawia zestaw URL-i w kolejności ważności, a GoogleBot będzie indeksował w tej kolejności na podstawie harmonogramu ustalonego przez obciążenie hosta. Jeśli Google uzna, że Twój serwer może to obsłużyć, zaindeksuje cały zestaw, jeśli nie, zatrzyma się.” (tłumaczenie) „ustawia zestaw URL-i w kolejności ważności, a GoogleBot będzie indeksował w tej kolejności na podstawie harmonogramu ustalonego przez obciążenie hosta. Jeśli Google uzna, że Twój serwer może to obsłużyć, zaindeksuje cały zestaw, jeśli nie, zatrzyma się.”
To zmienia cały temat. To nie jest płaski limit “dostajesz N stron dziennie” — to priorytetowa kolejka, a indeksowanie podąża za zapotrzebowaniem na wyszukiwanie. Illyes ponownie: “Jeśli zapotrzebowanie na wyszukiwanie spada, to koreluje to również ze spadkiem limitu indeksowania,” i “jeśli chcesz zwiększyć to, ile indeksujemy, to musisz jakoś przekonać wyszukiwarkę, że Twoje treści są warte pobrania, czego zasadniczo słucha scheduler.” Zespół Search Relations wprost nazwał pomysł “stałego dziennego limitu stron” błędnym przekonaniem.
Czy Twoja witryna faktycznie ma problem z budżetem indeksowania?
To najcenniejsza sekcja, więc będę szczery: większość witryn nie musi się martwić budżetem indeksowania. Jak ujmuje to źródło, “most sites don’t need to worry” (tłumaczenie) „większość witryn nie musi się tym martwić”. Własny przewodnik Google zaczyna się od deeskalacji: “Jeśli Twoja witryna nie ma dużej liczby szybko zmieniających się stron lub jeśli Twoje strony wydają się być indeksowane tego samego dnia, w którym są publikowane, nie musisz czytać tego przewodnika. W przypadku Google Search wystarczy aktualizowanie mapy witryny i regularne sprawdzanie pokrycia indeksu.” Evidence for this claim Google says sites without many rapidly changing pages, or whose pages are crawled the day they publish, generally do not need crawl-budget guidance. Scope: Google's rough applicability guidance, not a guarantee for every site. Confidence: high · Verified: Google: Large site crawl budget guide
John Mueller podał konkretną liczbę: “100k URL-i zwykle nie wystarcza, aby wpłynąć na budżet indeksowania (to <1/minutę w ciągu 3 miesięcy).” Jeśli masz mniej niż sześć cyfr URL-i a strony są indeksowane szybko, przejdź dalej.
Kiedy to ma znaczenie, przybliżone progi Google to:
- Duże witryny — 1 milion+ unikalnych stron z treścią, która zmienia się umiarkowanie często (mniej więcej co tydzień).
- Średnie lub większe witryny — 10 000+ unikalnych stron z bardzo szybko zmieniającą się treścią (codziennie).
- Witryny z dużą częścią URL-i sklasyfikowanych jako “Odkryto – obecnie nie zindeksowano” w Search Console — to sygnał ostrzegawczy, że Google wie o URL-ach, do których nie dociera.
Google dodaje zastrzeżenie, że “podane tutaj liczby są przybliżonym szacunkiem… nie dokładnymi progami.” Nawet w przypadku dużych witryn, niuanse z mojej własnej pracy pozostają aktualne: zwykle to nowe, słabo linkowane lub statyczne strony pozostają w tyle — nie te popularne.
Czy budżet indeksowania wpływa na pozycje? Nie.
Indeksowanie jest konieczne do rankowania, ale nie jest sygnałem rankingowym. Google w 2017: “Zwiększona szybkość indeksowania niekoniecznie doprowadzi do lepszych pozycji w wynikach wyszukiwania. Google używa setek sygnałów do rankowania wyników, a chociaż indeksowanie jest konieczne, aby znaleźć się w wynikach, nie jest sygnałem rankingowym.” Ujmuję to tak samo w moim przewodniku Ahrefs: “Więcej indeksowania nie oznacza, że będziesz rankować lepiej, ale jeśli Twoje strony nie są indeksowane i zindeksowane, nie będą rankować wcale.” Traktuj budżet indeksowania jako problem wydajności, kropka.
Co marnuje budżet indeksowania
Illyes opublikował kanoniczną listę URL-i o niskiej wartości dodanej “w kolejności znaczenia”:
- Nawigacja fasetowa i identyfikatory sesji — główny winowajca, zwłaszcza kombinacje filtrów/sortowania w e-commerce, które mnożą URL-e kombinatorycznie.
- Zduplikowane treści na stronie — klasyczne warianty techniczne: HTTP vs HTTPS, non-www vs www, końcowy ukośnik vs jego brak, wielkie vs małe litery, domyślne/strony indeksowe i parametry URL. (Około 60% sieci to zduplikowane treści, według wewnętrznych szacunków Google.)
- Strony z miękkimi błędami — miękkie 404s, które zwracają
200, są nadal indeksowane. - Zhakowane strony.
- Nieskończone przestrzenie i proxy — kalendarze, paginacja z nieskończonym przewijaniem, która duplikuje treść, kombinacje fasetowe; klasyczne wzorce pułapek dla robotów.
- Treści niskiej jakości i spam.
Koszt jest konkretny: “Marnowanie zasobów serwera na takie strony wyczerpie aktywność indeksowania ze stron, które faktycznie mają wartość, co może spowodować znaczne opóźnienie w odkrywaniu świetnych treści na stronie.” Oprócz listy, długie łańcuchy przekierowań “mają negatywny wpływ na indeksowanie,” a wolne, ciężkie strony sprawiają, że każde pobranie jest droższe.
Jak to zoptymalizować
Cała gra polega na konsolidacji budżetu na URL-ach, które mają znaczenie:
- Konsoliduj duplikaty. Google: “Consolidate duplicate content to focus crawling on unique content rather than unique URLs.” (tłumaczenie) „Skonsoliduj zduplikowane treści, aby skupić crawlowanie na unikalnej treści, a nie na unikalnych URL-ach”. Wybierz jeden host, jeden protokół, jedną konwencję końcowego ukośnika; kanonizuj; obsługuj parametry.
- Zablokuj naprawdę bezwartościowe ścieżki za pomocą
robots.txt— ale tylko te, których nigdy nie chcesz, aby były indeksowane. W przypadku nawigacji fasetowej zwykle opcje to zablokowanie ścieżek parametrów wrobots.txtlub użycie#zamiast?, aby adresy URL nie były w ogóle indeksowalne. - Nie używaj
noindex, aby oszczędzić budżet. Google: “Don’t use noindex, as Google will still request, but then drop the page when it sees a noindex meta tag or header in the HTTP response, wasting crawling time.” (tłumaczenie) „Nie używaj noindex: Google nadal pobierze stronę, a następnie odrzuci ją po wykryciu tagu meta noindex lub nagłówka w odpowiedzi HTTP, marnując czas crawlowania”. Żądanie i tak Cię kosztuje. Zablokuj wrobots.txt, jeśli nigdy nie chcesz, aby zostało pobrane. - Nie oczekuj, że
robots.txtprzydzieli budżet. “Google won’t shift this newly available crawl budget to other pages unless Google is already hitting your site’s serving limit.” (tłumaczenie) „Google nie przeniesie nowo dostępnego budżetu crawlowania na inne strony, chyba że już osiąga limit obsługi witryny”. Blokowanie śmieci to dobra higiena, ale nie przekazuje zwolnionych odwiedzin Twoim dobrym stronom, chyba że byłeś ograniczony wydajnością. - Napraw miękkie błędy 404s; zwracaj prawdziwe 404s/410s dla usuniętych stron. “A 404 status code is a strong signal not to crawl that URL again.” (tłumaczenie) „Kod statusu 404 jest silnym sygnałem, aby nie crawlować ponownie tego URL-a”.
- Skracaj łańcuchy przekierowań, aktualizuj mapy witryny (uczciwe
lastmod) i popraw szybkość serwera. - Wzmacniaj linki wewnętrzne do ważnych i nowych stron — łatwiejsze niż cokolwiek innego, ponieważ masz nad tym pełną kontrolę.
A te dwa — tylko dwa — sposoby, według Google, na faktyczne zwiększenie budżetu: “Add more server resources… [and] optimize your content’s quality.” (tłumaczenie) „Dodaj więcej zasobów serwera… i popraw jakość treści”. Zwróć uwagę na pułapkę: szybszy serwer podnosi limit wydajności, ale jeśli popyt jest niski, Google nadal indeksuje mniej. Potrzebujesz obu.
Jak to zmierzyć
- GSC > Ustawienia > Raport statystyk indeksowania — całkowita liczba żądań indeksowania w czasie, średni czas odpowiedzi, status hosta oraz podział według kodu odpowiedzi, typu pliku i typu Googlebota. To własny widok Google na to, jak Cię indeksuje.
- Analiza plików dziennika serwera — prawda podstawowa. Rzeczywiste trafienia Googlebota według wzorca adresu URL, dzięki czemu możesz zobaczyć marnotrawstwo indeksowania i nieindeksowane ważne strony. Zweryfikuj, czy bot to naprawdę Googlebot, poprzez odwrotny + bezpośredni DNS lub opublikowane zakresy IP Google (wiele fałszywych botów podszywa się pod user-agent).
- “Odkryto – obecnie nieindeksowane” w GSC — traktuj rosnącą liczbę tutaj jako ostrzeżenie o budżecie indeksowania: Google zna adresy URL, ale do nich nie dociera.
In a synthetic cohort, product pages are 28 percent of the URL inventory, 24 percent of Googlebot requests, and 52 percent of useful 200 responses. Category pages are 7, 10, and 21 percent. Facet URLs are 45, 61, and 8 percent. Gone URLs are 20, 5, and 0 percent. The figures illustrate comparison logic, not a live log sample.
Bing i inne wyszukiwarki: “efektywność indeksowania”
Bing przeformułowuje temat jako efektywność indeksowania, a nie budżet. Definicja Fabrice’a Canela: “The crawl efficiency is how often we crawl and discover new and fresh content per page crawled.” (tłumaczenie) „Efektywność crawlowania określa, jak często crawlujemy oraz odkrywamy nową i świeżą treść na każdą scrawlowaną stronę”. Celem jest “crawl an URL only when the content has been added (URL not crawled before), updated (fresh on-page context or useful outbound links).” (tłumaczenie) „crawlować URL tylko wtedy, gdy treść została dodana — URL nie był wcześniej crawlowany — albo zaktualizowana przez nowy kontekst na stronie lub przydatne linki wychodzące”. Bezpośrednia filozofia Binga: “Less is more for SEO. Never forget that. Less URLs to crawl, better for SEO.” (tłumaczenie) „W SEO mniej znaczy więcej. Nigdy o tym nie zapominaj. Mniej URL-i do crawlowania oznacza lepsze SEO”.
Preferowanym rozwiązaniem Binga jest IndexNow — wypychanie zmienionych adresów URL, aby bingbot nie musiał wykonywać eksploracyjnych indeksowań — oraz Crawl Control w Bing Webmaster Tools, który pozwala zaplanować, kiedy bingbot indeksuje, co do godziny, aby chronić obciążenie serwera. To realna różnica między Google a Bingiem, którą warto odnotować: Google wycofał swój stary limiter szybkości indeksowania w Search Console, podczas gdy Bing nadal pozwala aktywnie kształtować harmonogram indeksowania.
Mity o budżecie indeksowania, poprawione
- „Każda witryna powinna optymalizować budżet indeksowania.” Nie — większość nie powinna. Crawling tego samego dnia i mniej niż 100k URL-i oznacza, że jesteś w porządku.
- „Więcej crawl = lepsze pozycje.” Nie. Crawling jest konieczny, ale nie jest sygnałem rankingowym.
- „To stały dzienny limit stron.” Nie — to planowanie oparte na ważności, ograniczone obciążeniem hosta.
- „Użyj
noindex, aby zaoszczędzić budżet.” Nie — Google nadal najpierw żąda strony. - „Zablokuj strony w
robots.txt, aby dać innym stronom więcej budżetu.” Generalnie nie, chyba że już osiągasz swój limit serwowania. - „Szybszy serwer sam podnosi twój budżet.” Podnosi tylko sufit wydajności; niski popyt nadal oznacza mniej crawl.
Aby zobaczyć szerszy potok, w którym to się znajduje — odkrywanie, harmonogram crawl, renderowanie i jak crawling różni się od indeksowania — zobacz centrum crawl. Tematy pokrewne (szybkość crawl, częstotliwość crawl, pułapki na pająki i analiza plików logów) każdy zagłębia się w jeden element tego.
Podsumowanie AI
Skrócona wersja wersji zaawansowanej:
- Budżet crawl = limit wydajności crawl × zapotrzebowanie na crawl. Wydajność to to, co twój serwer może obsłużyć (rośnie przy szybkich/czystych odpowiedziach, spada przy
5xx/429); zapotrzebowanie to popularność + nieaktualność + postrzegany inwentarz. Jednozdaniowe wyjaśnienie Google: „liczba URL-i, które Googlebot może i chce przecrawlować.” - To nie jest czynnik rankingowy. Crawling jest konieczny do rankingu, ale więcej crawl nie podnosi pozycji — to wyłącznie kwestia efektywności.
- Wewnętrznie to planowanie według ważności, ograniczone obciążeniem hosta — priorytetowa kolejka, a nie płaski dzienny limit stron. Crawling podąża za zapotrzebowaniem wyszukiwania.
- Większość witryn nie musi tym zarządzać. Mueller: 100k URL-i zwykle to za mało, aby miało znaczenie. Google: jeśli strony są crawlowane tego samego dnia, pomiń przewodnik. Problem pojawia się przy ~1M+ stron (zmiany tygodniowe), 10k+ (zmiany dzienne) lub dużej stercie „Odkryto – obecnie nie indeksowano.”
- Co to marnuje (kolejność Google): nawigacja fasetowa / ID sesji, zduplikowana treść, miękkie 404s, zhakowane strony, nieskończone przestrzenie, treść niskiej jakości — plus łańcuchy przekierowań i wolne strony.
- Optymalizuj, usuwając marnotrawstwo: konsoliduj duplikaty, blokuj bezwartościowe ścieżki w
robots.txt(nienoindex— Google nadal najpierw żąda), napraw miękkie 404s, skracaj przekierowania, utrzymuj czyste mapy witryn, wzmacniaj linki wewnętrzne. Tylko dwa sposoby na prawdziwe zwiększenie budżetu: większa wydajność serwera i wyższa jakość treści. - Mierz za pomocą GSC Crawl Stats, analizy logów serwera i raportu „Odkryto – obecnie nie indeksowano.”
- Bing nazywa to efektywnością crawl („mniej znaczy więcej”) i promuje IndexNow + Crawl Control zamiast podejścia Google polegającego na nieingerencji.
Oficjalna dokumentacja
Dokumentacja źródłowa od wyszukiwarek.
- Optymalizuj swój budżet crawl — kanoniczny dokument (przeniesiony ze starego URL „przewodnika dla właścicieli dużych witryn” w dokumentacji infrastruktury crawl Google, ostatnia aktualizacja: grudzień 2025): wydajność crawl + zapotrzebowanie, kto tego potrzebuje, lista marnotrawstwa i jak optymalizować. Zacznij tutaj.
- Co budżet crawl oznacza dla Googlebota (Gary Illyes, 2017) — oryginalne ujęcie: limit szybkości crawl + zapotrzebowanie na crawl oraz kategorie URL-i o niskiej wartości dodanej.
- Crawling i indeksowanie — centrum dla robots, map witryn, kanonikalizacji i kontroli crawl.
- Seria Grudzień Crawling (2024) — Googlebot, buforowanie HTTP, nawigacja fasetowa i CDN.
Bing / Microsoft
- Seria bingbot: maksymalizacja efektywności crawlowania — ujęcie Binga o efektywności crawlowania i jego nadrzędnym celu.
- Seria bingbot: optymalizacja częstotliwości crawlowania — sposób, w jaki Bing ustala rytm ponownego crawlowania.
- Bing Webmaster Tools — sterowanie crawlowaniem — godzinowe planowanie crawlowania przez bingbota.
- IndexNow / indexnow.org — przesyłanie zmienionych URL-i, aby wyszukiwarki nie musiały wykonywać crawlowania eksploracyjnego.
Cytaty ze źródła
Oficjalne wypowiedzi Google i Bing. Każdy link to link bezpośredni, który przenosi do cytowanego fragmentu na stronie źródłowej.
Google — definicja
- “The amount of time and resources that Google devotes to crawling a site is commonly called the site’s crawl budget and it’s determined by two main elements: crawl capacity limit and crawl demand.” (tłumaczenie) „Ilość czasu i zasobów, które Google poświęca na indeksowanie witryny, jest powszechnie nazywana budżetem indeksowania witryny i jest określana przez dwa główne elementy: limit przepustowości indeksowania i zapotrzebowanie na indeksowanie.” — Google Search Central docs. Przejdź do cytatu
- “Google’s crawlers calculate a crawl capacity limit, which is the maximum number of simultaneous parallel connections that Google can use to crawl a site, as well as the time delay between fetches.” (tłumaczenie) „Robotami Google obliczają limit przepustowości indeksowania, który jest maksymalną liczbą równoczesnych połączeń równoległych, które Google może wykorzystać do indeksowania witryny, a także opóźnieniem między pobraniami.” Przejdź do cytatu
- “Taking crawl rate and crawl demand together we define crawl budget as the number of URLs Googlebot can and wants to crawl.” (tłumaczenie) „Łącząc tempo indeksowania i zapotrzebowanie na indeksowanie, definiujemy budżet indeksowania jako liczbę adresów URL, które Googlebot może i chce indeksować.” — Gary Illyes, Google (2017). Przejdź do cytatu
Google — kiedy nie musisz się tym przejmować
- “If your site doesn’t have a large number of pages that change rapidly, or if your pages seem to be crawled the same day that they are published, you don’t need to read this guide.” (tłumaczenie) „Jeśli Twoja witryna nie ma dużej liczby stron, które szybko się zmieniają, lub jeśli Twoje strony wydają się być indeksowane tego samego dnia, w którym są publikowane, nie musisz czytać tego przewodnika.” Przejdź do cytatu
- “100k URLs is usually not enough to affect crawl budget (it’s <1/minute over 3 months).” (tłumaczenie) „Sto tysięcy adresów URL zwykle nie wystarcza, aby wpłynąć na budżet indeksowania (to mniej niż jeden na minutę przez trzy miesiące).” — John Mueller, Google (2021). Przeczytaj relację
Google — co kontrolujesz, a indeksowanie a pozycjonowanie
- “If many of these URLs are duplicates, or you don’t want them crawled for some other reason (removed, unimportant, and so on), this wastes a lot of Google crawling time on your site. This is the factor that you can positively control the most.” (tłumaczenie) „Jeśli wiele z tych adresów URL to duplikaty lub nie chcesz, aby były indeksowane z innego powodu (usunięte, nieistotne itd.), marnuje to dużo czasu indeksowania Google na Twojej witrynie. To czynnik, który możesz najbardziej pozytywnie kontrolować.” Przejdź do cytatu
- “An increased crawl rate will not necessarily lead to better positions in Search results. Google uses hundreds of signals to rank the results, and while crawling is necessary for being in the results, it’s not a ranking signal.” (tłumaczenie) „Zwiększone tempo indeksowania niekoniecznie doprowadzi do lepszych pozycji w wynikach wyszukiwania. Google używa setek sygnałów do rankowania wyników, a chociaż indeksowanie jest konieczne, aby znaleźć się w wynikach, nie jest sygnałem rankingowym.” — Gary Illyes, Google (2017). Przejdź do cytatu
Google — lista strat i czego nie robić
- “Faceted navigation and session identifiers / On-site duplicate content / Soft error pages / Hacked pages / Infinite spaces and proxies / Low quality and spam content” (tłumaczenie) „Nawigacja fasetowa i identyfikatory sesji / duplikaty treści w witrynie / strony z błędami miękkimi / zhakowane strony / nieskończone przestrzenie i serwery proxy / treści niskiej jakości i spam” — kategorie o niskiej wartości dodanej, w kolejności istotności. — Gary Illyes, Google (2017). Skocz do cytatu
- “Consolidate duplicate content to focus crawling on unique content rather than unique URLs.” (tłumaczenie) „Skonsoliduj zduplikowane treści, aby skupić crawlowanie na unikalnej treści, a nie na unikalnych URL-ach”. Skocz do cytatu
- “Don’t use noindex, as Google will still request, but then drop the page when it sees a noindex meta tag or header in the HTTP response, wasting crawling time.” (tłumaczenie) „Nie używaj noindex: Google nadal pobierze stronę, a potem odrzuci ją po wykryciu tagu meta noindex lub nagłówka w odpowiedzi HTTP, marnując czas crawlowania”. Skocz do cytatu
- “Google won’t shift this newly available crawl budget to other pages unless Google is already hitting your site’s serving limit.” (tłumaczenie) „Google nie przeniesie nowo dostępnego budżetu crawlowania na inne strony, chyba że już osiąga limit obsługi witryny”. Skocz do cytatu
Gary Illyes, Google — planowanie i obciążenie hosta (via relacji Search Engine Roundtable z sesji Q&A Stone Temple)
- “Host load kind of sets a bucket of URLs in importance order and GoogleBot will crawl in that order based on the schedule the host load decided. If Google thinks your server can handle it, it will crawl the whole bucket, if not, it will stop.” (tłumaczenie) „Obciążenie hosta układa pulę URL-i według ważności, a Googlebot crawluje je w tej kolejności zgodnie z harmonogramem wyznaczonym przez obciążenie. Jeśli uzna, że serwer sobie poradzi, scrawluje całą pulę; w przeciwnym razie się zatrzyma”. Skocz do cytatu
Fabrice Canel, Microsoft Bing
- “The crawl efficiency is how often we crawl and discover new and fresh content per page crawled.” (tłumaczenie) „Efektywność crawlowania określa, jak często crawlujemy oraz odkrywamy nową i świeżą treść na każdą scrawlowaną stronę”. Skocz do cytatu
- “Less is more for SEO. Never forget that. Less URLs to crawl, better for SEO.” (tłumaczenie) „W kontekście SEO warto pamiętać, że mniej znaczy więcej: ograniczenie liczby URL-i do crawlowania sprzyja lepszym wynikom”. Skocz do cytatu
Lista kontrolna optymalizacji budżetu indeksowania
Warto się tym zająć tylko wtedy, gdy potwierdzisz, że faktycznie masz problem z budżetem (duża witryna, wolne indeksowanie tego samego dnia lub rosnący stos „Odkryto – obecnie nie zaindeksowano”). Następnie:
- Potwierdzono, że problem jest realny — sprawdzono statystyki indeksowania w GSC oraz „Odkryto – obecnie nieindeksowane” przed optymalizacją czegokolwiek.
- Wybrano jedną kanoniczną konwencję (host, protokół, końcowy ukośnik, wielkość liter) i skonsolidowano duplikaty do niej.
- Obsłużono parametry URL — skanonizowano lub zablokowano te, które tworzą tylko zduplikowane/małowartościowe warianty.
- Okiełznano nawigację fasetową — zablokowano bezwartościowe kombinacje filtrów/sortowania w
robots.txtlub przeniesiono je za#, aby nie były indeksowane. - Naprawiono miękkie błędy 404; zwracanie prawdziwych
404/410dla trwale usuniętych stron. - Usunięto lub skrócono łańcuchy przekierowań.
- Mapy witryn zawierają tylko kanoniczne, indeksowalne adresy URL z dokładnym
lastmod. - Nie używano
noindex, aby „oszczędzić” budżet (Google i tak to żąda) i nie oczekiwano, że blokadyrobots.txtprzeniosą budżet na inne strony. - Wzmocniono linki wewnętrzne do ważnych i nowo opublikowanych stron.
- Poprawiono czas odpowiedzi serwera i wydajność ładowania stron.
- (Bing) Przyjęto IndexNow, aby wypychać zmiany; używano Crawl Control, jeśli obciążenie serwera jest ograniczeniem.
Modele mentalne
1. Budżet = przepustowość × zapotrzebowanie. Przepustowość indeksowania to, co Twój serwer może przyjąć; zapotrzebowanie na indeksowanie to popularność + nieaktualność + postrzegany zasób. Oba muszą być obecne: szybki serwer z niskim zapotrzebowaniem nadal jest indeksowany rzadziej, a wysokie zapotrzebowanie ogranicza przeciążony serwer. Aby zwiększyć efektywny budżet, prawie zawsze usuwasz marnotrawstwo, a nie „prosisz o więcej”.
2. Brama „czy w ogóle mam problem?”. Uruchom to przed dotknięciem czegokolwiek:
- Strony indeksowane tego samego dnia, w którym publikują? → Brak problemu. Zatrzymaj się tutaj.
- Poniżej ~100k adresów URL (reguła kciuka Muellera)? → Prawie na pewno brak problemu.
- 1 mln+ stron zmieniających się co tydzień lub 10 tys.+ zmieniających się codziennie lub duża sterta „Odkryto – obecnie nieindeksowane”? → Teraz warto poświęcić czas.
3. Usuń marnotrawstwo, zanim poprosisz Google o więcej indeksowania. Najważniejsza idea na tej stronie. Google próbuje indeksować wszystko, o czym wie; jeśli połowa to duplikaty, fasety i miękkie błędy 404s, wydaje Twój budżet na śmieci. Wytnij śmieci, a budżet skonsoliduje się na stronach, które mają znaczenie — to „czynnik, który możesz pozytywnie kontrolować najbardziej”.
4. Indeksowanie ≠ ranking. Indeksowanie to brama, a nie tablica wyników. Więcej indeksowania nie podniesie pozycji. Celem jest więc pokrycie właściwych adresów URL, nigdy surowa liczba indeksowanych stron.
5. To kolejka priorytetowa, a nie limit. Wewnętrznie to planowanie według ważności ograniczone obciążeniem hosta — priorytetyzowany zasobnik adresów URL, a nie płaskie „N stron dziennie”. Przesuwasz się w górę kolejki, będąc ważniejszym (linki, zapotrzebowanie) i nie marnując pobrań.
Budżet indeksowania — ściągawka
Co go marnuje (kolejność ważności wg Google)
| # | Kategoria | Typowa przyczyna |
|---|---|---|
| 1 | Nawigacja fasetowa i identyfikatory sesji | Kombinacje filtrów/sortowania w e-commerce mnożące adresy URL |
| 2 | Zduplikowane treści na stronie | www/non-www, HTTP/HTTPS, ukośnik, wielkość liter, index, parametry |
| 3 | Miękkie strony błędów | Strony „Nie znaleziono” zwracające 200 |
| 4 | Zhakowane strony | Wstrzyknięte spamowe adresy URL |
| 5 | Nieskończone przestrzenie i proxy | Kalendarze, nieskończone przewijanie, kombinacje fasetowe |
| 6 | Treści niskiej jakości i spam | Cienkie/automatycznie generowane strony |
Plus: długie łańcuchy przekierowań i wolne/ciężkie strony sprawiają, że każde pobranie kosztuje więcej.
Czy w ogóle musisz się tym przejmować?
- Indeksowanie tego samego dnia → nie.
- < ~100k adresów URL (Mueller) → prawie na pewno nie.
- 1 mln+ stron zmieniających się co tydzień, lub 10 tys.+ zmieniających się codziennie, lub duża sterta „Odkryto – obecnie nieindeksowane” → tak.
Działające poprawki
- Skonsoliduj duplikaty / skanonizuj.
- Zablokuj bezwartościowe ścieżki w
robots.txt(fasety, parametry) — nigdy nie używajnoindex, aby „oszczędzić” budżet. - Napraw miękkie błędy 404s; zwracaj prawdziwe
404/410. - Skróć łańcuchy przekierowań; przyspiesz serwer.
- Wyczyść mapy witryn; wzmocnij linki wewnętrzne.
Tylko dwa sposoby na zwiększenie budżetu (Google): większa przepustowość serwera oraz wyższa jakość treści. Jedno bez drugiego nie wystarczy.
Bing: to „wydajność indeksowania” — przyspieszaj z IndexNow, planuj z Crawl Control.
Narzędzia do pomiaru i zarządzania budżetem indeksowania
- Google Search Console — raport Crawl Stats (Ustawienia → Crawl Stats) — własny widok Google: całkowita liczba żądań w czasie, średni czas odpowiedzi, status hosta oraz podział według kodu odpowiedzi, typu pliku i typu Googlebota. Zacznij tutaj.
- GSC „Wykryto – obecnie nieindeksowane” (raport Strony) — lampka ostrzegawcza dla adresów URL, które Google zna, ale nie indeksuje.
- Analiza plików dziennika serwera — źródło prawdy o tym, które adresy URL boty faktycznie odwiedzają i jak często. Narzędzia: Screaming Frog Log File Analyser lub przesyłanie dzienników do BigQuery / platformy dzienników. (Zobacz analiza plików dziennika.)
- Ahrefs Site Audit / Screaming Frog SEO Spider — symuluj indeksowanie, aby wykryć zduplikowane adresy URL, łańcuchy przekierowań, miękkie błędy 404s, zablokowane adresy URL i pułapki w przestrzeniach fasetowych.
- Ahrefs Webmaster Tools — darmowe indeksowanie i audyt dla zweryfikowanych witryn.
- URL Inspection (GSC) — szybka kontrola tego samego dnia dla pojedynczego adresu URL.
- Bing Webmaster Tools — Crawl Control — zaplanuj indeksowanie bingbota według godzin, jeśli obciążenie serwera jest ograniczeniem.
Czy masz problem z budżetem indeksowania?
Should you work on crawl budget now?
Miesięczna kontrola kondycji budżetu indeksowania
- Eksportuj żądania robotów indeksujących z dzienników serwera dla tego samego okresu raportowania każdego miesiąca.
- Podziel żądania według kodu statusu, katalogu, typu strony i tego, czy adres URL jest indeksowalny.
- Przejrzyj wzorce parametrów o dużej liczbie żądań, zduplikowane ścieżki, przekierowania, miękkie błędy 404s i błędy serwera.
- Porównaj udział w indeksowaniu wartościowych szablonów z poprzednim okresem i opisz wdrożenia lub migracje.
- Przypisz każdemu nowemu wzorcowi marnotrawstwa właściciela i kontrolę: linki, parametry, przekierowania, kanonikalizację, usuwanie lub naprawę serwera.
- Sprawdź ponownie dotknięty wzorzec w następnym oknie dziennika; procedura SOP jest zakończona, gdy wartościowe adresy URL zachowują dostęp, a marnotrawstwo spada w porównaniu z bazową wartością witryny.
Błędy w budżecie indeksowania
- Dążenie do większej liczby żądań. Więcej indeksowania nie poprawia pozycji. Zamiast tego śledź, czy ważne adresy URL są indeksowane, gdy jest to potrzebne.
- Blokowanie marnotrawstwa tylko w robots.txt. To może zatrzymać pobieranie bez usuwania wykrytych adresów URL lub naprawiania linków, które je tworzą. Usuń ścieżki indeksowania i skonsoliduj inwentarz tam, gdzie to właściwe.
- Aktualizowanie każdego
lastmodw mapie witryny przy każdej kompilacji. Fałszywa świeżość uczy roboty, aby nie ufały temu sygnałowi. Zmieniaj go tylko przy znaczących aktualizacjach stron. - Ignorowanie błędów serwera podczas dostrajania wzorców adresów URL. Problem z wydajnością ogranicza użyteczne indeksowanie. Najpierw napraw przekroczenia czasu i odpowiedzi 5xx.
- Traktowanie każdego wykluczonego adresu URL jako marnotrawstwa. Niektóre nieindeksowane zasoby wspierają renderowanie lub wykrywanie. Sklasyfikuj cel przed zablokowaniem czegokolwiek.
Prompt: klasyfikuj marnotrawstwo w dzienniku indeksowania
Wklej plik CSV z dziennika z kolumnami: URL, szablon, status, bot, trafienia, bajty i indeksowalność. Najpierw usuń wartości zapytań lub dane użytkownika.
Act as a technical SEO analyst. Classify each URL pattern as valuable crawling, necessary support crawling, redirect/error waste, duplicate/parameter waste, or unclear. Do not infer intent from the URL alone: list the evidence needed for every unclear row. Rank patterns by crawler requests and bytes, propose the safest control, and state what could break if that control is wrong. Return a table plus a short validation plan.Prompt: zakwestionuj diagnozę budżetu indeksowania
Review the crawl-budget diagnosis below. Separate evidence of capacity, demand, discovery, and URL-inventory problems. Flag claims that confuse crawling with indexing or rankings. Then give the three smallest tests that would confirm or reject the diagnosis. Do not invent thresholds; use changes against the site's own baseline.
[PASTE DIAGNOSIS AND OBSERVATIONS] Podsumuj kody statusu robota z dziennika dostępu
Uruchom to na dzienniku w stylu nginx/Apache po dostosowaniu wzorca bota do zweryfikowanego ruchu robota:
awk 'BEGIN{IGNORECASE=1} /Googlebot|bingbot/ {print $9}' access.log | sort | uniq -c | sort -nrW PowerShell:
Select-String -Path .\access.log -Pattern 'Googlebot|bingbot' | ForEach-Object { if ($_.Line -match '"\s(\d{3})\s') { $Matches[1] } } | Group-Object | Sort-Object Count -DescendingWyodrębnij rodziny parametrów zapytań
Użyj tego wyrażenia regularnego w eksporcie robota lub edytorze tekstu, aby przechwycić pierwszą nazwę parametru zapytania:
\?([^=&]+)(?:=[^&]*)?Grupa 1 to nazwa parametru. Wysoka liczba żądań identyfikuje wzorce do zbadania, a nie adresy URL do automatycznego blokowania.
Sprawdź się: Budżet indeksowania
Zasoby warte Twojego czasu
Moje powiązane artykuły
- Kiedy powinieneś martwić się o budżet indeksowania? — mój pełny przewodnik Ahrefs na ten temat, ze szczegółami optymalizacji i decyzjami dotyczącymi nawigacji fasetowej.
- Jak naprawić „Wykryto – obecnie nieindeksowane” — sygnał GSC, który służy również jako lampka ostrzegawcza budżetu indeksowania.
- Początkowy przewodnik po technicznym SEO — gdzie budżet indeksowania wpisuje się w szerszy obraz.
- Strategie SEO dla przedsiębiorstw — dla mniejszości dużych witryn, które faktycznie tego potrzebują.
Moje wystąpienia
- Jak działa wyszukiwarka (SlideShare) — mój przewodnik po modelu zapotrzebowania na indeksowanie a limitu szybkości indeksowania. Stałe zastrzeżenie: “This is my understanding of systems… not going to be 100% complete or accurate.” (tłumaczenie) „Tak rozumiem te systemy… opis nie będzie w stu procentach kompletny ani dokładny”.
Z branży
- Seria Google Crawling December (oficjalna, ale najlepszy skondensowany zbiór wyjaśnień dotyczących indeksowania, w tym nawigacji fasetowej).
- Google wyjaśnia webmasterom znaczenie „crawl budget” (Barry Schwartz, Search Engine Land, 2017) — przystępne podsumowanie oryginalnego wpisu Google o budżecie indeksowania; dobre dla kontekstu “most sites don’t need to worry” (tłumaczenie) „większość witryn nie musi się tym martwić”.
- Gary Illyes wyjaśnia różnicę między budżetem crawlowania, harmonogramem i obciążeniem hosta (Search Engine Roundtable) — źródło dla ram „koszyka według ważności” i obciążenia hosta, które pokazują, że to kolejka priorytetowa, a nie płaski limit.
- Google: 100 000 URL-i zwykle nie wpływa na budżet crawlowania (Search Engine Roundtable, 2021) — konkretny punkt odniesienia Muellera i kontekst mniej niż jednego URL-a na minutę przez trzy miesiące.
- Priorytety crawlowania Google: spostrzeżenia analityka Gary’ego Illyesa (Search Engine Journal) — omawia obalenie mitu stałego dziennego limitu stron i podejście polegające na przekonaniu wyszukiwarki, że treści są warte pobrania.
- Pięć bram infrastruktury stojących za crawlowaniem, renderowaniem i indeksowaniem (Search Engine Land) — źródło cytatu Fabrice’a Canela o zasadzie „mniej znaczy więcej” i filozofii Bingu dotyczącej efektywności indeksowania.
- Seria bingbot: optymalizacja częstotliwości crawlowania (Bing Webmaster Blog, Fabrice Canel) — jak Bing decyduje o częstotliwości ponownego indeksowania; uzupełnienie wpisu o maksymalizacji efektywności crawlowania.
- r/TechSEO — społeczność do debugowania indeksowania i indeksu.
Statystyki, które warto cytować
- Sto tysięcy URL-i zwykle nie wystarcza, by miało to znaczenie. Konkretny punkt odniesienia Johna Muellera: “100k URLs is usually not enough to affect crawl budget (it’s <1/minute over 3 months).” (tłumaczenie) „Sto tysięcy URL-i zwykle nie wystarcza, aby wpłynąć na budżet crawlowania; to mniej niż jeden URL na minutę przez trzy miesiące”. Najbardziej przydatna liczba do studzenia obaw o budżet indeksowania. Źródło
- Progi, od których zaczyna to mieć znaczenie: 1 mln+ stron zmieniających się mniej więcej co tydzień lub 10 tys.+ stron zmieniających się codziennie (szacunki Google, a nie dokładne progi). Źródło
- ~60 % internetu to zduplikowane treści — wewnętrzny szacunek Google, dlatego zduplikowane URL-e są tak pewnym drenażem budżetu indeksowania. Źródło
Stały KPI efektywności indeksowania
Budżet indeksowania to nie liczba, którą Google Ci podaje — wnioskujesz ją z tego, gdzie Googlebot faktycznie wydaje swoje żądania. KPI to podział: ile indeksowania trafia na strony, które chcesz mieć w indeksie, a ile na strony, które są czystym marnotrawstwem. (Najpierw uczciwość: to ma znaczenie tylko na dużą skalę — Google mówi, że budżet indeksowania to problem głównie dla witryn o około 1 mln+ stron lub średnich witryn generujących wiele automatycznie tworzonych URL-i. Mała statyczna witryna może całkowicie pominąć ten wskaźnik.)
Alokacja indeksowania — wartościowe a zmarnowane żądania
- Metryka — Udział zweryfikowanych żądań Googlebota trafiających na ważne, indeksowalne adresy URL w porównaniu z zmarnowanymi (duplikaty, adresy URL z parametrami/fasetami, warianty niekanoniczne, przekierowania, 4xx/5xx).
- Co Ci to mówi — Czy Twoja przepustowość indeksowania jest wydawana na strony, które mogą się rankingować. Rosnący udział zmarnowanych żądań jest wiodącym wskaźnikiem opóźnień w odkrywaniu/indeksowaniu, zanim jeszcze pojawi się to jako problem z rankingiem.
- Jak to wyciągnąć — Przepuść logi serwera przez Log File Analyzer i podziel zweryfikowane żądania Googlebota według klasy adresów URL; potwierdź to raportem Crawl Stats w GSC (całkowita liczba żądań, według odpowiedzi, według celu pliku, status hosta).
- Benchmark / realistyczny zakres — Zależnie od sytuacji — nie ma uczciwego uniwersalnego „procentu zmarnowanych”, ponieważ zależy to od architektury Twoich adresów URL. Ustal własną bazę i z czasem zmniejszaj udział zmarnowanych; trend jest sygnałem, a nie wymyślona absolutna liczba.
- Częstotliwość — Miesięcznie, a częściej zaraz po zmianie strukturalnej (nowe fasety, migracja) lub gdy Crawl Stats pokaże nagły wzrost żądań lub odpowiedzi 4xx/5xx. Zmarnowane indeksowanie to wiodąca metryka; liczba zindeksowanych stron pozostaje w tyle.
Dziennik zmian
Zaktualizowano 11 sie 2026.
Podsumowanie redakcyjne i zapisane szczegóły zmian.Szczegóły zmian
-
Szczegółowe uwagi dotyczące zmian są obecnie dostępne po angielsku.
Pełne porównanie jest niedostępne — dla tej wersji nie zarchiwizowano wcześniejszej migawki.
Zaktualizowano 27 lip 2026.
Podsumowanie redakcyjne i zapisane szczegóły zmian.Szczegóły zmian
-
Szczegółowe uwagi dotyczące zmian są obecnie dostępne po angielsku.
Pełne porównanie jest niedostępne — dla tej wersji nie zarchiwizowano wcześniejszej migawki.
Zaktualizowano 17 lip 2026.
Podsumowanie redakcyjne i zapisane szczegóły zmian.Szczegóły zmian
-
Szczegółowe uwagi dotyczące zmian są obecnie dostępne po angielsku.
-
Szczegółowe uwagi dotyczące zmian są obecnie dostępne po angielsku.
-
Szczegółowe uwagi dotyczące zmian są obecnie dostępne po angielsku.
Pełne porównanie jest niedostępne — dla tej wersji nie zarchiwizowano wcześniejszej migawki.