Znacznik meta robots
Znacznik meta robots określa sposób indeksowania i prezentowania strony — od poszczególnych dyrektyw i zasady „najpierw pobierz, potem zastosuj” po rozwiązywanie konfliktów oraz różnice między znacznikiem meta a nagłówkiem X-Robots-Tag.
Języki
1 sygnał dowodowy na tej stronie
- Powiązane działające narzędzieHTTP Header Checker
Znacznik meta robots — <meta name="robots" content="noindex"> w sekcji <head> — informuje wyszukiwarki, jak indeksować i prezentować pojedynczą stronę. Kluczowa jest zasada „najpierw pobierz, potem zastosuj”: strony zablokowanej w robots.txt robot nie pobierze, więc nie zobaczy jej noindex. Bez znacznika domyślnie obowiązuje index, follow. W razie konfliktu stosowana jest najbardziej restrykcyjna reguła; dla znacznika googlebot i ogólnego znacznika robots Googlebot przyjmuje sumę reguł negatywnych. Znacznik działa tylko w HTML — dla plików PDF, obrazów i innych zasobów nie-HTML użyj nagłówka X-Robots-Tag.
TL;DR — Tag meta robots to linia HTML, którą umieszczasz w
<head>strony, aby powiedzieć wyszukiwarkom, jak mają traktować tę jedną stronę — najczęściej<meta name="robots" content="noindex">, aby wykluczyć ją z wyników wyszukiwania. Haczyk, który wszystkich łapie: Google musi być w stanie przeskanować stronę, aby przeczytać tag. Jeśli zablokujesz stronę wrobots.txt, Google nigdy nie zobaczy tagu, a strona może pozostać w wynikach wyszukiwania. Bez żadnego tagu domyślnie obowiązuje „indeksuj i podążaj za linkami”.
Czym jest tag meta robots
Tag meta robots to mały element HTML, który znajduje się w <head> strony:
<meta name="robots" content="noindex">Mówi wyszukiwarkom, jak traktować tę konkretną stronę — czy pokazać ją
w wynikach, czy podążać za linkami na niej, czy pokazać fragment, i tak dalej.
Część name="robots" oznacza „wszystkie wyszukiwarki, które czytają ten tag.” Możesz
zamienić ją na nazwę robota indeksującego, np. name="googlebot", aby mówić tylko do jednej wyszukiwarki.
Jeśli na stronie nie ma tagu meta robots, domyślnie obowiązuje index, follow — pokaż
ją w wynikach wyszukiwania i podążaj za jej linkami. Więc tag jest potrzebny tylko wtedy, gdy chcesz
zmienić ten domyślny stan. Evidence for this claim For Google, the default robots meta behavior is index, follow when no restrictive rule is present. Scope: Google-supported robots meta rules; other crawlers publish their own support and defaults. Confidence: high · Verified: Google Search Central: Robots meta tag specifications
Jedna rzecz, którą trzeba zrobić dobrze: nie blokuj strony, którą próbujesz wykluczyć z indeksu
To błąd, który widzę najczęściej. Ludzie chcą usunąć stronę z Google, więc robią obie rzeczy naraz:
- Dodają
noindexdo strony, oraz - Blokują stronę w
robots.txt.
Ten drugi krok niweczy pierwszy. Zablokowanie adresu URL w robots.txt mówi Google
„nie pobieraj nawet tej strony.” Więc Google nigdy jej nie pobiera, nigdy nie czyta
noindex, a strona może pozostać w indeksie. Rozwiązaniem jest pozostawienie strony
możliwej do przeszukania i pozwolenie Google na przeczytanie noindex. Evidence for this claim Google can read and follow page-level robots rules only when it is allowed to access the page. Scope: Google-supported robots meta and X-Robots-Tag rules; robots.txt blocking can prevent rule discovery. Confidence: high · Verified: Google Search Central: Robots meta tag specifications
Pomyśl o tym jak o dwóch różnych zadaniach:
robots.txtkontroluje przeszukiwanie — czy boty w ogóle pobierają stronę.- Tag meta robots kontroluje indeksowanie i serwowanie — co się dzieje, gdy strona zostanie pobrana.
Nie są one wymienne i nie chcesz mieć obu na tym samym adresie URL, gdy Twoim celem jest usunięcie go z wyników wyszukiwania.
The same page contains a meta robots noindex directive. In the first path, crawling is allowed, so the crawler fetches the page, reads noindex, and can remove the URL from results after processing. In the second path, robots.txt blocks crawling, so the crawler cannot fetch the page or see noindex, and the URL may remain in results. Crawl control and index control are separate jobs.
© Patrick Stox LLC · CC BY 4.0 ·
Typowe dyrektywy
Kilka, których faktycznie użyjesz:
noindex— wyklucz tę stronę z wyników wyszukiwania.nofollow— nie podążaj za linkami na tej stronie. (Inaczej niż w przypadku umieszczeniarel="nofollow"na pojedynczym linku — ta dyrektywa dotyczy każdego linku na stronie.)none— skrót dlanoindex, nofollow.nosnippet— nie pokazuj fragmentu tekstu dla tej strony w wynikach.
Możesz je łączyć przecinkiem: <meta name="robots" content="noindex, nofollow">.
Kilka uczciwych pułapek
noindexnie czyni strony prywatną. Strona jest nadal publiczna i możliwa do przeszukania — po prostu nie pojawi się w wynikach wyszukiwania. Dla prawdziwej prywatności użyj logowania.noindexnie oszczędza budżetu przeszukiwania. Google nadal musi pobrać stronę, aby zobaczyć tag.- W przypadku pliku PDF lub obrazu nie można dodać tagu
<meta>— nie ma tam HTML-owego<head>. Do tego służy nagłówek HTTP X-Robots-Tag (więcej na ten temat w wersji Advanced). - Nie ma ustalonego czasu na wypadnięcie strony z
noindexz Google. Google mówi, że usunięcie strony o niższym priorytecie z indeksu może zająć miesiące — nie obiecuj klientowi „2–4 tygodni”.
Chcesz pełną listę dyrektyw, sposób, w jaki Google rozwiązuje sprzeczne reguły, przypadek
brzegowy googlebot-vs-robots oraz nagłówek X-Robots-Tag w szczegółach? Przełącz
się na zakładkę Advanced.
Sprawdź się: dyrektywy meta robots
Wybierz kontrolę według rezultatu
Which robots control should I use?
Kontrole robotów, które nie spełniają swojego zadania
- Łączenie
noindexz blokadą w robots.txt. Blokada uniemożliwia crawlerowi zobaczenie dyrektywy usunięcia. - Używanie
disallowjako gwarancji deindeksacji. Zatrzymuje pobieranie, ale linkowany URL może być nadal indeksowany bez treści strony. - Zakładanie, że meta tag robots umieszczony w body jest po cichu ignorowany.
Google mówi, że będzie respektować meta tag robots w body, więc szablon, który
wstrzykuje go tam, nadal działa dla Google — ale mimo to trzymaj się umieszczenia
w
<head>, ponieważ to jedyne miejsce, którego inne crawler i walidatory są gwarantowane oczekiwać. - Używanie tokena nazwy crawlera, którego Google nie czyta (np.
name="bingbot") i zakładanie, że również ogranicza regułę dla Google. Google rozpoznaje tylkogooglebotigooglebot-news; każda inna wartość nazwy jest całkowicie ignorowana przez Google. - Używanie meta tagu HTML dla pliku PDF. Serwuj
X-Robots-Tagw odpowiedzi HTTP dla plików niebędących HTML. - Traktowanie
nofollowjakonoindex. Obsługa linków nie usuwa bieżącej strony z wyników. - Publikowanie ogólnych i specyficznych dla crawlera tagów bez rozstrzygania sumy.
Audytuj wszystkie dyrektywy
robots,googleboti nagłówki razem; restrykcyjna reguła może przetrwać w drugiej lokalizacji. - Używanie reguł robots do tajności. Każdy może zażądać publicznego URL lub
przeczytać
robots.txt; poufne treści wymagają uwierzytelnienia.
Bezpieczne wdrożenie noindex
- Potwierdzono, że usunięcie z wyszukiwania — a nie redukcja indeksowania, konsolidacja kanoniczna lub kontrola dostępu — jest zamierzonym rezultatem.
- Użyto
<meta name="robots" content="noindex">dla HTML lub nagłówka odpowiedziX-Robots-Tag: noindexdla zasobu niebędącego HTML. - URL pozostał dostępny do indeksowania i dostępny dla docelowego crawlera.
- Usunięto sprzeczne dyrektywy z szablonu, CMS, CDN i specyficzne dla crawlera.
- Sprawdzono wyrenderowany head i rzeczywistą odpowiedź, nie tylko szablon źródłowy.
- Przetestowano zarówno kanoniczny URL, jak i znaczące warianty lub przekierowania.
- Zanotowano zestaw dotkniętych URL-i i czas wdrożenia do późniejszego porównania.
- Zweryfikowano regułę w URL Inspection i monitorowano raport Page Indexing po ponownym indeksowaniu.
- Użyto uwierzytelniania zamiast tego, jeśli treść musi być prywatna.
Sprawdź meta, nagłówki i dostęp crawlera
Zastąp URL w tym audycie powłoki:
url="https://example.com/page/"
curl -sSI "$url" | grep -iE '^(HTTP/|x-robots-tag:|location:)'
curl -sS "$url" | grep -oiE '<meta[^>]+name=["'"'](robots|googlebot)["'"'][^>]*>'
curl -sS "https://example.com/robots.txt"W konsoli DevTools zinwentaryzuj każdy sparsowany tag robots, zamiast zatrzymywać się na pierwszym dopasowaniu:
console.table([...document.querySelectorAll('meta[name]')]
.filter((meta) => /^(robots|googlebot|bingbot)$/i.test(meta.name))
.map((meta) => ({ crawler: meta.name, content: meta.content })));Nagłówki nie są widoczne w DOM, więc porównaj wynik konsoli z rzeczywistą odpowiedzią. Śledź też przekierowania: dyrektywa na odpowiedzi pośredniej nie dowodzi, że miejsce docelowe serwuje tę samą regułę.
Przetestuj każdą warstwę osobno
- HTTP Header Checker — sprawdź status, przekierowania
i każdy rzeczywisty nagłówek
X-Robots-Tag, w tym dla plików PDF. - Robots.txt Tester — sprawdź, czy docelowy crawler może pobrać URL, a tym samym odkryć dyrektywę robots.
Użyj obu podczas diagnozowania uporczywie indeksowanego URL. Poprawna odpowiedź noindex nie jest użyteczna, jeśli robots.txt uniemożliwia pobranie, a dozwolone indeksowanie nie dowodzi, że strona faktycznie serwuje noindex.
Udowodnij, że dyrektywa działa po wdrożeniu
Test 1 — Dostarczanie na żywo
- Hipoteza: Każdy zamierzony URL serwuje jedną skuteczną regułę
noindex. - Metoda: Pobierz próbkę zestawu URL-i, śledź przekierowania i sprawdź wyrenderowane meta oraz nagłówki odpowiedzi.
- Warunek zaliczenia: Finalna odpowiedź jest dostępna do indeksowania i
ujawnia
noindexzamierzonemu crawlerowi bez żadnej sprzecznej ścieżki dostarczania. - Warunek niezaliczenia: Przekierowanie, nagłówek CDN lub tag specyficzny dla crawlera to zmienia.
- Następne działanie: Napraw odpowiedzialną warstwę i powtórz tę samą próbkę.
Test 2 — Przetwarzanie przez wyszukiwarkę
- Hipoteza: Google może przeszukać stronę i przetworzył regułę usunięcia.
- Metoda: Uruchom test na żywo w URL Inspection, a następnie monitoruj raport Page Indexing po ponownym przeszukaniu.
- Warunek zaliczenia: Test na żywo wykrywa noindex, a URL przestaje być indeksowany z tego powodu.
- Warunek niezaliczenia: URL jest zablokowany, dyrektywa jest nieobecna lub stary stan indeksu utrzymuje się bez nowego przeszukania.
- Następna akcja: Przywróć dostęp do przeszukiwania lub poproś o ponowne przeszukanie; nie dodawaj disallow.
Mierz intencję, nie uniwersalny benchmark
Pokrycie zamierzonego noindex
URLs serving the intended noindex ÷ URLs in the approved noindex set
Zbuduj mianownik z własnego inwentarza usunięć, a następnie porównaj przeszukania przed i po wdrożeniu. Celem jest pełne pokrycie tego zatwierdzonego zestawu—nie procent branżowy.
Niezamierzone konflikty kontroli indeksu
Śledź liczby zamierzonych URL-i noindex, które są nadal indeksowane, zablokowane przez robots.txt, lub serwują sprzeczne reguły meta/nagłówków. Segmentuj według szablonu, reguły CDN i typu pliku, aby jedna wada implementacji nie ukryła się w ogólnej liczbie dla całej witryny.
Użyj raportu Page Indexing i URL Inspection w Google Search Console jako dowodu przetwarzania, pamiętając, że deindeksacja zależy od ponownego przeszukania. Zachowaj liczbę sprzed zmiany i datę wdrożenia; w przeciwnym razie spadająca suma nie ma wiarygodnej linii bazowej.
Evidence for this claim Google can read and follow page-level robots rules only when it is allowed to access the page. Scope: Google-supported robots meta and X-Robots-Tag rules; robots.txt blocking can prevent rule discovery. Confidence: high · Verified: Google Search Central: Robots meta tag specificationsTL;DR —
<meta name="robots" content="…">w<head>kontroluje, jak pojedyncza strona jest indeksowana i serwowana; bez tagu domyślnie jestindex, follow. Obowiązuje zasada najpierw pobierz, potem zastosuj: “these settings can be read and followed only if crawlers are allowed to access the pages” (tłumaczenie) „te ustawienia można odczytać i zastosować tylko wtedy, gdy roboty mają dostęp do stron” — dlatego URL zablokowany wrobots.txtnie zostanie pobrany, a jegonoindexpozostanie niewidoczne. Potwierdzają to moje własne dane z odwrotnego przypadku. Sprzeczne reguły rozstrzyga się na korzyść najbardziej restrykcyjnej; w przypadku tagugoogleboti ogólnego tagurobots, Googlebot przyjmuje sumę negatywnych reguł. Tag jest tylko HTML — użyj nagłówka X-Robots-Tag dla nie-HTML i na dużą skalę. Google czyta tylko dwa tokeny nazwane od przeszukiwaczy —googlebotigooglebot-news— i ignoruje każdą inną wartość, w tym tokeny innych silników, takie jakbingbot.
Co to jest, gdzie to umieścić i domyślna wartość
Znacznik meta robots pozwala, słowami Google, “use a granular, page-specific
approach to controlling how an individual HTML page should be indexed and served
to users in Google Search results.” (tłumaczenie) „stosować szczegółowe podejście na poziomie strony do kontrolowania sposobu indeksowania i prezentowania pojedynczej strony HTML użytkownikom wyników wyszukiwania Google”. Standardowym i przenośnym miejscem dla niego jest
<head>:
<meta name="robots" content="noindex, nofollow">Umieszczenie w <head> to konwencja autorska, której oczekuje każdy silnik, ale Google
wyraźnie stwierdza, że nie jest to bezwzględny wymóg tej wyszukiwarki: “Google
Search doesn’t enforce placement of meta robots in the HTML head and will respect
robots meta tags in the body section of an HTML document as well.” (tłumaczenie) „Wyszukiwarka Google nie wymusza umieszczenia znacznika meta robots w sekcji head i respektuje go również w sekcji body dokumentu HTML”. Traktuj to jako tolerancję Google, a nie przenośne zalecenie — nadal umieszczaj znacznik w <head>, aby poprawnie odczytał go każdy robot i walidator oczekujący standardowego położenia.
Atrybut name to grupa docelowa, i to tutaj większość przewodników przecenia
wsparcie Google. name="robots" adresuje każdego przeszukiwacza, który czyta tag.
Poza tym Google obsługuje dokładnie dwa tokeny nazw robotów i ignoruje każdą
inną wartość: “Google supports two user agent tokens in the robots meta tag;
other values are ignored: googlebot for all text results, and googlebot-news
for news results.” (tłumaczenie) „Google obsługuje w znaczniku meta robots dwa tokeny user-agent: googlebot dla wszystkich wyników tekstowych i googlebot-news dla wyników wiadomości; pozostałe wartości są ignorowane”. Znacznik name="bingbot" nie jest udokumentowanym mechanizmem sterowania Google —
Bing czyta swój własny token na własnych warunkach, ale Google pomija każdą wartość name,
której nie rozpoznaje. Zarówno atrybuty name, jak i content są
nierozróżniające wielkości liter dla Google, podobnie jak nazwy i wartości nagłówka X-Robots-Tag.
Gdy nie ma tagu robots meta, domyślnie jest
index, follow. Google zaznacza o regule all, że “has no effect if explicitly listed” (tłumaczenie) „nie wywołuje żadnego skutku, gdy zostanie podana jawnie”. Evidence for this claim For Google, the default robots meta behavior is index, follow when no restrictive rule is present. Scope: Google-supported robots meta rules; other crawlers publish their own support and defaults. Confidence: high · Verified: Google Search Central: Robots meta tag specifications Znacznik jest potrzebny tylko do zmiany wartości domyślnej.
Łączysz reguły na dwa sposoby: oddzielone przecinkami w jednym tagu (noindex, nofollow) lub jako
wiele tagów <meta>. Google wyjaśnia, że można “create a multi-rule instruction by
combining robots meta tag rules with commas or by using multiple meta tags.” (tłumaczenie) „utworzyć instrukcję z wieloma regułami, rozdzielając reguły znacznika meta robots przecinkami albo używając kilku znaczników meta”.
Reguła, która psuje wszystko: Google musi pobrać stronę, aby zobaczyć znacznik
To sedno całego artykułu. Znacznik meta robots działa według zasady najpierw pobierz, potem zastosuj. Google musi pobrać stronę, aby odczytać tag — więc wszystko, co zatrzymuje pobieranie, zatrzymuje tag przed zastosowaniem. Wprost ze specyfikacji:
Google ujmuje to wprost: “Keep in mind that these settings can be read and followed only if crawlers are allowed to access the pages that include these settings.” (tłumaczenie) „Należy pamiętać, że te ustawienia można odczytać i zastosować tylko wtedy, gdy roboty mają dostęp do stron, na których je umieszczono.”
Evidence for this claim Google can read and follow page-level robots rules only when it is allowed to access the page. Scope: Google-supported robots meta and X-Robots-Tag rules; robots.txt blocking can prevent rule discovery. Confidence: high · Verified: Google Search Central: Robots meta tag specificationsA konsekwencja, wyrażona wprost:
Dokumentacja podaje też konsekwencję: “If a page is disallowed from crawling through the robots.txt file, then any information about indexing or serving rules will not be found and will therefore be ignored.” (tłumaczenie) „Jeśli plik robots.txt blokuje pobieranie strony, informacje o regułach indeksowania lub prezentowania nie zostaną odnalezione, a więc będą zignorowane.”
Klasyczny błąd — Disallow w robots.txt plus noindex na tym samym
URL — po cichu niweczy noindex. Google nie pobiera strony, więc nie
widzi znacznika, a URL może pozostać w indeksie (często jako sam adres bez fragmentu,
jeśli coś do niego linkuje). Towarzyszący dokument Google o blokowaniu indeksowania
mówi to samo prostszym językiem: aby reguła noindex działała, strona
“must not be blocked by a robots.txt file… If the page is blocked by a
robots.txt file or the crawler can’t access the page, the crawler will never see
the noindex rule, and the page can still appear in search results.”
(tłumaczenie) „nie może być zablokowana przez plik robots.txt… Jeśli plik robots.txt blokuje stronę albo robot nie może uzyskać do niej dostępu, nigdy nie zobaczy reguły noindex, a strona może nadal pojawiać się w wynikach wyszukiwania.”
Obserwowałem odwrotną stronę tego mechanizmu na prawdziwych danych. W moim
eksperymencie Historia zablokowania dwóch wysoko pozycjonowanych stron za pomocą robots.txt,
celowo zablokowałem w robots.txt dwie nasze strony zajmujące wysokie pozycje. Ponieważ Google
nie mógł już ich pobierać, nie mógł odświeżyć informacji o nich — a
strony w większości utrzymały ranking: “We lost a position here or there and all of the
featured snippets for the pages.” (tłumaczenie) „Straciliśmy pozycję tu czy tam i wszystkie
wyróżnione fragmenty tych stron.” Moje wnioski: “Accidentally blocking pages
(that Google already ranks) from being crawled using robots.txt probably isn’t
going to have much impact on your rankings, and they will likely still show in the
search results.” (tłumaczenie) „Przypadkowe zablokowanie za pomocą robots.txt możliwości pobierania stron, które Google już plasuje wysoko, prawdopodobnie
nie wpłynie znacząco na ich pozycje i najpewniej nadal będą się pojawiać w
wynikach wyszukiwania.” To ta sama moneta co problem noindex — zablokowany URL jest
zamrożony. Blokada ≠ usunięcie. Jeśli naprawdę chcesz, aby strona zniknęła, potrzebujesz
strony dostępnej do pobrania z dyrektywą noindex — właśnie po to służy ten znacznik.
To jest linia, którą publicznie wyznaczyłem, gdzie należy każde narzędzie. Zapytany, czy Google
powinien dodać obsługę noindex do robots.txt, powiedziałem: “Google was clear
they want robots.txt for crawl control only.” (tłumaczenie) „Google jasno stwierdziło,
że chce, aby robots.txt służył wyłącznie do kontroli pobierania.” Sterowanie pobieraniem to zadanie robots.txt;
indeksowanie to zadanie tagu meta (lub nagłówka). Nie pokrywają się, a
dyrektywa noindex w robots.txt nigdy nie była oficjalnie wspierana — Google
zaprzestał jej parsowania 1 września 2019 r.
Każda dyrektywa meta robots (referencja)
Wspierane wartości Google, z dosłownymi opisami ze specyfikacji:
Indeksowanie
all— “There are no restrictions for indexing or serving. This rule is the default value and has no effect if explicitly listed.” (tłumaczenie) „Brak ograniczeń dla indeksowania lub serwowania. Ta reguła jest wartością domyślną i nie ma efektu, jeśli jest jawnie wymieniona.”noindex— “Do not show this page, media, or resource in search results.” (tłumaczenie) „Nie pokazuj tej strony, multimediów ani zasobu w wynikach wyszukiwania.”none— “Equivalent tonoindex, nofollow.” (tłumaczenie) „Oznacza dokładnie to samo co połączenie dyrektywnoindex, nofollow.”indexifembedded— “Google is allowed to index the content of a page if it’s embedded in another page through iframes or similar HTML tags, in spite of anoindexrule.” (tłumaczenie) „Google może indeksować treść strony, jeśli jest osadzona w innej stronie przez iframe lub podobne tagi HTML, mimo regułynoindex.” (Jedyna dyrektywa, która nadpisujenoindex, dla treści osadzonych.)
Linki
nofollow— “Do not follow the links on this page.” (tłumaczenie) „Nie podążaj za linkami na tej stronie.” To jest na poziomie strony — inny zakres niż per-linkrel="nofollow", który dotyczy jednego linku.
Serwowanie i snippety
nosnippet— “Do not show a text snippet or video preview in the search results for this page.” (tłumaczenie) „Nie pokazuj fragmentu tekstu ani podglądu wideo w wynikach wyszukiwania dla tej strony.” Ten zakres jest szerszy niż klasyczny fragment tekstu: Google mówi, że “applies to all forms of search results (at Google: web search, Google Images, Discover, AI Overviews, AI Mode) and will also prevent the content from being used as a direct input for AI Overviews and AI Mode.” (tłumaczenie) „Ma zastosowanie do wszystkich form wyników wyszukiwania w Google i zapobiega także wykorzystaniu treści jako bezpośredniego materiału wejściowego dla Przeglądów od AI i Trybu AI.”max-snippet:[number]— “Use a maximum of [number] characters as a textual snippet for this search result.” (tłumaczenie) „Użyj maksymalnie podanej liczby znaków jako fragmentu tekstowego dla tego wyniku wyszukiwania.” Zakres jest taki sam jak dlanosnippet: dyrektywa “applies to all forms of search results (such as Google web search, Google Images, Discover, Assistant, AI Overviews, AI Mode) and will also limit how much of the content may be used as a direct input for AI Overviews and AI Mode.” (tłumaczenie) „Ma zastosowanie do wszystkich form wyników wyszukiwania i ogranicza ilość treści, którą można wykorzystać bezpośrednio w Przeglądach od AI i Trybie AI.” To kontrola kwalifikowania treści jako bezpośredniego materiału wejściowego dla funkcji AI w wyszukiwarce Google, a nie ogólna rezygnacja z trenowania AI. Wyłączenie treści z trenowania modeli, na przykład przez Google-Extended, oraz osobna kontrola funkcji generatywnej AI w Search Console mają inne zakresy.max-image-preview:[setting]— “Set the maximum size of an image preview for this page in search results.” (tłumaczenie) „Ustaw maksymalny rozmiar podglądu obrazu tej strony w wynikach wyszukiwania.” Dostępne ustawienia tonone,standardilarge; przy ostatnim z nich “A larger image preview, up to the width of the viewport, may be shown.” (tłumaczenie) „Może zostać wyświetlony większy podgląd obrazu, nawet na całą szerokość obszaru wyświetlania.”max-video-preview:[number]— “Use a maximum of [number] seconds as a video snippet for videos on this page in search results.” (tłumaczenie) „Użyj maksymalnie podanej liczby sekund jako podglądu filmów z tej strony w wynikach wyszukiwania.”notranslate— “Don’t offer translation of this page in search results.” (tłumaczenie) „Nie proponuj tłumaczenia tej strony w wynikach wyszukiwania.”noimageindex— “Do not index images on this page.” (tłumaczenie) „Nie indeksuj obrazów znajdujących się na tej stronie.”unavailable_after:[date/time]— “Do not show this page in search results after the specified date/time.” (tłumaczenie) „Nie pokazuj tej strony w wynikach wyszukiwania po podanej dacie i godzinie.”
Historyczne — nieaktywne już kontrolki Google
Kilka dyrektyw, które wciąż krążą w starszych przewodnikach, to te, o których Google mówi, że już ich nie używa. Nie dodawaj ich, oczekując, że cokolwiek zdziałają:
noarchive— “Thenoarchiverule is no longer used by Google Search to control whether a cached link is shown in search results, as the cached link feature no longer exists.” (tłumaczenie) „Regułanoarchivenie służy już w wyszukiwarce Google do sterowania wyświetlaniem linku do kopii z pamięci podręcznej, ponieważ ta funkcja już nie istnieje.”nocache(synonim, którego niektóre wyszukiwarki używały dlanoarchive) — “Thenocacherule isn’t used by Google Search.” (tłumaczenie) „Regułanocachenie jest używana przez wyszukiwarkę Google.”nositelinkssearchbox— “Thenositelinkssearchboxrule is no longer used by Google Search to control whether the sitelink search box is shown for a given page, as the feature no longer exists.” (tłumaczenie) „Regułanositelinkssearchboxnie służy już do sterowania wyświetlaniem pola wyszukiwania w linkach do podstron, ponieważ ta funkcja już nie istnieje.”
Na poziomie akapitu (nie w tagu meta)
Istnieje też mechanizm na poziomie fragmentu strony: atrybut data-nosnippet. Według Google można “designate textual parts of an HTML page not to be used as a snippet… on span, div, and section elements.” (tłumaczenie) „wskazać tekstowe części strony HTML, których nie należy używać jako fragmentu wyniku… na elementach span, div i section”. Wszystkie dyrektywy znacznika meta dotyczą całej strony; nosnippet / data-nosnippet pozwala wykluczyć pojedynczy fragment bez ingerowania w resztę.
Łączenie dyrektyw i rozwiązywanie konfliktów
Dwie zasady regulują to, co się dzieje, gdy dyrektywy wchodzą w konflikt.
1. Bardziej restrykcyjna reguła wygrywa. “In the case of conflicting robots rules,
the more restrictive rule applies. For example, if a page has both max-snippet:50
and nosnippet rules, the nosnippet rule will apply.” (tłumaczenie) „W przypadku konfliktu reguł robots obowiązuje reguła bardziej restrykcyjna. Na przykład przy jednoczesnym użyciu max-snippet:50 i nosnippet zastosowana zostanie reguła nosnippet”. nosnippet jest bardziej restrykcyjne niż limit 50 znaków, więc to ono zadziała.
2. googlebot kontra robots — suma reguł negatywnych. Ten mechanizm jest często opisywany błędnie. Znacznik nazwany googlebot nie zastępuje po prostu ogólnego znacznika robots; w części wspólnej Googlebot przyjmuje sumę ograniczeń. Google wyjaśnia: “For situations where multiple crawlers are specified
along with different rules, the search engine will use the sum of the negative
rules.” (tłumaczenie) „Gdy wskazano kilka robotów z różnymi regułami, wyszukiwarka zastosuje sumę reguł negatywnych”. Przykład:
<meta name="robots" content="nofollow">
<meta name="googlebot" content="noindex">“The page containing these meta tags will be interpreted as having a noindex, nofollow rule when crawled by Googlebot.” (tłumaczenie) „Strona zawierająca te znaczniki meta zostanie zinterpretowana jako objęta regułą noindex, nofollow, gdy pobierze ją Googlebot”. Reguła nofollow z robots plus noindex z googlebot dają razem noindex, nofollow dla Googlebota. Jeśli znaczniki googlebot i robots ustawiają tę samą dyrektywę odmiennie, dla tego robota obowiązuje wariant nazwany jego nazwą.
Meta tag robots a X-Robots-Tag (nagłówek HTTP)
Znacznik meta robots działa tylko w HTML, ponieważ wymaga <head>. Dla innych zasobów służy X-Robots-Tag, który przekazuje dokładnie ten sam zestaw reguł w nagłówku odpowiedzi HTTP. Google podaje: “The X-Robots-Tag can be used
as an element of the HTTP header response for a given URL. Any rule that can be
used in a robots meta tag can also be specified as an X-Robots-Tag.” (tłumaczenie) „Nagłówek X-Robots-Tag może być elementem odpowiedzi HTTP dla danego adresu URL, a każdą regułę dostępną w znaczniku meta robots można określić również w tym nagłówku”. Powód jego istnienia jest prosty: “You can use the X-Robots-Tag for non-HTML files like image
files where the usage of robots meta tags in HTML is not possible.” (tłumaczenie) „Nagłówka X-Robots-Tag można używać dla plików nie-HTML, takich jak obrazy, w których nie da się zastosować znacznika meta robots”.
Więc:
- PDF, obraz lub inny nie-HTML? Nie możesz dodać tagu
<meta>— użyj nagłówka, np.X-Robots-Tag: noindex. - Całe katalogi lub wzorce? Nagłówek jest ustawiany na poziomie serwera/CDN, więc skaluje się do całych ścieżek w jednej regule konfiguracji.
- Jedna wyszukiwarka? Nagłówek może również celować w crawlera:
X-Robots-Tag: googlebot: noindex, nofollow, a wiele nagłówków X-Robots-Tag może być połączonych w jednej odpowiedzi.
Te same reguły, dwa mechanizmy dostarczania: meta tag dla stron HTML, nagłówek dla wszystkiego innego i dla skalowania.
Które dyrektywy obsługują Bing i inne wyszukiwarki
Nie zakładaj, że zestaw dyrektyw jest uniwersalny — nie jest. Bing obsługuje podstawowe reguły indeksowania i serwowania — noindex, nofollow, noarchive (z nocache jako synonimem) oraz nosnippet — i honoruje X-Robots-Tag dla zasobów niebędących HTML. Ale Bing nie obsługuje skrótu none, więc dla bezpieczeństwa między wyszukiwarkami zapisz jawnie noindex, nofollow, zamiast polegać na none. Rodzina kontroli fragmentów i podglądów — max-snippet, max-image-preview, max-video-preview — wraz z noimageindex, notranslate, indexifembedded i unavailable_after jest skutecznie tylko dla Google. W razie wątpliwości zapisuj dyrektywy wprost i traktuj kontrolki max-* jako funkcje Google.
Częste błędy (i poprawki)
Disallow+noindexna tym samym URL.noindexnigdy nie jest widziany. Poprawka: pozostaw stronę dostępną do indeksowania; zostaw tylkonoindex.noindexplusrel=canonicalwskazujący gdzie indziej. Sprzeczne sygnały — mówisz Google zarówno “porzuć tę stronę”, jak i “skonsoliduj ją z inną”. Wybierz jedno. (Więcej w kanonikalizacji.)noindexna całym środowisku stagingowym wdrożony na produkcję. Katastrofalna, ogólnostronicowa deindeksacja. Sprawdź przed uruchomieniem.noindexwstrzyknięty tylko przez JavaScript po stronie klienta. Google musi wyrenderować stronę, aby to zobaczyć, a jeśli wyrenderowany HTML różni się od oczekiwanego, zachowanie również się różni. Preferuj tag w surowym HTML lub nagłówek. (Zobacz renderowanie.)- Oczekiwanie, że Bing będzie honorować dyrektywy tylko dla Google (
none, rodzinamax-*). - Oczekiwanie, że dyrektywa robots wykona zadanie, którego nie obsługuje. Reguła
noindexlubnosnippetsama w sobie nie gwarantuje oszczędności budżetu pobierania, poufności, zmiany pozycji, identycznego zachowania w różnych wyszukiwarkach, konkretnego terminu usunięcia ani wykluczenia z każdej powierzchni AI lub wyszukiwania. Każdy z tych wyników wymaga innego mechanizmu: uwierzytelniania dla poufności,robots.txtdla pobierania, dokumentacji konkretnej wyszukiwarki dla zgodności oraz Search Console lub Google-Extended dla zakresów związanych z AI. Google nie podaje stałego czasu usunięcia strony objętejnoindex; dla mniej ważnej strony proces “may take months” (tłumaczenie) „może potrwać miesiące”.
Aby umieścić to w szerszym kontekście: robots.txt steruje pobieraniem; noindex steruje obecnością w indeksie; a nosnippet / data-nosnippet, max-snippet i max-image-preview kształtują sposób prezentowania wyniku. X-Robots-Tag przekazuje te same dyrektywy w nagłówku HTTP dla plików niebędących HTML.
Podsumowanie AI
Skrócona wersja wersji zaawansowanej:
- Tag meta robots —
<meta name="robots" content="…">w<head>— kontroluje, jak pojedyncza strona HTML jest indeksowana i wyświetlana. Brak tagu oznacza domyślnieindex, follow. - Najpierw pobierz, potem zastosuj. Google musi pobrać stronę, aby przeczytać znacznik: “these
settings can be read and followed only if crawlers are allowed to access the
pages.” (tłumaczenie) „te ustawienia można odczytać i zastosować tylko wtedy, gdy roboty mają dostęp do stron”. Dlatego Google nie zobaczy
noindexna stronie zablokowanej w robots.txt. Eksperyment Patricka z zablokowanymi stronami potwierdza ten mechanizm: strony pozostały w indeksie i w większości utrzymały pozycje. Blokada ≠ usunięcie. - robots.txt = kontrola pobierania; znacznik meta (lub X-Robots-Tag) = kontrola indeksowania i prezentowania. Nie są wymienne. Google przestało obsługiwać
noindexw robots.txt 1 września 2019 r. - Dyrektywy: indeksowanie (
noindex,none,indexifembedded), linki (nofollow, na całej stronie), wyświetlanie (nosnippet,max-snippet,max-image-preview,max-video-preview,notranslate,noimageindex,unavailable_after), a także atrybutdata-nosnippetna poziomie akapitu.noarchive,nocacheinositelinkssearchboxsą historyczne — Google twierdzi, że już ich nie używa. nosnippet/max-snippetograniczają również AI Overviews i AI Mode — Google twierdzi, że kontrolują, czy treść strony może być użyta jako bezpośrednie dane wejściowe dla tych funkcji, a nie tylko klasyczny fragment tekstu. To nie jest ogólna rezygnacja z trenowania AI; Google-Extended i osobna właściwość generatywnego AI Search to różne systemy.- Konflikty rozstrzygane są na korzyść najbardziej restrykcyjnej reguły (
nosnippetwygrywa zmax-snippet:50). W przypadku tagugoogleboti ogólnego tagurobots, Googlebot stosuje sumę reguł negatywnych —robots: nofollow+googlebot: noindex⇒noindex, nofollow. Google rozpoznaje tylko tokeny nazwgooglebot/googlebot-news; inne wartości (takie jakbingbot) są ignorowane przez Google. - Tag meta jest konwencjonalnie umieszczany tylko w
<head>(Google toleruje też umieszczenie w treści, ale to specyficzne dla Google, nieprzenośne); X-Robots-Tag przenosi te same reguły w nagłówku HTTP dla plików PDF, obrazów, plików niebędących HTML i całych katalogów. - Między silnikami: Bing obsługuje
noindex/nofollow/noarchive(nocache)/nosnippet, ale nienone; rodzinamax-*jest praktycznie tylko dla Google — pisz dyrektywy jawnie. - Brak gwarancji: sama dyrektywa robots nie zapewnia oszczędności budżetu pobierania, poufności, zmiany pozycji, zgodności między wyszukiwarkami ani stałego terminu usunięcia — Google nie podaje określonego czasu zadziałania
noindex.
Oficjalna dokumentacja
Dokumentacja źródłowa od wyszukiwarek.
- Specyfikacje tagu meta robots, data-nosnippet i X-Robots-Tag — autorytatywna specyfikacja: każda dyrektywa, zasady łączenia, rozstrzyganie konfliktów, suma
googlebot-vs-robotsoraz nagłówek X-Robots-Tag. Zacznij tutaj. - Blokowanie indeksowania w wyszukiwarce za pomocą noindex — jak działa
noindex, dwa mechanizmy dostarczania (tag meta i nagłówek) oraz zależność od crawlowania w prostym języku. - Wprowadzenie do robots.txt — odpowiednik kontroli crawlowania, aby nie mylić tych dwóch zadań.
- Crawlowanie i indeksowanie — centrum dla robots, sitemap, kanonikalizacji i kontroli crawlowania.
Bing / Microsoft
- Znaczniki meta robots i atrybuty obsługiwane przez Bing — obsługiwane dyrektywy Bing (potwierdź dokładną listę na stronie na żywo; jest renderowana w JavaScript).
Referencja
- MDN —
<meta name="robots">— referencja dyrektyw między silnikami, w tym które silniki używająnoarchive/nocache.
Cytaty ze źródła
Oficjalne wypowiedzi Google. Każdy link to link bezpośredni, który przeskakuje do cytowanego fragmentu na stronie źródłowej.
Google — czym jest tag i wartość domyślna
- “The robots
metatag lets you use a granular, page-specific approach to controlling how an individual HTML page should be indexed and served to users in Google Search results.” (tłumaczenie) „Tagmetarobots pozwala na granularne, stronicowe podejście do kontrolowania, jak pojedyncza strona HTML ma być indeksowana i wyświetlana użytkownikom w wynikach wyszukiwania Google.” — Google Search Central docs. Przejdź do cytatu
Google — zależność najpierw indeksowanie, potem przestrzeganie
- “Keep in mind that these settings can be read and followed only if crawlers are allowed to access the pages that include these settings.” (tłumaczenie) „Pamiętaj, że te ustawienia mogą być odczytane i przestrzegane tylko wtedy, gdy roboty mają dostęp do stron zawierających te ustawienia.” Przejdź do cytatu
- “If a page is disallowed from crawling through the robots.txt file, then any information about indexing or serving rules will not be found and will therefore be ignored.” (tłumaczenie) „Jeśli strona jest zablokowana przed indeksowaniem przez plik robots.txt, to wszelkie informacje o zasadach indeksowania lub serwowania nie zostaną znalezione i dlatego zostaną zignorowane.” Przejdź do cytatu
- “For the
noindexrule to be effective, the page or resource must not be blocked by a robots.txt file, and it has to be otherwise accessible to the crawler.” (tłumaczenie) „Aby regułanoindexbyła skuteczna, strona lub zasób nie może być zablokowany przez plik robots.txt i musi być w inny sposób dostępny dla robota indeksującego.” — Google, “Block Search Indexing with noindex.” (tłumaczenie) „Blokowanie indeksowania w wyszukiwarce za pomocą noindex.” Przejdź do cytatu
Google — dyrektywy (opisy dosłowne)
- “Do not show this page, media, or resource in search results.” (tłumaczenie) „Nie pokazuj tej strony, multimediów ani zasobu w wynikach wyszukiwania.” —
noindex. Przejdź do cytatu - “Equivalent to
noindex, nofollow.” (tłumaczenie) „Oznacza dokładnie to samo co połączenie dyrektywnoindex, nofollow.” —none. Przejdź do cytatu - “Do not show a text snippet or video preview in the search results for this page.” (tłumaczenie) „Nie pokazuj fragmentu tekstu ani podglądu wideo w wynikach wyszukiwania dla tej strony.” —
nosnippet. Przejdź do cytatu - “Google is allowed to index the content of a page if it’s embedded in another page through iframes or similar HTML tags, in spite of a
noindexrule.” (tłumaczenie) „Google może indeksować treść strony, jeśli jest osadzona w innej stronie za pomocą elementu iframe lub podobnego znacznika HTML, mimo regułynoindex.” —indexifembedded. Przejdź do cytatu - “A larger image preview, up to the width of the viewport, may be shown.” (tłumaczenie) „Może zostać wyświetlony większy podgląd obrazu, nawet na całą szerokość obszaru wyświetlania.” —
max-image-preview:large. Przejdź do cytatu - “Do not index images on this page.” (tłumaczenie) „Nie indeksuj obrazów znajdujących się na tej stronie.” —
noimageindex. Przejdź do cytatu - “You can designate textual parts of an HTML page not to be used as a snippet.” (tłumaczenie) „Możesz wskazać tekstowe części strony HTML, których nie należy używać jako fragmentu wyniku.” —
data-nosnippet. Przejdź do cytatu
Google — łączenie i rozwiązywanie konfliktów
- “You can create a multi-rule instruction by combining robots
metatag rules with commas or by using multiplemetatags.” (tłumaczenie) „Możesz utworzyć instrukcję wieloregulową, łącząc reguły tagumetarobots przecinkami lub używając wielu tagówmeta.” Przejdź do cytatu - “In the case of conflicting robots rules, the more restrictive rule applies. For example, if a page has both
max-snippet:50andnosnippetrules, thenosnippetrule will apply.” (tłumaczenie) „W przypadku sprzecznych reguł robots obowiązuje bardziej restrykcyjna reguła. Na przykład, jeśli strona ma zarówno regułymax-snippet:50, jak inosnippet, zastosowana zostanie regułanosnippet.” Przejdź do cytatu - “For situations where multiple crawlers are specified along with different rules, the search engine will use the sum of the negative rules.” (tłumaczenie) „W sytuacjach, gdy określonych jest wielu crawlerów z różnymi regułami, wyszukiwarka zastosuje sumę reguł negatywnych.” Przejdź do cytatu
Google — umiejscowienie, tokeny crawlera i wielkość liter
- “Google Search doesn’t enforce placement of meta robots in the HTML head and will respect robots meta tags in the body section of an HTML document as well.” (tłumaczenie) „Google Search nie wymusza umiejscowienia meta robots w nagłówku HTML i będzie respektować tagi meta robots również w sekcji body dokumentu HTML.” Przejdź do cytatu
- “Google supports two user agent tokens in the robots
metatag; other values are ignored.” (tłumaczenie) „Google obsługuje dwa tokeny user agent w tagumetarobots; inne wartości są ignorowane.” Przejdź do cytatu - “Both the
nameand thecontentattributes are case-insensitive.” (tłumaczenie) „Zarówno atrybutyname, jak icontentnie rozróżniają wielkości liter.” Przejdź do cytatu
Google — noarchive i inne historyczne dyrektywy
- “The
noarchiverule is no longer used by Google Search to control whether a cached link is shown in search results, as the cached link feature no longer exists.” (tłumaczenie) „Regułanoarchivenie jest już używana przez Google Search do kontrolowania, czy w wynikach wyszukiwania wyświetlany jest link do wersji z pamięci podręcznej, ponieważ funkcja linku do wersji z pamięci podręcznej już nie istnieje.” Przejdź do cytatu - “The
nocacherule isn’t used by Google Search.” (tłumaczenie) „Regułanocachenie jest używana przez Google Search.” Przejdź do cytatu
Google — nosnippet i max-snippet obejmują AI Overviews i AI Mode
- “[nosnippet] applies to all forms of search results (at Google: web search, Google Images, Discover, AI Overviews, AI Mode) and will also prevent the content from being used as a direct input for AI Overviews and AI Mode.” (tłumaczenie) „[nosnippet] ma zastosowanie do wszystkich form wyników wyszukiwania (w Google: wyszukiwanie w sieci, Google Images, Discover, AI Overviews, AI Mode) i zapobiegnie również wykorzystaniu treści jako bezpośredniego wejścia dla AI Overviews i AI Mode.” Przejdź do cytatu
- “[max-snippet] applies to all forms of search results (such as Google web search, Google Images, Discover, Assistant, AI Overviews, AI Mode) and will also limit how much of the content may be used as a direct input for AI Overviews and AI Mode.” (tłumaczenie) „[max-snippet] ma zastosowanie do wszystkich form wyników wyszukiwania (takich jak wyszukiwanie w sieci Google, Google Images, Discover, Assistant, AI Overviews, AI Mode) i ograniczy również, ile treści może być użyte jako bezpośrednie wejście dla AI Overviews i AI Mode.” Przejdź do cytatu
Google — brak ustalonego czasu na wejście w życie noindex
- “If a page is still appearing in results, it’s probably because we haven’t crawled the page since you added the
noindexrule. Depending on the importance of the page on the internet, it may take months for Googlebot to revisit a page.” (tłumaczenie) „Jeśli strona nadal pojawia się w wynikach, prawdopodobnie dlatego, że nie przeszukaliśmy jej od czasu dodania regułynoindex. W zależności od ważności strony w internecie, Googlebot może potrzebować miesięcy, aby ponownie ją odwiedzić.” — Google, “Block Search Indexing with noindex.” (tłumaczenie) „Blokowanie indeksowania w wyszukiwarce za pomocą noindex.” Przejdź do cytatu
Google — X-Robots-Tag
- “The
X-Robots-Tagcan be used as an element of the HTTP header response for a given URL. Any rule that can be used in a robotsmetatag can also be specified as anX-Robots-Tag.” (tłumaczenie) „X-Robots-Tagmoże być używany jako element nagłówka odpowiedzi HTTP dla danego adresu URL. Każda reguła, którą można zastosować w tagumetarobots, może być również określona jakoX-Robots-Tag.” Przejdź do cytatu - “You can use the
X-Robots-Tagfor non-HTML files like image files where the usage of robotsmetatags in HTML is not possible.” (tłumaczenie) „Możesz użyćX-Robots-Tagdla plików innych niż HTML, takich jak pliki graficzne, gdzie użycie tagówmetarobots w HTML nie jest możliwe.” Przejdź do cytatu
Patrick Stox — robots.txt służy wyłącznie do kontroli indeksowania
- “Google was clear they want robots.txt for crawl control only. The biggest downside will probably be all the people who accidentally take their entire site out of the index.”
(tłumaczenie) „Google jasno stwierdziło, że chce, aby robots.txt służył wyłącznie do kontroli indeksowania. Największą wadą będzie prawdopodobnie liczba osób, które przypadkowo usuną całą swoją witrynę z indeksu.”
— Patrick Stox, o tym, czy Google powinno dodać
noindexdo robots.txt, w Search Engine Land. Przejdź do cytatu
Patrick Stox — blokowanie stron rankingowych za pomocą robots.txt (dowód crawl vs. index)
- “Accidentally blocking pages (that Google already ranks) from being crawled using robots.txt probably isn’t going to have much impact on your rankings, and they will likely still show in the search results.” (tłumaczenie) „Przypadkowe zablokowanie indeksowania stron (które Google już pozycjonuje) za pomocą robots.txt prawdopodobnie nie będzie miało dużego wpływu na Twoje pozycje i prawdopodobnie nadal będą się pojawiać w wynikach wyszukiwania.” Przejdź do cytatu
- “We lost a position here or there and all of the featured snippets for the pages.” (tłumaczenie) „Straciliśmy pozycję tu czy tam oraz wszystkie wyróżnione fragmenty dla tych stron.” Przejdź do cytatu
Każda dyrektywa robots meta — ściągawka
Pełny zestaw wartości content obsługiwanych przez Google, co każda z nich robi oraz wartość domyślna.
| Dyrektywa | Co robi | Domyślnie? |
|---|---|---|
all | Brak ograniczeń indeksowania lub serwowania — domyślne niejawne | Tak (gdy brak tagu) |
index | Zezwól na umieszczenie strony w wynikach wyszukiwania (domyślnie; rzadko zapisywane) | Niejawne |
noindex | Nie umieszczaj tej strony/pliku multimedialnego/zasobu w wynikach wyszukiwania | Nie |
follow | Podążaj za linkami na tej stronie (domyślnie; rzadko zapisywane) | Niejawne |
nofollow | Nie podążaj za żadnymi linkami na tej stronie (w całej witrynie) | Nie |
none | Skrót dla noindex, nofollow (nieobsługiwany przez Bing) | Nie |
nosnippet | Nie pokazuj fragmentu tekstu ani podglądu wideo; blokuje również stronę jako bezpośrednie źródło dla AI Overviews/AI Mode | Nie |
max-snippet:[n] | Ogranicz fragment tekstu do [n] znaków (0 = brak, -1 = bez limitu); ogranicza również ilość treści, która może bezpośrednio zasilać AI Overviews/AI Mode | Nie |
max-image-preview:[setting] | Ogranicz rozmiar podglądu obrazu: none / standard / large | Nie |
max-video-preview:[n] | Ogranicz podgląd wideo do [n] sekund (0 = brak, -1 = bez limitu) | Nie |
notranslate | Nie oferuj tłumaczenia tej strony w wynikach | Nie |
noimageindex | Nie indeksuj obrazów na tej stronie | Nie |
unavailable_after:[date/time] | Usuń stronę z wyników po podanej dacie i godzinie | Nie |
indexifembedded | Zezwól na indeksowanie treści osadzonej przez iframe nawet z noindex | Nie |
Historyczne — Google już ich nie używa:
| Dyrektywa | Status |
| --- | --- | --- |
| noarchive | Już nieużywana — funkcja linku do pamięci podręcznej, którą kontrolowała, już nie istnieje |
| nocache | Nieużywana przez Google Search (niektóre wyszukiwarki traktowały ją jako synonim noarchive) |
| nositelinkssearchbox | Już nieużywana — funkcja pola wyszukiwania w linkach do podstron, którą kontrolowała, już nie istnieje |
Na poziomie akapitu (atrybut HTML, nie wartość content):
| Atrybut | Co robi | Gdzie |
|---|---|---|
data-nosnippet | Nie uwzględniaj konkretnego fragmentu w snippecie | Na span, div, section |
Składnia
<!-- one tag, comma-separated -->
<meta name="robots" content="noindex, nofollow">
<!-- target one engine -->
<meta name="googlebot" content="noindex">
<!-- the HTTP-header equivalent, for non-HTML / at scale -->
X-Robots-Tag: noindex
X-Robots-Tag: googlebot: noindex, nofollowSzybkie fakty
- Brak tagu → domyślnie
index, follow. none=noindex, nofollow— ale Bing nie obsługujenone; zapisz to wprost.max-*,noimageindex,notranslate,indexifembedded,unavailable_aftersą w praktyce tylko dla Google.- Tag jest tylko HTML; nagłówek
X-Robots-Tagprzenosi te same zasady dla plików PDF, obrazów i całych katalogów. - Google czyta dokładnie dwa tokeny nazw robotów —
googlebotigooglebot-news— i ignoruje wszystko inne, w tym tokeny innych wyszukiwarek, takie jakbingbot. - Umieszczenie w nagłówku to przenośna konwencja, ale Google dodatkowo respektuje
tag meta robots umieszczony w
<body>. - Wartości
name/contentiX-Robots-Tagsą niewrażliwe na wielkość liter dla Google.
Modele mentalne
1. Najpierw pobierz, potem zastosuj — znacznik działa tylko wtedy, gdy strona jest dostępna.
Google musi pobrać stronę, aby odczytać znacznik. Wszystko, co blokuje pobranie
(Disallow w robots.txt, uwierzytelnianie lub błąd serwera), sprawia, że znacznik nigdy nie zostanie zobaczony. Zanim zaufasz noindex, potwierdź więc dostęp robota do adresu URL. Wniosek: nie stosuj Disallow wobec adresu, który chcesz objąć noindex.
2. Trzy narzędzia, trzy zadania — nie myl ich.
robots.txt= kontrola pobierania (czy roboty mogą pobrać stronę).- Tag meta Robots / X-Robots-Tag = kontrola indeksowania i serwowania (co się dzieje po pobraniu).
- Uwierzytelnianie = tajność (strona
noindexjest nadal publiczna). Dopasuj zadanie do narzędzia. Najczęstszym błędem jest używanierobots.txtdo próby usunięcia z indeksu — to zadanie tagu meta.
3. Zasada decyzyjna dotycząca usuwania strony.
Chcesz ją usunąć z wyszukiwarki? Pozostaw ją dostępną do przeszukania i dodaj noindex — i
nie blokuj jej również w robots.txt, i nie ustawiaj też canonical na inny
URL. Chcesz, aby boty całkowicie pominęły przestrzeń (a nie zależy Ci na indeksowaniu)?
robots.txt disallow. Te dwie rzeczy nie są wymienne.
4. Rozwiązywanie konfliktów — wygrywa najbardziej restrykcyjna reguła.
Gdy reguły są ze sobą sprzeczne, obowiązuje ta bardziej rygorystyczna (nosnippet wygrywa z max-snippet:50).
Nie próbuj przechytrzyć tego kombinacjami; zakładaj, że najciaśniejsza reguła to ta,
która wchodzi w życie.
5. googlebot vs robots — suma ograniczeń, nie nadpisanie.
W przypadku nakładania się Googlebot sumuje ograniczenia z ogólnego tagu robots
i tagu nazwanego googlebot, zamiast wybierać jeden. robots: nofollow +
googlebot: noindex ⇒ Googlebot otrzymuje noindex, nofollow. Znacznik nazwany od robota
ma pierwszeństwo nad znacznikiem ogólnym, gdy oba ustawiają tę samą dyrektywę
odmiennie, ale w praktyce warto zapamiętać zasadę sumowania ograniczeń.
6. Strona HTML → tag meta; wszystko inne → nagłówek.
Jeśli plik ma <head>, użyj tagu <meta>. Jeśli to PDF, obraz, dowolny plik niebędący HTML,
lub musisz objąć cały katalog, użyj nagłówka X-Robots-Tag —
ta sama składnia reguł, inne dostarczanie.
Dziennik zmian
Zaktualizowano 11 sie 2026.
Podsumowanie redakcyjne i zapisane szczegóły zmian.Szczegóły zmian
-
Szczegółowe uwagi dotyczące zmian są obecnie dostępne po angielsku.
-
Szczegółowe uwagi dotyczące zmian są obecnie dostępne po angielsku.
-
Szczegółowe uwagi dotyczące zmian są obecnie dostępne po angielsku.
Pełne porównanie jest niedostępne — dla tej wersji nie zarchiwizowano wcześniejszej migawki.
Zaktualizowano 11 sie 2026.
Podsumowanie redakcyjne i zapisane szczegóły zmian.Szczegóły zmian
-
Szczegółowe uwagi dotyczące zmian są obecnie dostępne po angielsku.
-
Szczegółowe uwagi dotyczące zmian są obecnie dostępne po angielsku.
-
Szczegółowe uwagi dotyczące zmian są obecnie dostępne po angielsku.
Pełne porównanie jest niedostępne — dla tej wersji nie zarchiwizowano wcześniejszej migawki.
Zaktualizowano 11 sie 2026.
Podsumowanie redakcyjne i zapisane szczegóły zmian.Szczegóły zmian
-
Szczegółowe uwagi dotyczące zmian są obecnie dostępne po angielsku.
Pełne porównanie jest niedostępne — dla tej wersji nie zarchiwizowano wcześniejszej migawki.
Zaktualizowano 18 lip 2026.
Podsumowanie redakcyjne i zapisane szczegóły zmian.Szczegóły zmian
-
Szczegółowe uwagi dotyczące zmian są obecnie dostępne po angielsku.
-
Szczegółowe uwagi dotyczące zmian są obecnie dostępne po angielsku.
-
Szczegółowe uwagi dotyczące zmian są obecnie dostępne po angielsku.
-
Szczegółowe uwagi dotyczące zmian są obecnie dostępne po angielsku.
-
Szczegółowe uwagi dotyczące zmian są obecnie dostępne po angielsku.
Pełne porównanie jest niedostępne — dla tej wersji nie zarchiwizowano wcześniejszej migawki.