YandexBot und SEO
Was YandexBot ist, wie man ihn erkennt und verifiziert, die Yandex-exklusive Clean-param-Direktive, warum Crawl-delay tot ist, wie er mit JavaScript umgeht und wie er im Vergleich zu Googlebot und Bingbot abschneidet.
Sprachen
1 Evidenzsignal auf dieser Seite
- Verknüpftes Live-WerkzeugGooglebot Verifier
YandexBot ist der Haupt-Webcrawler von Yandex – der Bot, der Seiten für die Yandex-Suche entdeckt und abruft, die Suchmaschine mit einem Marktanteil von über 70 % in Russland. Sein robots.txt-Token ist YandexBot (nur der Haupt-Indexierungs-Bot) im Gegensatz zu Yandex (die breitere Bot-Familie). Er unterstützt eine Yandex-exklusive Direktive, Clean-param, die URL-Parameter konsolidiert und kein Google-/Bing-Pendant hat – und er hat am 22. Februar 2018 aufgehört, Crawl-delay zu beachten (einige SEO-Leitfäden behaupten das fälschlicherweise immer noch). Das JavaScript-Rendering ist Beta und 'im Ermessen des Bots', und der Quellcode-Leak von 2023 deutete darauf hin, dass es kein separates JS-Rendering-System gibt, wie Google eines hat. Verifizieren Sie einen echten YandexBot durch Reverse-then-Forward-DNS auf einen yandex.ru/.net/.com-Host – dieselbe Technik, die Google und Bing für ihre eigenen Bots verwenden – und nicht anhand des User-Agent-Strings.
Evidence for this claim Yandex documents its search robots and their user-agent identifiers in Yandex Webmaster Help. Scope: Current official Yandex robot list. Confidence: high · Verified: Yandex Webmaster: Yandex robots Evidence for this claim Yandex provides an official method for checking whether an IP address belongs to a Yandex robot; a user-agent string alone can be spoofed. Scope: Current Yandex robot verification guidance. Confidence: high · Verified: Yandex Webmaster: Verify a robotTL;DR — YandexBot ist der Crawler für die Yandex-Suche – dieselbe Aufgabe, die Googlebot für Google und Bingbot für Bing übernimmt. Er besucht Ihre Seiten, lädt sie herunter und fügt sie dem Yandex-Index hinzu. Ob Sie sich darum kümmern sollten, hängt von einer Frage ab: Haben Sie ein Publikum oder Geschäft in Märkten, in denen Yandex relevant ist? Wenn ja, ist es wichtig. Wenn nein, ist es meist nur Traffic in Ihren Logs.
Was YandexBot ist
Wenn Sie YandexBot in Ihren Server-Logs sehen, ist das der Crawler für Yandex –
die Suchmaschine, die die Suche in Russland so dominiert, wie Google den Großteil der
übrigen Welt dominiert. Genau wie Googlebot und Bingbot folgt YandexBot Links,
liest Sitemaps, lädt Ihre Seiten herunter und übergibt sie zur Aufnahme in den
Yandex-Suchindex.
Der Grund, warum er einen eigenen Artikel bekommt – statt „einfach alle Nicht-Google-Bots blockieren“ – ist die Geografie. Yandex ist weltweit eine vernachlässigbare Größe, aber in Russland hält er etwa 71 % des Suchmarkts gegenüber Googles ~27 % (StatCounter, Juni 2026). Wenn Sie also Menschen in Russland (und historisch gesehen einigen Nachbarmärkten) etwas verkaufen oder ihnen dienen, ist YandexBot Ihr Tor zum Großteil dieses Suchverkehrs.
Wie man ihn erkennt
Der zuverlässige Identitätscheck für YandexBot ist ein DNS-Lookup, nicht der User-Agent- String – hier ist der Grund, und so funktioniert es.
Der User-Agent von YandexBot enthält das Wort YandexBot. Die eigene Dokumentation von Yandex
listet den vollständigen String wie folgt auf:
Mozilla/5.0 (compatible; YandexBot/3.0; +http://yandex.com/bots) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/81.0.4044.268Aber dieser String allein beweist nichts: Jeder kann ihn fälschen. Scraper und böswillige Bots geben sich routinemäßig als YandexBot aus. Der User-Agent ist also nur ein Filter dafür, welche Log-Zeilen eine Prüfung wert sind – der eigentliche Beweis ist ein Reverse-then-Forward-DNS- Lookup, der bestätigt, dass die Anfrage von einem echten Yandex-Host stammt, dieselbe Technik, die Google und Bing für ihre eigenen Crawler verwenden (behandelt im Tab „Erweitert“).
Sollten Sie ihn blockieren?
Das ist die eigentliche Frage, die sich die meisten stellen. Eine schnelle Denkweise dazu:
- Haben Sie ein Russland/GUS-bezogenes Geschäft? Blockieren Sie ihn nicht – Sie würden sich selbst von der dort dominierenden Suchmaschine ausschließen.
- Haben Sie keinerlei Russland-bezogenes Publikum und das Crawling belastet Ihren
Server? Dann ist das Blockieren oder Verlangsamen eine vernünftige Entscheidung. Sie können ihm mit ein paar Zeilen in Ihrer
robots.txtsagen, dass er draußen bleiben soll.
Eine Einschränkung auf der Blockier-Seite: Eine robots.txt-Regel ist eine Bitte, keine
Durchsetzung. Die eigene Dokumentation von Yandex warnt, dass einige seiner Roboter robots.txt-Anweisungen
ignorieren können. Wenn Sie also eine garantierte Aussperrung benötigen – nicht nur „bitte nicht“ – blockieren Sie
über verifizierte IP-Adressen auf Server-/Firewall-Ebene (siehe Tab „Erweitert“ für die Frage, welche
Yandex-Bots davon betroffen sind).
Eine wichtige Falle, und es ist dieselbe wie bei Google: Eine Seite in die
robots.txt aufzunehmen, entfernt sie nicht aus den Suchergebnissen von Yandex – es verhindert nur,
dass Yandex die Seite liest. Yandex sagt dies in seiner eigenen Dokumentation und fügt eine
Bedingung hinzu, die man kennen sollte: Wenn Sie eine Seite auch in der robots.txt blockieren, kann Yandex sie „nicht
indexieren und Ihre Anweisungen erkennen“ – das bedeutet, ein noindex-Tag funktioniert nur, wenn
Sie Yandex die Seite abrufen lassen, um sie zu sehen. Das Blockieren des Crawlings und das Hinzufügen von noindex auf
derselben URL hebt das noindex gegenseitig auf. Um eine Seite tatsächlich draußen zu halten, erlauben Sie das Crawling
und fügen stattdessen ein noindex-Tag hinzu.
Möchten Sie die technische Version – die genauen robots.txt-Tokens, Yandex’ einzigartige Clean-param-Direktive, wie man einen echten YandexBot verifiziert und wie er mit JavaScript umgeht? Wechseln Sie zum Tab Erweitert.
Evidence for this claim Yandex documents its search robots and their user-agent identifiers in Yandex Webmaster Help. Scope: Current official Yandex robot list. Confidence: high · Verified: Yandex Webmaster: Yandex robots Evidence for this claim Yandex provides an official method for checking whether an IP address belongs to a Yandex robot; a user-agent string alone can be spoofed. Scope: Current Yandex robot verification guidance. Confidence: high · Verified: Yandex Webmaster: Verify a robotTL;DR — YandexBot ist der primäre Indexierungs-Crawler der Yandex-Suche. Sein
robots.txtTokenYandexBotzielt nur auf den Haupt-Indexierungs-Bot;Yandexzielt auf die breitere Bot-Familie. Es unterstützt eine nur bei Yandex verfügbare Direktive, Clean-param, die URL-Parameter konsolidiert — kein Google/Bing-Äquivalent — und es hat die Unterstützung fürCrawl-delayam 22. Februar 2018 eingestellt (nutzen Sie stattdessen das Crawl-Rate-Tool; einige SEO-Leitfäden behaupten fälschlicherweise weiterhin, dass Yandex Crawl-delay unterstützt). JavaScript Rendering erfolgt nach Ermessen des Crawlers, daher bevorzugen Sie SSR/Pre-Rendering für kritische Inhalte.Disallow≠noindex(gleiche Falle wie bei Google). Verifizieren Sie einen echten YandexBot durch Reverse-then-Forward-DNS zu einemyandex.ru/yandex.net/yandex.com-Host — dieselbe Technik, die auch Google und Bing verwenden — niemals nur den User-Agent- String allein.
Was YandexBot tatsächlich ist
YandexBot ist der primäre Web-Crawler für Yandex, die russische Suchmaschine. Er entdeckt URLs, ruft Seiten ab und speist den Yandex-Index — dieselbe Rolle, die Googlebot und Bingbot für ihre Suchmaschinen spielen. Der User-Agent-String, den Yandex dokumentiert (auf seiner Seite „Überprüfen, ob ein Roboter zu Yandex gehört“), lautet:
Mozilla/5.0 (compatible; YandexBot/3.0; +http://yandex.com/bots) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/81.0.4044.268Yandex fügt einen nützlichen Hinweis hinzu: Da „die Browserversion sich ändern kann“, empfiehlt es,
nicht auf eine feste Chrome-Version zu matchen, wenn Sie versuchen, den Bot zu
identifizieren. Matchen Sie das YandexBot-Token, nicht Chrome/81.0.4044.268.
Entscheidend ist, dass „YandexBot“ wirklich nur das Haupt-Indexierungs-Mitglied einer Familie von
Yandex-Robotern ist — YandexImages, YandexMetrika, YandexDirect, YandexMobileBot,
YandexAccessibilityBot, YandexRenderResourcesBot, YandexCalendar und weitere — jedes
einzeln in robots.txt steuerbar. Viele Artikel vermischen „YandexBot“ mit
„allen Yandex-Crawlern“, was unpräzise ist.
Ein weiterer, den es zu kennen lohnt: Die Server-Log-Tabelle von Yandex dokumentiert jetzt
YandexAdditionalBot (und ein fast identisches Token, YandexAdditional) als einen Roboter,
der „hilft, robots.txt zu verarbeiten, um zu verhindern, dass Seiteninhalte in der Suche
mit Yandex-KI-Antworten erscheinen“, angewendet auf Seiten, die der Haupt-Crawler bereits indexiert hat.
Laut derselben Tabelle berücksichtigt er die allgemeinen User-agent: *-Regeln nicht
— wenn Sie eine Seite also gezielt von Yandex-KI-Funktionen ausschließen möchten, benötigen Sie
einen expliziten User-agent: YandexAdditionalBot-Block, dasselbe Muster, das auch die
KI-Crawler-Opt-outs anderer Suchmaschinen verwenden.
YandexBot vs. „Yandex“ in robots.txt — sie sind nicht dasselbe Token
Dies ist die unauffälligste robots.txt-Eigenheit von Yandex, und sie beißt Menschen, die von
Google-zentrierter technischer SEO migrieren. Beginnen Sie mit Yandex’ eigenem ausgearbeitetem Beispiel — es
macht die Aufteilung des Geltungsbereichs explizit, Kommentare inklusive:
User-agent: YandexBot # will be used only by the main indexing bot
Disallow: /*id=
User-agent: Yandex # will be used by all Yandex bots
Disallow: /*sid= # except the main indexing bot
User-agent: * # will not be used by Yandex bots
Disallow: /cgi-binWörtlich gelesen sind die Kommentare des Beispiels selbst die Dokumentation:
User-agent: YandexBot— wird nur vom Haupt-Indexierungs-Bot verwendet.User-agent: Yandex— wird von Yandex-Bots breiter verwendet — aber laut Kommentar des Beispiels zum zweiten Block „mit Ausnahme des Haupt-Indexierungs-Bots.“ Das breitere Token ist nicht einmal innerhalb der Yandex-Familie universell.
Zwei Dinge folgen aus Yandex’ Regeln hier. Erstens, Priorität: „Wenn der User-agent: Yandex-String erkannt wird, wird der User-agent: *-String ignoriert.“ Ein generischer
User-agent: *-Block gilt also nicht für Yandex-Bots, wenn Sie auch einen Yandex-
Block geschrieben haben. Zweitens — und das überrascht sicherheitsbewusste Leser — warnt Yandex,
dass „Einige Yandex-Roboter Direktiven in robots.txt ignorieren können, einschließlich
jener für User-agent: Yandex.“ Nicht jeder Yandex-Bot ist garantiert bereit, einer
pauschalen Regel zu gehorchen, was ein weiterer Grund ist, warum serverseitige Verifizierung und Blockierung
für den vollständigen Ausschluss wichtig sind.
Verifizieren, dass es wirklich YandexBot ist
Da der User-Agent fälschbar ist, empfiehlt Yandex, die Verifizierung per DNS durchzuführen, genau wie Google und Bing es für ihre eigenen Crawler tun. Yandex: “Some robots can disguise themselves as Yandex robots by indicating the relevant User Agent. You can check the authenticity of a robot using a reverse DNS lookup.” (Übersetzung) „Einige Roboter können sich als Yandex-Roboter ausgeben, indem sie den entsprechenden User Agent angeben. Sie können die Authentizität eines Roboters mithilfe eines Reverse-DNS-Lookups überprüfen.“ Die dokumentierte Methode:
- “Determine the IP address of the user agent in question using your server logs.” (Übersetzung) „Ermitteln Sie die IP-Adresse des betreffenden User-Agents mithilfe Ihrer Server-Logs.“
- “Use a reverse DNS lookup of the IP address to determine the host domain name.” (Übersetzung) „Führen Sie einen Reverse-DNS-Lookup der IP-Adresse durch, um den Host-Domainnamen zu ermitteln.“
- “Check whether the host belongs to Yandex. All Yandex robots have names ending
in
yandex.ru,yandex.netoryandex.com.” (Übersetzung) „Prüfen Sie, ob der Host zu Yandex gehört. Alle Yandex-Roboter haben Namen, die aufyandex.ru,yandex.netoderyandex.comenden.“ (Wenn der Hostname eine andere Endung hat, ist es nicht Yandex.) - “Make sure that the name is correct. Use a forward DNS lookup to get the IP address corresponding to the host name. It should match the IP address used in the reverse DNS lookup.” (Übersetzung) „Stellen Sie sicher, dass der Name korrekt ist. Führen Sie einen Forward-DNS-Lookup durch, um die IP-Adresse zu erhalten, die dem Hostnamen entspricht. Sie sollte mit der IP-Adresse übereinstimmen, die im Reverse-DNS-Lookup verwendet wurde.“
Und die Fehlerbedingung, in Yandex’ eigenen Worten: “If the IP addresses do not match, it means that the host name is fake.” (Übersetzung) „Wenn die IP-Adressen nicht übereinstimmen, bedeutet das, dass der Hostname gefälscht ist.“ Yandex erwähnt außerdem ein offizielles „IP-Adress-Prüftool“ als Alternative zur manuellen Durchführung der Lookups.
Dies ist dasselbe Forward-Confirmed-Reverse-DNS-Muster (FCrDNS), auf das sich alle drei großen Suchmaschinen einigen — Google verifiziert gegen googlebot.com/google.com/
googleusercontent.com, Bing gegen *.search.msn.com und Yandex gegen
yandex.ru/yandex.net/yandex.com. Keine von ihnen behandelt eine veröffentlichte IP-Liste als ausreichend vertrauenswürdig. Die Befehle befinden sich im Tab Skripte; die Domain-Suffixe sind das Einzige, was sich zwischen den Suchmaschinen ändert. (Für die Google- und Bing-Versionen siehe die Geschwisterartikel Googlebot und Bingbot.)
Steuerung von YandexBot mit robots.txt
Yandex erkennt einen vertrauten Kern von Direktiven, die jeweils in der eigenen Dokumentation definiert sind:
- User-agent — “Indicates the robot to which the rules listed in
robots.txtapply.” (Übersetzung) „Gibt den Roboter an, auf den die inrobots.txtaufgeführten Regeln zutreffen.“ - Disallow — “Prohibits crawling of sections or individual pages of the site.” (Übersetzung) „Verhindert das Crawlen von Abschnitten oder einzelnen Seiten der Website.“
- Allow — “Allows indexing site sections or individual pages.” (Übersetzung) „Erlaubt das Indexieren von Website-Abschnitten oder einzelnen Seiten.“
- Sitemap — “Specifies the path to the
Sitemapfile that is posted on the site.” (Übersetzung) „Gibt den Pfad zurSitemap-Datei an, die auf der Website veröffentlicht ist.“ - Clean-param — “Indicates to the robot that the page URL contains parameters (like UTM tags) that should be ignored when indexing it.” (Übersetzung) „Weist den Roboter darauf hin, dass die Seiten-URL Parameter (wie UTM-Tags) enthält, die beim Indexieren ignoriert werden sollten.“ (Nur bei Yandex — siehe unten.)
Einige Dateianforderungen sind wissenswert: Die Datei muss “a TXT file named
“robots”, robots.txt,” (Übersetzung) „eine TXT-Datei namens „robots“, robots.txt“ sein, ihre Größe darf 500 KB nicht überschreiten, und der Server muss für das Lesen einen HTTP-200-OK-Status zurückgeben.
Disallow ≠ noindex — dieselbe Falle wie bei Google
Die am häufigsten missverstandene Tatsache über robots.txt gilt direkt auch für Yandex, und Yandex formuliert es klar: “Pages restricted in robots.txt can participate in
Yandex search. To remove pages from search, specify the noindex directive in the
HTML code of the page or configure the HTTP header.” (Übersetzung) „In robots.txt eingeschränkte Seiten können an der Yandex-Suche teilnehmen. Um Seiten aus der Suche zu entfernen, geben Sie die noindex-Direktive im HTML-Code der Seite an oder konfigurieren Sie den HTTP-Header.“ Mit anderen Worten: Disallow steuert das Crawlen, nicht das Indexieren — eine disallowte URL kann weiterhin in den Yandex-Ergebnissen erscheinen. Dies ist dieselbe konzeptionelle Falle wie bei Google (ich habe sie für Google in Indexed, though blocked by robots.txt beschrieben), und die Lösung ist identisch: Um eine Seite tatsächlich zu entfernen, erlauben Sie das Crawlen und fügen noindex hinzu. Yandex erklärt im selben Abschnitt genau, warum: “Do not restrict
such pages in robots.txt, or the Yandex bot can’t index them and detect your
instructions.” (Übersetzung) „Schränken Sie solche Seiten nicht in robots.txt ein, sonst kann der Yandex-Bot sie nicht indexieren und Ihre Anweisungen nicht erkennen.“ Eine Indexsteuerungs-Direktive funktioniert nur, wenn der Crawler die Seite abrufen kann, um sie zu sehen — Disallow und noindex auf derselben URL ist ein Widerspruch: Das Disallow verhindert, dass Yandex das noindex-Tag jemals liest, sodass die Seite genau dort bleibt, wo sie war.
Clean-param — Yandex’ einzigartige Parameter-Direktive
Clean-param ist die mit Abstand yandex-spezifischste Direktive für ein Publikum, das Google und Bing gewohnt ist, und sie hat kein Google- oder Bing-Pendant. Ihr Zweck laut Yandex: “The Yandex robot uses this directive to avoid reloading duplicate information. This improves the robot’s efficiently and reduces the server load.” (Übersetzung) „Der Yandex-Roboter verwendet diese Direktive, um das erneute Laden doppelter Informationen zu vermeiden. Dies verbessert die Effizienz des Roboters und reduziert die Serverlast.“ (Dieses „efficiently“ ist ein echter Tippfehler auf Yandex’ Live-Seite – ich zitiere es unverändert, statt es stillschweigend zu korrigieren.)
Das Problem, das sie löst: “The new parameter that doesn’t affect the page content may result in duplicate pages that should not be included in the search.” (Übersetzung) „Der neue Parameter, der den Seiteninhalt nicht beeinflusst, kann zu doppelten Seiten führen, die nicht in die Suche aufgenommen werden sollten.“ Die Syntax:
Clean-param: p0[&p1&p2&..&pn] [path]Yandex’ eigenes Praxisbeispiel – drei URLs, die sich nur durch einen ref-Tracking-Parameter unterscheiden:
www.example.com/some_dir/get_book.pl?ref=site_1&book_id=123
www.example.com/some_dir/get_book.pl?ref=site_2&book_id=123
www.example.com/some_dir/get_book.pl?ref=site_3&book_id=123…kollabieren zu einer kanonischen URL (www.example.com/some_dir/get_book.pl?book_id=123) mit einer einzigen Direktive:
User-agent: Yandex
Clean-param: ref /some_dir/get_book.plZwei Details machen Clean-param leicht falsch anzuwenden. Erstens: “The Clean-param directive does not require mandatory combination with the Disallow directive” (Übersetzung) „Die Clean-param-Direktive erfordert keine zwingende Kombination mit der Disallow-Direktive“ – sie steht für sich allein; Sie müssen die Parameter-URLs nicht Disallowen. Zweitens ist sie intersektional: Laut Yandex ist sie “intersectional, so it can be specified anywhere in the file, regardless of the location.” (Übersetzung) „intersektional, sodass sie überall in der Datei angegeben werden kann, unabhängig vom Ort.“ Anders als Allow/Disallow, die an einen Pfad gebunden sind, ist Clean-param eine globale Direktive, die Sie überall in der Datei platzieren können.
Yandex merkt außerdem an, dass es einige Parameter automatisch behandeln kann: “Parameters for analytics and tracking that don’t affect the page content may be automatically removed by the search engine if the algorithms determine that those parameters are insignificant.” (Übersetzung) „Parameter für Analytik und Tracking, die den Seiteninhalt nicht beeinflussen, können von der Suchmaschine automatisch entfernt werden, wenn die Algorithmen feststellen, dass diese Parameter unbedeutend sind.“ Aber sich für die Parameter, die Ihnen wichtig sind, auf Clean-param zu verlassen, ist der deterministische Schritt. Dies ist das Yandex-Pendant dazu, wie Google sich inzwischen auf Kanonisierungssignale (Canonical-Tag, interne Verlinkung) stützt, seit es sein altes URL-Parameter-Tool eingestellt hat – Yandex gibt Ihnen nur eine explizite robots.txt-Direktive, wo Google keine bietet.
Crawl-delay ist tot (seit Februar 2018)
Wenn Sie gelesen haben, dass Crawl-delay in Yandex’ robots.txt funktioniert, sind diese Informationen veraltet. Yandex’ eigene dedizierte Seite ist unmissverständlich: “From February 22, 2018, Yandex doesn’t take into account the Crawl-delay directive.” (Übersetzung) „Ab dem 22. Februar 2018 berücksichtigt Yandex die Crawl-delay-Direktive nicht mehr.“
Das ist erwähnenswert, weil mindestens eine vielgelesene SEO-Ressource immer noch das Gegenteil behauptet. Ahrefs’ robots.txt-Leitfaden (verfasst von Joshua Hardwick, nicht von mir) sagt derzeit: “Google no longer supports this directive, but Bing and Yandex do.” (Übersetzung) „Google unterstützt diese Direktive nicht mehr, aber Bing und Yandex tun es.“ Was die Yandex-Hälfte betrifft, widerspricht dem Yandex’ eigene aktuelle Dokumentation. Ich würde Yandex’ dedizierte, datierte Seite hier als maßgeblich betrachten – aber die breitere Lektion ist die nützliche: Überprüfen Sie eine Crawl-Verhaltens-Behauptung anhand der Live-Dokumente der Engine, bevor Sie einem sekundären Leitfaden vertrauen, denn diese Details driften und selbst gute Quellen werden veraltet. (Beachten Sie den Kontrast zu Bing, das crawl-delay tatsächlich weiterhin berücksichtigt – eine der echten Bingbot/YandexBot-Divergenzen.)
Der Ersatz ist die Crawl-Rate-Einstellung in Yandex Webmaster, mit der Sie beeinflussen können, wie schnell YandexBot Ihre Website abruft. (Yandex’ Crawl-delay-Seite ist im Wesentlichen ein Satz plus ein Verweis auf diese Einstellung.)
Wie YandexBot mit JavaScript umgeht
Yandex’ JavaScript-Rendering ist von Yandex selbst explizit als Beta (β) gekennzeichnet, und das Standardverhalten ist “at the bot’s discretion” – der Bot “will independently determine whether to execute JavaScript code on the site’s pages.” (Übersetzung) „wird unabhängig entscheiden, ob JavaScript-Code auf den Seiten der Website ausgeführt wird.“ Wenn er es tut, kann er “assess the quality and completeness of the content on the pages with and without JavaScript” (Übersetzung) „die Qualität und Vollständigkeit des Inhalts auf den Seiten mit und ohne JavaScript bewerten“ und die Version ausliefern, die für den Besucher wahrscheinlich nützlicher ist.
Es gibt eine bedeutsame Spannung, die es wert ist, hervorgehoben zu werden. Der Yandex-Quellcode-Leak von 2023 (offengelegte interne Engineering-Dokumente, keine offizielle Stellungnahme – ich werde weiter unten näher darauf eingehen) deutete auf ein einfacheres Bild hin. Wie Mike King in seiner Search Engine Land-Analyse des Leaks schrieb: “Yandex has no separate rendering system for JavaScript. They say this in their documentation and, although they have Webdriver-based system for visual regression testing called Gemini, they limit themselves to text-based crawl.” (Übersetzung) „Yandex hat kein separates Rendering-System für JavaScript. Das sagen sie in ihrer Dokumentation, und obwohl sie ein Webdriver-basiertes System für visuelle Regressionstests namens Gemini haben, beschränken sie sich auf textbasiertes Crawlen.“ (Dieses interne „Gemini“ ist ein Yandex-Tool für visuelle Regressionstests – völlig unabhängig von Googles Gemini-KI-Modell, trotz des gemeinsamen Namens. Es lohnt sich, das zu verdeutlichen, damit niemand die beiden verwechselt.) Und Dan Taylors Search Engine Journal-Beitrag schlussfolgerte, dass es “nothing new to suggest Yandex can crawl JavaScript yet outside of already publicly documented processes.” (Übersetzung) „nichts Neues gibt, das darauf hindeutet, dass Yandex JavaScript bereits außerhalb bereits öffentlich dokumentierter Prozesse crawlen kann.“
Die ehrliche Antwort ist also weder „YandexBot rendert JS genau wie Googlebot“ noch „YandexBot berührt JavaScript nie.“ Es ist selektiv und Beta, nach Yandex’ eigener Beschreibung. Die Aussage des Leaks über „kein separates Rendering-System“ ist mit diesem Rahmen konsistent, aber es handelt sich um geleaktes internes Material, das über Branchenberichte weitergegeben wurde, nicht um eine Offenlegung von Yandex – behandeln Sie „architektonisch einfacher als Google“ also als plausible Lesart zweier konsistenter Signale, nicht als dokumentierte Tatsache. Verlassen Sie sich für eine Route, die Ihnen wichtig ist, auf keine der beiden Darstellungen blind; testen Sie es direkt:
- Gerenderte Ausgabe: Rufen Sie die Seite mit deaktiviertem JavaScript ab und vergleichen Sie sie mit der JS-gerenderten Version. Wenn sich die beiden wesentlich unterscheiden, gehen Sie nicht davon aus, dass Yandex die gerenderte Version gesehen hat.
- Ressourcenzugriff: Stellen Sie sicher, dass die JS-, CSS- und API-Endpunkte, von denen die Seite abhängt,
nicht in
robots.txtblockiert sind. Yandex’YandexRenderResourcesBotruft Renderzeit-Ressourcen ab, aber (laut Yandex’ eigener Dokumentation dazu) nur für Seiten, die der Haupt-Indexierungs-Bot bereits erreichen kann – eine blockierte Ressource auf einer erlaubten Seite wird weiterhin nicht geladen. - Verzögerte und interaktive Inhalte: Alles, was nach dem
DOMContentLoaded-Ereignis oder hinter einem Klick lädt, ist nicht garantiert gerendert. Yandex’ erweiterte Rendering-Einstellungen (window.YandexRotorSettings) existieren speziell für Websites, bei denen „Inhalte mit Verzögerung laden“ – das ist ein Signal, das es wert ist, gelesen zu werden, nicht nur eine Konfigurationsoption.
Die praktische Schlussfolgerung: Yandex’ eigene Dokumentation empfiehlt, “Prohibit rendering if SSR (Server-Side Rendering) or pre-rendering is implemented on the site,” (Übersetzung) „Rendering zu verbieten, wenn SSR (Server-Side Rendering) oder Pre-Rendering auf der Website implementiert ist,“ und weist darauf hin, dass “Executing JavaScript code may create additional load on your server.” (Übersetzung) „Das Ausführen von JavaScript-Code kann zusätzliche Last auf Ihrem Server erzeugen.“ Wenn Sie zuverlässige Yandex-Indexierung von JS-lastigen Inhalten wünschen, liefern Sie sie serverseitig aus, statt Ihr Glück mit clientseitigem Rendering zu versuchen.
Für AJAX-ähnliche Websites sagt Yandex: “When indexing an AJAX site, the Yandex bot scans
the original URLs and executes JavaScript code on them” (Übersetzung) „Beim Indexieren einer AJAX-Website scannt der Yandex-Bot
die ursprünglichen URLs und führt JavaScript-Code auf ihnen aus“ – und es hat sich von
dem alten HTML-Snapshot-Hack entfernt: Wenn Sie weiterhin den veralteten
meta name="fragment"-Ansatz verwenden, “the bot will ignore it and index the original page.”
(Übersetzung) „wird der Bot ihn ignorieren und die ursprüngliche Seite indexieren.“
Seine moderne Empfehlung spiegelt Googles wider: “If the links on AJAX pages use the #
character, change the addresses to URLs without this character. For example, you may
use the History API.” (Übersetzung) „Wenn die Links auf AJAX-Seiten das #-Zeichen verwenden,
ändern Sie die Adressen in URLs ohne dieses Zeichen. Sie können beispielsweise
die History-API verwenden.“
Was der Quellcode-Leak von 2023 über den Crawler enthüllte
Im Januar 2023 leakte der interne Quellcode von Yandex – ein gut belegtes Ereignis, über das unter anderem Search Engine Land und Search Engine Journal berichteten. Behandeln Sie dies als geleakte interne Dokumentation, nicht als offizielle Stellungnahme von Yandex, aber es offenbarte echte Details darüber, wie der Crawler funktioniert. Laut Mike Kings SEL-Analyse: “Yandex’s documentation discusses a dual-distributed crawler system. One for real-time crawling called the ‘Orange Crawler’ and another for general crawling.” Er zog einen Vergleich zu Google, das “is said to have had an index stratified into three buckets, one for housing real-time crawl, one for regularly crawled and one for rarely crawled.” Beide Suchmaschinen scheinen also segmentiertes Crawling zu nutzen, das davon abhängt, wie oft Inhalte aktualisiert werden.
Der Leak verband das Crawling auch direkt mit der Seitenarchitektur. Laut Dan Taylors SEJ-Berichterstattung: “URLs that are reachable from the homepage have a ‘higher’ level of importance.” Das ist eine klare Brücke von „Crawler-Mechanik” zu „warum interne Verlinkung wichtig ist” – dieselbe Crawl-Tiefen-Logik, die auch für Googlebot gilt.
(Zur Einordnung: Die Berichterstattung merkte an, dass die vielzitierte Zahl von „1 922 Ranking-Faktoren” nur für eine Archivdatei galt, während der vollständigere Codebase Berichten zufolge weit mehr über mehrere Dateien hinweg enthielt – behalten Sie bei jeder konkreten Zahl ein Datum und eine Quelle bei, wenn Sie eine zitieren.)
Warum YandexBot immer noch wichtig ist – und wie häufig er in robots.txt vorkommt
Der globale Marktanteil von Yandex ist winzig, aber der in Russland nicht: ~71 % in Russland gegenüber ~27 % bei Google (Stand Juni 2026, StatCounter). Diese Stabilität ist der einzige Grund, warum YandexBot eine separate Behandlung verdient. Wenn Sie ein Geschäft mit Russland/GUS-Ausrichtung haben, schließt das Blockieren von YandexBot die dominierende Suchmaschine in diesem Markt aus.
Wie oft konfigurieren Websites überhaupt für ihn? Selten, aber zunehmend. Im Web Almanac 2022 SEO-Kapitel (ich war in dem Jahr Reviewer; ich war Hauptautor des Kapitels 2021): YandexBot erschien in “just 0.5% of robots.txt files in 2021. By 2022, there was a six-fold increase, with 3% of files specifying Yandexbot.” Klein, aber ein klarer Aufwärtstrend – und eine nützliche Basislinie dafür, „wie häufig ist das in freier Wildbahn”.
Wenn Sie entscheiden, ob Sie ihn blockieren sollen, ist die ehrliche Einordnung eine geschäftliche Frage, keine technische – und es ist eine echte Debatte, die in Webmaster-Foren ausgetragen wird. Für die allgemeineren Mechanismen, in denen YandexBot lebt – URL-Erkennung, Crawl-Scheduler, Rendering und die Unterscheidungen zwischen Crawlen, Indexieren und Ranking – siehe den Crawling-Hub. Und für die spezifische Konfiguration von Yandex als Teil einer Russland/GUS-Strategie verbindet das internationale-SEO- und marktspezifische-SEO-Material die Punkte.
KI-Zusammenfassung
Eine komprimierte Darstellung der erweiterten Version:
- YandexBot = Yandex Search’s main indexing crawler — the Yandex equivalent of
Googlebot/Bingbot. UA string:
Mozilla/5.0 (compatible; YandexBot/3.0; +http://yandex.com/bots) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/81.0.4044.268(don’t match on the Chrome version — it changes). - Two robots.txt tokens, different scopes:
YandexBot= main indexing bot only;Yandex= the broader bot family. AUser-agent: Yandexblock makes Yandex ignoreUser-agent: *. Some Yandex bots may ignore robots.txt entirely. - Clean-param is Yandex-only — consolidates URL parameters that don’t change
content (no Google/Bing equivalent). It doesn’t require
Disallow, and it’s intersectional (can go anywhere in the file). - Crawl-delay is dead — Yandex stopped honoring it on February 22, 2018; use the Crawl rate tool instead. Some SEO guides still wrongly claim Yandex supports it. (Bing does; Yandex doesn’t.)
Disallow≠noindex— disallowed pages “can participate in Yandex search.” Usenoindex(meta or HTTP header) to actually remove a page.- JavaScript rendering is beta and “at the bot’s discretion.” The 2023 leak suggested “no separate rendering system for JavaScript” — so it’s selective and simpler than Google’s two-wave pipeline. Prefer SSR/pre-rendering; avoid hash-bang URLs (use the History API).
- 2023 source-code leak (leaked, not official): revealed a dual-crawler system (real-time “Orange Crawler” + general crawler) and that homepage-reachable URLs carry higher importance (crawl-depth as a signal).
- Verify with reverse-then-forward DNS to a
yandex.ru/yandex.net/yandex.comhost — the same FCrDNS technique Google and Bing use — never the spoofable user-agent. - Why care: ~71% Russia search share (vs. Google ~27%, June 2026). Tiny globally, dominant regionally. In robots.txt: ~0,5% of files (2021) → 3% (2022) per the Web Almanac.
Offizielle Dokumentation
Primärquellen-Dokumentation, hauptsächlich von Yandex Webmaster Help, mit Google/Bing-Vergleichslinks. Hinweis: Mehrere Yandex-Webmaster-Tool-Seiten (Crawl rate, der robots.txt-Analysator) sind App-Seiten, die einen angemeldeten Browser benötigen, um sie vollständig zu sehen, und die Verifizierungsseiten von Google/Bing sind JavaScript-gerendert – bestätigen Sie Details live, wenn ein Link nicht funktioniert.
Yandex
- The User-agent directive — die
YandexBot- vs.Yandex-Token-Scoping- und Präzedenzregeln. - How to check that a robot belongs to Yandex — die vollständige User-Agent-Zeichenfolge und die Reverse-DNS-Verifizierungsmethode.
- Using robots.txt — die von Yandex erkannten Direktiven, die 500-KB-/HTTP-200-Dateianforderungen und die
Disallow-≠-Index-Anmerkung. - The Clean-param directive — Yandex’ einzigartige Parameter-Konsolidierungs-Direktive (Syntax + ausgearbeitetes Beispiel).
- The Crawl-delay directive — die Seite, die besagt, dass Crawl-delay seit dem 22. Februar 2018 ignoriert wird.
- Site crawl rate — der Crawl-delay-Ersatz in Yandex Webmaster.
- Indexing pages with JavaScript (β) — der Standard „nach Ermessen des Bots“ und die SSR-Empfehlung.
- Indexing AJAX sites — JS-Ausführung auf ursprünglichen URLs und die History-API-Empfehlung.
Google / Bing (zum Vergleich)
- Verify Requests from Google Crawlers and Fetchers — Googles Reverse-/Forward-DNS-Methode (gegen
googlebot.com/google.com/googleusercontent.com) — dasselbe FCrDNS-Muster, das auch Yandex verwendet. - Which crawlers does Bing use? — Bings Crawler-Liste; Bing verifiziert gegen
*.search.msn.comund respektiert weiterhincrawl-delay(Yandex nicht).
Zitate aus der Quelle
Offizielle Aussagen aus Yandex’ eigener Dokumentation sowie das durch Branchenberichte weitergegebene interne Leak-Material. Jeder Link ist ein Deep Link, der direkt zur zitierten Passage springt. Yandex’ Dokumentation besteht aus englischen Übersetzungen, die von Yandex selbst veröffentlicht wurden – wörtlich von diesen Seiten zitiert.
Yandex – robots.txt-Tokens und Priorität
- “If the
User-agent: Yandexstring is detected, theUser-agent: *string is ignored.” (Übersetzung) „Wenn die ZeichenfolgeUser-agent: Yandexerkannt wird, wird die ZeichenfolgeUser-agent: *ignoriert.“ Zum Zitat springen - “Some Yandex robots may ignore directives in
robots.txt, including those forUser-agent: Yandex.” (Übersetzung) „Einige Yandex-Roboter können Anweisungen inrobots.txtignorieren, einschließlich derer fürUser-agent: Yandex.“ Zum Zitat springen - “
YandexAdditionalBot… Helps process robots.txt to prevent page content from appearing in Search with Yandex AI responses. Applies to the pages that have been indexed by the primary crawler.” (Übersetzung) „YandexAdditionalBot… Hilft bei der Verarbeitung von robots.txt, um zu verhindern, dass Seiteninhalte in der Suche mit Yandex-KI-Antworten erscheinen. Gilt für Seiten, die vom primären Crawler indexiert wurden.“ Zum Zitat springen
Yandex – Bot-Verifizierung
- “Some robots can disguise themselves as Yandex robots by indicating the relevant User Agent. You can check the authenticity of a robot using a reverse DNS lookup.” (Übersetzung) „Einige Roboter können sich als Yandex-Roboter ausgeben, indem sie den entsprechenden User Agent angeben. Sie können die Authentizität eines Roboters mithilfe eines Reverse-DNS-Lookups überprüfen.“ Zum Zitat springen
- “Check whether the host belongs to Yandex. All Yandex robots have names ending in
yandex.ru,yandex.netoryandex.com.” (Übersetzung) „Überprüfen Sie, ob der Host zu Yandex gehört. Alle Yandex-Roboter haben Namen, die aufyandex.ru,yandex.netoderyandex.comenden.“ Zum Zitat springen - “If the IP addresses do not match, it means that the host name is fake.” (Übersetzung) „Wenn die IP-Adressen nicht übereinstimmen, bedeutet das, dass der Hostname gefälscht ist.“ Zum Zitat springen
Yandex – robots.txt und Clean-param
- “Pages restricted in
robots.txtcan participate in Yandex search. To remove pages from search, specify thenoindexdirective in the HTML code of the page or configure the HTTP header.” (Übersetzung) „Inrobots.txteingeschränkte Seiten können an der Yandex-Suche teilnehmen. Um Seiten aus der Suche zu entfernen, geben Sie dienoindex-Direktive im HTML-Code der Seite an oder konfigurieren Sie den HTTP-Header.“ Zum Zitat springen - “The Yandex robot uses this directive to avoid reloading duplicate information. This improves the robot’s efficiently and reduces the server load.” [sic — “efficiently” is Yandex’s own typo] (Übersetzung) „Der Yandex-Roboter verwendet diese Direktive, um das erneute Laden doppelter Informationen zu vermeiden. Dies verbessert die Effizienz des Roboters und reduziert die Serverlast.“ [sic – „efficiently“ ist Yandex‘ eigener Tippfehler] Zum Zitat springen
- “The Clean-param directive does not require mandatory combination with the Disallow directive.” (Übersetzung) „Die Clean-param-Direktive erfordert keine zwingende Kombination mit der Disallow-Direktive.“ Zum Zitat springen
- “Do not restrict such pages in
robots.txt, or the Yandex bot can’t index them and detect your instructions.” (Übersetzung) „Beschränken Sie solche Seiten nicht inrobots.txt, sonst kann der Yandex-Bot sie nicht indexieren und Ihre Anweisungen nicht erkennen.“ Zum Zitat springen
Yandex – Crawl-delay und JavaScript
- “From February 22, 2018, Yandex doesn’t take into account the Crawl-delay directive.” (Übersetzung) „Ab dem 22. Februar 2018 berücksichtigt Yandex die Crawl-delay-Direktive nicht mehr.“ Zum Zitat springen
- “Prohibit rendering if SSR (Server-Side Rendering) or pre-rendering is implemented on the site.” (Übersetzung) „Verbieten Sie das Rendering, wenn auf der Website SSR (Server-Side Rendering) oder Pre-Rendering implementiert ist.“ Zum Zitat springen
- “When indexing an AJAX site, the Yandex bot scans the original URLs and executes JavaScript code on them.” (Übersetzung) „Beim Indexieren einer AJAX-Website scannt der Yandex-Bot die ursprünglichen URLs und führt darauf JavaScript-Code aus.“ Zum Zitat springen
Der Yandex-Quellcode-Leak von 2023 (durchgesickerte interne Dokumentation, vermittelt über Branchenberichterstattung – keine offizielle Yandex-Erklärung)
- “Yandex has no separate rendering system for JavaScript. They say this in their documentation and, although they have Webdriver-based system for visual regression testing called Gemini, they limit themselves to text-based crawl.” — Mike King, iPullRank, via Search Engine Land. (Übersetzung) „Yandex hat kein separates Rendering-System für JavaScript. Das sagen sie in ihrer Dokumentation, und obwohl sie ein Webdriver-basiertes System für visuelle Regressionstests namens Gemini haben, beschränken sie sich auf textbasiertes Crawling.“ Berichterstattung lesen
- “Yandex’s documentation discusses a dual-distributed crawler system. One for real-time crawling called the ‘Orange Crawler’ and another for general crawling.” — Search Engine Land. (Übersetzung) „Yandex‘ Dokumentation beschreibt ein dual-verteiltes Crawler-System. Eines für Echtzeit-Crawling namens ‚Orange Crawler‘ und ein weiteres für allgemeines Crawling.“ Berichterstattung lesen
- “There’s nothing new to suggest Yandex can crawl JavaScript yet outside of already publicly documented processes.” — Dan Taylor, via Search Engine Journal. (Übersetzung) „Es gibt nichts Neues, das darauf hindeutet, dass Yandex JavaScript bereits außerhalb der bereits öffentlich dokumentierten Prozesse crawlen kann.“ Berichterstattung lesen
Web Almanac 2022, SEO-Kapitel (Ich war ein Gutachter)
- “Yandexbot was specified in just 0.5% of robots.txt files in 2021. By 2022, there was a six-fold increase, with 3% of files specifying Yandexbot.” (Übersetzung) „Yandexbot wurde 2021 in nur 0,5 % der robots.txt-Dateien angegeben. Bis 2022 gab es eine sechsfache Steigerung, wobei 3 % der Dateien Yandexbot angaben.“ Zum Zitat springen
Sollte ich YandexBot blockieren, zulassen oder drosseln?
Die YandexBot-Frage ist fast immer eine geschäftliche Frage im technischen Gewand. Arbeiten Sie sie durch.
What to do about YandexBot in your logs
YandexBot-Mythen und zu vermeidende Fehler
Die Fallstricke, die am häufigsten auftreten – einige werden weit verbreitet und sind eine Korrektur wert:
- “Crawl-delay verlangsamt YandexBot.” Nein. Yandex hat die Berücksichtigung von
Crawl-delayam 22. Februar 2018 eingestellt (“Yandex berücksichtigt die Crawl-delay-Direktive nicht”). Einige SEO-Leitfäden behaupten immer noch, Yandex unterstütze sie – das ist veraltet. Verwenden Sie stattdessen die Crawl-Rate-Einstellung in Yandex Webmaster. (Stattdessen tun: Überprüfen Sie Crawl-Verhaltensbehauptungen anhand der Live-Dokumentation von Yandex und drosseln Sie über die Crawl-Rate, nicht über Crawl-delay.) - “
Disallowin robots.txt entfernt die Seite aus Yandex.” Nein – Yandex’ eigene Dokumentation besagt, dass nicht erlaubte Seiten “an der Yandex-Suche teilnehmen können”.Disallowstoppt das Crawlen, nicht das Indexieren. (Stattdessen tun: Verwenden Sienoindexim HTML oder einen HTTP-Header, um eine Seite tatsächlich auszuschließen; lassen Sie Yandex sie crawlen, damit es das Tag sehen kann.) - “
User-agent: YandexBotundUser-agent: Yandexsind dasselbe.” Nein –YandexBotzielt nur auf den Haupt-Indexierungsbot;Yandexzielt auf die breitere Familie. Und einUser-agent: Yandex-Block führt dazu, dass Yandex IhrenUser-agent: *-Block vollständig ignoriert. (Stattdessen tun: Wählen Sie das Token, das dem tatsächlich beabsichtigten Umfang entspricht, und gehen Sie nicht davon aus, dass*-Regeln Yandex-Bots erreichen.) - “YandexBot rendert JavaScript genau wie Googlebot.” Nicht belegt. Das Rendering von Yandex ist Beta und “im Ermessen des Bots”, und das Leak von 2023 deutete auf “kein separates Rendering-System für JavaScript” hin. (Stattdessen tun: Servieren Sie JS-abhängige Inhalte über SSR/Pre-Rendering, anstatt anzunehmen, dass clientseitiges Rendering indexiert wird.)
- “Der User-Agent-String beweist, dass es YandexBot ist.” Nein – er ist trivial fälschbar.
(Stattdessen tun: Verifizieren Sie mit Reverse-dann-Forward-DNS zu einem
yandex.ru/yandex.net/yandex.com-Host, genau wie Sie Googlebot oder Bingbot verifizieren würden.) - “Jeder YandexBot-Traffic auf einer nicht-russischen Website ist von Natur aus verdächtig/fake.”
Nicht unbedingt – legitime YandexBot-Crawls betreffen auch global ausgerichtete Websites, nicht nur
.ru-Domains. (Stattdessen tun: Verifizieren Sie per DNS, bevor Sie entscheiden, dass es gefälscht ist; ein echter Yandex-Host ist echt, unabhängig von Ihrer Zielgruppe.) - “Das Leak von 2023 hat bewiesen, dass Yandex einen geheimen überlegenen JS-Crawler hat.” Nein – die Berichterstattung kam zu dem Schluss, dass es “nichts Neues gibt, das darauf hindeutet, dass Yandex JavaScript außerhalb bereits öffentlich dokumentierter Prozesse crawlen kann”. (Stattdessen tun: Überinterpretieren Sie das Leak nicht; es bestätigte das Bild des begrenzten Renderings, es hat es nicht umgestoßen.)
YandexBot – Spickzettel
User-Agent-String (Haupt-Indexierungsbot)
Mozilla/5.0 (compatible; YandexBot/3.0; +http://yandex.com/bots) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/81.0.4044.268Matchen Sie auf das YandexBot-Token, nicht auf die Chrome/81.0.4044.268-Version – Yandex
sagt, dass sich die Browserversion ändern kann.
Die zwei robots.txt-Tokens
| Token | Umfang |
|---|---|
User-agent: YandexBot | Nur der Haupt-Indexierungsbot |
User-agent: Yandex | Yandex’ breitere Bot-Familie |
Ein User-agent: Yandex-Block führt dazu, dass Yandex Ihren User-agent: *-Block ignoriert.
Einige Yandex-Bots ignorieren robots.txt möglicherweise vollständig.
Direktiven, die Yandex erkennt
| Direktive | Funktion |
|---|---|
User-agent | Für welchen Roboter die Regeln gelten |
Disallow | Verhindert das Crawlen (nicht das Indexieren) |
Allow | Erlaubt das Crawlen/Indexieren von Abschnitten oder Seiten |
Sitemap | Pfad zur Sitemap-Datei |
Clean-param | Nur Yandex – ignoriert aufgelistete URL-Parameter (kein Google/Bing-Äquivalent) |
Clean-param-Kurzform
User-agent: Yandex
Clean-param: ref /some_dir/get_book.plKonsolidiert ?ref=…-Varianten zu einer URL. Benötigt kein Disallow; kann
überall in der Datei stehen.
Verifizierung vs. Google vs. Bing (alle verwenden Forward-Confirmed Reverse DNS)
| Suchmaschine | Reverse-DNS-Host muss enden auf |
|---|---|
| Yandex | yandex.ru / yandex.net / yandex.com |
googlebot.com / google.com / googleusercontent.com | |
| Bing | *.search.msn.com |
Kurzfakten
- Crawl-delay: tot seit dem 22. Februar 2018 – verwenden Sie das Crawl-Rate-Tool. (Bing
respektiert
crawl-delayweiterhin; Yandex nicht.) robots.txtmussrobots.txtheißen, ≤ 500 KB groß sein und HTTP 200 zurückgeben.- JavaScript-Rendering: Beta, “nach Ermessen des Bots” – bevorzugen Sie SSR.
- Russland-Anteil: ~71 % (vs. Google ~27 %), Juni 2026 (StatCounter).
- In robots.txt: 0,5 % (2021) → 3 % (2022) der Dateien (Web Almanac).
Überprüfen, ob ein Bot wirklich YandexBot ist
Der User-Agent ist trivial fälschbar, bestätigen Sie ihn daher mit einem Reverse-DNS-Lookup (muss
auf eine Yandex-Domain enden) gefolgt von einem Forward-DNS-Lookup (muss auf dieselbe
IP auflösen). Dies ist das exakte FCrDNS-Muster, das Sie für Googlebot oder Bingbot verwenden würden – nur die
Domain-Suffixe unterscheiden sich (yandex.ru / yandex.net / yandex.com).
macOS / Linux
# 1) Reverse-DNS the IP from your logs — the host must end in
# yandex.ru, yandex.net, or yandex.com
host 5.255.253.1
# → 1.253.255.5.in-addr.arpa domain name pointer <something>.yandex.com (illustrative)
# 2) Forward-DNS that hostname back — it must resolve to the same IP
host <the-hostname-from-step-1>.yandex.comWindows
nslookup 5.255.253.1
nslookup <the-hostname-from-step-1>.yandex.comWenn der Reverse-Lookup nicht auf eine Yandex-Domain endet oder der Forward-Lookup nicht die ursprüngliche IP zurückgibt, handelt es sich nicht um YandexBot – verwerfen oder drosseln Sie ihn.
Verifizierte vs. gefälschte YandexBot-Treffer aus einer Logdatei extrahieren
Ein schneller Shell-Durchlauf, um “YandexBot”-Zeilen herauszuziehen und die PTR jeder Quell-IP zu prüfen. Passen Sie die Feldpositionen an Ihr Logformat an (dies setzt ein gängiges kombiniertes Format mit der IP zuerst voraus).
# Pull unique IPs that claimed to be YandexBot, then reverse-resolve each
grep -i 'YandexBot' access.log \
| awk '{print $1}' | sort -u \
| while read ip; do
host="$(host "$ip" 2>/dev/null | awk '/pointer/{print $NF}' | sed 's/\.$//')"
case "$host" in
*.yandex.ru|*.yandex.net|*.yandex.com) echo "REAL $ip $host" ;;
"" ) echo "NO-PTR $ip" ;;
* ) echo "FAKE $ip $host" ;;
esac
doneREAL-Zeilen verdienen dennoch eine Forward-Lookup-Bestätigung für alles, auf das Sie reagieren
(host "$host" sollte die ursprüngliche IP zurückgeben), aber dies sortiert zuerst die offensichtlichen
Betrüger aus.
Regex zum Abgleichen des YandexBot-Tokens in einem User-Agent
Passen Sie das Produkttoken ab, nicht die Chrome-Version (die sich ändert). Groß-/Kleinschreibung wird ignoriert:
YandexBot/\d+(\.\d+)?Breiterer “beliebiger Yandex-Roboter”-Abgleich (erfasst YandexImages, YandexMobileBot usw.):
Yandex[A-Za-z]*/\dDenken Sie daran: Ein passender User-Agent ist notwendig, aber nicht ausreichend – kombinieren Sie jeden Regex-Abgleich mit der obigen DNS-Prüfung, bevor Sie ihm vertrauen.
Ein robots.txt-Ausgangspunkt für Yandex
# Slow/duplicate-parameter cleanup for all Yandex bots
User-agent: Yandex
Clean-param: utm_source&utm_medium&utm_campaign /
# Block only the main indexing bot from a low-value space
User-agent: YandexBot
Disallow: /internal-search/
Sitemap: https://example.com/sitemap.xmlDenken Sie daran: Disallow blockiert Crawling, nicht Indexierung – verwenden Sie noindex, um eine
Seite aus der Yandex-Suche zu entfernen. Um alle Yandex-Bots vollständig zu blockieren (einige ignorieren robots.txt),
blockieren Sie per verifizierter IP auf dem Server.
YandexBot-Bereitschafts-Checkliste
Ein schneller Durchlauf, um zu bestätigen, dass Sie YandexBot bewusst behandeln, nicht zufällig:
- Sie haben entschieden, ob Yandex für Ihre Website relevant ist (irgendein Russland/GUS-Publikum oder Geschäft?) – die gesamte Block/Erlauben-Frage hängt davon ab.
- Die Bot-Verifizierung verwendet Reverse + Forward-DNS zu einem
yandex.ru/yandex.net/yandex.com-Host – nicht den spoofbaren User-Agent und keine hartcodierte IP-Liste. - Sie verwenden das richtige robots.txt-Token für Ihre Absicht:
YandexBot(nur der Haupt-Indexierungs-Bot) vs.Yandex(die breitere Familie). - Sie wissen, dass ein
User-agent: Yandex-Block dazu führt, dass Yandex IhrenUser-agent: *-Block ignoriert. - Sie verlassen sich nicht auf
Crawl-delay(seit dem 22. Februar 2018 tot) – drosseln Sie stattdessen über das Crawl-Rate-Tool in Yandex Webmaster. - Sie verwenden
Disallownicht zum Deindexieren – das ist die Aufgabe vonnoindex(bei erlaubtem Crawling). - Doppelte URL-Parameter werden mit Clean-param konsolidiert, wo relevant (es benötigt kein
Disallowund kann überall in der Datei stehen). - JS-abhängige Inhalte werden über SSR/Pre-Rendering ausgeliefert, da das Rendering von Yandex Beta ist und „im Ermessen des Bots“ liegt.
- AJAX-Routen verwenden saubere URLs / die History-API, nicht Hash-Bang-URLs (
#!). - Für den vollständigen Ausschluss aller Yandex-Bots (einige ignorieren robots.txt) blockieren Sie per verifizierter IP auf dem Server, nicht nur in robots.txt.
Tools zur Verifizierung und Überwachung von YandexBot
Die beiden häufigsten Aufgaben im Zusammenhang mit YandexBot sind die Bestätigung, dass ein Treffer echt ist, und die Einschätzung, wie viel er tatsächlich von Ihrer Website crawlt. Beginnen Sie hier:
- Googlebot-Verifier – fügen Sie eine IP aus Ihren Logs ein, und das Tool führt die Forward-bestätigte Reverse-DNS-Prüfung für Sie durch (die gleiche Methode, die Yandex zur Bestätigung eines
yandex.ru/yandex.net/yandex.com-Hosts dokumentiert) und nennt den tatsächlichen Netzwerkbesitzer, wenn es sich stattdessen um einen Spoofer handelt. Schneller alshost/nslookupfür jeden verdächtigen Treffer von Hand auszuführen, und es deckt auch Googlebot, Bingbot und die wichtigsten KI-Crawler ab, wenn Sie ein gemischtes Log prüfen. - Log-Datei-Analyzer – laden Sie ein Server-Zugriffslog (nginx, Apache, IIS/W3C oder JSON) hoch und sehen Sie den tatsächlichen Crawl-Fußabdruck von YandexBot: wie viel von Ihrer Website er trifft, welche Bereiche, Statuscode-Verschwendung und einen Spoofer-Bericht, der IPs kennzeichnet, die behaupten, YandexBot zu sein, aber nicht übereinstimmen. Nützlich für die Frage „Belastet dieses Crawling tatsächlich meinen Server?“ aus dem Entscheidungsbaum oben – alles läuft in Ihrem Browser, nichts wird hochgeladen.
Von Yandex selbst
- Yandex Webmaster – die Crawl-Rate-Einstellung (der Ersatz für Crawl-delay) und der robots.txt-Analyzer befinden sich hier; Sie benötigen ein verifiziertes, angemeldetes Yandex-Webmaster-Konto, um beide zu nutzen.
Ressourcen, die Ihre Zeit wert sind
Meine verwandten Artikel
- Indexiert, obwohl durch robots.txt blockiert – warum eine robots-blockierte URL trotzdem indexiert wird; dieselbe
Disallow≠noindex-Falle gilt für Yandex. - Robots.txt und SEO: Alles, was Sie wissen müssen – die allgemeine robots.txt-Referenz (Hinweis: Die Yandex-
Crawl-delay-Behauptung ist veraltet, laut Yandex’ eigenen datierten Dokumenten – ein gutes Beispiel dafür, gegen die Quelle zu prüfen). - Die Geschichte der Blockierung von 2 stark rankenden Seiten mit Robots.txt – mein First-Party-Experiment darüber, was tatsächlich passiert, wenn Sie Ranking-Seiten blockieren.
- Lernen Sie die neuen Web-Crawler kennen: KI-Bots holen auf Suchmaschinen-Bots auf – wie sich die Crawler-Besetzung in Ihren Logs verändert hat.
- Die SEO-Bots, die ~140 Millionen Websites am häufigsten blockieren – meine Studie mit Xibeijia Guan über robots.txt-Blockraten (sie deckt westliche SEO-Tool-Bots ab, nicht YandexBot – zitiert für die Methodik und als Kontrast dazu, wie selten Websites für Yandex konfigurieren).
Meine Vorträge
- How Search Works (SlideShare) – meine Erläuterung von Crawling, Rendering, Indexierung und Ranking. (Der übliche Hinweis gilt: “This is my understanding of systems… not going to be 100% complete or accurate.”) (Übersetzung) „Das ist mein Verständnis von Systemen … es wird nicht zu 100 % vollständig oder genau sein.”
Aus der Branche
- Yandex scrapes Google and other SEO learnings from the source code leak (Mike King / iPullRank, Search Engine Land, 30. Januar 2023) – die Erkenntnisse zum „Orange Crawler“-Dual-Crawler-System und „kein separates Rendering-System für JavaScript“.
- Yandex Data Leak: The Ranking Factors & The Myths We Found (Dan Taylor, Search Engine Journal, 1. Februar 2023) – das Crawl-Tiefe-als-Bedeutungssignal und die Schlussfolgerung „nichts Neues zum JavaScript-Crawling“.
- Yandex ‘leak’ reveals 1,922 search ranking factors (Search Engine Land) – Kontext und Datierung für das Ausmaß des Leaks.
- Does the Yandex Code Leak Tell Us Anything About Google? (seoClarity) – eine ausgewogene engine-übergreifende Einordnung des Leaks.
- The Ultimate Guide to Yandex SEO (Search Engine Journal) – breiterer Kontext zur Yandex-Optimierung über den Crawler hinaus.
- Web Almanac 2022 — SEO chapter (HTTP Archive) – die Quelle der Statistik zur YandexBot-Erwähnung in robots.txt.
Statistiken, die sich zu zitieren lohnen
- ~71 % Russland-Suchanteil – Yandex‘ Anteil am russischen Suchmarkt gegenüber Googles ~27 %, laut StatCounter (Daten für Juni 2026 gemeldet; zeitkritisch, daher Monat/Jahr angeben und mit Abweichungen rechnen). Dies ist der einzige Grund, warum YandexBot eine separate Behandlung gegenüber „alle Nicht-Google-Bots blockieren“ rechtfertigt. Quelle
- 0,5 % → 3 % der robots.txt-Dateien – YandexBot ging von „nur 0,5 % der robots.txt-Dateien im Jahr 2021“ auf „3 % der Dateien, die Yandexbot angeben“ im Jahr 2022 über – eine sechsfache Steigerung, wenn auch immer noch gering (Web Almanac 2022, SEO-Kapitel, das ich geprüft habe). Nützlich als historische Basislinie für „wie verbreitet ist das in der Praxis“. Quelle
- 22. Februar 2018 – das Datum, an dem Yandex die Beachtung von
Crawl-delayeinstellte, laut eigener Dokumentation. Ein präzises, zitierfähiges Abschaltdatum, um veralteten Anleitungen entgegenzuwirken, die behaupten, Yandex unterstütze die Direktive weiterhin. Quelle
Testen Sie sich: YandexBot
Fünf kurze Fragen zu YandexBot, seinem robots.txt-Verhalten und wie er sich zu Googlebot und Bingbot verhält. Wählen Sie für jede eine Antwort und prüfen Sie dann.
Änderungsprotokoll
Aktualisiert am 18. Juli 2026.
Redaktionelle Zusammenfassung und aufgezeichnete Änderungsdetails.Änderungsdetails
-
Detaillierte Änderungsangaben sind derzeit auf Englisch verfügbar.
-
Detaillierte Änderungsangaben sind derzeit auf Englisch verfügbar.
-
Detaillierte Änderungsangaben sind derzeit auf Englisch verfügbar.
-
Detaillierte Änderungsangaben sind derzeit auf Englisch verfügbar.
-
Detaillierte Änderungsangaben sind derzeit auf Englisch verfügbar.
Vollständiger Vergleich nicht verfügbar — für diese Version wurde kein früherer Schnappschuss archiviert.