Robots.txt- und Sitemap-Prüfung
Prüfen Sie robots.txt und Sitemap-Dateien auf einem Bildschirm, ohne Anmeldung.
Dieses Werkzeug liest zuerst die robots.txt-Datei Ihrer Domain: ob sie existiert, ihre Größe, die Anzahl der Regelgruppen, eine Warnung bei einem Disallow: /, das die ganze Website sperrt, vorhandene Sitemap-Zeilen, den Crawl-delay-Wert und Syntaxfehler wie unbekannte Anweisungen. Anschließend liest es die in robots.txt genannte Sitemap oder, falls keine genannt ist, /sitemap.xml; handelt es sich um einen Sitemap-Index, geht es in die ersten zwei Unterdateien hinein, insgesamt werden höchstens drei Sitemap-Dateien geladen.
Der Bericht zeigt den Sitemap-Typ, ob es sich um eine einfache Liste oder einen Index handelt, die Anzahl der Adressen, den Anteil mit lastmod-Datum, das neueste und älteste lastmod, Adressen mit anderer Zieldomain, eine Mischung aus http und https, wie nahe die Datei an der offiziellen Grenze von 50.000 Adressen oder 50 MB liegt, und ob hreflang-Angaben (xhtml:link) vorhanden sind. Zusätzlich sendet es an die ersten fünf Adressen eine HEAD-Anfrage und listet deren Statuscodes auf.
Diese Prüfung stellt höchstens zehn ausgehende Anfragen, deshalb betrachtet sie bei einem sehr großen Sitemap-Index nur die ersten Teile und nicht den gesamten Baum; die gezeigte Adressenzahl spiegelt das Gelesene wider, nicht jede Seite Ihrer Website. Sperrt robots.txt die ganze Website oder lässt sich keine Sitemap finden, sehen Sie das als eigene Warnung, doch wie eine Suchmaschine Ihre Website tatsächlich crawlt, bestätigt nur ein Werkzeug wie die Google Search Console.
Häufige Fragen
Was passiert, wenn ich keine Sitemap habe?
Findet das Werkzeug weder eine Sitemap-Zeile in robots.txt noch etwas unter /sitemap.xml, markiert es das als fehlend. In diesem Fall lohnt es sich, eine Sitemap zu erstellen und zu veröffentlichen, damit Suchmaschinen Ihre Adressen finden.
Liest das Werkzeug jede Datei eines großen Sitemap-Index?
Nein, es lädt höchstens drei Sitemap-Dateien und geht bei einem Index nur in die ersten zwei Unterdateien hinein; der Bericht nennt diese Grenze klar, statt die ganze Website abzubilden.
Wird die eingegebene Domain gespeichert?
Nein, es gibt keine dauerhafte Speicherung; wird dieselbe Domain kurz danach erneut geprüft, bleibt sie für etwa zehn Minuten im Arbeitsspeicher des Servers und wird danach gelöscht.
Wirkt Crawl-delay bei Google?
Google ignoriert diese Anweisung; Bing und einige andere Crawler berücksichtigen sie möglicherweise, deshalb zeigt das Werkzeug den Wert, seine Wirkung hängt aber vom jeweiligen Crawler ab.
