KI-Crawler und robots.txt: Erlauben oder blockieren
GPTBot, ClaudeBot und PerplexityBot crawlen eine Website jeweils aus einem anderen Grund. Wir erklären, wie man entscheidet, was man erlaubt und blockiert.
rabbitclip-TeamVeröffentlicht: 4 Min. Lesezeit
Kurz gesagt
GPTBot, ClaudeBot und PerplexityBot erledigen auf derselben Website jeweils eine andere Aufgabe: Der eine sammelt Inhalte, um ein Modell zu trainieren, der andere besucht eine Seite, während er die konkrete Frage einer Person live beantwortet, der dritte indexiert eine Seite, um eine suchähnliche Antwort aufzubauen. Einen Crawler in robots.txt zu blockieren stoppt nur diese eine Aufgabe; ein anderer Bot desselben Unternehmens kann die Website weiter zu einem anderen Zweck besuchen.
Anthropics eigene Hilfeseite beschreibt drei getrennte Bots: ClaudeBot sammelt Trainingsdaten, Claude-User besucht eine Website im Auftrag einer Person, die Claude eine Frage stellt, und Claude-SearchBot bewertet Inhalte für suchartige Antworten. Alle drei respektieren robots.txt, werden aber jeweils getrennt verwaltet.
Was tun diese Crawler eigentlich?
Der Name eines Crawlers deutet meist auf seine Aufgabe hin, doch jedes Unternehmen benennt seine Bots anders. Bei Anthropic sammelt ClaudeBot Trainingsdaten, Claude-User besucht eine Live-Seite im Auftrag einer Nutzerin, Claude-SearchBot bewertet Inhalte für suchqualitätsbezogene Antworten.
Auf Seiten von OpenAI crawlt GPTBot für das Modelltraining, während OAI-SearchBot die Suchfunktion von ChatGPT speist; eine Website kann GPTBot blockieren und OAI-SearchBot trotzdem zulassen. Welche Teilaufgaben PerplexityBot genau auf getrennte Agenten verteilt, kann je nach Situation variieren; die aktuelle Liste steht immer in der eigenen Crawler-Dokumentation des jeweiligen Unternehmens.
Was kostet Blockieren, was bringt Erlauben?
Einen Trainingsbot (GPTBot, ClaudeBot) zu blockieren bedeutet, dass dieses Unternehmen die Inhalte einer Website nicht in zukünftigem Modelltraining verwenden kann. Im Gegenzug kann dadurch auch das Risiko steigen, in den Antworten dieses Modells nie mehr als Quelle zu erscheinen, denn dieselben Inhalte fließen häufig sowohl ins Training als auch in die Antwortgenerierung ein.
Einen Such- oder Nutzer-Bot (Claude-User, OAI-SearchBot) zu blockieren führt zu einem anderen Ergebnis: Die Website taucht in den Live-Antworten dieses Assistenten schlicht nicht mehr auf. Für eine E-Commerce-Website ist das meist ein unerwünschter Verlust, für eine Abo-Content-Website kann es eine bewusste Entscheidung sein.
So schreiben Sie die Regel in robots.txt: eine praktische Anleitung
Einen Crawler zu blockieren oder zuzulassen ist in robots.txt eine Regel von wenigen Zeilen.
- Öffnen Sie die robots.txt-Datei im Stammverzeichnis der Website (zum Beispiel seitenname.com/robots.txt).
- Schreiben Sie für einen zu blockierenden Bot unter einer Zeile 'User-agent: GPTBot' die Zeile 'Disallow: /'.
- Öffnen Sie für einen zuzulassenden Bot einen eigenen User-agent-Block und lassen Sie die Zeile 'Disallow:' leer.
- Definieren Sie jeden Bot in einem eigenen Block; mehrere Bot-Namen in einem Block aufzulisten funktioniert möglicherweise nicht wie erwartet.
- Prüfen Sie nach der Änderung direkt im Browser, ob die Datei live korrekt angezeigt wird.
Blockiert das Sperren eines Bots auch die anderen?
Nein. Anthropics eigene Dokumentation stellt klar, dass das Blockieren von ClaudeBot nur das Sammeln von Trainingsdaten stoppt und weder Claude-SearchBot noch Claude-User betrifft; die drei werden in robots.txt getrennt verwaltet.
Das bedeutet, eine Website kann je nach eigenen Prioritäten getrennte Entscheidungen treffen: Trainingsdatensammlung auszuschalten, aber trotzdem in Live-Antworten des Assistenten zu erscheinen, ist technisch möglich.
Häufige Fehler
Ein häufiger Fehler, den wir bei einem Bodenbelagshersteller gesehen haben, ist, alle KI-Bots mit einer einzigen pauschalen Regel zu blockieren, 'Disallow: /' unter 'User-agent: *'; das stoppt die unerwünschten Trainingsbots zusammen mit den Such- und Assistenten-Bots, die das Unternehmen eigentlich wollte.
Ein weiterer Fehler ist, robots.txt zu aktualisieren, ohne die Änderung live zu prüfen; ein Servercache oder ein falscher Dateipfad können dazu führen, dass die Änderung nie wirklich wirksam wird.
Für Erlauben oder Blockieren gibt es keine einzige richtige Antwort, eine E-Commerce-Website und eine Abo-Content-Website können hier nachvollziehbar zu unterschiedlichen Entscheidungen kommen. Entscheidend ist, mit klarem Bild davon zu entscheiden, was jeder Bot tut, statt alle in einen Topf zu werfen. Ein kurzes Gespräch mit rabbitclip genügt, um die aktuellen robots.txt-Regeln einer Website durchzugehen.
Häufige Fragen
Verschwinde ich komplett aus ChatGPT, wenn ich GPTBot blockiere?
GPTBot sammelt Trainingsdaten; OAI-SearchBot, der die Suchfunktion von ChatGPT speist, wird getrennt verwaltet, Sie können also weiterhin auf der Suchseite erscheinen, solange Sie nicht auch diesen blockieren.
Ist es sinnvoll, alle KI-Bots mit einer einzigen Regel zu blockieren?
Meist nicht; das stoppt die unerwünschten Trainingsbots zusammen mit den Such- und Assistenten-Bots, die man vielleicht tatsächlich möchte.
Wirkt eine Änderung an robots.txt sofort?
Bots lesen die Datei entsprechend ihrer eigenen Crawl-Frequenz erneut ein; dieser Zeitpunkt ist nicht fest, die Änderung wirkt also schrittweise statt sofort.
Wie entscheide ich, welche Bots ich blockiere?
Es geht um eine Abwägung zwischen dem Wunsch, keine Trainingsdaten zu teilen, und dem Wunsch, Such- und Assistentensichtbarkeit nicht zu verlieren; die richtige Antwort unterscheidet sich je nach Website.
