Werbung: Dieser Beitrag entstand in Zusammenarbeit mit deine-geo-agentur.de.
Die neue Website ist live, das Design gelobt, die Ladezeit halbiert – und trotzdem verschwindet das Unternehmen Wochen später aus den Antworten von ChatGPT und Perplexity. Die Ursache liegt häufig nicht im Inhalt, sondern in der Infrastruktur. Neue Hoster, CDNs und Web Application Firewalls bringen Voreinstellungen mit, die KI-Crawler abweisen, ohne dass jemand das beschlossen hat. Seit dem 15. September 2026 gelten bei Cloudflare für neu angelegte Domains zudem neue Standardregeln. Dieser Beitrag erklärt, wie solche Sperren entstehen und woran man sie erkennt. Abseits solcher Technikfragen gibt es bei Wissenswertes zur Pferdepflege Grundlagen zur Pferdehaltung und zum Alltag im Stall.
Auf einen Blick
- Die robots.txt ist eine Bitte nach RFC 9309; Firewall und Bot-Schutz setzen Regeln dagegen technisch durch – auch gegen den Willen der robots.txt.
- Cloudflare teilt KI-Verkehr seit Juli 2026 in Search, Agent und Training ein.
- Für neue Domains blockiert Cloudflare seit 15.09.2026 Training und Agent standardmäßig auf Seiten mit Werbung.
- OpenAI, Anthropic und Perplexity trennen Such-, Trainings- und Nutzer-Bots; jeder hat einen eigenen User-Agent.
Warum sperren Firewalls KI-Crawler, ohne dass es jemand beschlossen hat?
Weil Bot-Schutz nach Verhalten, IP-Reputation und Kennung urteilt, nicht nach Marketingzielen. Ein unbekannter oder als automatisiert eingestufter Zugriff erhält eine Challenge-Seite oder Status 403 – auch dann, wenn die robots.txt denselben Bot ausdrücklich zulässt.
Zwei Ebenen greifen hier ineinander, die in Relaunch-Projekten meist von verschiedenen Personen betreut werden. Die robots.txt folgt dem Robots Exclusion Protocol, das die IETF im September 2022 als RFC 9309 standardisiert hat. Sie formuliert Wünsche, die seriöse Crawler befolgen. Firewall, CDN und Bot-Management sitzen davor und entscheiden, ob eine Anfrage überhaupt beim Server ankommt. Die Redaktion pflegt die robots.txt, die IT konfiguriert die Firewall – und niemand gleicht beides ab. Hinzu kommen Relaunch-typische Altlasten. Eine Staging-Umgebung mit „Disallow: /“ oder einem serverweiten noindex-Header wird mit in den Livebetrieb übernommen. Oder der neue Server beantwortet die robots.txt-Anfrage mit einem 5xx-Fehler. Laut RFC 9309 müssen Crawler dann von einer vollständigen Sperre ausgehen. Eine einzige fehlerhafte Serverregel legt so das gesamte Crawling still.
| Ebene | Was sie tut | Typischer Fehler beim Relaunch |
|---|---|---|
| robots.txt | Bittet Crawler, Pfade auszulassen | „Disallow: /“ aus der Staging-Umgebung übernommen |
| HTTP-Header | X-Robots-Tag steuert Indexierung und Snippets | Serverweites noindex bleibt aktiv |
| Firewall / WAF | Blockiert Anfragen technisch | Regel gegen „Bots“ trifft auch Such-Crawler |
| CDN-Bot-Management | Bewertet Anfragen nach Score und Kategorie | Neue Standardwerte bei neu angelegter Zone |
Was hat Cloudflare 2026 an den Standardregeln geändert?
Cloudflare ordnet KI-Verkehr seit dem 1. Juli 2026 drei Zwecken zu: Search, Agent und Training. Für neu angelegte Domains werden seit dem 15. September 2026 Training und Agent auf Seiten mit Werbung standardmäßig blockiert, Search bleibt erlaubt.
Die Kategorien beschreibt Cloudflare so: Search umfasst alles, was Inhalte sammelt oder indexiert, um später Fragen dazu zu beantworten. Agent meint automatisierte Abrufe, die meist in Echtzeit im Auftrag eines Menschen stattfinden. Training bezeichnet Crawler, die Inhalte für das Training oder Feintuning eines Modells nutzen. Brisant ist eine Zusatzregel. Crawler mit mehreren Zwecken werden nach der strengsten zutreffenden Regel behandelt. Wer Training sperrt, blockiert damit laut Cloudflare auch Mehrzweck-Crawler wie Googlebot, Bingbot und Applebot. Bestandskunden konnten der Umstellung vor dem 15. September in den Sicherheitseinstellungen widersprechen. Für einen Relaunch ist das entscheidend: Wer die Website im Zuge des Projekts als neue Domain bei Cloudflare einrichtet, startet mit den neuen Voreinstellungen. Schon im Juli 2025 hatte Cloudflare begonnen, bei jeder neu angelegten Domain abzufragen, ob KI-Crawler zugelassen werden sollen. Ein schneller Klick im Einrichtungsdialog kann so über die Präsenz in KI-Antworten entscheiden.
Welche User-Agents sind betroffen und wofür stehen sie?
Die großen KI-Anbieter trennen ihre Bots nach Zweck. OpenAI dokumentiert vier Kennungen, Anthropic drei, Perplexity zwei. Wer nur den Trainings-Bot sperrt, bleibt in den Suchantworten sichtbar – wer den Such-Bot sperrt, verschwindet dort.
Bei OpenAI ist GPTBot für Trainingsdaten zuständig, OAI-SearchBot erfasst Websites für die Suchfunktionen von ChatGPT, ChatGPT-User ruft Seiten ab, wenn ein Nutzer das auslöst, und OAI-AdsBot prüft Zielseiten von Anzeigen. Nach einer Änderung der robots.txt brauchen die Systeme laut OpenAI rund 24 Stunden. Für nutzerausgelöste Abrufe gelten robots.txt-Regeln laut OpenAI möglicherweise nicht. Anthropic unterscheidet ClaudeBot, Claude-SearchBot und Claude-User, Perplexity den PerplexityBot und Perplexity-User. Eine Besonderheit ist Google-Extended. Das Token steuert in der robots.txt, ob Inhalte für Gemini-Training und Grounding genutzt werden dürfen, taucht aber in keinem Server-Log auf, weil Google mit den normalen Kennungen crawlt. Wichtig für jede Firewall-Regel: Ein User-Agent ist eine Selbstauskunft und lässt sich fälschen. Die Anbieter veröffentlichen deshalb IP-Bereiche, gegen die sich echte Zugriffe prüfen lassen.
Wie lässt sich eine Sperre nach dem Relaunch erkennen?
Am zuverlässigsten im Server- oder CDN-Log: Erhalten OAI-SearchBot, PerplexityBot oder Claude-SearchBot Status 200, oder stehen dort 403, 429 und Challenge-Antworten? Wer keinen Log-Zugang hat, braucht einen Test mit echten Bot-Kennungen.
Ohne Zugriff auf Logs hilft ein Test von außen. Einen solchen stellt deine-geo-agentur.de bereit, eine auf KI-Sichtbarkeit spezialisierte GEO-Agentur aus Hechingen: Der kostenlose KI-Crawler-Check wertet die robots.txt einer Domain nach RFC 9309 aus und deckt dabei 16 Crawler ab, darunter GPTBot, OAI-SearchBot und ChatGPT-User von OpenAI, die drei Claude-Bots von Anthropic, PerplexityBot, Googlebot und Bingbot. Für den Firewall-Test fragt das Werkzeug die Startseite in drei Durchgängen unter der Kennung des jeweiligen Bots ab und stellt das Ergebnis einem gewöhnlichen Browseraufruf gegenüber. Liefert der Server dem Bot einen anderen Statuscode als dem Browser, spricht das für eine Sperre durch Firewall oder Bot-Schutz. Die Grenzen benennt die Agentur selbst: Das Werkzeug sieht nicht, ob ein Bot die Website tatsächlich besucht, und nicht, ob ein System sie zitiert. Weil Bot-Management bei Cloudflare zusätzlich IP-Adressen und Signaturen prüft, ersetzt ein solcher Test den Blick in die Logs nicht, zeigt aber offensichtliche Blockaden innerhalb von Sekunden.
FAQ: KI-Crawler nach dem Relaunch
Reicht eine korrekte robots.txt, damit ChatGPT die Website erreicht?
Nein. Die robots.txt ist nur eine Bitte an kooperative Crawler. Ob die Anfrage den Server erreicht, entscheiden Firewall, CDN und Bot-Schutz. Beide Ebenen müssen dasselbe aussagen, sonst lässt die robots.txt einen Bot zu, den die Firewall anschließend mit 403 abweist.
Betrifft die Cloudflare-Umstellung bestehende Websites?
Die neuen Standards vom 15. September 2026 gelten laut Cloudflare für neu angelegte Domains. Bestandskunden, die Training bereits gesperrt hatten, konnten vorher widersprechen, damit Mehrzweck-Crawler wie Googlebot nicht mitblockiert werden. Ein Blick in die Sicherheitseinstellungen klärt den eigenen Stand.
Sollte man die Cloudflare-Kategorie Agent sperren?
Nur mit gutem Grund. Agent umfasst Abrufe, die ein Mensch in Echtzeit auslöst, etwa wenn ein Assistent eine Seite während eines Gesprächs öffnet. Ist die Kategorie gesperrt, kann das System die Seite in diesem Moment nicht lesen und damit auch nicht als Quelle nennen.
Wie lange dauert es, bis eine Freigabe wirkt?
Für die robots.txt nennt OpenAI rund 24 Stunden, bis die Suchsysteme Änderungen berücksichtigen. Firewall-Regeln wirken sofort. Bis Seiten erneut gecrawlt und in Antworten zitiert werden, kann es deutlich länger dauern; einen garantierten Zeitraum nennt keiner der Anbieter.
Fazit
Ein Relaunch verändert mehr als Design und Inhalte. Er tauscht oft auch die Infrastruktur aus, und mit ihr die Regeln, nach denen Bots behandelt werden. Seit Cloudflares Umstellung vom 15. September 2026 gilt das umso mehr. Wer die Checkliste zum Livegang um einen Crawler-Test ergänzt, etwa mit dem Check der Hechinger GEO-Agentur von Felix Wilhelm, und danach die Logs auswertet, bemerkt eine ungewollte Sperre nach Stunden statt nach Monaten.
Autor: Redaktion Webdesign & Technik bei webdesign-uptodate.de. Der Beitrag stützt sich auf die Dokumentationen von Cloudflare, OpenAI, Anthropic und Perplexity sowie auf RFC 9309 der IETF.
Quellen
- Your site, your rules: new AI traffic options for all customers, Cloudflare Blog, 01.07.2026
- New options to manage AI traffic, Cloudflare Changelog, 01.07.2026
- Overview of OpenAI Crawlers, OpenAI, abgerufen 22.09.2026
- RFC 9309: Robots Exclusion Protocol, IETF, September 2022
- Perplexity Crawlers, Perplexity Docs, abgerufen 22.09.2026
- Google common crawlers (Google-Extended), Google, abgerufen 22.09.2026
Stand der Informationen: 22.09.2026
