Zum Inhalt springen
Tech & Tacheles„Klartext zu KI, Security und Crypto"
← Alle Beiträge
Künstliche Intelligenz September 19, 2026

Cloudflare: KI-Training blockieren, in der Google-Suche bleiben

Cloudflares neue Einstellung „Disallow AI Training“ trennt Modelltraining von der Suchindexierung. Was sich ändert – und welcher Schalter deine Sichtbarkeit kostet.

Cloudflare: KI-Training blockieren, in der Google-Suche bleiben

Seit Juli stand eine unangenehme Änderung im Raum: Ab dem 15. September sollte ein Block auf Cloudflare KI-Training auch Googlebot, Applebot und Bingbot aussperren. Bis dahin waren diese Mehrzweck-Crawler von der Block-Einstellung ausgenommen. Gekommen ist es anders – seit dem 15. September 2026 gibt es eine eigene Einstellung namens „Disallow AI Training”, die genau das trennt, was sonst aneinandergehangen hätte.

Warum Cloudflare KI-Training und Suche trennen musste

Das Problem lag in der Bauweise der Crawler. Googlebot, Applebot und Bingbot sammeln Inhalte sowohl für den Suchindex als auch – zumindest potenziell – für das Modelltraining. Cloudflare nennt sie „mixed-use”. In der bis dahin geplanten Logik wurden solche Mehrzweck-Crawler nach der strengsten passenden Regel behandelt. Wer Training blockiert hätte, hätte sie ab dem 15. September vollständig blockiert. Diskutiert wurde die Nebenwirkung schon im August: Ein Betreiber meldete in r/TechSEO HTTP 403 für Googlebot und Bingbot bei AI Training = Block. Ursache und Reproduzierbarkeit blieben offen – im Verlauf kam auch Bot Fight Mode als Erklärung ins Spiel.

Newsletter

Klartext ins Postfach

KI, Security & Crypto – die wichtigsten Analysen, kein Spam. Jederzeit abbestellbar.

Die neue Einstellung geht einen anderen Weg. Statt den Crawler zu sperren, trägt Cloudflare eine Trainings-Absage in die robots.txt ein: eine Disallow-Regel für Google-Extended und eine für Applebot-Extended. Beide Tokens steuern die KI-Nutzung, nicht den Suchindex – bei Google umfasst Google-Extended laut Dokumentation neben dem Training auch das Grounding in Gemini Apps und Vertex AI. Google schreibt in der eigenen Crawler-Dokumentation ausdrücklich, dass Google-Extended weder die Aufnahme in die Suche noch das Ranking beeinflusst.

Wer weiterhin crawlen darf – und wer nicht

Mehrzweck-Crawler behalten den Suchzugriff nur, wenn Cloudflare ihren Betreiber als „Accountable” einstuft. Diese Einstufung setzt vier Zusagen voraus: ein Opt-out für KI-Training über robots.txt oder einen vergleichbaren Standard, ein Opt-out für KI-Zusammenfassungen, Transparenz auf URL-Ebene darüber, welche Seiten fürs Training bereitstanden, sowie die Zusicherung, dass ein Trainings-Opt-out die klassische Suche nicht beeinträchtigt.

Apple, Google und Microsoft erfüllen diese Anforderungen laut Cloudflare – teils schon heute, teils über terminierte Zusagen. Auch die betreffenden Crawler von Amazon, Anthropic, Meta und OpenAI führt Cloudflare als „Accountable”, allerdings aus einem anderen Grund: Diese Anbieter betreiben getrennte Such- und Trainings-Crawler. Deren Trainings-Crawler bleiben unter „Disallow AI Training” blockiert.

Wichtig ist die Kehrseite. Die Einstellung Block wirkt jetzt auch auf Mehrzweck-Crawler – und zwar inklusive Suche. Bisher waren sie davon ausgenommen, weil eine Sperre die Sichtbarkeit gekostet hätte. Dasselbe gilt jetzt für Block on pages with ads. Wer „Block” wählt, sperrt Googlebot, Applebot und Bingbot komplett von der eigenen Seite aus.

Was das für dich bedeutet

Für alle, die eine eigene Seite betreiben, ist das die erste wirklich saubere Trennung zwischen „mein Inhalt darf gefunden werden” und „mein Inhalt darf ein Modell trainieren”. Bisher war das eine politische Debatte mit technisch untauglichen Werkzeugen. Jetzt ist es eine Checkbox – mit allen Konsequenzen, wenn man die falsche anklickt.

Und genau darin liegt das Risiko. Die beiden Optionen heißen Disallow AI Training und Block, und sie klingen fast gleich. Praktisch trennt sie die Frage, ob deine Seite morgen noch in Google steht. Wer in den vergangenen Wochen aus Sorge vor KI-Scraping vorsorglich das Schärfste angeklickt hat, sollte heute nachsehen, was dort tatsächlich steht. Cloudflare migriert bestehende Trainings-Auswahlen zwar automatisch auf die neue Einstellung, aber „meistens passt es” ist bei der eigenen Sichtbarkeit keine belastbare Aussage.

Ehrlich bleiben muss man auch über die Reichweite. Bing bekommt die Trainings-Absage über robots.txt noch nicht; Microsofts Unterstützung dafür ist laut Cloudflare für Anfang 2027 vorgesehen. Wer sein Material dort aus dem Training halten will, braucht weiterhin das NOARCHIVE-Meta-Tag – mit dem Nebeneffekt, dass Inhalte dann auch in Chat und Copilot nicht mehr verlinkt werden. Und ob deine Seiten in Googles AI Overviews und im AI Mode auftauchen, steuert diese Einstellung ebenfalls nicht: Das läuft über eine eigene Option in der Search Console. Das Thema Sichtbarkeit in KI-Antworten bleibt also zerfasert – passend zu dem, was sich schon bei der Einstufung von OpenAI als Suchmaschine unter dem Digital Services Act abzeichnete.

Konkrete Schritte für Seitenbetreiber

  1. Einstellung kontrollieren. Im Cloudflare-Dashboard: Domain → Security → Settings, dort die drei Kontrollen Search, Training und Agent. Meine Empfehlung für die meisten Blogs und Firmenseiten: Disallow AI Training statt Block. Cloudflare selbst schlägt das als Voreinstellung nur für werbefinanzierte Domains vor – ohne Werbung lautet der Vorschlag Allow.
  2. robots.txt gegenlesen. Nach dem Umstellen sollten dort Disallow-Regeln für Google-Extended und Applebot-Extended stehen. Veröffentlicht werden sie über Bot Preference Sync – ist der nicht aktiv, steht dort nichts. Die robots.txt ist der Beleg, dass die Einstellung wirklich greift.
  3. Indexierung beobachten. In der Search Console eine Woche lang die Abdeckung im Blick behalten. Ein Einbruch bei gecrawlten Seiten ist das Warnsignal.
  4. Bing separat behandeln. Wer dort ein Trainings-Opt-out braucht, setzt NOARCHIVE – und sollte wissen, was er dafür aufgibt.
  5. Alte Schalter ausmustern. Der Schalter „Block AI Bots” und die Funktion Managed Robots.txt sind zur Abkündigung vorgesehen. Wer noch darauf setzt, sollte den Wechsel aktiv planen statt auf die automatische Migration zu vertrauen.

Mein Rat nach 25 Jahren IT: Solche Umschaltungen scheitern selten an der Technik, sondern daran, dass niemand nachsieht, wie der Schalter nach der Migration steht. Fünf Minuten Kontrolle heute sind billiger als drei Wochen Rankingverlust.

Quellen

Dranbleiben

Diese Analysen als Newsletter

Ein Mal pro Woche Klartext zu KI, Security & Crypto – direkt in dein Postfach.

Jetzt anmelden