Welche KI-Crawler lassen Sie in Ihren Shop? Die Entscheidung fällt bis zum 15. September

Welche KI-Crawler lassen Sie in Ihren Shop? Die Entscheidung fällt bis zum 15. September

KI-Crawler entscheiden mit, ob Ihre Produkte in ChatGPT, Google AI Mode oder Perplexity überhaupt auftauchen. Seit Anfang August 2026 crawlt mit Meta ein weiterer Konzern das Web im großen Stil, und zum 15. September 2026 stellt Cloudflare die Standardeinstellungen für KI-Bots um. Shop-Betreiber, die pauschal blockieren, verlieren dabei nicht nur Sichtbarkeit in KI-Antworten, sondern riskieren in einer konkreten Konstellation auch den Zugriff von Googlebot. Prüfen Sie deshalb jetzt, welche Bots Ihre robots.txt und Ihr CDN durchlassen, und treffen Sie diese Entscheidung bewusst statt per Voreinstellung.

Anfang August tauchten in den Server-Protokollen mehrerer Webseiten-Betreiber ungewöhnlich viele Zugriffe von Meta auf. Der Entwickler Pieter Levels veröffentlichte am 6. August 2026 Auswertungen dazu, die Search Engine Roundtable am 10. August aufgriff: Meta baut offenbar einen eigenen Web-Index auf, damit die hauseigene KI für Websuchen nicht auf Google angewiesen ist.1 Bestätigt ist das nicht. Interessant ist die Nachricht trotzdem, weil sie eine Frage stellt, die die meisten Shops nie bewusst beantwortet haben.

Die Frage lautet: Wer darf Ihren Shop eigentlich auslesen? Jeder dieser Bots verfolgt einen anderen Zweck, und jede Blockade hat eine andere Konsequenz. Wer alles durchlässt, verschenkt Kontrolle über die eigenen Inhalte. Wer alles blockiert, verschwindet aus genau den Antworten, in denen heute Kaufentscheidungen vorbereitet werden.

Was KI-Crawler sind und warum sie nicht alle dasselbe tun

Ein KI-Crawler ist ein automatisiertes Programm, das Webseiten abruft, um die Inhalte für ein KI-System nutzbar zu machen. Jeder dieser Bots meldet sich mit einem User-Agent, also einer Kennung im Seitenaufruf, über die Sie ihn in der robots.txt gezielt erlauben oder aussperren können. Cloudflare unterscheidet inzwischen drei Zwecke, und diese Einteilung ist die brauchbarste, die derzeit im Umlauf ist.2

  • Training: Der Bot sammelt Inhalte, um damit ein Modell zu trainieren. Ihre Texte werden dauerhaft Teil des Modells, ohne dass daraus ein Besuch in Ihrem Shop entsteht. Beispiele sind GPTBot, ClaudeBot, Google-Extended, Applebot-Extended und Meta-ExternalAgent.
  • Suche: Der Bot baut einen Index auf, um später Fragen zu Ihren Inhalten zu beantworten und dabei auf Sie zu verweisen. Hier entsteht Referral-Traffic, also Besucher, die über die Verlinkung in der Antwort zu Ihnen kommen. Beispiele sind OAI-SearchBot, PerplexityBot, Claude-SearchBot und der klassische Googlebot.
  • Agent: Der Bot handelt in Echtzeit im Auftrag einer konkreten Person, die gerade auf eine Antwort wartet. Beispiele sind ChatGPT-User und Perplexity-User. Diese Zugriffe entstehen nur, weil jemand tatsächlich nach etwas sucht, das Sie verkaufen.

Diese Unterscheidung ist der ganze Punkt. Ein Shop, der Trainings-Crawler aussperrt, verliert wenig und behält die Kontrolle über sein Bildmaterial und seine Produkttexte. Ein Shop, der Such- und Agent-Bots aussperrt, macht sich in KI-Antworten unsichtbar und merkt es monatelang nicht, weil in keiner Statistik ein Ausschlag zu sehen ist. Die beiden Entscheidungen fühlen sich beim Klick gleich an und wirken völlig unterschiedlich.

Erschwerend kommt hinzu, dass die Kennungen sich ähneln. Bei OpenAI etwa dient GPTBot dem Modelltraining, OAI-SearchBot dem Suchindex und ChatGPT-User dem Echtzeit-Abruf während eines Chats.3 Drei Kennungen desselben Anbieters, drei völlig verschiedene Geschäftsfolgen. Wer in der robots.txt pauschal alles sperrt, was nach OpenAI aussieht, trifft alle drei.

Schematische Übersicht der drei Crawler-Zwecke Training, Suche und Agent mit Beispiel-User-Agents und den Folgen einer Blockade
Schematische Darstellung, kein echter Screenshot: Die drei Zwecke von KI-Crawlern und was eine Blockade jeweils kostet.

Wissen Sie, welche KI-Crawler Ihr Shop heute durchlässt?

Wir lesen Ihre robots.txt, Ihre Server-Protokolle und Ihre CDN-Regeln aus und liefern Ihnen eine Übersicht, welcher Bot aktuell Zugriff hat und welcher nicht.

Der Fall Amazon: Was pauschales Blockieren kostet

Amazon liefert das derzeit größte Anschauungsbeispiel. Der Konzern hat im November 2025 die Kennungen ChatGPT-User und OAI-SearchBot in seiner robots.txt gesperrt, also genau die Such- und Agent-Zugriffe von OpenAI.4 Die Folge: Amazons Produktdaten stehen ChatGPT für Echtzeit-Antworten nicht mehr zur Verfügung.

Wettbewerber, die diese Zugriffe zulassen, sind seitdem in ChatGPT-Antworten präsent, wenn Nutzer nach Produkten fragen. Etsy bezieht laut Auswertungen von Modern Retail und Digiday aus dem Jahr 2026 mehr als 20 Prozent seines Referral-Traffics aus ChatGPT, Target etwa 15 Prozent.4 Wichtig zur Einordnung: Das ist der Anteil an den Verweis-Zugriffen, nicht am gesamten Besucheraufkommen. Die absoluten Zahlen sind noch klein. Die Richtung ist deutlich.

Warum blockiert Amazon dann trotzdem?

Amazon rechnet anders als Sie. Der Konzern verdient Milliarden mit Werbeplätzen auf der eigenen Plattform, und dieses Geschäft funktioniert nur, wenn Kunden auf amazon.de suchen statt in einem Chatfenster. Die Sperre verteidigt also einen eigenen Werbemarkt.

Ein mittelständischer Shop hat diese Ausgangslage nicht. Er verdient nichts daran, dass Kunden auf seiner Seite suchen, sondern nur daran, dass sie ihn überhaupt finden. Übernehmen Sie die Blockade-Logik großer Plattformen deshalb nicht ungeprüft.

Die Deadline: Was Cloudflare am 15. September 2026 umstellt

Am 1. Juli 2026 hat Cloudflare angekündigt, die Standardeinstellungen für KI-Bot-Traffic zum 15. September 2026 zu ändern. Für alle neu bei Cloudflare aufgeschalteten Domains werden Training- und Agent-Bots künftig auf werbeführenden Seiten standardmäßig blockiert, während Such-Bots erlaubt bleiben.2 Cloudflare begründet das damit, dass eine Anzeige ein Signal dafür ist, dass ein Mensch die Seite sehen soll.

Die zweite Änderung ist die relevantere, und sie wird bisher kaum diskutiert. Ab dem 15. September bewertet Cloudflare Mehrzweck-Crawler nach allen ihren Verhaltensweisen, nicht mehr nur nach einer. Es gilt jeweils die strengste zutreffende Regel. Konkret heißt das: Wer in seinen Cloudflare-Einstellungen Training blockiert, sei es über die neuen Optionen oder über den älteren Schalter „Block AI bots“, blockiert damit ab dem 15. September auch Googlebot, Applebot und BingBot.2 Diese Bots crawlen sowohl für die Suche als auch für KI-Training und fallen deshalb unter die strengere Regel.

Das ist der Punkt, an dem aus einer Sichtbarkeitsfrage ein Ranking-Risiko wird. Ein Shop, der vor einem Jahr aus einem verständlichen Reflex heraus „Block AI bots“ aktiviert hat, kann ab Mitte September für Google unerreichbar werden. Cloudflare bietet dafür ein Opt-out an: In den Security-Einstellungen lässt sich bis zum 15. September festhalten, dass an der Behandlung von Trainings-Crawlern, die auch für die Suche crawlen, nichts geändert werden soll. Nach Cloudflares eigenen Angaben liegen mehr als 20 Prozent aller Web-Domains hinter dem Dienst, die Umstellung betrifft also einen erheblichen Teil des Marktes.2

Läuft Ihr Shop hinter Cloudflare oder einem anderen CDN?

Wir prüfen Ihre Bot-Einstellungen vor dem 15. September und sagen Ihnen konkret, ob die neuen Standardwerte den Google-Zugriff auf Ihren Shop verändern.

So prüfen und steuern Sie den Zugriff in Ihrem Shop

Wo liegt die robots.txt und wie ändern Sie sie?

Rufen Sie zuerst Ihre Domain mit dem Zusatz /robots.txt im Browser auf. Was dort steht, ist die Anweisung, an die sich alle seriösen Crawler halten. Wenn dort Zeilen mit Disallow: / unter einer KI-Kennung stehen, ist der jeweilige Bot ausgesperrt.

In Shopware 6 gibt es die Datei nicht automatisch, sie muss angelegt werden. Ab Version 6.7.1.0 pflegen Sie die Regeln bequem im Admin unter Einstellungen > Grundeinstellungen > Stammdaten, und zwar getrennt je Domain.5 In älteren Installationen liegt die Datei im Verzeichnis public; wer mehrere Verkaufskanäle mit eigenen Domains betreibt, kann über eine Rewrite-Regel in der .htaccess oder im NGINX-Serverblock pro Domain eine eigene Datei ausliefern.5 Andere Shopsysteme lösen das ähnlich, oft über ein Plugin oder eine Einstellung im Backend.

Welche Bots sollten Sie erlauben?

Eine pauschal richtige Antwort gibt es nicht, aber eine brauchbare Ausgangslage für die meisten Shops: Such- und Agent-Bots erlauben, Trainings-Bots bewusst entscheiden. Such- und Agent-Zugriffe bringen Ihnen potenzielle Kunden. Trainings-Zugriffe bringen Ihnen nichts Unmittelbares, kosten aber auch selten etwas, solange Ihre Produkttexte nicht Ihr wichtigstes geistiges Eigentum sind.

Wenn Sie Ihre Präferenz zusätzlich dokumentieren wollen, ohne technisch zu blockieren, unterstützt Cloudflare inzwischen die Content-Signal-Angabe in der robots.txt, etwa in der Form Content-Signal: search=yes,ai-train=no.2 Das ist eine Absichtserklärung, keine Sperre, kann aber rechtlich wie kommunikativ hilfreich sein.

Warum ein Bot geblockt sein kann, obwohl die robots.txt ihn erlaubt

Das ist der häufigste blinde Fleck. Die robots.txt ist nur eine Bitte, die zweite Instanz sitzt davor: Ihr CDN, also der vorgeschaltete Auslieferungsdienst, und Ihre Web Application Firewall. Diese Systeme sperren Zugriffe technisch aus, unabhängig davon, was in Ihrer robots.txt steht, und liefern dem Bot stattdessen einen Fehlercode.

Prüfen Sie deshalb beides. In Ihrem Server-Log oder im Dashboard Ihres CDN sehen Sie, welche User-Agents in den vergangenen Tagen zugegriffen haben und mit welchem Statuscode sie bedient wurden. Tauchen die relevanten Kennungen dort gar nicht auf oder ausschließlich mit dem Code 403, greift irgendwo eine Sperre. Ergänzend lohnt ein Blick darauf, ob Ihr Shop eine llms.txt ausliefert, also die maschinenlesbare Übersicht Ihrer wichtigsten Inhalte für KI-Systeme.

Sie wollen die robots.txt nicht selbst anfassen?

Wir setzen die Regeln je Verkaufskanal in Ihrem Shopware-Shop um und dokumentieren nachvollziehbar, welcher Bot warum erlaubt oder gesperrt ist.

Crawler-Zugriff ist eine Geschäftsentscheidung, keine Serverfrage

Die Zugriffsfrage wird in den kommenden Monaten wichtiger, nicht unwichtiger. OpenAI schaltet ab dem 24. August 2026 Werbeanzeigen in 31 europäischen Märkten frei, darunter Deutschland, Österreich und die Schweiz.6 Damit wird ChatGPT zu einem Kanal, in dem organische Sichtbarkeit und bezahlte Platzierung nebeneinander stehen, so wie es bei Google seit zwanzig Jahren der Fall ist. Wer dort organisch nicht auffindbar ist, weil sein eigener Server die Abfrage blockt, zahlt später doppelt.

Wichtige Erkenntnisse für Unternehmen

  • Blockieren ist nie neutral: Jede Sperre kostet entweder Kontrolle oder Sichtbarkeit. Beides gleichzeitig zu behalten funktioniert nicht, deshalb sollte die Entscheidung dokumentiert und begründet sein.
  • Die Voreinstellung entscheidet, wenn Sie es nicht tun: Ab dem 15. September 2026 greifen bei Cloudflare neue Standardwerte, und Mehrzweck-Crawler wie Googlebot fallen unter die strengste zutreffende Regel. Wer nichts prüft, übernimmt die Voreinstellung eines Dienstleisters als Geschäftsentscheidung.
  • Zwei Ebenen, zwei Prüfungen: robots.txt und CDN beziehungsweise Firewall sind unabhängig voneinander. Eine korrekte robots.txt garantiert nicht, dass der Bot tatsächlich durchkommt.

Sie wollen wissen, ob Ihre Produkte in KI-Antworten überhaupt auftauchen?

Wir messen Ihre Sichtbarkeit in AI Overviews, ChatGPT und Perplexity und liefern Ihnen einen Ausgangswert, gegen den Sie jede spätere Änderung messen können.

Ihr 5-Minuten-To-do

  1. Rufen Sie Ihre robots.txt auf. Tippen Sie Ihre Shop-Domain gefolgt von /robots.txt in den Browser. Suchen Sie in der Ausgabe nach den Wörtern GPTBot, OAI-SearchBot, ChatGPT-User, PerplexityBot und ClaudeBot.
  2. Notieren Sie, was gesperrt ist. Steht unter einer dieser Kennungen die Zeile Disallow: /, ist der Bot ausgesperrt. Halten Sie fest, welche der drei Zwecke Training, Suche und Agent davon betroffen sind.
  3. Prüfen Sie, ob Sie Cloudflare einsetzen. Melden Sie sich im Cloudflare-Dashboard an und öffnen Sie die Security-Einstellungen. Ist dort „Block AI bots“ oder eine Sperre für Training aktiv, setzen Sie sich vor dem 15. September 2026 mit dieser Einstellung auseinander, sonst blockieren Sie ab diesem Datum auch Googlebot.
  4. Schauen Sie in Ihre Zugriffsprotokolle. Filtern Sie die Server-Logs der letzten sieben Tage nach den oben genannten User-Agents und prüfen Sie, mit welchem Statuscode sie bedient wurden. Der Code 200 bedeutet Zugriff, der Code 403 bedeutet Sperre.
  5. Blocken Sie 30 Minuten im Kalender. Legen Sie einen Termin bis Ende August an, um die Zugriffsregeln einmal bewusst festzulegen, statt sie am 15. September von einer Voreinstellung übernehmen zu lassen.