AI-Crawler, Grounding und Trainingsdaten
AI-Systeme beziehen Inhalte über drei getrennte Wege: Trainings-Crawler, Such- und Retrieval-Crawler und nutzerausgelöste Fetcher. Wer sie nicht unterscheidet, sperrt in der Praxis die falschen Bots und verliert Sichtbarkeit, ohne den Content zu schützen.
Die fünf Bot-Typen nach Zweck
1. Trainings-Crawler crawlen breit und regelmäßig; die Inhalte landen in Trainingsdatensätzen künftiger Modellversionen. Eine Sperre wirkt sich nicht direkt auf Zitationen aus, beeinflusst aber, was ein Modell über eine Marke „von Haus aus“ weiß.
2. Such- und Retrieval-Crawler bauen einen Index auf, aus dem der Assistent bei Live-Suchen Quellen auswählt. Für GEO sind sie der wichtigste Typ.
3. User-triggered Fetcher rufen eine Seite in Echtzeit ab, wenn ein Nutzer eine URL einfügt oder das Modell während einer Antwort nachschlägt. Meist wird nur eine Seite gelesen, und die Inhalte fließen nicht ins Training. Diese Fetcher ignorieren robots.txt weitgehend bewusst, weil eine Person die Seite angefordert hat.
4. Opt-out-Tokens ohne eigenen Crawler: Google-Extended und Applebot-Extended crawlen nicht selbst, sondern sind reine Steuerungs-Tokens in der robots.txt. Die Inhalte holt der normale Googlebot beziehungsweise Applebot; das Token regelt nur die Nutzung fürs KI-Training. Folge: Diese Namen tauchen nie in Server-Logs auf.
5. Klassische Suchmaschinen-Bots mit AI-Funktion: Googlebot speist auch AI Overviews und AI Mode, Bingbot speist Copilot. Sie lassen sich nicht separat für AI sperren, ohne die organische Suche zu verlieren. In Cloudflares Crawler-Daten vom Mai 2026 war Googlebot mit 27,26 % der Anfragen der größte AI-nahe Bot, vor GPTBot mit 11,48 % und ClaudeBot mit 9,73 %.
Die wichtigsten Bots
| User-Agent | Anbieter | Typ | Funktion |
|---|---|---|---|
| GPTBot | OpenAI | Training | Crawlt das Web für das Training der GPT-Modelle |
| OAI-SearchBot | OpenAI | Suche | Baut den Index für die ChatGPT-Suche auf, entscheidet über Zitationen |
| ChatGPT-User | OpenAI | User-triggered | Ruft Seiten live ab, wenn ChatGPT im Chat nachschlägt |
| OAI-AdsBot | OpenAI | Werbung | Besucht nur als Anzeigen eingereichte Seiten, nicht fürs Training |
| ClaudeBot | Anthropic | Training | Sammelt Inhalte für das Training der Claude-Modelle |
| Claude-SearchBot | Anthropic | Suche | Indexiert Seiten für die Suchfunktion von Claude |
| Claude-User | Anthropic | User-triggered | Ruft Seiten bei konkreten Nutzeranfragen ab |
| PerplexityBot | Perplexity | Suche | Baut den Perplexity-Index auf, aus dem zitiert wird |
| Perplexity-User | Perplexity | User-triggered | Live-Abruf bei Nutzeranfragen |
| Googlebot | Klassisch + AI | Crawlt für Google-Suche, AI Overviews und AI Mode | |
| Google-Extended | Opt-out-Token | Steuert Nutzung für Gemini-Training und Grounding; AI Overviews bleiben unberührt | |
| Bingbot | Microsoft | Klassisch + AI | Crawlt für Bing und Copilot |
| Applebot / Applebot-Extended | Apple | Suche / Opt-out-Token | Applebot crawlt für Siri und Spotlight; Extended regelt Apple-Intelligence-Training |
| Meta-ExternalAgent | Meta | Training | Crawlt für Llama-Modelle und Meta AI |
| Meta-ExternalFetcher | Meta | User-triggered | Live-Abruf von Links, die Nutzer in Meta AI teilen |
| Amazonbot | Amazon | Training / Suche | Crawlt für Alexa und Amazons AI-Dienste |
| Bytespider | ByteDance | Training | Aggressiver Trainings-Crawler, hält sich laut Berichten nur eingeschränkt an robots.txt |
| CCBot | Common Crawl | Training (indirekt) | Baut das offene Common-Crawl-Archiv, Trainingsbasis vieler LLMs |
| DuckAssistBot | DuckDuckGo | Suche | Ruft Quellen für DuckAssist-Antworten ab |
| MistralAI-User | Mistral | User-triggered | Live-Abruf für Le Chat |
| cohere-ai | Cohere | Training / Retrieval | Crawler für die Cohere-Modelle |
Die Liste verändert sich laufend. Die Community-Liste ai.robots.txt führt über 150 AI-User-Agents, Known Agents pflegt ein ähnliches Live-Verzeichnis. Nicht jeder Bot ist am User-Agent erkennbar: 25 der 87 AI-Bots im Cloudflare-Radar-Verzeichnis senden keinen unterscheidbaren User-Agent, darunter agentische Browser, die sich als normaler Chrome ausgeben. Da User-Agents fälschbar sind, gehört zu einer sauberen Logfile-Analyse die Prüfung der veröffentlichten IP-Ranges.
Grounding: welcher Bot ruft die Seite ab
Grounding läuft in zwei Schritten. Zuerst durchsucht das Modell mit mehreren Suchanfragen (Query Fan-out) einen vorab aufgebauten Index – dabei wird die Seite noch nicht aufgerufen. Erst wenn das Modell den Inhalt einer gefundenen URL lesen will, holt der User-triggered Fetcher sie in Echtzeit.
Der Ablauf im Überblick:
- Nutzerfrage
- Query Fan-out: Das Modell formuliert mehrere Suchanfragen.
- Index-Suche: Die Anfragen laufen gegen den Index, den ein Such-Crawler aufgebaut hat.
- Liegt der Inhalt im Cache? Wenn ja, folgt direkt die Antwort mit Zitationen. Wenn nein, ruft der User-triggered Fetcher die Seite live ab, danach folgt die Antwort mit Zitationen.
Nur der Live-Abruf hinterlässt einen Log-Eintrag auf dem eigenen Server.
| Plattform | Index aufgebaut von | Live-Abruf beim Grounding |
|---|---|---|
| ChatGPT (Suche) | OAI-SearchBot, ergänzt um Bing-Daten | ChatGPT-User |
| Claude | Claude-SearchBot bzw. Index des Suchpartners | Claude-User |
| Perplexity | PerplexityBot | Perplexity-User |
| Microsoft Copilot | Bingbot | kein separat erkennbarer Fetcher, Zugriff über Bing-Infrastruktur |
| Google Gemini, AI Overviews, AI Mode | Googlebot | kein eigener Live-Fetcher, Nutzung von Index und Cache; Steuerung über Google-Extended |
| Meta AI | Meta-ExternalAgent | Meta-ExternalFetcher |
| Mistral Le Chat | – | MistralAI-User |
Zugriffe von ChatGPT-User, Claude-User und Perplexity-User sind damit die aussagekräftigste Kennzahl für echte AI-Nachfrage: Jeder Hit entspricht grob einem Prompt, bei dem die Seite konsultiert wurde. Bei Google fehlt dieses Signal, weil alles im normalen Googlebot-Traffic aufgeht; dort muss die AI-Sichtbarkeit über Antwort-Monitoring gemessen werden.
Zwei Einschränkungen: Caches sorgen dafür, dass nicht jede zitierte Seite erneut abgerufen wird, die Fetcher-Hits unterschätzen die Nutzung also eher. Und wer Such-Bots erlaubt, User-Fetcher aber per Firewall blockiert, wird zwar im Index gefunden, das Modell kann den Inhalt aber nicht lesen – zitiert wird dann eher eine Konkurrenzquelle.
Der gecachte Index von ChatGPT
OpenAI veröffentlicht kein Datenschema. Gesichert ist: OAI-SearchBot baut den Index für die Such- und Shopping-Funktionen von ChatGPT; wird er blockiert, fällt die Seite aus den Suchzitationen, ohne dass das die Trainingsdaten betrifft. Laut OpenAI-Doku werden diese Daten nicht fürs Modelltraining genutzt; sind GPTBot und OAI-SearchBot beide erlaubt, kann ein einziger Crawl für beide Zwecke dienen.
Belegt durch Tests. Ende 2025 wurde entdeckt, dass die Web-Search-API den Parameter external_web_access kennt, der auf einen internen gecachten Index hinweist – der erste konkrete Beleg, dass ChatGPT Search nicht ausschließlich live abruft. Mit false antwortet das Modell nur aus dem Cache, mit true holt es frische Inhalte; true ist der Standard. Gespeist wird der Index von zwei Bots, OAI-SearchBot und ChatGPT-User. Inhalte zu Trendthemen waren schon wenige Stunden nach dem Ereignis im Cache abrufbar, Inhalte von vor über 30 Tagen weiterhin verfügbar. Ein Bot-Besuch garantiert aber keine Aufnahme: OpenAI filtert nach unbekannten Kriterien.
Vermutete Architektur (nicht bestätigt, abgeleitet aus üblichen Retrieval-Systemen): ein Dokumentenspeicher mit bereinigtem Text, URL, Titel und Crawl-Datum; eine Zerlegung längerer Seiten in Chunks, damit einzelne Passagen zitiert werden können; ein Keyword- und ein Vektorindex für die Fan-out-Queries; Metadaten wie Aktualität und Domain-Vertrauen; sowie eine Entitäten-Ebene – ChatGPT stellt Marken inzwischen als anklickbare Entitäten mit Knowledge Panels dar.
Konsequenz für die Optimierung. Gespeichert wird im Wesentlichen der Text aus dem HTML-Quellcode, ohne JavaScript-Rendering. Eine Logfile-Analyse von ChatGPT Deep Research (Juni 2026) zeigt: Die Seite wird als HTML in Quelltext-Reihenfolge linearisiert, der <head> entfernt, und nichts per JS Nachgeladenes taucht auf. Inhalte in Akkordeons oder Tabs sind damit faktisch unsichtbar. Deep Research läuft dabei komplett über Bing ohne Google-Fallback, die Snippets sind auf rund 285 Zeichen begrenzt, und in die Leseauswahl kommen nur die Top 2 bis 3 Bing-Ergebnisse pro Query. Bing-Rankings sind für ChatGPT also mindestens so relevant wie der eigene Index.
Trainingsdaten neben den Crawlern
Crawler sind nur eine von sechs Quellen. Wer alle Trainings-Bots sperrt, landet über die anderen Kanäle trotzdem in den Modellen.
Lizenzdeals. Der am schnellsten wachsende Kanal. OpenAI führt mit 24 offengelegten Deals, danach folgen Microsoft und Meta mit je etwa zwölf. Größter bekannter Vertrag: News Corp mit OpenAI, über 250 Mio. Dollar auf fünf Jahre, angekündigt im Mai 2024, mit Rechten für Training und Echtzeitzugriff. Google zahlt Reddit berichteten rund 60 Mio. Dollar pro Jahr, OpenAIs Reddit-Vereinbarung wird auf etwa 70 Mio. Dollar jährlich beziffert. Shutterstock erzielte 2023 bereits 104 Mio. Dollar mit AI-Lizenzen aus Deals mit OpenAI, Meta, Google, Amazon und Apple. Im deutschsprachigen Raum ist vor allem Axel Springer relevant (Bild, Welt, Politico, Business Insider), berichtet werden rund 10 Mio. Dollar pro Jahr. Seit 2026 verschiebt sich das Modell vom Verkauf statischer Archive zur Miete laufend aktualisierter Echtzeit-Feeds, sichtbar an der im Januar 2026 formalisierten Wikimedia-Enterprise-Partnerschaft mit Amazon, Meta, Microsoft, Perplexity und Mistral.
Eigene Plattformdaten. Meta hat historisch bevorzugt auf Daten aus Facebook und Instagram plus Web-Scraping gesetzt. Google verfügt über YouTube, Google Books, Maps-Rezensionen und den eigenen Suchindex, Microsoft über GitHub und LinkedIn, Amazon über Produktkatalog und Rezensionen, xAI über die Daten von X. Was in Rezensionen oder Foren über eine Marke steht, fließt unabhängig von der eigenen robots.txt ein.
Offene Datensätze und Archive. Common Crawl ist die größte Einzelquelle; wer CCBot sperrt, ist indirekt aus vielen Modellen draußen. Dazu kommen Wikipedia und Wikidata, arXiv und PubMed, Verwaltungsdaten sowie Code-Repositories, vor allem GitHub. Auf Hugging Face liegen fertige Korpora wie The Pile, RefinedWeb, C4 oder FineWeb, überwiegend Ableitungen aus Common Crawl. Diese Datensätze sind Momentaufnahmen: Einmal erfasste Inhalte bleiben im Umlauf, auch nach einer späteren Sperre.
Menschlich erzeugte Daten. OpenAI beschreibt seine Quellen als Mischung aus lizenzierten Daten, öffentlich zugänglichen Daten und Daten, die von menschlichen Trainern erstellt wurden. Dazu zählen Annotation und RLHF über Dienstleister, Expertendaten aus Medizin, Recht oder Programmierung sowie Nutzerkonversationen – bei kostenlosen und Plus-Tarifen standardmäßig, sofern nicht widersprochen wird; für Business- und API-Kunden gilt das nicht.
Synthetische Daten. Modelle erzeugen Trainingsdaten für andere Modelle, etwa über Destillation. Der Anteil wächst, weil hochwertige menschliche Texte knapp werden. Für GEO relevant, weil sich Fehler so über Modellgenerationen verfestigen können.
Datenmarktplätze. Zwischenhändler bündeln Rechte vieler kleiner Anbieter. Der Marktplatz Troveo etwa hat über 7.000 Lizenzgeber unter Vertrag, 95 % davon exklusiv, mit bisher über 20 Mio. Dollar Ausschüttung. Dazu kommen Stockarchive wie Getty und Adobe.
Monitoring und Sperrung: Stand der Praxis
Konsens. Fast alle Fachleute warnen vor Pauschalsperren. Häufigster Fehler ist, GPTBot zu blockieren und damit Zitationen in ChatGPT verhindern zu wollen – dafür ist OAI-SearchBot zuständig. Standard ist ein selektiver Zugang: Such- und Antwort-Discovery erlauben, wertlose Pfade einschränken, Trainings-Crawler nur bei klarem geschäftlichen Grund sperren. Klassische Rankings bleiben davon unberührt, weil Googlebot und Bingbot unabhängig arbeiten.
Streitpunkt Trainings-Bots. Das größere Lager sperrt Training (GPTBot, ClaudeBot, Google-Extended) und erlaubt Retrieval (OAI-SearchBot, Claude-SearchBot, PerplexityBot); werbefinanzierte Publisher argumentieren, dass Training ihre Erlöse direkt kannibalisiert. Das Gegenlager empfiehlt, auch Training zu erlauben, weil man sonst aus dem Modellwissen fällt und bei generischen Fragen nicht mehr genannt wird – dort kursieren allerdings auch steile Marketingthesen, etwa dass eine GPTBot-Sperre einer De-Indexierung bei Google gleichkäme.
robots.txt ist keine Schutzmaßnahme, sondern eine Präferenz: kein Schutz für private Bereiche, kostenpflichtige Datenbanken oder Geschäftsgeheimnisse. Ergänzend empfohlen werden WAF-Regeln, eine per Reverse DNS verifizierte Allowlist für Such-Bots und Blocking an der CDN-Edge.
Monitoring. Logfile-Analyse gilt als Pflicht, weil laufend neue User-Agents dazukommen; die robots.txt-Konfiguration sollte fortlaufend getestet werden. Häufig übersehen: Google-Extended ist nur ein Token und erscheint nie im Log. llms.txt wird überwiegend skeptisch gesehen – laut Search Engine Land zeigten acht von neun Websites nach der Einführung keine messbare Traffic-Veränderung, und John Mueller wies darauf hin, dass bislang kein AI-Crawler angegeben hat, Informationen darüber zu beziehen.
Cloudflare-Umstellung vom 15. September 2026. Auf Seiten mit Werbeanzeigen werden Trainings- und Agent-Crawler seitdem standardmäßig blockiert, Such-Crawler bleiben erlaubt. Betroffen sind neue Domains sowie bestehende Free-Plan-Kunden ohne eigene Einstellung; zahlende Kunden mit gewählten Einstellungen werden nicht automatisch umgestellt. Brisant bei Multi-Purpose-Crawlern: Wer Training blockiert, sperrt auch Googlebot, Applebot und Bingbot, obwohl Such-Crawler erlaubt sind – Cloudflare will die Anbieter so zwingen, ihre Crawler nach Zweck zu trennen. GEO-seitig besonders relevant ist, dass die Kategorie „Agent“ standardmäßig gesperrt wird und damit die User-triggered Fetcher betroffen sein können.
Index-Abdeckungsquote bei ChatGPT messen
Der Parameter external_web_access erlaubt eine Art Indexierungsprüfung für ChatGPT, vergleichbar mit der Abdeckungsprüfung in der Google Search Console.
Ablauf je URL:
- URL per Responses API mit
external_web_access: falsezusammenfassen lassen (reiner Cache-Modus). Kommt eine korrekte Zusammenfassung zurück, ist die Seite im Index. - Zur Absicherung gegen Halluzinationen die Seite selbst laden,
<title>und<h1>auslesen und mit der Modellantwort vergleichen. Erst ab etwa 80 % Ähnlichkeit gilt die Seite als indexiert, sonst als „unsicher“. - Zusätzlich prüfen, ob die Ziel-URL in den Tool-Calls oder Zitationen der Antwort auftaucht.
- Optionaler Warm-up: nicht indexierte Seiten einmal mit
truelive abrufen, nach einigen Minuten erneut im Cache-Modus prüfen. So wird sichtbar, ob OpenAI die Seite nach einem Abruf aufnimmt.
Aggregiert über die wichtigsten Landingpages, gruppiert nach Kategorie, ergibt das eine Abdeckungsquote, die sich über mehrere Messläufe verfolgen lässt. Als Werkzeug genügt ein Python-Skript mit CSV-Ein- und -Ausgabe; für wiederkehrende Messungen mit Verlauf lohnt eine kleine Web-App (Datenbank aus URL-Listen, Läufen und Ergebnissen, API-Key ausschließlich serverseitig, Verarbeitung je URL als eigener Job wegen Laufzeitlimits).
Grenzen der Methode: Der API-Cache muss nicht identisch mit dem Index der ChatGPT-Oberfläche sein, das Ergebnis ist ein Näherungswert. Jeder Aufruf kostet, bei mehreren hundert URLs mit Wiederholungen summiert sich das. Und Seiten, deren Inhalte erst per JavaScript geladen werden, können fälschlich als „unsicher“ erscheinen.
Quellen
| Thema | Quelle |
|---|---|
Gecachter Index, external_web_access, Testmethode | LLMrefs: OpenAI cached index |
| Ursprüngliche Entdeckung des Parameters | LinkedIn-Post von Jerome Salomon |
| Offizielle Parameter-Dokumentation | OpenAI: Web Search Tool |
| HTML-Linearisierung, Deep Research und Bing | Peec AI: How Deep Research reads your site |
| Entitäten und Knowledge Panels | LLMrefs: ChatGPT Entities |
| Bot-Übersichten und Typologie | contextbolt · geotoolbox · tenten |
| Cloudflare-Umstellung 15.09.2026 | Cloudflare Blog · Help Net Security · TechCrunch |
| Empfehlungen zu robots.txt und Sperrung | seeklab · Playwire · edikka · itoolverse |
| Gegenposition „auch Training erlauben“ | openhermit |
| Lizenzdeals und Marktzahlen | LLM Pulse: Licensing deals · Quartz · Troveo: Statistics · notioncue |
| OpenAI-Selbstauskunft zu Datenquellen | Contently |
Ohne Quellenbeleg sind in diesem Artikel: die vermutete Index-Architektur im Abschnitt zum ChatGPT-Cache (Einordnung auf Basis üblicher RAG-Systeme), die Angaben zu Google-Extended und Bingbot/Copilot sowie die gemeinsame Crawl-Nutzung von GPTBot und OAI-SearchBot. Sie stammen aus allgemeinem Fachwissen, nicht aus einer der oben abgerufenen Seiten.