CCBot: robots-Token, Verifizierung, erlauben oder sperren
Diese Seite ist maschinell uebersetzt. Die Messwerte und die Belege stammen unveraendert aus den gespeicherten Beobachtungen.
CCBot ist ein KI Crawler, betrieben von Common Crawl Foundation. Sein robots.txt Token lautet CCBot, und die Herstellerdokumentation, die wir am 2026-09-06 abgerufen haben, ist die Quelle jeder Aussage auf dieser Seite.
| Robots Token | CCBot |
|---|---|
| Hersteller | Common Crawl Foundation |
| Zweck | training corpus, public web corpus |
| Dokumentierte Pruefung | nicht veroeffentlicht |
| Herstellerdokumentation zuletzt geprueft | 2026-09-06 |
| Anteil der gelesenen Domains, die ihn fuer / sperren | 18.8% of 128 |
| Last verified |
Identitaet
| Robots Token | CCBot |
|---|---|
| Abgeglichen als | ccbot |
| Hersteller | Common Crawl Foundation |
| Zweck | training corpus, public web corpus |
| Dokumentation | https://commoncrawl.org/ccbot |
| Dokumentierte Pruefung | nicht veroeffentlicht |
Not an answer engine itself: it builds the public corpus that many models train on, which is why site owners treat it as an AI crawler. The exact snippet 'User-agent: CCBot Disallow: /' appears on the vendor page fetched on 2026-09-06.
Erlauben oder sperren
User-agent: CCBot Allow: /
User-agent: CCBot Disallow: /
Eine Regel in der robots.txt ist eine Bitte, die ein gut erzogener Crawler befolgt. Sie ist keine Zugriffskontrolle, und diese Seite sagt niemandem, wie er sich entscheiden soll.
Fragen
Befolgt CCBot die robots.txt?
Die Herstellerdokumentation unter https://commoncrawl.org/ccbot gibt an, dass CCBot die robots.txt beachtet. Wir haben diese Seite abgerufen, und sie hat unserem Pruefer am 2026-09-06 geantwortet. Das haelt fest, was der Hersteller dokumentiert, nicht was eine einzelne Anfrage getan hat.
Wie erlaube ich CCBot in der robots.txt?
Fuegen Sie diese Gruppe in die robots.txt im Wurzelverzeichnis des Hosts ein: User-agent: CCBot Allow: /. Nach RFC 9309 wird der Token ohne Beachtung der Gross und Kleinschreibung als Teilzeichenkette des User Agent verglichen, und die laengste passende Regel gewinnt.
Wie sperre ich CCBot in der robots.txt?
Fuegen Sie diese Gruppe in die robots.txt im Wurzelverzeichnis des Hosts ein: User-agent: CCBot Disallow: /. Eine Regel in der robots.txt ist eine Bitte, die ein gut erzogener Crawler befolgt; sie ist keine Zugriffskontrolle.
Wie pruefe ich, ob eine Anfrage wirklich von CCBot kam?
Wir haben fuer CCBot keine dokumentierte Pruefmethode gefunden: Der Hersteller veroeffentlicht weder eine Datei mit IP Bereichen noch eine Reverse DNS Konvention, die wir abrufen koennten. Ohne eine solche ist eine User Agent Zeichenkette kein Beleg fuer die Herkunft.
Was wir messen
Von den 128 erfassten Domains, deren robots.txt wir gelesen haben, sperren 24 den Token CCBot fuer / und 104 erlauben ihn, das sind 18.8% gesperrt, Woche 2026-W37. Nur Zahlen: keine Domain wird genannt.
Der woechentliche Index des KI Crawler Zugangs
Quellen
| Quelle | Typ | HTTP | Geprueft | Hinweis |
|---|---|---|---|---|
| https://commoncrawl.org/ccbot | vendor | 200 | 2026-09-06 | 11 occurrences of CCBot in the fetched body |
Freie Daten
Eine Domain gegen alle Token pruefen
AEO Watch ist ein unabhaengiger, faktischer Monitor. Er ist mit keinem Crawler Hersteller verbunden, wird von keinem unterstuetzt und spricht fuer keinen. Jede Aussage ist eine Beobachtung mit dem Datum, an dem sie gemacht wurde, und dem Rohbeleg dahinter: eine Zeile aus der robots.txt, ein HTTP Statuscode, ein Header. Es gibt hier keine Noten, keine Bewertungen und keine Urteile, und nichts auf dieser Seite ist eine Beratung. Eine Website kann jederzeit widersprechen, und der Widerspruch wird automatisch und dauerhaft beachtet.