CCBot: robots-token, verificatie, toestaan of blokkeren
Deze pagina is machinaal vertaald. De cijfers en het bewijs komen ongewijzigd uit de opgeslagen waarnemingen.
CCBot is een AI crawler die wordt beheerd door Common Crawl Foundation. Het robots.txt token is CCBot, en de documentatie van de leverancier die wij op 2026-09-06 hebben opgehaald is de bron van elke uitspraak op deze pagina.
| Robots token | CCBot |
|---|---|
| Leverancier | Common Crawl Foundation |
| Doel | training corpus, public web corpus |
| Gedocumenteerde controle | niet gepubliceerd |
| Documentatie van de leverancier voor het laatst gecontroleerd | 2026-09-06 |
| Aandeel van de gelezen domeinen dat het blokkeert voor / | 18.8% of 128 |
| Last verified |
Identiteit
| Robots token | CCBot |
|---|---|
| Vergeleken als | ccbot |
| Leverancier | Common Crawl Foundation |
| Doel | training corpus, public web corpus |
| Documentatie | https://commoncrawl.org/ccbot |
| Gedocumenteerde controle | niet gepubliceerd |
Not an answer engine itself: it builds the public corpus that many models train on, which is why site owners treat it as an AI crawler. The exact snippet 'User-agent: CCBot Disallow: /' appears on the vendor page fetched on 2026-09-06.
Toestaan of blokkeren
User-agent: CCBot Allow: /
User-agent: CCBot Disallow: /
Een regel in robots.txt is een verzoek dat een net gedragende crawler inwilligt. Het is geen toegangscontrole, en deze pagina zegt niemand wat te kiezen.
Vragen
Volgt CCBot robots.txt?
De documentatie van de leverancier op https://commoncrawl.org/ccbot stelt dat CCBot robots.txt respecteert. Wij hebben die pagina opgehaald en zij antwoordde onze controle op 2026-09-06. Dit legt vast wat de leverancier documenteert, niet wat een afzonderlijk verzoek deed.
Hoe sta ik CCBot toe in robots.txt?
Voeg deze groep toe aan de robots.txt in de hoofdmap van de host: User-agent: CCBot Allow: /. Volgens RFC 9309 wordt het token hoofdletterongevoelig vergeleken als deel van de user agent, en de langste passende regel wint.
Hoe blokkeer ik CCBot in robots.txt?
Voeg deze groep toe aan de robots.txt in de hoofdmap van de host: User-agent: CCBot Disallow: /. Een regel in robots.txt is een verzoek dat een net gedragende crawler inwilligt; het is geen toegangscontrole.
Hoe controleer ik of een verzoek echt van CCBot kwam?
Wij hebben voor CCBot geen gedocumenteerde controlemethode gevonden: de leverancier publiceert noch een bestand met IP reeksen, noch een reverse DNS afspraak die wij konden ophalen. Zonder die is een user agent tekst geen bewijs van herkomst.
Wat wij meten
Van de 128 opgenomen domeinen waarvan wij robots.txt hebben gelezen, blokkeren 24 CCBot voor / en staan 104 het toe, dat is 18.8% geblokkeerd, week 2026-W37. Alleen aantallen: geen enkel domein wordt genoemd.
De wekelijkse index van AI crawler toegang
Bronnen
| Bron | Type | HTTP | Gecontroleerd | Opmerking |
|---|---|---|---|---|
| https://commoncrawl.org/ccbot | vendor | 200 | 2026-09-06 | 11 occurrences of CCBot in the fetched body |
Vrije data
Controleer een domein tegen alle tokens
AEO Watch is een onafhankelijke, feitelijke monitor. Het is niet verbonden met een leverancier van crawlers, wordt door niemand onderschreven en spreekt namens niemand. Elke uitspraak is een waarneming met de datum waarop zij is gedaan en het ruwe bewijs erachter: een regel uit robots.txt, een HTTP statuscode, een header. Er zijn hier geen scores, geen cijfers en geen oordelen, en niets op deze pagina is advies. Een site kan zich op elk moment afmelden en die afmelding wordt automatisch en blijvend gerespecteerd.