CCBot: token robots, verifica, consentire o bloccare

Questa pagina e tradotta automaticamente. I numeri e le prove provengono invariati dalle osservazioni memorizzate.

CCBot e un crawler di IA gestito da Common Crawl Foundation. Il suo token robots.txt e CCBot, e la documentazione del fornitore che abbiamo scaricato il 2026-09-06 e la fonte di ogni affermazione in questa pagina.

Token robotsCCBot
FornitoreCommon Crawl Foundation
Finalitatraining corpus, public web corpus
Verifica documentatanessuno pubblicato
Documentazione del fornitore verificata l'ultima volta2026-09-06
Quota dei domini letti che lo bloccano per /18.8% of 128
Last verified

Identita

Token robotsCCBot
Confrontato comeccbot
FornitoreCommon Crawl Foundation
Finalitatraining corpus, public web corpus
Documentazionehttps://commoncrawl.org/ccbot
Verifica documentatanessuno pubblicato

Not an answer engine itself: it builds the public corpus that many models train on, which is why site owners treat it as an AI crawler. The exact snippet 'User-agent: CCBot Disallow: /' appears on the vendor page fetched on 2026-09-06.

Consentire o bloccare

User-agent: CCBot
Allow: /
User-agent: CCBot
Disallow: /

Una regola del file robots.txt e una richiesta che un crawler educato rispetta. Non e un controllo di accesso, e questa pagina non dice a nessuno cosa scegliere.

Domande

CCBot rispetta il file robots.txt?

La documentazione del fornitore all'indirizzo https://commoncrawl.org/ccbot afferma che CCBot rispetta il file robots.txt. Abbiamo scaricato quella pagina e ha risposto al nostro verificatore il 2026-09-06. Questo registra cio che il fornitore documenta, non cio che ha fatto una singola richiesta.

Come consento CCBot nel file robots.txt?

Aggiungi questo gruppo al file robots.txt nella radice dell'host: User-agent: CCBot Allow: /. Secondo la RFC 9309 il token viene confrontato senza distinzione tra maiuscole e minuscole come sottostringa dello user agent, e vince la regola corrispondente piu lunga.

Come blocco CCBot nel file robots.txt?

Aggiungi questo gruppo al file robots.txt nella radice dell'host: User-agent: CCBot Disallow: /. Una regola del file robots.txt e una richiesta che un crawler educato rispetta; non e un controllo di accesso.

Come verifico che una richiesta provenga davvero da CCBot?

Non abbiamo trovato un metodo di verifica documentato per CCBot: il fornitore non pubblica ne un file di intervalli IP ne una convenzione di DNS inverso che potessimo scaricare. Senza di essi, una stringa di user agent non e prova dell'origine.

Che cosa misuriamo

Dei 128 domini censiti di cui abbiamo letto il file robots.txt, 24 bloccano CCBot per / e 104 lo consentono, cioe il 18.8% bloccato, settimana 2026-W37. Solo conteggi: nessun dominio viene nominato.

L'indice settimanale di accesso dei crawler di IA

Fonti

FonteTipoHTTPVerificatoNota
https://commoncrawl.org/ccbot vendor200 2026-09-0611 occurrences of CCBot in the fetched body

Dati liberi

Verifica un dominio con tutti i token

AEO Watch e un osservatorio indipendente e fattuale. Non e affiliato ad alcun fornitore di crawler, non e approvato da nessuno e non parla per nessuno. Ogni affermazione e un'osservazione con la data in cui e stata fatta e la prova grezza che la sostiene: una riga del file robots.txt, un codice di stato HTTP, un'intestazione. Qui non ci sono punteggi, voti o verdetti, e nulla in questa pagina e un consiglio. Un sito puo chiedere l'esclusione in qualsiasi momento e l'esclusione e rispettata in modo automatico e permanente.

Cite this
CCBot: token robots, verifica e come consentirlo o bloccarlo - https://bikoosh.com/it/aeo/crawler/ccbot
<a href="https://bikoosh.com/it/aeo/crawler/ccbot">CCBot: token robots, verifica e come consentirlo o bloccarlo</a>
[CCBot: token robots, verifica e come consentirlo o bloccarlo](https://bikoosh.com/it/aeo/crawler/ccbot)
CCBot: token robots, verifica e come consentirlo o bloccarlo. Bikoosh. Retrieved 2026-09-07, from https://bikoosh.com/it/aeo/crawler/ccbot