CCBot: token robots, verifica, consentire o bloccare
Questa pagina e tradotta automaticamente. I numeri e le prove provengono invariati dalle osservazioni memorizzate.
CCBot e un crawler di IA gestito da Common Crawl Foundation. Il suo token robots.txt e CCBot, e la documentazione del fornitore che abbiamo scaricato il 2026-09-06 e la fonte di ogni affermazione in questa pagina.
| Token robots | CCBot |
|---|---|
| Fornitore | Common Crawl Foundation |
| Finalita | training corpus, public web corpus |
| Verifica documentata | nessuno pubblicato |
| Documentazione del fornitore verificata l'ultima volta | 2026-09-06 |
| Quota dei domini letti che lo bloccano per / | 18.8% of 128 |
| Last verified |
Identita
| Token robots | CCBot |
|---|---|
| Confrontato come | ccbot |
| Fornitore | Common Crawl Foundation |
| Finalita | training corpus, public web corpus |
| Documentazione | https://commoncrawl.org/ccbot |
| Verifica documentata | nessuno pubblicato |
Not an answer engine itself: it builds the public corpus that many models train on, which is why site owners treat it as an AI crawler. The exact snippet 'User-agent: CCBot Disallow: /' appears on the vendor page fetched on 2026-09-06.
Consentire o bloccare
User-agent: CCBot Allow: /
User-agent: CCBot Disallow: /
Una regola del file robots.txt e una richiesta che un crawler educato rispetta. Non e un controllo di accesso, e questa pagina non dice a nessuno cosa scegliere.
Domande
CCBot rispetta il file robots.txt?
La documentazione del fornitore all'indirizzo https://commoncrawl.org/ccbot afferma che CCBot rispetta il file robots.txt. Abbiamo scaricato quella pagina e ha risposto al nostro verificatore il 2026-09-06. Questo registra cio che il fornitore documenta, non cio che ha fatto una singola richiesta.
Come consento CCBot nel file robots.txt?
Aggiungi questo gruppo al file robots.txt nella radice dell'host: User-agent: CCBot Allow: /. Secondo la RFC 9309 il token viene confrontato senza distinzione tra maiuscole e minuscole come sottostringa dello user agent, e vince la regola corrispondente piu lunga.
Come blocco CCBot nel file robots.txt?
Aggiungi questo gruppo al file robots.txt nella radice dell'host: User-agent: CCBot Disallow: /. Una regola del file robots.txt e una richiesta che un crawler educato rispetta; non e un controllo di accesso.
Come verifico che una richiesta provenga davvero da CCBot?
Non abbiamo trovato un metodo di verifica documentato per CCBot: il fornitore non pubblica ne un file di intervalli IP ne una convenzione di DNS inverso che potessimo scaricare. Senza di essi, una stringa di user agent non e prova dell'origine.
Che cosa misuriamo
Dei 128 domini censiti di cui abbiamo letto il file robots.txt, 24 bloccano CCBot per / e 104 lo consentono, cioe il 18.8% bloccato, settimana 2026-W37. Solo conteggi: nessun dominio viene nominato.
L'indice settimanale di accesso dei crawler di IA
Fonti
| Fonte | Tipo | HTTP | Verificato | Nota |
|---|---|---|---|---|
| https://commoncrawl.org/ccbot | vendor | 200 | 2026-09-06 | 11 occurrences of CCBot in the fetched body |
Dati liberi
Verifica un dominio con tutti i token
AEO Watch e un osservatorio indipendente e fattuale. Non e affiliato ad alcun fornitore di crawler, non e approvato da nessuno e non parla per nessuno. Ogni affermazione e un'osservazione con la data in cui e stata fatta e la prova grezza che la sostiene: una riga del file robots.txt, un codice di stato HTTP, un'intestazione. Qui non ci sono punteggi, voti o verdetti, e nulla in questa pagina e un consiglio. Un sito puo chiedere l'esclusione in qualsiasi momento e l'esclusione e rispettata in modo automatico e permanente.