# CCBot

## In short

CCBot e un crawler di IA gestito da Common Crawl Foundation. Il suo token robots.txt e CCBot, e la documentazione del fornitore che abbiamo scaricato il 2026-09-06 e la fonte di ogni affermazione in questa pagina.

| Fact | Value |
| --- | --- |
| Token robots | CCBot |
| Fornitore | Common Crawl Foundation |
| Finalita | training corpus, public web corpus |
| Verifica documentata | nessuno pubblicato |
| Documentazione del fornitore verificata l'ultima volta | 2026-09-06 |
| Quota dei domini letti che lo bloccano per / | 19.1% of 131 |
| Last verified | 2026-09-06 |

## CCBot rispetta il file robots.txt?

La documentazione del fornitore all'indirizzo https://commoncrawl.org/ccbot afferma che CCBot rispetta il file robots.txt. Abbiamo scaricato quella pagina e ha risposto al nostro verificatore il 2026-09-06. Questo registra cio che il fornitore documenta, non cio che ha fatto una singola richiesta.

## Come consento CCBot nel file robots.txt?

Aggiungi questo gruppo al file robots.txt nella radice dell'host: User-agent: CCBot
Allow: /. Secondo la RFC 9309 il token viene confrontato senza distinzione tra maiuscole e minuscole come sottostringa dello user agent, e vince la regola corrispondente piu lunga.

## Come blocco CCBot nel file robots.txt?

Aggiungi questo gruppo al file robots.txt nella radice dell'host: User-agent: CCBot
Disallow: /. Una regola del file robots.txt e una richiesta che un crawler educato rispetta; non e un controllo di accesso.

## Come verifico che una richiesta provenga davvero da CCBot?

Non abbiamo trovato un metodo di verifica documentato per CCBot: il fornitore non pubblica ne un file di intervalli IP ne una convenzione di DNS inverso che potessimo scaricare. Senza di essi, una stringa di user agent non e prova dell'origine.

## Fonte

- https://commoncrawl.org/ccbot (HTTP 200, Verificato 2026-09-06)

AEO Watch e un osservatorio indipendente e fattuale. Non e affiliato ad alcun fornitore di crawler, non e approvato da nessuno e non parla per nessuno. Ogni affermazione e un'osservazione con la data in cui e stata fatta e la prova grezza che la sostiene: una riga del file robots.txt, un codice di stato HTTP, un'intestazione. Qui non ci sono punteggi, voti o verdetti, e nulla in questa pagina e un consiglio. Un sito puo chiedere l'esclusione in qualsiasi momento e l'esclusione e rispettata in modo automatico e permanente.
