CCBot: token de robots, verificacao, permitir ou bloquear
Esta pagina foi traduzida automaticamente. Os numeros e as provas vem sem alteracao das observacoes guardadas.
CCBot e um rastreador de IA operado por Common Crawl Foundation. Seu token de robots.txt e CCBot, e a documentacao do fornecedor que baixamos em 2026-09-06 e a fonte de cada afirmacao desta pagina.
| Token de robots | CCBot |
|---|---|
| Fornecedor | Common Crawl Foundation |
| Finalidade | training corpus, public web corpus |
| Verificacao documentada | nenhuma publicada |
| Documentacao do fornecedor verificada pela ultima vez | 2026-09-06 |
| Parcela dos dominios lidos que o bloqueiam para / | 18.8% of 128 |
| Last verified |
Identidade
| Token de robots | CCBot |
|---|---|
| Comparado como | ccbot |
| Fornecedor | Common Crawl Foundation |
| Finalidade | training corpus, public web corpus |
| Documentacao | https://commoncrawl.org/ccbot |
| Verificacao documentada | nenhuma publicada |
Not an answer engine itself: it builds the public corpus that many models train on, which is why site owners treat it as an AI crawler. The exact snippet 'User-agent: CCBot Disallow: /' appears on the vendor page fetched on 2026-09-06.
Permitir ou bloquear
User-agent: CCBot Allow: /
User-agent: CCBot Disallow: /
Uma regra do robots.txt e um pedido que um rastreador bem comportado atende. Nao e um controle de acesso, e esta pagina nao diz a ninguem o que escolher.
Perguntas
O CCBot respeita o robots.txt?
A documentacao do fornecedor em https://commoncrawl.org/ccbot afirma que o CCBot respeita o robots.txt. Baixamos essa pagina e ela respondeu ao nosso verificador em 2026-09-06. Isto registra o que o fornecedor documenta, nao o que uma requisicao especifica fez.
Como permito o CCBot no robots.txt?
Adicione este grupo ao robots.txt na raiz do host: User-agent: CCBot Allow: /. Pela RFC 9309 o token e comparado sem diferenciar maiusculas como subcadeia do user agent, e vence a regra correspondente mais longa.
Como bloqueio o CCBot no robots.txt?
Adicione este grupo ao robots.txt na raiz do host: User-agent: CCBot Disallow: /. Uma regra do robots.txt e um pedido que um rastreador bem comportado atende; nao e um controle de acesso.
Como verifico se uma requisicao veio mesmo do CCBot?
Nao encontramos um metodo de verificacao documentado para o CCBot: o fornecedor nao publica nem arquivo de faixas IP nem convencao de DNS reverso que pudessemos baixar. Sem isso, uma cadeia de user agent nao e prova de origem.
O que medimos
Dos 128 dominios cadastrados cujo robots.txt lemos, 24 bloqueiam o CCBot para / e 104 o permitem, ou seja 18.8% bloqueados, semana 2026-W37. Apenas contagens: nenhum dominio e nomeado.
O indice semanal de acesso dos rastreadores de IA
Fontes
| Fonte | Tipo | HTTP | Verificado | Observacao |
|---|---|---|---|---|
| https://commoncrawl.org/ccbot | vendor | 200 | 2026-09-06 | 11 occurrences of CCBot in the fetched body |
Dados livres
Verificar um dominio com todos os tokens
O AEO Watch e um monitor independente e factual. Nao tem vinculo com nenhum fornecedor de rastreadores, nao e endossado por nenhum e nao fala por nenhum. Cada afirmacao e uma observacao com a data em que foi feita e a prova bruta por tras dela: uma linha do robots.txt, um codigo de estado HTTP, um cabecalho. Aqui nao ha notas, classificacoes ou vereditos, e nada nesta pagina e aconselhamento. Um site pode pedir exclusao a qualquer momento e a exclusao e respeitada de forma automatica e permanente.