CCBot: token de robots, verificacao, permitir ou bloquear

Esta pagina foi traduzida automaticamente. Os numeros e as provas vem sem alteracao das observacoes guardadas.

CCBot e um rastreador de IA operado por Common Crawl Foundation. Seu token de robots.txt e CCBot, e a documentacao do fornecedor que baixamos em 2026-09-06 e a fonte de cada afirmacao desta pagina.

Token de robotsCCBot
FornecedorCommon Crawl Foundation
Finalidadetraining corpus, public web corpus
Verificacao documentadanenhuma publicada
Documentacao do fornecedor verificada pela ultima vez2026-09-06
Parcela dos dominios lidos que o bloqueiam para /18.8% of 128
Last verified

Identidade

Token de robotsCCBot
Comparado comoccbot
FornecedorCommon Crawl Foundation
Finalidadetraining corpus, public web corpus
Documentacaohttps://commoncrawl.org/ccbot
Verificacao documentadanenhuma publicada

Not an answer engine itself: it builds the public corpus that many models train on, which is why site owners treat it as an AI crawler. The exact snippet 'User-agent: CCBot Disallow: /' appears on the vendor page fetched on 2026-09-06.

Permitir ou bloquear

User-agent: CCBot
Allow: /
User-agent: CCBot
Disallow: /

Uma regra do robots.txt e um pedido que um rastreador bem comportado atende. Nao e um controle de acesso, e esta pagina nao diz a ninguem o que escolher.

Perguntas

O CCBot respeita o robots.txt?

A documentacao do fornecedor em https://commoncrawl.org/ccbot afirma que o CCBot respeita o robots.txt. Baixamos essa pagina e ela respondeu ao nosso verificador em 2026-09-06. Isto registra o que o fornecedor documenta, nao o que uma requisicao especifica fez.

Como permito o CCBot no robots.txt?

Adicione este grupo ao robots.txt na raiz do host: User-agent: CCBot Allow: /. Pela RFC 9309 o token e comparado sem diferenciar maiusculas como subcadeia do user agent, e vence a regra correspondente mais longa.

Como bloqueio o CCBot no robots.txt?

Adicione este grupo ao robots.txt na raiz do host: User-agent: CCBot Disallow: /. Uma regra do robots.txt e um pedido que um rastreador bem comportado atende; nao e um controle de acesso.

Como verifico se uma requisicao veio mesmo do CCBot?

Nao encontramos um metodo de verificacao documentado para o CCBot: o fornecedor nao publica nem arquivo de faixas IP nem convencao de DNS reverso que pudessemos baixar. Sem isso, uma cadeia de user agent nao e prova de origem.

O que medimos

Dos 128 dominios cadastrados cujo robots.txt lemos, 24 bloqueiam o CCBot para / e 104 o permitem, ou seja 18.8% bloqueados, semana 2026-W37. Apenas contagens: nenhum dominio e nomeado.

O indice semanal de acesso dos rastreadores de IA

Fontes

FonteTipoHTTPVerificadoObservacao
https://commoncrawl.org/ccbot vendor200 2026-09-0611 occurrences of CCBot in the fetched body

Dados livres

Verificar um dominio com todos os tokens

O AEO Watch e um monitor independente e factual. Nao tem vinculo com nenhum fornecedor de rastreadores, nao e endossado por nenhum e nao fala por nenhum. Cada afirmacao e uma observacao com a data em que foi feita e a prova bruta por tras dela: uma linha do robots.txt, um codigo de estado HTTP, um cabecalho. Aqui nao ha notas, classificacoes ou vereditos, e nada nesta pagina e aconselhamento. Um site pode pedir exclusao a qualquer momento e a exclusao e respeitada de forma automatica e permanente.

Cite this
CCBot: token de robots, verificacao e como permitir ou bloquear - https://bikoosh.com/pt/aeo/crawler/ccbot
<a href="https://bikoosh.com/pt/aeo/crawler/ccbot">CCBot: token de robots, verificacao e como permitir ou bloquear</a>
[CCBot: token de robots, verificacao e como permitir ou bloquear](https://bikoosh.com/pt/aeo/crawler/ccbot)
CCBot: token de robots, verificacao e como permitir ou bloquear. Bikoosh. Retrieved 2026-09-07, from https://bikoosh.com/pt/aeo/crawler/ccbot