CCBot: token de robots, verificacion, permitir o bloquear

Esta pagina esta traducida automaticamente. Las cifras y la evidencia proceden sin cambios de las observaciones almacenadas.

CCBot es un rastreador de IA operado por Common Crawl Foundation. Su token de robots.txt es CCBot, y la documentacion del proveedor que descargamos el 2026-09-06 es la fuente de cada afirmacion de esta pagina.

Token de robotsCCBot
ProveedorCommon Crawl Foundation
Finalidadtraining corpus, public web corpus
Verificacion documentadaninguno publicado
Documentacion del proveedor verificada por ultima vez2026-09-06
Proporcion de dominios leidos que lo bloquean para /18.8% of 128
Last verified

Identidad

Token de robotsCCBot
Comparado comoccbot
ProveedorCommon Crawl Foundation
Finalidadtraining corpus, public web corpus
Documentacionhttps://commoncrawl.org/ccbot
Verificacion documentadaninguno publicado

Not an answer engine itself: it builds the public corpus that many models train on, which is why site owners treat it as an AI crawler. The exact snippet 'User-agent: CCBot Disallow: /' appears on the vendor page fetched on 2026-09-06.

Permitir o bloquear

User-agent: CCBot
Allow: /
User-agent: CCBot
Disallow: /

Una regla del archivo robots.txt es una peticion que un rastreador bien educado atiende. No es un control de acceso, y esta pagina no le dice a nadie que elegir.

Preguntas

Respeta CCBot el archivo robots.txt?

La documentacion del proveedor en https://commoncrawl.org/ccbot indica que CCBot respeta el archivo robots.txt. Descargamos esa pagina y respondio a nuestro verificador el 2026-09-06. Esto registra lo que documenta el proveedor, no lo que hizo una peticion concreta.

Como permito CCBot en el archivo robots.txt?

Anada este grupo al archivo robots.txt en la raiz del host: User-agent: CCBot Allow: /. Segun la RFC 9309 el token se compara sin distinguir mayusculas como subcadena del user agent, y gana la regla coincidente mas larga.

Como bloqueo CCBot en el archivo robots.txt?

Anada este grupo al archivo robots.txt en la raiz del host: User-agent: CCBot Disallow: /. Una regla del archivo robots.txt es una peticion que un rastreador bien educado atiende; no es un control de acceso.

Como compruebo que una peticion vino realmente de CCBot?

No hemos encontrado un metodo de comprobacion documentado para CCBot: el proveedor no publica ni un archivo de rangos IP ni una convencion de DNS inverso que pudieramos descargar. Sin eso, una cadena de user agent no es prueba de origen.

Lo que medimos

De los 128 dominios registrados cuyo archivo robots.txt hemos leido, 24 bloquean CCBot para / y 104 lo permiten, es decir un 18.8% bloqueado, semana 2026-W37. Solo recuentos: no se nombra ningun dominio.

El indice semanal de acceso de los rastreadores de IA

Fuentes

FuenteTipoHTTPVerificadoNota
https://commoncrawl.org/ccbot vendor200 2026-09-0611 occurrences of CCBot in the fetched body

Datos libres

Comprobar un dominio con todos los tokens

AEO Watch es un monitor independiente y factual. No esta afiliado a ningun proveedor de rastreadores, ninguno lo respalda y no habla en nombre de ninguno. Cada afirmacion es una observacion con la fecha en que se hizo y la prueba en bruto que la sostiene: una linea del archivo robots.txt, un codigo de estado HTTP, una cabecera. Aqui no hay puntuaciones, ni calificaciones, ni veredictos, y nada de esta pagina es un consejo. Un sitio puede excluirse en cualquier momento y la exclusion se respeta de forma automatica y permanente.

Cite this
CCBot: token de robots, verificacion y como permitirlo o bloquearlo - https://bikoosh.com/es/aeo/crawler/ccbot
<a href="https://bikoosh.com/es/aeo/crawler/ccbot">CCBot: token de robots, verificacion y como permitirlo o bloquearlo</a>
[CCBot: token de robots, verificacion y como permitirlo o bloquearlo](https://bikoosh.com/es/aeo/crawler/ccbot)
CCBot: token de robots, verificacion y como permitirlo o bloquearlo. Bikoosh. Retrieved 2026-09-07, from https://bikoosh.com/es/aeo/crawler/ccbot