CCBot: jeton robots, verification, autoriser ou bloquer
Cette page est traduite automatiquement. Les mesures et les preuves proviennent telles quelles des observations enregistrees.
CCBot est un robot d'IA exploite par Common Crawl Foundation. Son jeton robots.txt est CCBot, et la documentation de l'editeur que nous avons telechargee le 2026-09-06 est la source de chaque affirmation de cette page.
| Jeton robots | CCBot |
|---|---|
| Editeur | Common Crawl Foundation |
| Finalite | training corpus, public web corpus |
| Verification documentee | aucune publiee |
| Documentation de l'editeur verifiee le | 2026-09-06 |
| Part des domaines lus qui le bloquent pour / | 18.8% of 128 |
| Last verified |
Identite
| Jeton robots | CCBot |
|---|---|
| Compare comme | ccbot |
| Editeur | Common Crawl Foundation |
| Finalite | training corpus, public web corpus |
| Documentation | https://commoncrawl.org/ccbot |
| Verification documentee | aucune publiee |
Not an answer engine itself: it builds the public corpus that many models train on, which is why site owners treat it as an AI crawler. The exact snippet 'User-agent: CCBot Disallow: /' appears on the vendor page fetched on 2026-09-06.
Autoriser ou bloquer
User-agent: CCBot Allow: /
User-agent: CCBot Disallow: /
Une regle du fichier robots.txt est une demande qu'un robot bien eleve respecte. Ce n'est pas un controle d'acces, et cette page ne dit a personne quoi choisir.
Questions
Est-ce que CCBot respecte le fichier robots.txt?
La documentation de l'editeur a l'adresse https://commoncrawl.org/ccbot indique que CCBot respecte le fichier robots.txt. Nous avons telecharge cette page et elle a repondu a notre verificateur le 2026-09-06. Cela enregistre ce que l'editeur documente, pas ce qu'une requete particuliere a fait.
Comment autoriser CCBot dans le fichier robots.txt?
Ajoutez ce groupe au fichier robots.txt place a la racine de l'hote: User-agent: CCBot Allow: /. Selon la RFC 9309, le jeton est compare sans tenir compte de la casse comme sous chaine du user agent, et la regle correspondante la plus longue l'emporte.
Comment bloquer CCBot dans le fichier robots.txt?
Ajoutez ce groupe au fichier robots.txt place a la racine de l'hote: User-agent: CCBot Disallow: /. Une regle du fichier robots.txt est une demande qu'un robot bien eleve respecte; ce n'est pas un controle d'acces.
Comment verifier qu'une requete vient reellement de CCBot?
Nous n'avons trouve aucune methode de verification documentee pour CCBot: l'editeur ne publie ni fichier de plages IP ni convention de DNS inverse que nous puissions telecharger. Sans cela, une chaine de user agent ne prouve pas l'origine.
Ce que nous mesurons
Sur les 128 domaines recenses dont nous avons lu le fichier robots.txt, 24 bloquent CCBot pour / et 104 l'autorisent, soit 18.8% de blocage, semaine 2026-W37. Uniquement des comptes: aucun domaine n'est nomme.
L'index hebdomadaire de l'acces des robots d'IA
Sources
| Source | Type | HTTP | Verifie | Remarque |
|---|---|---|---|---|
| https://commoncrawl.org/ccbot | vendor | 200 | 2026-09-06 | 11 occurrences of CCBot in the fetched body |
Donnees libres
Verifier un domaine pour tous les jetons
AEO Watch est un observateur independant et factuel. Il n'est affilie a aucun editeur de robot, n'est soutenu par aucun et ne parle au nom d'aucun. Chaque affirmation est une observation portant la date a laquelle elle a ete faite et la preuve brute qui la fonde: une ligne du fichier robots.txt, un code d'etat HTTP, un en tete. Il n'y a ici ni note, ni classement, ni verdict, et rien sur cette page n'est un conseil. Un site peut se retirer a tout moment et ce retrait est respecte automatiquement et definitivement.