Google-Extended: jeton robots, verification, autoriser ou bloquer
Cette page est traduite automatiquement. Les mesures et les preuves proviennent telles quelles des observations enregistrees.
Google-Extended est un robot d'IA exploite par Google. Son jeton robots.txt est Google-Extended, et la documentation de l'editeur que nous avons telechargee le 2026-09-06 est la source de chaque affirmation de cette page.
| Jeton robots | Google-Extended |
|---|---|
| Editeur | |
| Finalite | training corpus, grounding |
| Verification documentee | plages IP publiees |
| Documentation de l'editeur verifiee le | 2026-09-06 |
| Part des domaines lus qui le bloquent pour / | 17.2% of 128 |
| Last verified |
Identite
| Jeton robots | Google-Extended |
|---|---|
| Compare comme | google-extended |
| Editeur | |
| Finalite | training corpus, grounding |
| Documentation | https://developers.google.com/search/docs/crawling-indexing/google-common-crawlers |
| Verification documentee | plages IP publiees: https://developers.google.com/static/search/apis/ipranges/special-crawlers.json |
probe_supported is false on the vendor's own evidence: 'Google-Extended doesn't have a separate HTTP request user agent string. Crawling is done with existing Google user agent strings; the robots.txt user-agent token is used in a control capacity.' It controls use of content for Gemini training and for grounding, and the vendor states it does not affect inclusion or ranking in Google Search. An edge probe carrying this token would therefore prove nothing and we do not run one.
Autoriser ou bloquer
User-agent: Google-Extended Allow: /
User-agent: Google-Extended Disallow: /
Une regle du fichier robots.txt est une demande qu'un robot bien eleve respecte. Ce n'est pas un controle d'acces, et cette page ne dit a personne quoi choisir.
Questions
Est-ce que Google-Extended respecte le fichier robots.txt?
La documentation de l'editeur a l'adresse https://developers.google.com/search/docs/crawling-indexing/google-common-crawlers indique que Google-Extended respecte le fichier robots.txt. Nous avons telecharge cette page et elle a repondu a notre verificateur le 2026-09-06. Cela enregistre ce que l'editeur documente, pas ce qu'une requete particuliere a fait.
Comment autoriser Google-Extended dans le fichier robots.txt?
Ajoutez ce groupe au fichier robots.txt place a la racine de l'hote: User-agent: Google-Extended Allow: /. Selon la RFC 9309, le jeton est compare sans tenir compte de la casse comme sous chaine du user agent, et la regle correspondante la plus longue l'emporte.
Comment bloquer Google-Extended dans le fichier robots.txt?
Ajoutez ce groupe au fichier robots.txt place a la racine de l'hote: User-agent: Google-Extended Disallow: /. Une regle du fichier robots.txt est une demande qu'un robot bien eleve respecte; ce n'est pas un controle d'acces.
Comment verifier qu'une requete vient reellement de Google-Extended?
L'editeur publie a l'adresse https://developers.google.com/static/search/apis/ipranges/special-crawlers.json les plages d'adresses IP depuis lesquelles ce robot telecharge. Comparez l'adresse de la requete a ce fichier. Une chaine de user agent seule ne prouve rien, car n'importe qui peut l'envoyer.
Ce que nous mesurons
Sur les 128 domaines recenses dont nous avons lu le fichier robots.txt, 22 bloquent Google-Extended pour / et 106 l'autorisent, soit 17.2% de blocage, semaine 2026-W37. Uniquement des comptes: aucun domaine n'est nomme.
L'index hebdomadaire de l'acces des robots d'IA
Sources
| Source | Type | HTTP | Verifie | Remarque |
|---|---|---|---|---|
| https://developers.google.com/search/docs/crawling-indexing/google-common-crawlers | vendor | 200 | 2026-09-06 | 6 occurrences of Google-Extended in the fetched body |
| https://developers.google.com/static/search/apis/ipranges/special-crawlers.json | vendor | 200 | 2026-09-06 | published IP ranges; fetched 200 by scripts/aeowatch_crawlers_refresh.py on 2026-09-06 and also refreshed weekly into data/bot_ranges.json (270 prefixes on disk) |
Donnees libres
Verifier un domaine pour tous les jetons
AEO Watch est un observateur independant et factuel. Il n'est affilie a aucun editeur de robot, n'est soutenu par aucun et ne parle au nom d'aucun. Chaque affirmation est une observation portant la date a laquelle elle a ete faite et la preuve brute qui la fonde: une ligne du fichier robots.txt, un code d'etat HTTP, un en tete. Il n'y a ici ni note, ni classement, ni verdict, et rien sur cette page n'est un conseil. Un site peut se retirer a tout moment et ce retrait est respecte automatiquement et definitivement.