Google-Extended: token de robots, verificacao, permitir ou bloquear
Esta pagina foi traduzida automaticamente. Os numeros e as provas vem sem alteracao das observacoes guardadas.
Google-Extended e um rastreador de IA operado por Google. Seu token de robots.txt e Google-Extended, e a documentacao do fornecedor que baixamos em 2026-09-06 e a fonte de cada afirmacao desta pagina.
| Token de robots | Google-Extended |
|---|---|
| Fornecedor | |
| Finalidade | training corpus, grounding |
| Verificacao documentada | faixas de IP publicadas |
| Documentacao do fornecedor verificada pela ultima vez | 2026-09-06 |
| Parcela dos dominios lidos que o bloqueiam para / | 17.2% of 128 |
| Last verified |
Identidade
| Token de robots | Google-Extended |
|---|---|
| Comparado como | google-extended |
| Fornecedor | |
| Finalidade | training corpus, grounding |
| Documentacao | https://developers.google.com/search/docs/crawling-indexing/google-common-crawlers |
| Verificacao documentada | faixas de IP publicadas: https://developers.google.com/static/search/apis/ipranges/special-crawlers.json |
probe_supported is false on the vendor's own evidence: 'Google-Extended doesn't have a separate HTTP request user agent string. Crawling is done with existing Google user agent strings; the robots.txt user-agent token is used in a control capacity.' It controls use of content for Gemini training and for grounding, and the vendor states it does not affect inclusion or ranking in Google Search. An edge probe carrying this token would therefore prove nothing and we do not run one.
Permitir ou bloquear
User-agent: Google-Extended Allow: /
User-agent: Google-Extended Disallow: /
Uma regra do robots.txt e um pedido que um rastreador bem comportado atende. Nao e um controle de acesso, e esta pagina nao diz a ninguem o que escolher.
Perguntas
O Google-Extended respeita o robots.txt?
A documentacao do fornecedor em https://developers.google.com/search/docs/crawling-indexing/google-common-crawlers afirma que o Google-Extended respeita o robots.txt. Baixamos essa pagina e ela respondeu ao nosso verificador em 2026-09-06. Isto registra o que o fornecedor documenta, nao o que uma requisicao especifica fez.
Como permito o Google-Extended no robots.txt?
Adicione este grupo ao robots.txt na raiz do host: User-agent: Google-Extended Allow: /. Pela RFC 9309 o token e comparado sem diferenciar maiusculas como subcadeia do user agent, e vence a regra correspondente mais longa.
Como bloqueio o Google-Extended no robots.txt?
Adicione este grupo ao robots.txt na raiz do host: User-agent: Google-Extended Disallow: /. Uma regra do robots.txt e um pedido que um rastreador bem comportado atende; nao e um controle de acesso.
Como verifico se uma requisicao veio mesmo do Google-Extended?
O fornecedor publica em https://developers.google.com/static/search/apis/ipranges/special-crawlers.json as faixas de enderecos IP de onde este rastreador busca. Compare o endereco da requisicao com esse arquivo. Uma cadeia de user agent sozinha nao prova nada, porque qualquer um pode envia la.
O que medimos
Dos 128 dominios cadastrados cujo robots.txt lemos, 22 bloqueiam o Google-Extended para / e 106 o permitem, ou seja 17.2% bloqueados, semana 2026-W37. Apenas contagens: nenhum dominio e nomeado.
O indice semanal de acesso dos rastreadores de IA
Fontes
| Fonte | Tipo | HTTP | Verificado | Observacao |
|---|---|---|---|---|
| https://developers.google.com/search/docs/crawling-indexing/google-common-crawlers | vendor | 200 | 2026-09-06 | 6 occurrences of Google-Extended in the fetched body |
| https://developers.google.com/static/search/apis/ipranges/special-crawlers.json | vendor | 200 | 2026-09-06 | published IP ranges; fetched 200 by scripts/aeowatch_crawlers_refresh.py on 2026-09-06 and also refreshed weekly into data/bot_ranges.json (270 prefixes on disk) |
Dados livres
Verificar um dominio com todos os tokens
O AEO Watch e um monitor independente e factual. Nao tem vinculo com nenhum fornecedor de rastreadores, nao e endossado por nenhum e nao fala por nenhum. Cada afirmacao e uma observacao com a data em que foi feita e a prova bruta por tras dela: uma linha do robots.txt, um codigo de estado HTTP, um cabecalho. Aqui nao ha notas, classificacoes ou vereditos, e nada nesta pagina e aconselhamento. Um site pode pedir exclusao a qualquer momento e a exclusao e respeitada de forma automatica e permanente.