TL;DR O
noindexé uma diretiva de indexação, não de acesso: só funciona se o crawler conseguir buscar a página.robots.txt Disallow+noindexanulam-se. O Google nunca vê a diretiva e o URL pode continuar a aparecer nos resultados. O erro nº1 no WordPress é o interruptor "desencorajar motores de busca" (Definições → Leitura) esquecido ativo depois de uma migração ou de um staging. Os bots de treino e de pesquisa (GPTBot, OAI-SearchBot, ClaudeBot, PerplexityBot) respeitam orobots.txt; os acessos iniciados pelo utilizador, não. Abaixo tem um fluxo de diagnóstico e correção em 6 passos, verificável no Search Console e na monitorização de fontes citadas por IA.
Noindex no WordPress: o que é e porque é que bloqueia Google e IA
O noindex é uma instrução que diz aos motores de busca: "não coloques esta página no índice". Pode ser entregue de duas formas, com o mesmo efeito:
- uma meta tag no
<head>da página:<meta name="robots" content="noindex">; - um cabeçalho HTTP:
X-Robots-Tag: noindex.
A regra de ouro é simples: a página tem de ser rastreável para o noindex ser lido. Se o crawler não consegue aceder ao URL, nunca vê a diretiva. E se não a vê, a página pode continuar a aparecer no Google, muitas vezes sem descrição, porque outros sites apontam para ela.
| Diretiva | O que controla | Onde se aplica |
|---|---|---|
noindex |
Se a página entra no índice | meta robots / X-Robots-Tag |
nofollow |
Se o Google segue os links da página | meta robots / X-Robots-Tag / rel |
disallow |
Se o crawler pode aceder ao URL | robots.txt |
Guarde esta ideia: o robots.txt controla acesso, não indexação. São coisas diferentes e é aqui que nasce a maior parte da confusão. Além disso, o Google já não suporta noindex dentro do robots.txt. Se escrever Noindex: /pagina nesse ficheiro, não acontece nada.
Atenção: se a página está bloqueada no robots.txt, o noindex nunca é lido. Está a bloquear o acesso e a esperar um efeito de indexação que não vai chegar.
Onde o noindex se ativa no WordPress (e como se esconde)
No WordPress, o noindex pode entrar por vários caminhos ao mesmo tempo. Desligar um não desliga os outros.
Lista de verificação: os 6 locais a inspecionar
- Definições → Leitura → checkbox "Discourage search engines from indexing this site".
- Plugin de SEO → nível de página, tipo de conteúdo, taxonomia e arquivos.
- Tema → funções que injetam meta tags no
wp_head. - Multisite → a opção é por site, não por rede.
robots.txt→ regrasDisallowque impedem o crawl.- Servidor/CDN → cabeçalhos
X-Robots-Tag, sobretudo em PDFs, imagens e vídeos.
| Local | Como verificar | Sintoma típico |
|---|---|---|
| Definições → Leitura | Ver se o checkbox está desmarcado | Site inteiro fora do índice |
| Plugin de SEO | Ver o estado da página/tipo de conteúdo | Só algumas secções desaparecem |
| Tema | Procurar noindex no código-fonte |
noindex sem explicação aparente |
| Multisite | Verificar cada subsite | Um subsite invisível, os outros não |
robots.txt |
Abrir /robots.txt no browser |
URL aparece sem descrição |
| Servidor/CDN | DevTools → Network ou curl -I |
PDFs e imagens fora dos resultados |
Uma nota importante sobre o core: desde o WordPress 5.3, o interruptor de visibilidade deixou de escrever Disallow: / no robots.txt e passou a emitir noindex,nofollow. A razão é precisamente a que explicámos acima: o Disallow impedia o crawl e podia acabar por permitir a indexação do URL.
Diagnóstico em 6 passos: encontrar o bloqueio
Siga pela ordem. Em poucos minutos sabe se o problema é de rastreio ou de indexação.
- Definições → Leitura. O checkbox está desmarcado? Se estiver marcado, encontrou o culpado mais comum.
- Abra
https://oseusite.com/robots.txtno browser e procure linhasDisallow. - Veja o código-fonte da página (Ctrl+U) e procure
robotsenoindex. - Verifique os cabeçalhos HTTP. DevTools → Network → Headers, ou
curl -I https://oseusite.com/pagina. ProcureX-Robots-Tag. - Confirme no Google Search Console → Inspeção de URL. Veja "Crawl allowed?" e "Indexing allowed?".
- Reveja plugins de SEO, tema e configuração multisite.
A armadilha que estraga diagnósticos: se a página estiver bloqueada por robots.txt, o campo "Indexing allowed?" aparece como "Yes". Não é boa notícia. Significa apenas que o Google não conseguiu ver o noindex porque nunca chegou à página. Muita gente conclui que está tudo bem e continua bloqueada.
Checklist de diagnóstico
- Checkbox "Discourage search engines" desmarcado
-
robots.txtsemDisallowpara as páginas que quer indexar - Código-fonte sem
noindexinesperado - Cabeçalhos HTTP sem
X-Robots-Tag: noindex - Search Console com "Crawl allowed?" e "Indexing allowed?" coerentes
- Plugins, tema e multisite revistos
Correção: como remover o noindex sem partir o site
A ordem importa. Se corrigir o robots.txt antes de remover o noindex, o Google passa a ver a diretiva e a página continua fora do índice.
- Desmarque "Discourage search engines" em Definições → Leitura e guarde.
- Remova o
noindexde plugins, tema e páginas individuais. - Corrija o
robots.txt, retirando oDisallowque impedia o Google de ver onoindex. - Verifique o
X-Robots-Tagno servidor ou CDN. - Inspeção de URL → Teste em direto → Pedir indexação.
- Confirme no Bing Webmaster Tools, se for relevante para o seu público.
Sobre prazos: não há datas garantidas. O recrawl pode levar de dias a semanas. O pedido de indexação costuma ser mais rápido, mas também não é garantido. Ajustes de robots.txt em sistemas de IA tendem a demorar cerca de um dia a propagar-se, segundo a documentação dos fornecedores.
Erros comuns e como corrigir
- Staging copiado para produção com
blog_public = 0: reative a visibilidade nas Definições → Leitura. Disallow+noindexem simultâneo: retire oDisallowprimeiro.noindexde plugin esquecido: desmarcar o core não o remove.- Sitemap com URLs
noindex: o sitemap não sobrepõe a diretiva. Limpe-o. - Confundir
noindexcom proteção de acesso: um staging comnoindexcontinua acessível a quem saiba o URL.
Nota prática: as correções no WordPress e no WooCommerce fazem-se sem programador. Ajustes de servidor ou CDN podem exigir apoio técnico.
Google, IA e bots: o que o noindex bloqueia (e o que não bloqueia)
Aqui está o ponto que mais confusão gera: o noindex não "bloqueia a IA" de forma absoluta. Depende do bot e do tipo de acesso.
| Bot | O que bloqueia | Consequência |
|---|---|---|
| Googlebot | Elegibilidade no índice | Sem indexação, sem AI Overviews nem AI Mode |
| Google-Extended | Treino Gemini e grounding | Não afeta o Search nem o ranking |
| GPTBot | Treino da OpenAI | Conteúdo fora do treino futuro |
| OAI-SearchBot | Pesquisa no ChatGPT | Site fora das respostas de pesquisa |
| ClaudeBot | Treino da Anthropic | Conteúdo fora do treino futuro |
| Claude-SearchBot | Pesquisa Claude | Menos visibilidade e precisão nos resultados |
| PerplexityBot | Pesquisa Perplexity | Site fora das respostas |
| ChatGPT-User / Perplexity-User | Ações iniciadas pelo utilizador | Não respeitam robots.txt de forma fiável |
Três camadas para ter em conta:
- Google Search. O
noindexremove a página da elegibilidade, incluindo AI Overviews e AI Mode. Onosnippete omax-snippetlimitam o uso do conteúdo como input direto. - Treino e grounding. O
Google-Extendedcontrola o treino de modelos Gemini e o grounding, sem afetar o Search. É um token derobots.txt, não um user-agent próprio. - Acessos iniciados pelo utilizador. Quando alguém pede ao ChatGPT ou à Perplexity para abrir uma página, esse acesso não segue o
robots.txtde forma fiável. Aqui, o controlo é ao nível do servidor.
Aviso importante: o noindex não é um controlo fiável para LLMs. Quando o crawler lê a meta tag, já ingeriu o conteúdo. Não existe um equivalente de noindex para modelos de linguagem. O llms.txt é uma proposta útil, mas não é uma norma adotada por todos os motores.
É exatamente aqui que a Semly entra. O agente Leon audita robots.txt, llms.txt, cabeçalhos e schema.org, e mostra onde o seu site está a perder acesso antes de perder visibilidade.
Verificar se a correção funcionou (e provar o impacto)
Corrigir não chega. Tem de confirmar.
- Search Console → Inspeção de URL: confirme que "Crawl allowed?" e "Indexing allowed?" estão coerentes e que a página está indexada.
- Relatório de páginas: acompanhe o estado "Excluída por tag 'noindex'" e veja se está a diminuir.
- Monitorização de fontes citadas por IA da Semly: veja se a sua marca volta a ser citada nas respostas dos modelos.
- Integração WordPress/WooCommerce via chave de API: audite produtos e dados automaticamente, sem trabalho manual.
Uma distinção que vale a pena guardar: indexado não é o mesmo que citado por IA. Estar no índice é o bilhete de entrada. Ser citado depende de conteúdo, autoridade e ligações. E sem uma SEO sólida (rastreio, indexação, conteúdo, ligações), é difícil ter boa visibilidade também na IA.
Quando usar noindex de propósito (sem prejudicar a IA)
Não remova noindex de tudo por reflexo. Há páginas que devem ficar fora do índice.
- Páginas de agradecimento e de confirmação.
- Filtros e resultados de pesquisa interna.
- Conteúdo duplicado ou versões alternativas.
- Arquivos de baixo valor (datas, autores, tags vazias).
A regra prática: indexe o que quer que seja citado; bloqueie o que não acrescenta. Uma página de agradecimento não precisa de aparecer no Google nem nas respostas de IA. Uma página de produto, um guia ou um artigo de fundo precisam.
Conclusão e próximos passos
O fluxo é este: diagnosticar → corrigir → verificar → monitorizar. Comece pelas Definições → Leitura, confirme o robots.txt, veja o código-fonte e os cabeçalhos, e feche o ciclo no Search Console.
Depois, olhe para além do Google. Uma auditoria técnica com o Leon mostra se o seu robots.txt, llms.txt, cabeçalhos e schema.org estão a deixar entrar os sistemas de IA certos. E a monitorização de visibilidade da Semly mostra se a marca volta a ser citada.
A correção é o primeiro passo, não o fim. Sem ela, nada do resto funciona.
Perguntas frequentes
O noindex impede o treino de IA?
Não de forma fiável. O crawler lê a meta tag depois de já ter buscado a página. Para bloquear treino, use robots.txt com os tokens certos, como GPTBot ou Google-Extended.
Quanto tempo até voltar ao Google? Não há garantias. O recrawl pode levar de dias a semanas. O pedido de indexação costuma ser mais rápido, mas não é imediato.
Preciso de bloquear todos os bots de IA?
Não. Bloquear bots de pesquisa, como o OAI-SearchBot, tira o seu site das respostas. Bloquear bots de treino é uma decisão diferente. Escolha por camadas, não em bloco.
O llms.txt resolve isto?
Não. É uma proposta, não uma norma adotada por todos os motores. Ajuda a orientar, mas não substitui uma indexação correta.
Mini-dicionário
noindex: diretiva que impede a página de entrar no índice.nofollow: diretiva que impede o seguimento de links da página.disallow: regra derobots.txtque bloqueia o acesso do crawler ao URL.X-Robots-Tag: cabeçalho HTTP equivalente à meta tag, usado em ficheiros não-HTML.nosnippet: impede o uso do conteúdo em snippets e como input direto em AI Overviews.llms.txt: ficheiro proposto para orientar modelos de IA; não é padrão oficial.