Noindex no WordPress: como evitar bloquear o Google e os sistemas de IA

TL;DR O noindex é uma diretiva de indexação, não de acesso: só funciona se o crawler conseguir buscar a página. robots.txt Disallow + noindex anulam-se. O Google nunca vê a diretiva e o URL pode continuar a aparecer nos resultados. O erro nº1 no WordPress é o interruptor "desencorajar motores de busca" (Definições → Leitura) esquecido ativo depois de uma migração ou de um staging. Os bots de treino e de pesquisa (GPTBot, OAI-SearchBot, ClaudeBot, PerplexityBot) respeitam o robots.txt; os acessos iniciados pelo utilizador, não. Abaixo tem um fluxo de diagnóstico e correção em 6 passos, verificável no Search Console e na monitorização de fontes citadas por IA.

Noindex no WordPress: o que é e porque é que bloqueia Google e IA

O noindex é uma instrução que diz aos motores de busca: "não coloques esta página no índice". Pode ser entregue de duas formas, com o mesmo efeito:

  • uma meta tag no <head> da página: <meta name="robots" content="noindex">;
  • um cabeçalho HTTP: X-Robots-Tag: noindex.

A regra de ouro é simples: a página tem de ser rastreável para o noindex ser lido. Se o crawler não consegue aceder ao URL, nunca vê a diretiva. E se não a vê, a página pode continuar a aparecer no Google, muitas vezes sem descrição, porque outros sites apontam para ela.

Diretiva O que controla Onde se aplica
noindex Se a página entra no índice meta robots / X-Robots-Tag
nofollow Se o Google segue os links da página meta robots / X-Robots-Tag / rel
disallow Se o crawler pode aceder ao URL robots.txt

Guarde esta ideia: o robots.txt controla acesso, não indexação. São coisas diferentes e é aqui que nasce a maior parte da confusão. Além disso, o Google já não suporta noindex dentro do robots.txt. Se escrever Noindex: /pagina nesse ficheiro, não acontece nada.

Atenção: se a página está bloqueada no robots.txt, o noindex nunca é lido. Está a bloquear o acesso e a esperar um efeito de indexação que não vai chegar.

Onde o noindex se ativa no WordPress (e como se esconde)

No WordPress, o noindex pode entrar por vários caminhos ao mesmo tempo. Desligar um não desliga os outros.

Lista de verificação: os 6 locais a inspecionar

  1. Definições → Leitura → checkbox "Discourage search engines from indexing this site".
  2. Plugin de SEO → nível de página, tipo de conteúdo, taxonomia e arquivos.
  3. Tema → funções que injetam meta tags no wp_head.
  4. Multisite → a opção é por site, não por rede.
  5. robots.txt → regras Disallow que impedem o crawl.
  6. Servidor/CDN → cabeçalhos X-Robots-Tag, sobretudo em PDFs, imagens e vídeos.
Local Como verificar Sintoma típico
Definições → Leitura Ver se o checkbox está desmarcado Site inteiro fora do índice
Plugin de SEO Ver o estado da página/tipo de conteúdo Só algumas secções desaparecem
Tema Procurar noindex no código-fonte noindex sem explicação aparente
Multisite Verificar cada subsite Um subsite invisível, os outros não
robots.txt Abrir /robots.txt no browser URL aparece sem descrição
Servidor/CDN DevTools → Network ou curl -I PDFs e imagens fora dos resultados

Uma nota importante sobre o core: desde o WordPress 5.3, o interruptor de visibilidade deixou de escrever Disallow: / no robots.txt e passou a emitir noindex,nofollow. A razão é precisamente a que explicámos acima: o Disallow impedia o crawl e podia acabar por permitir a indexação do URL.

Diagnóstico em 6 passos: encontrar o bloqueio

Siga pela ordem. Em poucos minutos sabe se o problema é de rastreio ou de indexação.

  1. Definições → Leitura. O checkbox está desmarcado? Se estiver marcado, encontrou o culpado mais comum.
  2. Abra https://oseusite.com/robots.txt no browser e procure linhas Disallow.
  3. Veja o código-fonte da página (Ctrl+U) e procure robots e noindex.
  4. Verifique os cabeçalhos HTTP. DevTools → Network → Headers, ou curl -I https://oseusite.com/pagina. Procure X-Robots-Tag.
  5. Confirme no Google Search Console → Inspeção de URL. Veja "Crawl allowed?" e "Indexing allowed?".
  6. Reveja plugins de SEO, tema e configuração multisite.

A armadilha que estraga diagnósticos: se a página estiver bloqueada por robots.txt, o campo "Indexing allowed?" aparece como "Yes". Não é boa notícia. Significa apenas que o Google não conseguiu ver o noindex porque nunca chegou à página. Muita gente conclui que está tudo bem e continua bloqueada.

Checklist de diagnóstico

  • Checkbox "Discourage search engines" desmarcado
  • robots.txt sem Disallow para as páginas que quer indexar
  • Código-fonte sem noindex inesperado
  • Cabeçalhos HTTP sem X-Robots-Tag: noindex
  • Search Console com "Crawl allowed?" e "Indexing allowed?" coerentes
  • Plugins, tema e multisite revistos

Correção: como remover o noindex sem partir o site

A ordem importa. Se corrigir o robots.txt antes de remover o noindex, o Google passa a ver a diretiva e a página continua fora do índice.

  1. Desmarque "Discourage search engines" em Definições → Leitura e guarde.
  2. Remova o noindex de plugins, tema e páginas individuais.
  3. Corrija o robots.txt, retirando o Disallow que impedia o Google de ver o noindex.
  4. Verifique o X-Robots-Tag no servidor ou CDN.
  5. Inspeção de URL → Teste em direto → Pedir indexação.
  6. Confirme no Bing Webmaster Tools, se for relevante para o seu público.

Sobre prazos: não há datas garantidas. O recrawl pode levar de dias a semanas. O pedido de indexação costuma ser mais rápido, mas também não é garantido. Ajustes de robots.txt em sistemas de IA tendem a demorar cerca de um dia a propagar-se, segundo a documentação dos fornecedores.

Erros comuns e como corrigir

  • Staging copiado para produção com blog_public = 0: reative a visibilidade nas Definições → Leitura.
  • Disallow + noindex em simultâneo: retire o Disallow primeiro.
  • noindex de plugin esquecido: desmarcar o core não o remove.
  • Sitemap com URLs noindex: o sitemap não sobrepõe a diretiva. Limpe-o.
  • Confundir noindex com proteção de acesso: um staging com noindex continua acessível a quem saiba o URL.

Nota prática: as correções no WordPress e no WooCommerce fazem-se sem programador. Ajustes de servidor ou CDN podem exigir apoio técnico.

Google, IA e bots: o que o noindex bloqueia (e o que não bloqueia)

Aqui está o ponto que mais confusão gera: o noindex não "bloqueia a IA" de forma absoluta. Depende do bot e do tipo de acesso.

Bot O que bloqueia Consequência
Googlebot Elegibilidade no índice Sem indexação, sem AI Overviews nem AI Mode
Google-Extended Treino Gemini e grounding Não afeta o Search nem o ranking
GPTBot Treino da OpenAI Conteúdo fora do treino futuro
OAI-SearchBot Pesquisa no ChatGPT Site fora das respostas de pesquisa
ClaudeBot Treino da Anthropic Conteúdo fora do treino futuro
Claude-SearchBot Pesquisa Claude Menos visibilidade e precisão nos resultados
PerplexityBot Pesquisa Perplexity Site fora das respostas
ChatGPT-User / Perplexity-User Ações iniciadas pelo utilizador Não respeitam robots.txt de forma fiável

Três camadas para ter em conta:

  • Google Search. O noindex remove a página da elegibilidade, incluindo AI Overviews e AI Mode. O nosnippet e o max-snippet limitam o uso do conteúdo como input direto.
  • Treino e grounding. O Google-Extended controla o treino de modelos Gemini e o grounding, sem afetar o Search. É um token de robots.txt, não um user-agent próprio.
  • Acessos iniciados pelo utilizador. Quando alguém pede ao ChatGPT ou à Perplexity para abrir uma página, esse acesso não segue o robots.txt de forma fiável. Aqui, o controlo é ao nível do servidor.

Aviso importante: o noindex não é um controlo fiável para LLMs. Quando o crawler lê a meta tag, já ingeriu o conteúdo. Não existe um equivalente de noindex para modelos de linguagem. O llms.txt é uma proposta útil, mas não é uma norma adotada por todos os motores.

É exatamente aqui que a Semly entra. O agente Leon audita robots.txt, llms.txt, cabeçalhos e schema.org, e mostra onde o seu site está a perder acesso antes de perder visibilidade.

Verificar se a correção funcionou (e provar o impacto)

Corrigir não chega. Tem de confirmar.

  • Search Console → Inspeção de URL: confirme que "Crawl allowed?" e "Indexing allowed?" estão coerentes e que a página está indexada.
  • Relatório de páginas: acompanhe o estado "Excluída por tag 'noindex'" e veja se está a diminuir.
  • Monitorização de fontes citadas por IA da Semly: veja se a sua marca volta a ser citada nas respostas dos modelos.
  • Integração WordPress/WooCommerce via chave de API: audite produtos e dados automaticamente, sem trabalho manual.

Uma distinção que vale a pena guardar: indexado não é o mesmo que citado por IA. Estar no índice é o bilhete de entrada. Ser citado depende de conteúdo, autoridade e ligações. E sem uma SEO sólida (rastreio, indexação, conteúdo, ligações), é difícil ter boa visibilidade também na IA.

Quando usar noindex de propósito (sem prejudicar a IA)

Não remova noindex de tudo por reflexo. Há páginas que devem ficar fora do índice.

  • Páginas de agradecimento e de confirmação.
  • Filtros e resultados de pesquisa interna.
  • Conteúdo duplicado ou versões alternativas.
  • Arquivos de baixo valor (datas, autores, tags vazias).

A regra prática: indexe o que quer que seja citado; bloqueie o que não acrescenta. Uma página de agradecimento não precisa de aparecer no Google nem nas respostas de IA. Uma página de produto, um guia ou um artigo de fundo precisam.

Conclusão e próximos passos

O fluxo é este: diagnosticar → corrigir → verificar → monitorizar. Comece pelas Definições → Leitura, confirme o robots.txt, veja o código-fonte e os cabeçalhos, e feche o ciclo no Search Console.

Depois, olhe para além do Google. Uma auditoria técnica com o Leon mostra se o seu robots.txt, llms.txt, cabeçalhos e schema.org estão a deixar entrar os sistemas de IA certos. E a monitorização de visibilidade da Semly mostra se a marca volta a ser citada.

A correção é o primeiro passo, não o fim. Sem ela, nada do resto funciona.

Perguntas frequentes

O noindex impede o treino de IA? Não de forma fiável. O crawler lê a meta tag depois de já ter buscado a página. Para bloquear treino, use robots.txt com os tokens certos, como GPTBot ou Google-Extended.

Quanto tempo até voltar ao Google? Não há garantias. O recrawl pode levar de dias a semanas. O pedido de indexação costuma ser mais rápido, mas não é imediato.

Preciso de bloquear todos os bots de IA? Não. Bloquear bots de pesquisa, como o OAI-SearchBot, tira o seu site das respostas. Bloquear bots de treino é uma decisão diferente. Escolha por camadas, não em bloco.

O llms.txt resolve isto? Não. É uma proposta, não uma norma adotada por todos os motores. Ajuda a orientar, mas não substitui uma indexação correta.

Mini-dicionário

  • noindex: diretiva que impede a página de entrar no índice.
  • nofollow: diretiva que impede o seguimento de links da página.
  • disallow: regra de robots.txt que bloqueia o acesso do crawler ao URL.
  • X-Robots-Tag: cabeçalho HTTP equivalente à meta tag, usado em ficheiros não-HTML.
  • nosnippet: impede o uso do conteúdo em snippets e como input direto em AI Overviews.
  • llms.txt: ficheiro proposto para orientar modelos de IA; não é padrão oficial.

Sources

Verifique se vê sua marca

Digite o seu site para receber um relatório gratuito de Visibilidade em IA