Você tem uma área de clientes, um membership ou um paywall no seu WordPress. E agora fica aquela dúvida: será que a IA consegue ver o que está lá dentro? Será que estou a esconder a minha oferta de quem procura por ela no Google e no ChatGPT?
A boa notícia é que conteúdo restrito não é sinónimo de invisibilidade. A má notícia é que muita gente bloqueia a IA sem saber, por causa de uma configuração errada ou de um plugin que faz mais do que devia.
Neste guia vamos ver, passo a passo, o que abrir, o que fechar e como marcar tudo corretamente. A ideia é simples: manter os seus leads protegidos e, ao mesmo tempo, deixar a IA encontrar e citar a sua marca.
TL;DR Conteúdo restrito (login ou paywall) não é automaticamente invisível para a IA. O problema costuma ser marcação errada e bots bloqueados. Regra de ouro: bloqueado a utilizadores não é o mesmo que bloqueado a crawlers. Paywall server-side (teaser) bloqueia GPTBot e PerplexityBot; paywall client-side (JavaScript) deixa vazar o HTML completo. No WordPress, vale verificar plugins de segurança e caching, roles e password protection antes de publicar. Modelo híbrido: abrir findings, estatísticas e FAQ (citáveis) e fechar dataset, templates e ferramentas avançadas como lead magnet, com
isAccessibleForFree: falseehasPart. Medir faz parte: logs de servidor por user-agent, referrers de chatgpt.com e perplexity.ai, e auditoria trimestral. A Semly entra aqui como plataforma para medir se a sua marca é recomendada por ChatGPT, Gemini, Claude, Grok e Google AI.
Conteúdo restrito no WordPress e visibilidade na IA: o problema real
Vamos começar pelo mito mais comum: "se está atrás do login, a IA não vê". Isso não é bem verdade.
O que conta como conteúdo restrito? Tudo o que exige login, subscrição, membership ou password para ser lido: área de clientes, cursos, relatórios, datasets, templates. Para o utilizador, está fechado. Para um crawler, depende de como o servidor responde.
E aqui está a frase que vale a pena guardar: bloqueado a utilizadores não é o mesmo que bloqueado a crawlers. São duas coisas diferentes, controladas em sítios diferentes.
Pense em dois tipos de paywall:
- Paywall server-side (teaser): o servidor só envia um resumo. O resto do conteúdo nunca sai do servidor. Resultado: o GPTBot e o PerplexityBot também só recebem o teaser.
- Paywall client-side (JavaScript): o servidor envia o HTML completo e o JavaScript esconde o conteúdo no browser. Resultado: crawlers que não executam JavaScript recebem tudo, mesmo sem login.
Isto explica porque é que o seu paywall pode estar a esconder tudo, ou a mostrar demasiado. E porque é que o WordPress merece atenção especial: segundo a W3Techs (24/09/2026), o WordPress está em 40,2% de todos os sites. É muita gente a lidar com o mesmo problema. Além disso, cerca de 21% do top-1000 de sites bloqueia o GPTBot (Paul Calvano, julho de 2025), muitas vezes sem intenção.
Na prática Server-side: o servidor devolve apenas o teaser a todos, incluindo bots. Nada vaza, mas também nada é citável. Client-side: o servidor devolve o HTML completo e o JavaScript esconde. Os bots podem ler o que o utilizador não vê.
O que a IA realmente vê: crawlers, robots.txt e indexação
Para decidir bem, precisa de saber quem anda a rastrear o seu site. Não é um bicho papão único, são vários bots com funções diferentes.
| Crawler | O que faz | O que acontece se bloquear |
|---|---|---|
| GPTBot | Recolhe conteúdo para treino de modelos | O conteúdo não entra no treino; não afeta diretamente a pesquisa ChatGPT |
| OAI-SearchBot | Indexa para aparecer na pesquisa do ChatGPT | O site fica excluído das respostas de pesquisa do ChatGPT |
| ChatGPT-User | Ações pedidas pelo utilizador em tempo real | Pode não respeitar o robots.txt |
| PerplexityBot | Indexa para as respostas do Perplexity | O site deixa de ser considerado nas respostas |
| Googlebot | Indexa para a pesquisa Google | Perde indexação e visibilidade no Google |
Duas ideias que costumam confundir:
- O robots.txt controla o crawl, não a indexação. É um pedido, não uma barreira. Bots sérios respeitam, mas não é um bloqueio real.
- O noindex impede o Google de indexar, mas não impede o treino de modelos. São coisas separadas.
Segundo a OpenAI (2026), o OAI-SearchBot e o GPTBot são independentes: pode permitir um e bloquear o outro. E se mudar o robots.txt, as alterações costumam demorar cerca de 24 horas a fazer efeito. Já o llms.txt tem adoção baixa (10,13%, segundo a Limy, maio de 2026) e não é um fator confirmado de citação. Vale a pena ter, mas não é a chave de tudo.
Passo 1 — Auditar o que está bloqueado no seu WordPress
Antes de abrir ou fechar nada, descubra o que está a acontecer hoje. Esta checklist leva poucos minutos e evita surpresas.
- Veja o seu robots.txt. Abra
oseusite.com/robots.txtno browser e procure regras que bloqueiem GPTBot, OAI-SearchBot, PerplexityBot ou Googlebot. - Verifique plugins de segurança. Wordfence, Sucuri e afins podem bloquear bots de IA por padrão, sem aviso claro.
- Verifique plugins de caching. Alguns servem versões diferentes a bots ou bloqueiam user-agents desconhecidos.
- Confirme roles e capabilities. Veja quem tem acesso a quê em Definições e nas opções de membership.
- Teste a password protection. Se usa proteção por password, confirme se o servidor devolve teaser ou HTML completo.
- Veja o código-fonte. Abra uma página restrita e procure o conteúdo no HTML. Se aparecer, está a vazar.
Passo 2 — Decidir o que abrir e o que fechar (modelo híbrido)
Aqui está o coração da estratégia. Não precisa de escolher entre "tudo aberto" e "tudo fechado". O modelo híbrido dá conta do recado.
Abra (conteúdo citável):
- Findings e conclusões principais
- Estatísticas e dados que ajudam decisões
- FAQ e perguntas frequentes
- Guias introdutórios e explicações de conceitos
Feche (lead magnet):
- Datasets completos
- Templates e ficheiros editáveis
- Ferramentas avançadas e calculadoras
- Relatórios detalhados e personalizados
Porque é que isto importa? Porque paywall total tende a significar zero citações de IA, enquanto conteúdo aberto é o que alimenta as respostas. Um estudo da 5W PR (julho de 2026) mostrou exatamente essa diferença entre grandes jornais pagos e conteúdo de acesso livre. Já o New York Times, com Flexible Sampling (abrir uma parte e fechar o resto), conseguiu que a maioria das suas citações em AI Overviews viesse de conteúdo pago (GEO AIO, fevereiro de 2026).
Drzewko de decisão "abrir ou fechar?":
- Este conteúdo ajuda alguém a tomar uma decisão? Se sim, abra.
- Este conteúdo é o produto em si (dataset, template, ferramenta)? Se sim, feche.
- Este conteúdo pode ser resumido numa versão citável? Se sim, abra o resumo e feche o detalhe.
Passo 3 — Marcar corretamente o conteúdo restrito (schema e sinais)
Agora a parte técnica. Marcar bem é o que separa conteúdo restrito legítimo de cloaking.
Segundo o Google Search Central (atualizado a 08/09/2026), conteúdo pago ou com registo deve usar isAccessibleForFree: false e indicar as partes fechadas com hasPart e cssSelector. Assim o Google entende que há conteúdo pago e não trata o site como cloaking. Garanta também que o Googlebot e o Googlebot-News conseguem rastrear a página.
Na prática
"isAccessibleForFree": false"hasPart": { "@type": "WebPageElement", "isAccessibleForFree": false, "cssSelector": ".paywall" }
Prefira JSON-LD a microdados. É mais fácil de ler por modelos de linguagem e menos propenso a erros. E não se esqueça do FAQ schema: segundo a Relixir (2025), pode aumentar as citações entre 2,7x e 3,2x. Ainda assim, menos de 13% dos sites usam schema (Animalz, 2026), o que é uma oportunidade clara.
Aviso: nunca mostre conteúdo diferente a bots e a utilizadores com a intenção de enganar. Isso é cloaking e pode custar-lhe a indexação.
Passo 4 — Medir se a IA está a citar a sua marca
Publicar bem é metade do trabalho. A outra metade é saber se está a resultar.
| Métrica | O que mostra | Onde ver |
|---|---|---|
| Logs de servidor por user-agent | Se GPTBot, OAI-SearchBot e PerplexityBot visitam o site | Logs do servidor ou plugin de logs |
| Referrers de IA | Se há tráfego vindo de chatgpt.com e perplexity.ai | Google Analytics ou similar |
| Citações da marca | Se a IA menciona a sua marca nas respostas | Semly |
| Sentimento e SOV | Como a marca é descrita e quanto espaço ocupa | Semly |
A Semly foi feita precisamente para isto: mede se a sua marca é recomendada por ChatGPT, Gemini, Claude, Grok e Google AI, monitoriza prompts, fontes citadas, sentimento, share of voice e concorrentes. Integra-se com WordPress e WooCommerce, o que facilita ligar o conteúdo do site à medição. O Leon AI Agent, por exemplo, verifica o robots.txt e o llms.txt por si.
Os resultados aparecem em casos concretos: a Ofertoland passou de 5% para 54% de visibilidade, e a Obeg registou +280% de registos. Uma auditoria trimestral é um bom ritmo para manter tudo em ordem.
Erros comuns e como corrigir
- Paywall client-side que vaza HTML. Corrija movendo a proteção para o servidor, para que o conteúdo fechado nunca saia.
- Bloquear GPTBot sem querer via plugin. Corrija revendo as regras de segurança e liberando os bots que quer permitir.
- noindex mal aplicado. Corrija confirmando que só as páginas certas estão com noindex, e lembre-se de que não impede treino.
- Falta de schema. Corrija adicionando JSON-LD com
isAccessibleForFreeehasPart. - Consent walls que bloqueiam o HTML. Corrija garantindo que o conteúdo continua acessível a crawlers, mesmo com o aviso de cookies.
- Assumir que conteúdo restrito dispensa base legal. Corrija revendo o RGPD: restringir a utilizadores não isenta o tratamento de dados de crawlers.
O que fazer a seguir
- Faça a auditoria trimestral. robots.txt, plugins, roles e schema, sempre na mesma ordem.
- Teste o modelo híbrido. Abra um finding ou FAQ e feche o detalhe. Meça o impacto.
- Acompanhe as citações com a Semly. Monitorização contínua de prompts, fontes e sentimento.
- Mantenha paywall total quando fizer sentido. Produto premium ou dados sensíveis podem ficar fechados, desde que compense com conteúdo aberto noutro formato.
Quando escolher cada opção:
- Conteúdo que ajuda a decidir: abra.
- Conteúdo que é o produto: feche.
- Conteúdo que pode ter versão resumida: abra o resumo, feche o detalhe.
Checklist final:
- robots.txt revisto
- Plugins de segurança e caching verificados
- Roles e password protection confirmados
- Schema com
isAccessibleForFreeehasPartaplicado - FAQ schema adicionado
- Logs e referrers de IA monitorizados
- Auditoria trimestral agendada
FAQ
O noindex bloqueia a IA? Não. O noindex impede o Google de indexar a página, mas não impede que modelos usem o conteúdo para treino. São mecanismos diferentes.
O robots.txt é suficiente? Não. O robots.txt é um pedido, não um bloqueio real. Bots sérios respeitam, mas não é uma barreira técnica.
Preciso de abrir tudo para aparecer na IA? Não. O modelo híbrido permite abrir o que é citável e fechar o que é lead magnet, com a marcação correta.
Com que frequência devo auditar? Uma auditoria trimestral costuma ser suficiente para manter robots.txt, plugins e schema em ordem.