GuidesSchema e rich snippets
Robots.txt e o seu comprador de IA: está a bloquear os rastreadores que o citam?
Algumas lojas bloqueiam sem querer os rastreadores que alimentam os motores de resposta. Como auditar o robots.txt para rastreadores de IA sem expor tudo.
A resposta curta: Abra asualoja.pt/robots.txt e verifique as regras Disallow que apontam para user-agents de rastreadores de IA como GPTBot, ClaudeBot, PerplexityBot e Google-Extended. Os motores de resposta chegam às avaliações da sua loja através desses rastreadores, pelo que um bloqueio geral pode remover a sua loja das citações de IA sem que ninguém dê conta. A auditoria das regras de user-agent demora poucos minutos e é uma das verificações com maior impacto que pode fazer na visibilidade junto de motores de resposta.
Por que motivo o robots.txt pode bloquear rastreadores de IA
Raramente de forma intencional. A maioria dos bloqueios chega por herança: um plugin de segurança, uma configuração predefinida de CDN, um preset do alojamento ou um modelo copiado que adicionou regras Disallow para bots de IA durante a vaga de 2023 de "mantenha o meu conteúdo fora do treino". A regra fica no ficheiro durante anos sem que ninguém a reveja.
A intenção nessa altura era impedir que o seu conteúdo fosse utilizado no treino de modelos. O efeito secundário hoje é que essa mesma regra pode manter as suas avaliações fora das citações em tempo real que os motores de resposta mostram a um comprador no momento da decisão. Acesso para treino e acesso para resposta não são a mesma coisa, mas uma única linha Disallow muitas vezes bloqueia os dois.
Cada motor de pesquisa de IA envia rastreadores diferentes, e bloquear um não bloqueia os outros. Abra o seu robots.txt e examine as linhas User-agent à procura dos rastreadores identificados, depois leia as regras Disallow associadas a cada bloco. Uma regra sob um user-agent aplica-se apenas a esse agente, pelo que um ficheiro pode receber bem o Googlebot da pesquisa orgânica e ao mesmo tempo bloquear silenciosamente o rastreador que alimenta um AI Overview.
- GPTBot e OAI-SearchBot, os rastreadores da OpenAI por trás da pesquisa do ChatGPT.
- ClaudeBot e Claude-User, utilizados pela Anthropic.
- PerplexityBot, que obtém as páginas que o Perplexity cita.
- Google-Extended, que governa o Gemini e os AI Overviews separadamente do Googlebot comum.
Como auditar o robots.txt sem expor tudo
Na maioria das vezes, bloquear um rastreador significa perder a citação. Os motores de resposta dependem dos rastreadores que controlam para ler a página em tempo real, e o robots.txt é o portão que o rastreador obedece. Se o portão estiver fechado, o motor não tem uma cópia legível das suas avaliações para citar, e deixa de aparecer nas respostas para qualquer comprador que nunca escreveu o nome da sua marca.
O aviso honesto: robots.txt é um pedido, não uma barreira. Os rastreadores que cumprem as regras respeitam-no, e os principais bots de IA geralmente fazem-no, pelo que um Disallow tem um custo real com eles. Não vai impedir um agente que ignora o ficheiro, e não é um mecanismo de controlo de segurança.
Não está a escolher entre bloqueio total e exposição total. A auditoria consiste em remover os bloqueios acidentais nos poucos rastreadores que alimentam respostas orientadas ao comprador, mantendo os bloqueios que definiu deliberadamente. Percorra o processo por ordem e altere uma coisa de cada vez para perceber o efeito de cada edição.
- Leia asualoja.pt/robots.txt e liste cada bloco User-agent e as respetivas regras Disallow.
- Sinalize qualquer Disallow que aponte para GPTBot, ClaudeBot, PerplexityBot, OAI-SearchBot ou Google-Extended.
- Decida rastreador a rastreador: um bloqueio deliberado mantém-se; um herdado que nunca escolheu sai.
- Confirme que as suas páginas de avaliações e URLs de produtos não são abrangidos por um caminho Disallow demasiado amplo.
Depois do desbloqueio: legibilidade e outras ferramentas de controlo
Deixar o rastreador entrar só tem utilidade se houver algo legível para ele levar ao sair. Uma loja pode receber todos os bots de IA e ainda assim não ser citada porque as suas avaliações são apresentadas dentro de um widget JavaScript que o rastreador vê como um contentor vazio. A maioria das aplicações de avaliação foi construída para o comprador na página e para no widget, o que torna as avaliações ilegíveis para os próprios rastreadores que acabou de desbloquear. Tornar as suas avaliações existentes legíveis, corroboradas e citadas na pesquisa e em IA é a lacuna que o BeyondReviews existe para fechar. O robots.txt abre a porta; o HTML de avaliações legível é o que o motor de resposta de facto leva consigo.
Vale distinguir três mecanismos de controlo com efeitos diferentes. O robots.txt determina se um rastreador pode obter uma página. A tag noindex permite que o rastreador a obtenha, mas pede ao motor que não a indexe, pelo que é um sinal mais suave e só é lido depois de a obtenção ser permitida. O ficheiro llms.txt é uma proposta separada que orienta os modelos para conteúdo preferido e não tem poder de bloquear ninguém. Para citação por IA, o robots.txt é o elemento determinante: se não permitir o rastreador, nada mais importa.
O robots.txt é uma verificação de cinco minutos com consequências desproporcionais. Um único Disallow herdado pode remover a sua loja das respostas de IA sem que ninguém dê conta, e a correção é normalmente eliminar uma linha que nunca quis adicionar. Audite os user-agents de rastreadores de IA, mantenha os bloqueios que escolheu, remova os que herdou e depois confirme que as avaliações por trás da porta são realmente legíveis quando o rastreador passa por ela.
Perguntas frequentes
Onde encontro o meu ficheiro robots.txt?
Fica na raiz do seu domínio: escreva asualoja.pt/robots.txt no navegador. Se a página aparecer em branco ou devolver um erro 404, não tem regras configuradas, o que significa que não está a bloquear rastreadores de IA, embora esteja a depender inteiramente dos predefinidos da plataforma.
Desbloquear rastreadores de IA vai permitir que o meu conteúdo seja utilizado para treinar modelos?
Possivelmente, e essa é uma escolha real a ponderar. Alguns rastreadores obtêm páginas para respostas em tempo real, outros para treino, e alguns user-agents fazem os dois. Se a utilização para treino for uma preocupação, permita os bots orientados para respostas (como OAI-SearchBot e PerplexityBot) enquanto mantém as regras orientadas para treino, em vez de bloquear tudo e perder também as citações.
O robots.txt realmente impede um rastreador ou é apenas uma sugestão?
É um pedido que os rastreadores que cumprem as regras respeitam, e os principais bots de IA geralmente fazem-no. Isso torna-o fiável para definir quem o cita, mas não é uma barreira de segurança. Um agente que ignora o ficheiro ainda pode ler a página, pelo que nunca trate o robots.txt como controlo de acesso para algo sensível.
Se permitir os rastreadores, as avaliações serão citadas automaticamente?
Não. Permitir o rastreador apenas remove o bloqueio; o motor ainda precisa de texto de avaliação legível para citar. Se as suas avaliações são apresentadas dentro de um widget JavaScript que o rastreador lê como vazio, pode estar completamente desbloqueado e ainda assim não ser citado. Acesso e legibilidade são dois trabalhos separados.