Pular para o conteúdo
Voltar para o blog

Ser citado pela IA6 min de leitura

Robots.txt e IA: o que liberar ou bloquear no seu site

Cada robô de IA tem uma função: busca, treinamento ou visita pedida por uma pessoa. Veja o que cada um faz e como decidir o que permitir.

Gianluca Ferro

Fundador da Ferro Labs e sócio da apareça.ai

Neste artigo

Você ouviu que precisa "liberar a IA" no site, ou o contrário, "bloquear a IA", e abriu o arquivo robots.txt sem saber o que escrever. O problema é que não existe um único robô de IA: cada empresa usa rastreadores diferentes, com funções diferentes, e bloquear o errado pode tirar seu negócio das respostas ou, ao contrário, não impedir nada.

Este guia explica, com base na documentação oficial da OpenAI e do Google, o que cada rastreador faz, o que o robots.txt consegue controlar e como decidir sem prometer que liberar um robô garanta menção ou visita.

O que é o robots.txt e o que ele controla

O robots.txt é um arquivo de texto na raiz do site (por exemplo, seusite.com.br/robots.txt) que informa a rastreadores quais áreas podem ser acessadas. A documentação do Google lembra que ele serve para gerenciar o tráfego de rastreamento, não para esconder conteúdo: uma página bloqueada ainda pode ser descoberta por outros caminhos, e a regra depende de o robô respeitá-la.

Cada robô se apresenta com um nome, chamado de user-agent (agente de usuário). Você escreve uma regra por nome. É essa separação que permite, por exemplo, aceitar um robô de busca e recusar um robô de treinamento.

Os três rastreadores da OpenAI

A página de rastreadores da OpenAI descreve três agentes com finalidades distintas:

  • OAI-SearchBot: usado para exibir sites nos resultados da busca do ChatGPT. Segundo a documentação, quem o bloqueia não aparece nas respostas de busca, embora ainda possa surgir como link de navegação.
  • GPTBot: coleta conteúdo que pode ser usado no treinamento de modelos. Bloqueá-lo sinaliza que o conteúdo não deve servir a esse treinamento.
  • ChatGPT-User: acessa páginas quando uma pessoa pede isso dentro do ChatGPT ou de GPTs personalizados. Como a ação é iniciada pelo usuário, as regras do robots.txt podem não valer, e a documentação afirma que ele não define se um conteúdo aparece na busca.

Cada configuração é independente. Um site pode permitir o OAI-SearchBot e bloquear o GPTBot, e a própria documentação cita esse arranjo como exemplo. Segundo a OpenAI, pode levar cerca de 24 horas para os sistemas se ajustarem depois de uma mudança no arquivo.

E o Google? Googlebot e Google-Extended

No ecossistema do Google, o Googlebot rastreia para a Busca. Já o Google-Extended é, segundo a documentação de rastreadores do Google, um token independente para os editores controlarem se o conteúdo rastreado pode ser usado no treinamento de futuras gerações de modelos Gemini e na fundamentação em aplicativos do Gemini. O mesmo texto afirma que o Google-Extended não afeta a inclusão do site na Busca nem é sinal de ranqueamento.

Na prática, bloquear o Googlebot por engano é o erro caro: o site pode sair da Busca. Se a intenção era só limitar o uso para IA, o token correto é outro. Há um caso parecido, em que uma regra de infraestrutura bloqueia tudo de uma vez, no artigo sobre como a Cloudflare pode bloquear o Google junto com a IA.

Como decidir o que permitir

A decisão depende do objetivo do negócio, e não há resposta única. Um raciocínio simples ajuda:

  • Quer ser encontrado em respostas de IA? Permita os robôs de busca, como o OAI-SearchBot, e mantenha o Googlebot liberado. Isso é condição de acesso, não garantia de citação. Veja por que o ChatGPT lê mas quase nunca cita.
  • Não quer que o conteúdo treine modelos? Bloqueie os agentes de treinamento, como GPTBot e Google-Extended, sem tocar nos de busca.
  • Não tem certeza? Mantenha o que já funciona e mude uma regra de cada vez, anotando a data.

Um exemplo de arquivo que aceita a busca e recusa o treinamento ficaria assim:

User-agent: OAI-SearchBot
Allow: /

User-agent: GPTBot
Disallow: /

User-agent: Google-Extended
Disallow: /

User-agent: *
Allow: /

Trate o exemplo como ponto de partida e confira os nomes na documentação no dia em que for aplicar, porque rastreadores novos aparecem e as descrições mudam.

Como conferir se está funcionando

Abra seusite.com.br/robots.txt no navegador e confirme que o arquivo existe e mostra as regras esperadas. Se o site for feito em uma plataforma, veja se ela gera o arquivo por conta própria antes de substituí-lo. Depois, olhe os registros de acesso do servidor ou da hospedagem, quando disponíveis, para ver quais robôs visitam o site.

Lembre também que robôs de IA nem sempre executam JavaScript, então um site que só mostra conteúdo depois de carregar scripts pode ficar vazio para eles mesmo com o robots.txt correto. Esse limite aparece em por que o JavaScript pode ser invisível para a IA. Se você quer o panorama de como aparecer nessas respostas, comece pelo guia como aparecer no ChatGPT.

O que o robots.txt não resolve

Ele não garante que um robô obedeça, não remove páginas já conhecidas e não decide se você será citado. Permitir o acesso é só a primeira etapa: o conteúdo ainda precisa ser claro, útil e fácil de entender. Para tirar uma página do índice, outras ferramentas servem melhor, e o guia sobre redirecionamento, canonical e noindex mostra a diferença.

Fontes consultadas: OpenAI, visão geral dos rastreadores, Google, rastreadores comuns e Google, introdução ao robots.txt.

Perguntas frequentes

Preciso bloquear a IA no robots.txt?

Não é obrigatório. Depende do seu objetivo: se quer ser encontrado em respostas de IA, mantenha os robôs de busca liberados. Bloquear só os de treinamento é uma opção para quem não quer o conteúdo usado em modelos.

Bloquear o GPTBot tira meu site do ChatGPT?

Segundo a OpenAI, o GPTBot está ligado ao treinamento de modelos, e o OAI-SearchBot é o que cuida da busca do ChatGPT. As configurações são independentes.

Bloquear o Google-Extended prejudica meu posicionamento?

A documentação do Google afirma que ele não afeta a inclusão na Busca nem é sinal de ranqueamento. O Googlebot é o robô que importa para a Busca.

O ChatGPT-User obedece ao robots.txt?

A documentação da OpenAI diz que as regras podem não se aplicar, porque as visitas são iniciadas por uma pessoa dentro do ChatGPT.

Quanto tempo leva para uma mudança valer?

A OpenAI informa que pode levar cerca de 24 horas para o OAI-SearchBot se ajustar a uma atualização do arquivo. Para outros robôs, confira a documentação de cada um.

Liberar o robô garante que meu negócio será citado?

Não. Liberar o acesso é uma condição necessária, mas a citação depende do conteúdo, da relevância e de decisões de cada sistema.