Robots.txt e IA: o que liberar ou bloquear no seu site
Cada robô de IA tem uma função: busca, treinamento ou visita pedida por uma pessoa. Veja o que cada um faz e como decidir o que permitir.
Neste artigo

Você ouviu que precisa "liberar a IA" no site, ou o contrário, "bloquear a IA", e abriu o arquivo robots.txt sem saber o que escrever. O problema é que não existe um único robô de IA: cada empresa usa rastreadores diferentes, com funções diferentes, e bloquear o errado pode tirar seu negócio das respostas ou, ao contrário, não impedir nada.
Este guia explica, com base na documentação oficial da OpenAI e do Google, o que cada rastreador faz, o que o robots.txt consegue controlar e como decidir sem prometer que liberar um robô garanta menção ou visita.
O que é o robots.txt e o que ele controla
O robots.txt é um arquivo de texto na raiz do site (por exemplo, seusite.com.br/robots.txt) que informa a rastreadores quais áreas podem ser acessadas. A documentação do Google lembra que ele serve para gerenciar o tráfego de rastreamento, não para esconder conteúdo: uma página bloqueada ainda pode ser descoberta por outros caminhos, e a regra depende de o robô respeitá-la.
Cada robô se apresenta com um nome, chamado de user-agent (agente de usuário). Você escreve uma regra por nome. É essa separação que permite, por exemplo, aceitar um robô de busca e recusar um robô de treinamento.
Os três rastreadores da OpenAI
A página de rastreadores da OpenAI descreve três agentes com finalidades distintas:
- OAI-SearchBot: usado para exibir sites nos resultados da busca do ChatGPT. Segundo a documentação, quem o bloqueia não aparece nas respostas de busca, embora ainda possa surgir como link de navegação.
- GPTBot: coleta conteúdo que pode ser usado no treinamento de modelos. Bloqueá-lo sinaliza que o conteúdo não deve servir a esse treinamento.
- ChatGPT-User: acessa páginas quando uma pessoa pede isso dentro do ChatGPT ou de GPTs personalizados. Como a ação é iniciada pelo usuário, as regras do robots.txt podem não valer, e a documentação afirma que ele não define se um conteúdo aparece na busca.
Cada configuração é independente. Um site pode permitir o OAI-SearchBot e bloquear o GPTBot, e a própria documentação cita esse arranjo como exemplo. Segundo a OpenAI, pode levar cerca de 24 horas para os sistemas se ajustarem depois de uma mudança no arquivo.
E o Google? Googlebot e Google-Extended
No ecossistema do Google, o Googlebot rastreia para a Busca. Já o Google-Extended é, segundo a documentação de rastreadores do Google, um token independente para os editores controlarem se o conteúdo rastreado pode ser usado no treinamento de futuras gerações de modelos Gemini e na fundamentação em aplicativos do Gemini. O mesmo texto afirma que o Google-Extended não afeta a inclusão do site na Busca nem é sinal de ranqueamento.
Na prática, bloquear o Googlebot por engano é o erro caro: o site pode sair da Busca. Se a intenção era só limitar o uso para IA, o token correto é outro. Há um caso parecido, em que uma regra de infraestrutura bloqueia tudo de uma vez, no artigo sobre como a Cloudflare pode bloquear o Google junto com a IA.
Como decidir o que permitir
A decisão depende do objetivo do negócio, e não há resposta única. Um raciocínio simples ajuda:
- Quer ser encontrado em respostas de IA? Permita os robôs de busca, como o OAI-SearchBot, e mantenha o Googlebot liberado. Isso é condição de acesso, não garantia de citação. Veja por que o ChatGPT lê mas quase nunca cita.
- Não quer que o conteúdo treine modelos? Bloqueie os agentes de treinamento, como GPTBot e Google-Extended, sem tocar nos de busca.
- Não tem certeza? Mantenha o que já funciona e mude uma regra de cada vez, anotando a data.
Um exemplo de arquivo que aceita a busca e recusa o treinamento ficaria assim:
User-agent: OAI-SearchBot
Allow: /
User-agent: GPTBot
Disallow: /
User-agent: Google-Extended
Disallow: /
User-agent: *
Allow: /
Trate o exemplo como ponto de partida e confira os nomes na documentação no dia em que for aplicar, porque rastreadores novos aparecem e as descrições mudam.
Como conferir se está funcionando
Abra seusite.com.br/robots.txt no navegador e confirme que o arquivo existe e mostra as regras esperadas. Se o site for feito em uma plataforma, veja se ela gera o arquivo por conta própria antes de substituí-lo. Depois, olhe os registros de acesso do servidor ou da hospedagem, quando disponíveis, para ver quais robôs visitam o site.
Lembre também que robôs de IA nem sempre executam JavaScript, então um site que só mostra conteúdo depois de carregar scripts pode ficar vazio para eles mesmo com o robots.txt correto. Esse limite aparece em por que o JavaScript pode ser invisível para a IA. Se você quer o panorama de como aparecer nessas respostas, comece pelo guia como aparecer no ChatGPT.
O que o robots.txt não resolve
Ele não garante que um robô obedeça, não remove páginas já conhecidas e não decide se você será citado. Permitir o acesso é só a primeira etapa: o conteúdo ainda precisa ser claro, útil e fácil de entender. Para tirar uma página do índice, outras ferramentas servem melhor, e o guia sobre redirecionamento, canonical e noindex mostra a diferença.
Fontes consultadas: OpenAI, visão geral dos rastreadores, Google, rastreadores comuns e Google, introdução ao robots.txt.
Perguntas frequentes
Preciso bloquear a IA no robots.txt?
Não é obrigatório. Depende do seu objetivo: se quer ser encontrado em respostas de IA, mantenha os robôs de busca liberados. Bloquear só os de treinamento é uma opção para quem não quer o conteúdo usado em modelos.
Bloquear o GPTBot tira meu site do ChatGPT?
Segundo a OpenAI, o GPTBot está ligado ao treinamento de modelos, e o OAI-SearchBot é o que cuida da busca do ChatGPT. As configurações são independentes.
Bloquear o Google-Extended prejudica meu posicionamento?
A documentação do Google afirma que ele não afeta a inclusão na Busca nem é sinal de ranqueamento. O Googlebot é o robô que importa para a Busca.
O ChatGPT-User obedece ao robots.txt?
A documentação da OpenAI diz que as regras podem não se aplicar, porque as visitas são iniciadas por uma pessoa dentro do ChatGPT.
Quanto tempo leva para uma mudança valer?
A OpenAI informa que pode levar cerca de 24 horas para o OAI-SearchBot se ajustar a uma atualização do arquivo. Para outros robôs, confira a documentação de cada um.
Liberar o robô garante que meu negócio será citado?
Não. Liberar o acesso é uma condição necessária, mas a citação depende do conteúdo, da relevância e de decisões de cada sistema.


