Pular para o conteúdo
Painel digital controlando o fluxo de dados na web, separando rastreadores de IA para treinamento, busca e citação de conteúdo.
Voltar para o Blog

Bloquear a IA de Treinar no Seu Site Sem Sair do Google: O Que a Cloudflare Lançou e o Que Você Nunca Deve Bloquear Se Quer Ser Citado pelo ChatGPT

Equipe Golber.
14 min de leitura
Atualizado em
Tecnologia
Ouça este artigo

Bloquear a IA de Treinar no Seu Site Sem Sair do Google: O Que a Cloudflare Lançou e o Que Você Nunca Deve Bloquear Se Quer Ser Citado pelo ChatGPT

0:00 / 18:09
1×
Sincronia do destaque
no ponto
Se a voz parecer atrás do trecho marcado, atrase o destaque
Painel digital controlando o fluxo de dados na web, separando rastreadores de IA para treinamento, busca e citação de conteúdo.

Até ontem, o mesmo robô que indexava a sua página para o Google levava o seu conteúdo para treinar modelo de IA, e bloquear um era bloquear o outro. Em 15 de setembro a Cloudflare separou os rastreadores por comportamento, Busca, Treinamento e Agente, e Apple, Google e Microsoft garantiram por escrito que recusar treinamento não afeta o ranking. A notícia boa esconde uma armadilha: a mesma tela permite bloquear os agentes que leem a sua página quando alguém pergunta algo ao ChatGPT ou ao Gemini, e quem bloqueia isso achando que está protegendo o conteúdo está se apagando das respostas de IA. Explico o selo Accountable e as quatro exigências, os padrões novos para sites com anúncio, a diferença entre treinamento e citação, o que eu vou configurar no golber.net e por quê, e como ativar em cinco minutos.

Até ontem, todo dono de site vivia um dilema sem saída: o mesmo robô que indexa a sua página para o Google também leva o seu conteúdo para treinar modelo de IA. Bloquear o robô tirava você da busca. Deixar passar entregava o seu trabalho de graça. Em 15 de setembro de 2026, a Cloudflare lançou a configuração Disallow AI Training e acabou com o empate: agora dá para recusar o treinamento e continuar aparecendo no Google.

A notícia é boa, e a maior parte da cobertura vai parar nela. Este post vai além, porque existe uma armadilha nova escondida na solução: a mesma tela que permite bloquear o treinamento também permite bloquear os agentes de IA que buscam páginas para responder perguntas. E quem bloqueia esses, achando que está protegendo o conteúdo, está se apagando do ChatGPT, do Gemini e de toda resposta gerada por IA. Para quem trabalha visibilidade em busca e em IA, é a decisão mais importante de configuração do ano, e ela precisa ser tomada com critério.

Vou explicar o que mudou, como funciona por dentro, o que cada uma das três chaves faz, o que eu vou configurar no meu próprio site e por quê.

  • O que mudou: a Cloudflare passou a classificar rastreadores por comportamento, e não por empresa. Três chaves separadas: Busca, Treinamento e Agente.

  • Rastreador de uso misto, que indexa e treina com o mesmo robô, era 36,6% do tráfego verificado. Era o que tornava o bloqueio impossível sem perda.

  • Apple, Google e Microsoft aceitaram o selo "Accountable" e garantiram por escrito que recusar treinamento não afeta o ranking. Amazon, Anthropic, Meta e OpenAI também entraram, com robôs separados.

  • A armadilha: bloquear "Agente" tira você das respostas do ChatGPT e do Gemini. Para quem quer GEO, é o oposto do que se quer.

  • O que eu faço: Busca liberada, Treinamento recusado, Agente liberado. É a combinação que protege o conteúdo sem sumir de onde as pessoas perguntam.

  • Padrão novo para domínios novos com anúncios: Treinamento e Agente bloqueados em páginas com anúncio. Se você monetiza com anúncio e quer GEO, precisa mexer na configuração.

O problema que existia até ontem

O robô do Google que indexa a sua página é o mesmo que alimenta o treinamento dos modelos do Google. O da Microsoft, idem. Isso se chama rastreador de uso misto, e segundo a Cloudflare ele representava 36,6% de todo o tráfego de rastreadores verificados na rede, a maior categoria isolada.

A consequência era um dilema binário. O robots.txt, que é o arquivo em que o site diz aos robôs o que podem fazer, só sabe dizer "pode" ou "não pode" para cada robô. Se você negasse o robô do Google, saía do Google. Se permitisse, autorizava tudo o que ele fizesse com o conteúdo, inclusive treinar modelo. Não existia forma técnica de dizer "indexe, mas não treine".

O resultado aparece nos números da própria Cloudflare: menos de 1% dos sites bloqueiam robôs de busca, por medo óbvio, enquanto 17% já ativaram algum mecanismo para bloquear treinamento. A demanda existia; a ferramenta não.

O que a Cloudflare lançou

Três comportamentos, três chaves

A mudança de fundo é conceitual: em vez de classificar o robô pela empresa dona, a Cloudflare passou a classificar pelo que ele está fazendo. Três comportamentos:

  • Busca (Search): rastreamento para construir índice de busca. É o que coloca você no Google e no Bing.

  • Treinamento (Training): rastreamento para treinar ou ajustar um modelo. É o que transforma o seu texto em peso dentro de uma rede neural, sem crédito e sem retorno.

  • Agente (Agent): agentes dirigidos por um usuário que visitam a página em nome de uma pessoa. É o robô que busca a sua página quando alguém pergunta algo ao ChatGPT, e o agente de navegação que executa tarefas por alguém.

Cada um tem a própria chave no painel da Cloudflare, na seção de segurança da zona. Você escolhe por comportamento, e a Cloudflare traduz a escolha para o robots.txt automaticamente pela função Bot Preference Sync, sem você editar arquivo nenhum.

O selo "Accountable"

Para a separação funcionar, o operador do robô precisa respeitar a distinção. A Cloudflare criou a designação Accountable para quem cumpre, ou se compromete com prazo a cumprir, quatro exigências:

  1. Um mecanismo claro de recusa de treinamento via robots.txt ou padrão equivalente.

  2. Permitir que o site recuse os resumos gerados por IA nos resultados de busca.

  3. Visibilidade por URL de como o conteúdo é usado, em busca e em treinamento.

  4. Confirmação pública de que recusar treinamento não afeta o ranking na busca tradicional.

Quem está dentro: Apple, Google e Microsoft, com capacidades disponíveis hoje e prazos assumidos para o resto (a Microsoft mira o início de 2027 para o suporte completo no Bing; Apple e Google prometem as ferramentas por URL até o começo do ano que vem). Amazon, Anthropic, Meta e OpenAI também foram classificados como Accountable, porque já operam robôs separados por finalidade.

E as garantias por escrito, que são o que interessa: a Apple declara que recusar treinamento "não impacta o ranking de busca"; o Google, que "não impacta a inclusão do site na Busca Google"; a Microsoft, que a diretiva de não arquivar "não impacta o ranking". Pela primeira vez, as três grandes disseram publicamente que você pode dizer não ao treinamento sem ser punido na busca.

Os padrões novos

Para domínios que entram na Cloudflare a partir de 15 de setembro:

Comportamento

Site sem anúncios

Site com anúncios

Busca

Permitido

Permitido

Treinamento

Permitido

Recusado

Agente

Permitido

Bloqueado nas páginas com anúncio

Sites que já tinham o bloqueio total antigo migram automaticamente para "Treinamento recusado" e "Agente bloqueado nas páginas com anúncio". Repare na última linha da tabela, porque é ali que mora a armadilha.

Recusar treinamento é proteger o que você escreveu. Bloquear agente é impedir que alguém encontre o que você escreveu quando pergunta a uma IA. São decisões opostas, e estão na mesma tela.

A armadilha: treinamento não é o mesmo que citação

Aqui está a parte que quase ninguém vai explicar, e que decide se a configuração te ajuda ou te apaga.

Quando alguém pergunta ao ChatGPT "qual o melhor sistema de escala para hospital" e a resposta cita o seu post com link, isso não veio do treinamento. Veio de um agente que, naquele momento, buscou páginas na web para responder, leu a sua e a citou. É o comportamento "Agent" da classificação da Cloudflare. É o GEO inteiro.

Então as três chaves têm efeitos completamente diferentes sobre a sua visibilidade:

  • Recusar Treinamento impede que o seu texto vire peso do modelo. Você perde nada de visibilidade imediata, porque modelo treinado não cita fonte mesmo. Ganha controle sobre o uso do seu trabalho.

  • Bloquear Agente impede que a IA leia a sua página na hora de responder. Você some das respostas do ChatGPT, do Gemini, do Perplexity e de qualquer busca com IA. É a fonte de tráfego que mais cresce, e você a desliga.

  • Bloquear Busca tira você do Google. Ninguém faz isso de propósito.

O padrão da Cloudflare para sites com anúncio bloqueia Agente nas páginas com anúncio. A lógica deles é legítima: agente que lê a página em nome do usuário não vê o anúncio, então o dono do site não ganha nada com aquela visita. Mas para quem vive de ser encontrado, e não de impressão de banner, a visita do agente é a que gera a citação, e a citação é o que gera o clique humano depois. Escrevi sobre esses canais em os canais de audiência que fazem um site vender, e a busca por IA já é um deles.

O que eu vou configurar no golber.net, e por quê

A minha decisão, com a justificativa de cada chave:

  1. Busca: permitida. Óbvio. É de onde vem a maior parte do tráfego hoje.

  2. Treinamento: recusado. Eu escrevo dezenas de textos originais, com pesquisa, número e posição. Não vejo motivo para isso virar peso de modelo sem crédito. E, com a garantia por escrito de Apple, Google e Microsoft de que não afeta ranking, o custo de recusar ficou zero.

  3. Agente: permitido, inclusive em páginas com anúncio. Este blog quer ser citado. Toda a estratégia de conteúdo, de posts com número e data até o placar público de previsões, existe para ser a fonte que a IA usa ao responder. Bloquear agente seria sabotar isso para proteger uma impressão de banner que eu nem tenho.

Se você monetiza com anúncio e o seu modelo é volume de impressão, a conta pode ser outra: aí a visita do agente é custo sem receita, e o padrão da Cloudflare faz sentido. A regra é simples: quem vive de ser encontrado libera Agente; quem vive de impressão de anúncio pode bloquear. O que não dá é deixar o padrão decidir por você.

Como ativar, em cinco minutos

  1. No painel da Cloudflare, abra a zona do seu domínio e vá até a seção de segurança, onde ficam os controles de rastreadores de IA.

  2. Você vai ver as três chaves: Search, Training e Agent. Ajuste cada uma conforme a decisão acima.

  3. Ative o Bot Preference Sync. É ele que publica a sua preferência no robots.txt automaticamente, no formato que os operadores Accountable leem. Sem edição manual.

  4. Confira o seu robots.txt depois de alguns minutos, acessando seudominio.com/robots.txt, para ver a diretiva publicada.

  5. Se você já tinha bloqueio total, revise: a migração automática deixou Agente bloqueado em páginas com anúncio, e isso pode não ser o que você quer.

Um detalhe técnico que vale saber: a Cloudflare não oferece "recusar treinamento só em páginas com anúncio", porque essa lista é grande e muda demais para caber no robots.txt. Treinamento é uma decisão para o site inteiro.

O que ainda vem

  • Controle sobre resumos de IA. Hoje o operador Accountable é obrigado a oferecer a recusa dos resumos gerados por IA na busca. Até o início do ano que vem, a Cloudflare promete um controle mais fino, de quanto do seu conteúdo pode aparecer no resumo, e não só sim ou não, configurado uma vez para todos os operadores.

  • Visibilidade por URL. Apple e Google prometem ferramentas para você ver quais páginas foram usadas em busca e em treinamento. É o que vai permitir medir, e não só configurar.

  • O dado que justifica tudo: segundo a Cloudflare, mais da metade das pessoas lê os resumos de IA, e quem lê tem mais de 40% de chance a mais de encerrar a busca ali, sem clicar em nada. É por isso que a citação dentro do resumo passou a valer mais que a posição na lista de links.

Para quem tem site e não é da área

Se tudo isso parece distante, a versão curta: existe agora um botão que impede empresas de IA de usar o seu conteúdo para treinar modelo, sem você perder o Google. Vale apertar. Mas existe ao lado um segundo botão que impede a IA de ler a sua página quando alguém pergunta sobre o seu assunto, e esse, para a maioria dos negócios, não vale apertar. Se o seu site está na Cloudflare, peça a quem cuida dele para configurar Busca e Agente permitidos e Treinamento recusado. Se não sabe quem cuida, essa é a primeira pergunta a resolver, e escrevi sobre isso em acabou a garantia, começou o favor.

O que eu acho que acontece

Duas apostas, com data e grau de confiança, no formato dos outros posts:

  • Até março de 2027, a maioria dos sites de mídia na Cloudflare estará com Treinamento recusado. Confiança: 75%. Com garantia de ranking por escrito, não sobra motivo para permitir.

  • Até o fim de 2027, "Agente permitido" vira recomendação padrão de SEO, e o padrão da Cloudflare para sites com anúncio é revisto. Confiança: 55%. Quando os donos de site perceberem que bloquear agente os tira das respostas de IA, a pressão vai inverter o padrão.

O fecho

A Cloudflare resolveu o dilema certo: você não precisa mais escolher entre estar no Google e proteger o seu conteúdo. Mas criou, sem querer, um dilema novo na mesma tela: entre proteger o conteúdo e ser encontrado por quem pergunta a uma IA. Recuse o treinamento. Libere o agente. E não deixe o padrão decidir o que você quer ser na internet.

O panorama do que cada modelo de IA fez em setembro, e por que a citação virou a nova posição, está em novidades de IA em setembro de 2026.

Perguntas frequentes

O que é o Disallow AI Training da Cloudflare?

É uma configuração lançada em 15 de setembro de 2026 que permite ao dono do site recusar que seu conteúdo seja usado para treinar modelos de IA, sem sair dos resultados de busca. A Cloudflare passou a classificar os rastreadores por comportamento, Busca, Treinamento e Agente, e publica a preferência do site no robots.txt automaticamente.

Bloquear treinamento de IA tira meu site do Google?

Não. Apple, Google e Microsoft aceitaram a designação Accountable da Cloudflare e confirmaram por escrito que recusar treinamento não afeta o ranking nem a inclusão na busca tradicional. Essa garantia é a novidade que torna a recusa segura.

Qual a diferença entre bloquear treinamento e bloquear agentes de IA?

Treinamento é o uso do seu conteúdo para construir o modelo; recusar não afeta sua visibilidade imediata. Agente é o robô que lê a sua página em nome de um usuário no momento em que ele pergunta algo ao ChatGPT, ao Gemini ou a uma busca com IA; bloquear faz você desaparecer dessas respostas. Para quem quer ser citado por IA, a recomendação é recusar treinamento e permitir agente.

O que é um rastreador de uso misto?

É um único robô que faz duas coisas: indexa para busca e coleta para treinamento. Segundo a Cloudflare, representava 36,6% do tráfego verificado de rastreadores, e era o que impedia recusar treinamento sem perder a busca. A nova classificação por comportamento e o selo Accountable resolvem isso.

O que muda para sites novos com anúncios?

Para domínios que entram na Cloudflare a partir de 15 de setembro de 2026 e exibem anúncios, o padrão passa a ser Treinamento recusado e Agente bloqueado nas páginas com anúncio, com Busca permitida. Sites que já tinham bloqueio total migram para o mesmo padrão. Quem quer aparecer em respostas de IA precisa liberar Agente manualmente.

Como ativo a configuração?

No painel da Cloudflare, na seção de segurança da zona do domínio, ajuste as três chaves de Busca, Treinamento e Agente e ative o Bot Preference Sync, que publica a preferência no robots.txt sem edição manual. Depois de alguns minutos, confira o arquivo em seudominio.com/robots.txt.

Posso recusar treinamento só nas páginas com anúncio?

Não. A Cloudflare explica que a lista de páginas com anúncio é grande demais e muda com frequência demais para caber no robots.txt. Treinamento é uma decisão para o site inteiro; Agente é que pode ser bloqueado apenas nas páginas com anúncio.

Quais empresas de IA respeitam a recusa?

Apple, Google e Microsoft, com capacidades já disponíveis e prazos assumidos para o restante das exigências. Amazon, Anthropic, Meta e OpenAI também foram classificadas como Accountable por já operarem robôs separados por finalidade. Operadores fora da lista não têm garantia, e para eles valem as regras de bloqueio tradicionais.

Fonte principal: anúncio e documentação técnica da Cloudflare de 15 de setembro de 2026, incluindo as declarações públicas de Apple, Google e Microsoft sobre ranking. A configuração descrita para o golber.net é decisão minha, adequada a um site que vive de ser encontrado e não de impressão de anúncio; sites com outro modelo podem decidir diferente. As previsões são minhas, com verificação nas datas indicadas. Última atualização: 16 de setembro de 2026.

Gostou?
Compartilhar

Quer mais conteúdo desse?

Receba toda semana o que escrevo sobre stack, IA aplicada e negócios solo. Zero spam, descadastro num clique.