Estamos cientes de um problema que pode afetar o serviço.

Bot Preference Sync: Cloudflare quer escrever o robots.txt — entenda a mudança

Por: Eduardo Carrega
22/09/2026
08:59h
Bot Preference Sync: Cloudflare quer escrever o robots.txt — entenda a mudança
Bot Preference Sync automatiza o robots.txt da Cloudflare, mas limita o controle sobre crawlers de IA; entenda regras, categorias e bloqueios.
RESUMIR COM:

O Bot Preference Sync, anunciado pela Cloudflare no dia seguinte a uma discussão sobre divergências entre o robots.txt e as regras efetivamente aplicadas no site, promete automatizar uma tarefa que muitos administradores fazem manualmente. A ferramenta transforma as preferências definidas no painel da empresa em instruções para crawlers de inteligência artificial.

Na prática, o Bot Preference Sync acrescenta essas regras ao início do arquivo robots.txt, entre os marcadores # BEGIN Cloudflare Bot Preference Sync e # END Cloudflare Bot Preference Sync. O conteúdo que já existia no arquivo é mantido abaixo do bloco gerado. Segundo a Cloudflare, o recurso estará disponível a partir do plano gratuito e, para novos clientes, será ativado por padrão.

Bot Preference Sync tenta alinhar regras e robots.txt

A proposta surgiu depois que o autor identificou que seu próprio robots.txt continuava permitindo o acesso do Bytespider, mesmo meses após essa deixar de ser sua preferência. Ele começou a corrigir o arquivo manualmente em August 20 e terminou o trabalho em August 26. No dia seguinte ao início da correção, a Cloudflare anunciou o novo produto.

No entanto, há uma ressalva importante: as informações disponíveis descrevem o produto conforme anunciado. As of September 13, não havia uma entrada sobre o Bot Preference Sync no changelog de bots da Cloudflare, que ainda terminava em July 1. Também não existia menção ao recurso na documentação de bots nem um bloco gerado no robots.txt analisado.

A Cloudflare afirma que, quando as preferências declaradas no arquivo entram em conflito com as regras aplicadas na borda da rede, alguns crawlers podem ignorar essas preferências ou tentar contornar os bloqueios. A empresa, porém, não informa quais crawlers fazem isso, quantos seriam nem como chegou a essa conclusão.

“Quando suas preferências declaradas e suas regras aplicadas discordam, alguns crawlers tratam isso como motivo para desconsiderar suas preferências ou tentar contornar suas regras aplicadas.”

Esse descompasso acontece porque o robots.txt e a proteção na borda são administrados em locais diferentes. O arquivo pode ter sido escrito meses antes, enquanto as regras do painel são alteradas posteriormente. Dessa forma, nenhum dos dois mecanismos acompanha automaticamente a decisão mais recente do proprietário do site.

Política é definida por categoria, não por crawler

Política é definida por categoria, não por crawler

O Bot Preference Sync trabalha com três categorias disponíveis em Security Settings e Configure AI bot policies: Search, Agent e Training. Para todas elas, a documentação apresenta três opções: bloquear em todas as páginas, bloquear apenas nas páginas com anúncios ou permitir.

A classificação dos crawlers é feita pela lista monitorada pela Cloudflare. Por isso, não é possível excluir um bot específico da sincronização. A orientação para quem precisa de um controle mais detalhado é desativar o recurso e manter o arquivo manualmente.

Esse modelo não atende a todas as estratégias. O autor permite GPTBot, da OpenAI, o crawler da Anthropic e o PerplexityBot. Ao mesmo tempo, bloqueia Bytespider e meta-externalagent. Embora todas essas empresas treinem modelos, a decisão considera o retorno oferecido por cada crawler: alguns podem colocar as páginas diante de pessoas que fazem perguntas a assistentes, enquanto outros apenas coletam conteúdo.

Se Training for configurado como disallow, o arquivo impedirá o treinamento por parte de um crawler que o administrador gostaria de autorizar. Se a opção for allow, Meta e ByteDance não serão diferenciadas no robots.txt, ainda que a borda da rede devolva 403 para ambas. Ou seja, não há uma configuração que represente exatamente essa política individual.

Cloudflare estabelece quatro condições para liberar crawlers

Ao escolher Training como disallow, o sistema escreve uma instrução de não treinamento e bloqueia crawlers de IA considerados opacos pela Cloudflare. Para evitar essa classificação, um bot que atua tanto em busca quanto em treinamento precisa atender a quatro condições:

  • Respeitar, por qualquer mecanismo, uma preferência de “não treinar” definida no robots.txt;
  • Oferecer aos proprietários de sites uma forma de recusar resumos gerados por IA;
  • Informar, no nível da URL, quais páginas foram disponibilizadas para treinamento e apresentar métricas sobre os resultados de busca;
  • Demonstrar publicamente que bloquear o treinamento não prejudica os resultados da busca tradicional.

Se o crawler não cumprir os quatro critérios, a Cloudflare o considera opaco e o bloqueia em todos os sites que tenham configurado Training como disallow. Nenhuma empresa é citada nominalmente na lista.

As condições dois e quatro se relacionam ao Google. A documentação do crawler da empresa, atualizada pela última vez em July 14 2026, diz que o Google-Extended controla o uso do conteúdo rastreado no treinamento dos modelos Gemini e na fundamentação de respostas. O texto também afirma que essa configuração “não afeta a inclusão de um site na Google Search nem é usada como sinal de classificação na Google Search”.

Assim, o Google já atende à quarta exigência segundo sua própria declaração pública. A segunda, porém, permanece sem resposta no material apresentado: a exigência de oferecer uma maneira de recusar resumos de IA.

Com informações de searchenginejournal.com.

Compartilhe

Leia também

Bot Preference Sync: Cloudflare quer escrever o robots.txt — entenda a mudança

Bot Preference Sync: Cloudflare quer escrever o robots.txt — entenda a mudança

Bot Preference Sync automatiza o robots.txt da Cloudflare, mas limita o controle sobre crawlers de IA; entenda regras, categorias e ...
Responsabilidade em IA: escola cria modelo que Big Tech ainda não conseguiu entregar

Responsabilidade em IA: escola cria modelo que Big Tech ainda não conseguiu entregar

Responsabilidade em IA ganha força: veja como uma escola estruturou regras, revisão humana e transparência para conquistar confiança em buscas. ...
Buscas locais no EEE: Google amplia unidades de resultados — entenda a mudança

Buscas locais no EEE: Google amplia unidades de resultados — entenda a mudança

Buscas locais no EEE ganham novas unidades no Google; veja como diretórios e empresas podem aparecer e o impacto para ...

Aviso de instabilidade temporária

*COMUNICADO IMPORTANTE SOBRE CONECTIVIDADE NESTA TARDE DE 25/05/2026 ✅*
Parte da rede nacional está apresentando instabilidades de acesso.
Há equipes em várias esferas já está atuando em conjunto com o data center responsável para identificar a causa e normalizar a conectividade o mais rápido possível.
O ambiente segue sendo monitorado em tempo real e novas atualizações serão disponibilizadas conforme houver avanço na análise.
Neste momento alguns VPS, Dedicados e Hospedagens compartilhadas estão com acesso limitado.

Orçamento