Estamos cientes de um problema que pode afetar o serviço.

Sitemap no Google: Mueller revela como IA rastreia arquivos — entenda o impacto

Por: Eduardo Carrega
05/10/2026
20:04h
Sitemap no Google: Mueller revela como IA rastreia arquivos — entenda o impacto
Mueller, do Google, explica como crawlers de IA acessam sitemap e RSS, e por que o llms.txt ainda não substitui o sitemap tradicional.
RESUMIR COM:

O analista do Google John Mueller afirmou que crawlers de treinamento de inteligência artificial costumam não oferecer nenhum canal para que donos de site enviem um sitemap diretamente. Segundo ele, a alternativa é usar um nome de arquivo padrão ou manter um feed RSS ativo, caso o site queira que esses robôs encontrem o conteúdo. A declaração foi dada ao lado de Martin Splitt, no episódio de 1º de outubro do podcast Search Off the Record, do Google, batizado de “Do sitemaps still matter?” (sitemaps ainda importam?).

Mueller contou ainda que já viu, nos próprios registros de servidor, crawlers de IA acessando tanto o arquivo de sitemap quanto o feed RSS do seu site. O relato chama atenção porque mostra, na prática, como sistemas de inteligência artificial estão buscando conteúdo na web, ainda sem um processo formal de indexação como o que já existe para a busca tradicional do Google.

O que muda para quem administra um site?

Para quem cuida da presença digital de um site, a fala de Mueller tem efeito direto sobre a estratégia de sitemap. Ele explicou que é possível manter um sitemap privado, com um nome de arquivo incomum, sem registrá-lo no robots.txt, enviando-o apenas diretamente ao Google. A desvantagem, segundo ele, é que outros sistemas simplesmente não vão conseguir achar esse arquivo, e o Bing, por exemplo, provavelmente exigiria um envio separado.

Já os crawlers de treinamento de IA seguem uma lógica diferente. “Eles geralmente não têm nenhum tipo de console ou configuração em que você possa enviar um arquivo de sitemap”, disse Mueller. Por isso, para sites que querem aparecer em sistemas de IA, ele recomendou manter o nome genérico “sitemap.xml” ou investir em feeds RSS.

De acordo com o protocolo de sitemaps, a linha “Sitemap” dentro do robots.txt é independente da linha de user-agent, o que significa que ela não está amarrada às regras de um crawler específico. Mueller também observou que feeds costumam ser mais fáceis de localizar, já que normalmente aparecem vinculados no cabeçalho HTML da página.

Llms.txt pode substituir o sitemap?

Não, segundo Mueller. Questionado se o arquivo llms.txt poderia fazer esse papel, ele comparou o documento em Markdown a um sitemap em HTML e afirmou que os sistemas do Google não conseguem utilizá-lo como sitemap, já que falta a ele o formato rígido exigido.

“Acho que a expectativa é maior do que a realidade”, declarou Mueller, admitindo que sistemas de busca podem, no futuro, passar a ler arquivos Markdown. “Atualmente, nada disso acontece”, completou. Ele disse não ter problema com sites que queiram testar o recurso, mas não recomenda depender dele.

Em agosto, Mueller já havia dito que os únicos crawlers capazes de aceitar Markdown em seus sites de teste eram ferramentas de SEO, não sistemas de busca ou de IA propriamente ditos.

Por que um sitemap válido aparece como “não foi possível buscar”?

Splitt encerrou a conversa perguntando por que o Search Console às vezes reporta “não foi possível buscar” (couldn’t fetch) mesmo para um sitemap válido, público e corretamente vinculado no robots.txt.

Mueller apontou dois motivos. O primeiro é a sobrecarga do host: os sistemas do Google podem estar ocupados demais para buscar o sitemap naquele momento, e o Search Console classifica isso como falha de busca também. O segundo é a demanda de rastreamento, que pode levar o Google a simplesmente pular o sitemap quando entende que não há necessidade de rastrear muito mais conteúdo daquele site.

“E a demanda de rastreamento, com muita frequência, está baseada na qualidade percebida de um site”, afirmou Mueller, acrescentando que “não é uma questão puramente técnica”. Em fevereiro, ele já havia dito a um usuário do Reddit que o Google não usa um sitemap quando não está convencido de que existe conteúdo novo e relevante para indexar.

A própria página de ajuda do relatório de sitemaps do Search Console lista a baixa demanda de rastreamento entre as razões para a falha de busca, e afirma que conteúdo melhor gera mais demanda de rastreamento. Outras causas citadas incluem bloqueios no robots.txt, ações manuais não resolvidas e URLs incorretas.

Por que isso importa

Um sitemap com nome incomum e sem entrada no robots.txt fica invisível para qualquer sistema ao qual não tenha sido enviado diretamente, segundo Mueller. E crawlers de treinamento de IA, via de regra, não oferecem meio algum de receber esse envio. Por isso, a recomendação de manter um nome padrão de sitemap ou investir em RSS ganha peso para quem quer que seu conteúdo alimente ferramentas de inteligência artificial. Já no caso do “não foi possível buscar”, os dois motivos descritos por Mueller, sobrecarga do host e demanda de rastreamento, estão fora do controle direto do próprio arquivo.

Mueller recomendou trabalhar com o que já está documentado hoje, em vez de planejar estratégias em cima do llms.txt. Segundo ele, os registros de servidor foram justamente onde percebeu o acesso dos crawlers de IA aos seus arquivos, e são esse mesmo tipo de registro que qualquer site pode consultar para entender como está sendo rastreado.

Com informações de searchenginejournal.com.

Compartilhe

Leia também

Visibilidade em IA: pesquisa com 9 milhões de prompts derruba mitos de SEO — confira os dados

Visibilidade em IA: pesquisa com 9 milhões de prompts derruba mitos de SEO — confira os dados

Pesquisa com 9 milhões de prompts revela o que realmente aumenta a visibilidade em IA e derruba mitos comuns sobre ...

Checklist de SEO: veja os passos essenciais para otimizar seu site

Veja um checklist de SEO com passos técnicos e de conteúdo para melhorar a visibilidade do site no Google e ...
Rank tracking em risco: Google trava rastreamento de SERPs e agentes de IA pioram a crise

Rank tracking em risco: Google trava rastreamento de SERPs e agentes de IA pioram a crise

Google dificulta o rank tracking e o avanço de agentes de IA ameaça ainda mais o rastreamento de rankings nas ...

Aviso de instabilidade temporária

*COMUNICADO IMPORTANTE SOBRE CONECTIVIDADE NESTA TARDE DE 25/05/2026 ✅*
Parte da rede nacional está apresentando instabilidades de acesso.
Há equipes em várias esferas já está atuando em conjunto com o data center responsável para identificar a causa e normalizar a conectividade o mais rápido possível.
O ambiente segue sendo monitorado em tempo real e novas atualizações serão disponibilizadas conforme houver avanço na análise.
Neste momento alguns VPS, Dedicados e Hospedagens compartilhadas estão com acesso limitado.

Orçamento

Pergunte a IA sobre a Plustag IA: