Estamos cientes de um problema que pode afetar o serviço.

Visibilidade em IA: por que a resposta certa desaparece do nada — entenda o motivo

Por: Eduardo Carrega
16/09/2026
16:59h
Visibilidade em IA: por que a resposta certa desaparece do nada — entenda o motivo
Estudos recentes mostram por que a visibilidade em IA pode falhar mesmo quando o modelo sabe a resposta certa. Entenda o motivo por trás disso.
RESUMIR COM:

Desde o final do ano passado, virou quase um hobby aqui na redação acompanhar os papers publicados no arXiv sobre inteligência artificial. É bem interessante cruzar as descobertas de diferentes estudos e tentar entender melhor esse universo ainda meio nebuloso da visibilidade em IA. As perguntas que os pesquisadores fazem são bem mais específicas do que costumamos ver no dia a dia de quem trabalha com busca, mas quando você lê tudo junto, começa a questionar melhor as explicações fáceis que costumam ser dadas por aí.

Um exemplo recente parte de uma situação curiosa: um modelo de linguagem já tinha respondido corretamente a uma pergunta. Só que, depois, uma ferramenta externa devolveu uma informação errada — e o modelo simplesmente aceitou aquilo, abandonando a resposta certa que ele mesmo tinha dado.

É exatamente esse comportamento que o estudo MemToC investiga: o que acontece quando a resposta própria de um modelo entra em conflito com a informação trazida por uma ferramenta externa. Essa ferramenta funciona como uma espécie de fonte extra, parecida com o que ocorre no RAG (recuperação aumentada de geração), fornecendo dados para o modelo usar na resposta final. No caso analisado, os pesquisadores testaram especificamente retornos de ferramentas já executadas.

Quando a resposta certa some sem explicação

Antes de mais nada, os pesquisadores pediram que os modelos respondessem, sem qualquer ferramenta de apoio, às perguntas factuais da melhor forma possível. Depois, repetiram a pergunta — só que agora com retornos controlados de ferramentas. O foco estava nos casos em que um modelo ajustado por instrução (instruction-tuned) tinha acertado a resposta, mas a ferramenta trazia uma informação incorreta.

O resultado chama atenção: entre os quatro modelos testados, a taxa de manutenção da resposta correta variou de 6,5% a 17,1%, considerando os resultados agrupados em três formulações diferentes de instrução. Ou seja, na maioria das vezes, o modelo simplesmente abandonou a resposta certa que ele mesmo tinha dado segundos antes.

Isso torna a explicação “o modelo não sabe” bem fraca, já que ele tinha acabado de responder corretamente. Por outro lado, acertar uma vez também não garante que o modelo aprendeu aquele fato de forma sólida, nem que aquela resposta resistiria a uma informação conflitante.

Agora imagine que tudo o que você vê é a resposta final — e o dado que sumiu é justamente sobre a sua marca. Aparece uma célula vermelha no relatório de visibilidade, e alguém vai precisar explicar isso na próxima reunião com o cliente.

Uma contagem de aparições mostra o que aconteceu nas respostas coletadas. Chamar aquela célula vermelha de “problema de autoridade” exige provas que essa contagem, por si só, não oferece. Convenientemente, essa explicação também costuma sugerir mais um trabalho a ser cobrado.

A resposta mudou — mas o que exatamente mudou junto?

A resposta mudou — mas o que exatamente mudou junto?

Os pesquisadores do MemToC conseguiram comparar a resposta final com a resposta anterior do modelo e com o retorno controlado da ferramenta. Isso permite testar se uma resposta correta sobrevive diante de evidências contraditórias. Numa amostra separada, com 120 respostas a retornos incorretos de ferramentas, cobrindo cinco modelos e os dois tipos de conflito possíveis, nenhuma resposta reconheceu explicitamente a divergência. Vale destacar que esse resultado se limita à amostra analisada — não dá para afirmar que os modelos nunca sinalizam conflitos.

É importante lembrar que esses testes foram controlados, feitos principalmente em modelos de peso aberto com 7 a 9 bilhões de parâmetros. Portanto, os percentuais encontrados não podem ser transportados diretamente para ferramentas como o ChatGPT search ou os AI Overviews do Google.

Esse achado complementa uma questão já discutida antes: a contaminação por recuperação de informação. O MemToC acrescenta uma camada extra ao problema, já que mostra que o modelo pode até saber a resposta certa e, mesmo assim, ceder à informação errada trazida por uma ferramenta.

Talvez a resposta correta seja mais fácil de derrubar quando o modelo aprendeu aquele fato de forma menos consistente. Um aprendizado mais robusto poderia tornar a resposta mais resistente a informações conflitantes. Também é possível que o modelo dê mais peso à resposta da ferramenta simplesmente pela forma como essa informação é apresentada. De qualquer forma, os números de retenção, isolados, não indicam qual dessas explicações é a correta.

Fica então uma pergunta em aberto e bastante útil: será que fortalecer o que o modelo aprende melhora tanto as respostas sem ferramentas quanto a capacidade de manter uma informação correta quando uma ferramenta a contradiz?

O fato “existe”, mas o modelo não confia nele

Um problema de conteúdo insuficiente e um conflito de fontes podem gerar exatamente a mesma ausência de menção num relatório de visibilidade. Por isso, antes de aceitar a próxima recomendação de “criar mais uma página”, vale entender como se chegou à conclusão de que o problema é de conteúdo. Simplesmente contar a ausência de novo não responde essa questão.

Mesmo sem uma fonte concorrente disputando a resposta, o salto de “o modelo ficou em silêncio” para “o modelo não sabe” já é bastante frágil. É exatamente essa lacuna que o estudo Empty Shelves or Lost Keys? investiga, comparando a diferença entre reproduzir um fato com fortes pistas contextuais e responder perguntas sobre ele de forma confiável.

Os autores consideram um fato como “codificado” quando o modelo o reproduz sob uma de duas pistas contextuais fortes. Já o teste de resposta confiável é bem mais rígido: exige acertos em todas as quatro variantes, cobrindo duas formulações e as duas direções possíveis de uma relação factual. Essa diferença nos critérios ajuda a explicar boa parte da lacuna medida — e nenhum dos dois testes examina diretamente os pesos do modelo.

  • GPT-5 e Gemini-3 passam nas provas de codificação em 95-98% dos fatos do benchmark;
  • Mesmo assim, a recuperação confiável continua mais fraca;
  • Fatos raros e perguntas invertidas são os pontos mais problemáticos;
  • O uso de “thinking” recupera uma boa parte das falhas.

Como o estudo usa fatos derivados da Wikipédia, ele não deixa claro com que frequência isso se repete quando o assunto são recomendações de marcas comerciais. Ainda assim, se uma pista útil traz a resposta de volta, chamar o fato de “ausente” é simplificar demais a situação. Além disso, mais aprendizado ainda pode tornar essa resposta mais confiável — e essa hipótese precisaria ser testada antes de virar recomendação de serviço pago.

Perguntar sobre uma marca específica já entrega o nome da marca de bandeja. Já uma pergunta genérica de categoria de compra deixa o sistema por conta própria para produzir esse nome. Não dá para tratar essas duas situações como evidências equivalentes de visibilidade — e esse benchmark não sustenta esse tipo de equivalência.

Abrir o modelo por dentro também não resolve tudo

Abrir o modelo por dentro também não resolve tudo

O estudo From Parameters to Answers analisa o que acontece dentro do modelo durante o processamento. Os pesquisadores fazem perguntas do tipo país-continente e estimam sinais internos associados tanto ao país perguntado quanto ao continente correspondente, removendo ou invertendo partes desses sinais enquanto mantêm os pesos do modelo fixos.

É possível “ler” um sinal antes mesmo que as mudanças feitas nele tenham efeito perceptível na resposta. Em testes com pares de países, a resposta depende menos de um sinal de solicitação compartilhado nas camadas finais, embora o conteúdo medido ainda influencie o resultado. Porém, ao estimar esse sinal de solicitação de outra forma, alterá-lo ainda pode afetar a resposta já nas etapas finais do processamento.

Em resumo, a conclusão depende muito de qual sinal está sendo medido e de como ele é alterado. Não existe, portanto, um diagrama universal de como cada modelo busca um fato na memória. Ou seja, um slide que rotula seu problema como “falha de recall” também precisaria vir acompanhado de provas próprias.

Mesmo com acesso direto à computação interna do modelo, os pesquisadores ainda precisam separar o que conseguem detectar do que realmente conseguem comprovar que afeta a resposta final. Compare isso com o simples diagnóstico de “faltou o nome da marca” feito apenas a partir da resposta — usar vocabulário técnico no slide não substitui o experimento que falta ser feito.

Nenhum desses três estudos mede exatamente a mesma coisa: o MemToC testa reações a evidências conflitantes trazidas por ferramentas; o Empty Shelves compara reprodução fortemente induzida com resposta confiável; e o From Parameters intervém diretamente nas ativações internas do modelo. Juntar tudo isso num funil bonitinho de causa e efeito criaria um modelo que nenhum desses papers de fato testou.

No fim das contas, o gráfico pode até estar certo

Uma empresa tem toda a razão em se preocupar se compradores estão encontrando seu nome nas respostas de IA, independentemente de qual seja a explicação técnica por trás disso. O ponto principal aqui não é descartar os relatórios de visibilidade, e sim desconfiar das explicações rápidas demais que costumam vir junto com eles — principalmente quando essas explicações já vêm com uma proposta de serviço anexada.

Com informações de searchenginejournal.com.

Compartilhe

Leia também

Indexação no Google: veja quanto tempo cada etapa pode levar

Indexação no Google: veja quanto tempo cada etapa pode levar

Google revela faixas de tempo para indexação no Google, rastreamento, mudança de domínio e recuperação após core update. Veja prazos ...
Superinteligência: Musk vai renomear unidade de IA da SpaceX após pressão de Trump

Superinteligência: Musk vai renomear unidade de IA da SpaceX após pressão de Trump

Musk confirma que vai trocar nome de unidade de IA da SpaceX para SpaceXSI, adotando o termo superinteligência defendido por ...
Autorregulação de IA: por que só funciona com fiscalização independente

Autorregulação de IA: por que só funciona com fiscalização independente

Entenda por que a autorregulação de IA discutida na Casa Branca é considerada frágil e o que o modelo da ...

Aviso de instabilidade temporária

*COMUNICADO IMPORTANTE SOBRE CONECTIVIDADE NESTA TARDE DE 25/05/2026 ✅*
Parte da rede nacional está apresentando instabilidades de acesso.
Há equipes em várias esferas já está atuando em conjunto com o data center responsável para identificar a causa e normalizar a conectividade o mais rápido possível.
O ambiente segue sendo monitorado em tempo real e novas atualizações serão disponibilizadas conforme houver avanço na análise.
Neste momento alguns VPS, Dedicados e Hospedagens compartilhadas estão com acesso limitado.

Orçamento

Pergunte a IA sobre a Plustag IA: