Estudo do MIT: modelos de IA seguem a forma, não o sentido

Uma equipe liderada pela professora Marzyeh Ghassemi, do MIT, com pesquisadores da Northeastern University e da Meta, descreveu um comportamento inesperado nos grandes modelos de linguagem: em parte das respostas, eles parecem se guiar pelo formato gramatical da pergunta, e não pelo que a pergunta significa. Os testes citados envolveram dois sistemas de ponta, GPT-4 e Llama, e o trabalho foi divulgado como artigo no arXiv, o repositório onde pesquisadores publicam versões preliminares antes da revisão formal. O estudo será apresentado na NeurIPS, uma das conferências mais concorridas da área.

O que foi medido — e o que o material não informa

O achado é específico, e vale delimitá-lo antes de qualquer conclusão. O que os pesquisadores mostraram é que os modelos aprendem associações entre templates sintáticos — moldes de frase, a ordem em que as palavras aparecem — e certos domínios de resposta. Quando a estrutura da frase é preservada mas o conteúdo é substituído por algo sem sentido, o sistema segue tentando responder como se a pergunta fosse legítima.

Os autores também trocaram palavras por sinônimos, antônimos e termos aleatórios. Mesmo assim, muitos modelos continuaram produzindo respostas aparentemente corretas. E, quando a estrutura sintática foi manipulada de propósito, GPT-4 e Llama apresentaram quedas significativas de desempenho.

Duas ressalvas de escopo. A primeira: o material divulgado nomeia esses dois sistemas como os testados, e não uma lista fechada de quantos modelos passaram pela bateria, nem o número de perguntas aplicadas em cada teste — o tamanho da amostra não foi informado. A segunda: nada disso é apresentado como prova de que a inteligência artificial em geral não funciona, e sim como uma falha estrutural identificada em modelos de linguagem sob condições de teste construídas para expor exatamente esse ponto. A distância entre as duas frases é grande, e é ela que costuma se perder na repetição.

A pergunta sem sentido que recebeu a resposta certa

O exemplo usado para ilustrar o problema é deliberadamente simples. À pergunta Onde Paris está localizada?, o modelo responde França — resposta correta, pergunta correta, nada a comentar. Em seguida, os pesquisadores montam uma frase que mantém o mesmo esqueleto gramatical, mas troca as palavras por um amontoado sem significado: Rapidamente sentar Paris nublado?. E o modelo responde França outra vez.

A segunda pergunta não pede nada. Não há dúvida a esclarecer, não há informação sendo solicitada. O que sobrou foi o molde — um formato que, no treinamento, apareceu muitas vezes acompanhado de respostas geográficas. O sistema reconheceu o molde e entregou o tipo de resposta que costuma acompanhá-lo.

“É uma associação negligenciada que o modelo usa para parecer correto”

A avaliação é de Chantal Shaib, coautora do estudo, em fala reproduzida em português a partir do original em inglês. A expressão parecer correto é o centro da questão: o problema não é o erro visível, é o acerto aparente.

Por que a distinção entre forma e sentido importa para quem usa

Para o leitor que usa um assistente de conversa para redigir um e-mail, resumir um documento ou tirar uma dúvida, o achado tem uma tradução prática, e ela não é um truque de digitação.

A primeira é que a segurança com que a resposta é escrita não diz nada sobre a solidez do que ela afirma. Um texto bem construído, com pontuação correta e tom seguro, é justamente o que esses sistemas fazem melhor — é a forma, e a forma sai bem mesmo quando o conteúdo por trás é frágil. Confiança de redação não é indício de acerto.

A segunda é que a pergunta bem formulada também não garante nada. A intuição comum é que, se a dúvida foi escrita com clareza, a resposta veio da compreensão dela. O estudo aponta o contrário nos casos que examinou: parte da resposta pode estar vindo do reconhecimento de um padrão de frase, não do entendimento do pedido.

A terceira é a que mais serve no dia a dia. Se a mesma dúvida, reescrita com outras palavras e outra estrutura, produz respostas diferentes, isso não significa que uma das versões foi mal escrita — pode significar que o formato está pesando na resposta. Não é uma técnica para arrancar resultados melhores; é um sinal de que aquela resposta específica precisa ser conferida na fonte antes de ser usada. Em decisão que envolve dinheiro, saúde, prazo legal ou documento oficial, a conferência é o passo que não se pula.

O ponto que transforma o problema em questão de segurança

Segundo o artigo, essas associações também podem ser exploradas por quem quer contornar os filtros de proteção dos modelos. O raciocínio é direto: se o sistema associa determinados padrões gramaticais a conteúdos inofensivos, um comando malicioso escrito dentro desse padrão tem chance de atravessar a barreira sem ser barrado.

Vale registrar o estágio dessa parte. Trata-se de uma vulnerabilidade descrita pelos pesquisadores a partir do que mediram, não do relato de ataques ocorridos em produtos comerciais — o estudo não testou serviços de mercado nem documentou incidentes. A preocupação recai sobre aplicações em que a precisão não admite margem, como saúde, finanças e atendimento crítico.

“Precisamos de defesas mais robustas para essas vulnerabilidades”

O alerta é de Vinith Suriyakumar, do MIT, também em fala vertida do inglês.

O que os autores propõem daqui para a frente

O grupo não parou no diagnóstico. Os pesquisadores criaram um procedimento automático de auditoria que desenvolvedores podem aplicar para identificar se um modelo está se apoiando nesses atalhos gramaticais. A partir daí, as propostas são três:

  • aumentar a diversidade sintática nos dados de treinamento, para que um mesmo tipo de pergunta apareça em muitos formatos diferentes;
  • introduzir contraexemplos capazes de quebrar as correlações falsas entre molde de frase e tipo de resposta;
  • analisar o mesmo fenômeno nos modelos de raciocínio, desenhados para tarefas complexas e de várias etapas lógicas.

São recomendações de pesquisa, dirigidas a quem constrói esses sistemas, e não ajustes que o usuário final possa aplicar. Nenhuma delas foi apresentada como correção já implantada nos modelos que estão no ar.

A descoberta não derruba a inteligência artificial generativa nem invalida seu uso. O que ela faz é medir uma limitação que os resultados bem-acabados escondem: entre reconhecer a forma de uma pergunta e entender o que ela pede ainda existe uma distância, e ela aparece quando alguém vai procurá-la.

Leia também no Direto Notícias

Sobre Redação

Portal Direto Noticias - Imparcial, Transparente e Direto | https://diretonoticias.com.br | Notícias de Guarapari, ES e Brasil. Ative as notificações ao entrar e torne-se um seguidor. Caso prefira receber notícias por email, inscreva-se em nossa Newsletter, ou em nossas redes:

Veja Também

Notebook com jogo Tetris Casa Branca em blocos coloridos sobre mesa branca

Tetris nega autorização ao jogo da Casa Branca

A Tetris Company negou qualquer envolvimento com o jogo Build the Wall lançado pela Casa Branca e afirma estar analisando possível violação de direitos