Uma pesquisa acadêmica identificou uma falha de arquitetura fundamental nos modelos de linguagem (LLMs) de gigantes como OpenAI, Google e Anthropic. A vulnerabilidade permite o roubo do “raciocínio” passo a passo — conhecido como chain-of-thought — que as empresas tentam proteger como um valioso segredo industrial.

O ataque explora uma prática comum: para manter o contexto de uma conversa, o processo de raciocínio do modelo é encapsulado em um bloco de texto criptografado, enviado ao usuário e devolvido a cada nova interação. A tese aqui é que a conveniência operacional criou um vetor de ataque sistêmico, transformando uma medida de segurança em um calcanhar de Aquiles.

O elo mais fraco da corrente

A vulnerabilidade reside na interoperabilidade desses blocos criptografados. Pesquisadores descobriram que um bloco gerado por um modelo de ponta, como o GPT-4, pode ser inserido em uma sessão com um modelo inferior da mesma empresa, como o GPT-3.5. O modelo mais fraco, com menos salvaguardas de segurança, simplesmente decodifica e exibe o conteúdo do bloco em texto puro.

Na prática, é uma forma de ataque de escalonamento de privilégios. Um adversário não precisa quebrar as defesas do modelo mais sofisticado; ele apenas usa um modelo menos protegido como uma chave-mestra para decifrar os segredos do seu “irmão mais velho”. Isso contorna diretamente as medidas de anti-distilação, projetadas para impedir que concorrentes copiem a lógica interna que define a performance de um modelo proprietário.

De segredos industriais a dados pessoais

As implicações vão além da espionagem corporativa. O estudo detalha quatro vetores de ataque, com destaque para a extração de dados em larga escala. Ao analisar mais de 315 mil blocos de raciocínio compartilhados publicamente por desenvolvedores em repositórios de código — que não sabiam o que havia dentro dos textos criptografados —, os pesquisadores recuperaram 367 dados de identificação pessoal (PII) e 182 credenciais de acesso.

A falha também pode revelar informações perigosas que foram filtradas da resposta final do modelo, mas que permaneceram no seu processo de raciocínio. Adicionalmente, abre portas para ataques de prompt injection invisíveis, onde comandos maliciosos são embutidos nos blocos criptografados, envenenando o comportamento de agentes de IA de forma oculta.

Após a divulgação responsável aos provedores, espera-se que mitigações criptográficas e sistêmicas sejam implementadas. Ainda assim, o episódio serve como um lembrete de que, na corrida para desenvolver IAs cada vez mais capazes, a segurança fundamental da arquitetura pode se tornar uma vítima silenciosa da inovação.

Com reportagem de Brazil Valley

Source · Schneier on Security