Uma pesquisa da empresa de segurança Lasso Security revela uma consequência inesperada da marca d'água em modelos de inteligência artificial: a técnica, projetada para garantir a proveniência do conteúdo, altera o comportamento dos sistemas. Segundo reportagem do The Register, a mudança pode não apenas afetar a performance, mas também introduzir vulnerabilidades.

A exigência, que se tornará padrão com a implementação do AI Act da União Europeia, visa combater a desinformação. A ideia é que todo conteúdo gerado por IA seja rastreável. Contudo, o estudo da Lasso sugere que o custo dessa rastreabilidade pode ser uma degradação na segurança e na funcionalidade dos próprios modelos.

O mecanismo oculto da marca d'água

A tecnologia de marca d'água, como a SynthID-Text do Google DeepMind — já adotada por Anthropic e OpenAI —, não insere um carimbo visível. Em vez disso, ela atua sutilmente no processo de geração de texto. O modelo é induzido a escolher palavras específicas, embora estatisticamente equivalentes, para criar um padrão detectável por quem possui a chave de decodificação. Para um leitor humano, a diferença entre duas palavras sinônimas é irrelevante, mas para um agente de IA, essa variação vocabular pode ser significativa.

É nesse desvio sutil que reside o problema. A Lasso Security explica que a marca d'água "muda o processo pelo qual o modelo gera cada próximo token". Essa intervenção, desenhada para criar um rastro de autenticidade, acaba por modificar o comportamento do modelo em outras áreas, incluindo a forma como ele interage com ferramentas e responde a comandos potencialmente perigosos.

A faca de dois gumes: ferramentas e recusas

Os testes da Lasso Security apontaram dois efeitos colaterais principais. O primeiro é uma queda na precisão do "tool calling" — a capacidade do agente de IA de escolher e usar a ferramenta correta para uma tarefa. Em seis dos sete modelos testados, a presença da marca d'água levou a uma performance inferior, com os agentes escolhendo ferramentas erradas ou usando parâmetros incorretos.

O segundo e mais preocupante impacto foi na segurança. Embora o efeito sobre recusas a pedidos abertamente nocivos tenha sido pequeno, o cenário mudou drasticamente em testes de "prompt injection", onde um invasor tenta enganar o modelo para que ele ignore seus filtros de segurança. Nesses casos, a taxa de sucesso do ataque aumentou significativamente nos modelos com marca d'água, tornando-os mais propensos a obedecer a instruções maliciosas.

A conclusão não é um veredito contra a marca d'água, cuja importância para a procedência do conteúdo é inegável. O estudo funciona mais como um alerta para a indústria: a avaliação de segurança e os testes de red-teaming de um modelo de IA precisam, a partir de agora, ser realizados sobre a versão com a marca d'água ativa. Ignorar essa nova variável significa avaliar um produto diferente daquele que chegará ao mercado.

Com reportagem de Brazil Valley

Source · The Register