The Register · Europa
Marcas d’água em modelos de IA alteram o comportamento de agentes
A Lasso Security avaliou como a marca d’água SynthID-Text, usada para identificar a origem de conteúdos gerados por IA, altera o comportamento de modelos e agentes. Nos testes, a marca d’água reduziu a precisão no uso de ferramentas em seis dos sete modelos analisados, levando agentes a selecionar ferramentas ou argumentos incorretos e a produzir entradas malformadas. O efeito também apareceu nas recusas de solicitações nocivas e foi mais acentuado sob injeção de prompt, quando os modelos ficaram menos propensos a recusar pedidos prejudiciais.
Segundo a empresa, as mudanças ocorrem porque a marca d’água interfere nas escolhas de tokens durante a geração do texto. A Lasso afirmou que avaliações de segurança e exercícios de red teaming devem incluir conteúdo com marca d’água para medir essas diferenças antes da implantação de agentes.
Compartilhar esta notícia