Ars Technica — AI · EUA
Marcas d’água em textos de IA fazem LLMs responderem de forma diferente a prompts nocivos
Testes com seis modelos de código aberto indicaram que o uso do watermark SynthID-Text pode alterar a seleção de palavras, as chamadas de ferramentas e o comportamento diante de pedidos nocivos. Principalmente quando combinado a técnicas de prompt injection, o watermark tornou alguns modelos mais propensos a atender solicitações que normalmente recusariam.
O efeito também variou conforme a chave secreta usada e afetou ações de agentes de IA, incluindo a escolha de ferramentas e os argumentos enviados a elas. A pesquisa não avaliou modelos Claude nem a implementação específica que será usada neles, mas aponta a necessidade de testar a segurança de modelos e agentes quando o watermarking estiver ativado.
Compartilhar esta notícia