Hugging Face Blog · EUA
Segurança para quem? Como recusar a parte certa de um tema, não o tema inteiro
Um trabalho da Multiverse Computing propõe avaliar a segurança de modelos de linguagem pelos limites entre pedidos nocivos e legítimos dentro de um mesmo tema, em vez de tratar o tema inteiro como perigoso. Usando a persuasão política como caso de teste, os pesquisadores treinaram modelos para recusar pedidos de manipulação direcionada e continuar respondendo a perguntas factuais, com pares de prompts que variam apenas na intenção.
A análise identificou que a geração de dados em uma única tentativa descarta exemplos difíceis e que o ajuste de segurança pode aumentar recusas indevidas. Uma estratégia de novas tentativas reduziu os exemplos abandonados de 19,88% para 0,20%, enquanto dados benignos e pares de prompts ajudaram a reduzir recusas falsas próximas ao limite, de 32,94% para 4,16%. Houve uma queda menor nas recusas de pedidos nocivos, de 91,88% para 87,72%. Os autores defendem que as taxas de recusa de conteúdo nocivo e de recusa excessiva em pedidos legítimos sejam avaliadas juntas.
Compartilhar esta notícia