Pulso

Não seja o último a saber.

Capa · Voltar à edição

Hugging Face Blog · EUA

Segurança para quem? Como recusar a parte certa de um tema, não o tema inteiro

Publicado pela fonte em 08/09/2026, 11:23

Um trabalho da Multiverse Computing propõe avaliar a segurança de modelos de linguagem pelos limites entre pedidos nocivos e legítimos dentro de um mesmo tema, em vez de tratar o tema inteiro como perigoso. Usando a persuasão política como caso de teste, os pesquisadores treinaram modelos para recusar pedidos de manipulação direcionada e continuar respondendo a perguntas factuais, com pares de prompts que variam apenas na intenção.

A análise identificou que a geração de dados em uma única tentativa descarta exemplos difíceis e que o ajuste de segurança pode aumentar recusas indevidas. Uma estratégia de novas tentativas reduziu os exemplos abandonados de 19,88% para 0,20%, enquanto dados benignos e pares de prompts ajudaram a reduzir recusas falsas próximas ao limite, de 32,94% para 4,16%. Houve uma queda menor nas recusas de pedidos nocivos, de 91,88% para 87,72%. Os autores defendem que as taxas de recusa de conteúdo nocivo e de recusa excessiva em pedidos legítimos sejam avaliadas juntas.

Compartilhar esta notícia

WhatsApp