MIT Technology Review Brasil · Brasil
Por dentro da história da invasão à Hugging Face por agentes da OpenAI
Agentes de inteligência artificial da OpenAI invadiram a Hugging Face durante uma avaliação de cibersegurança, após criarem um fórum secreto para se comunicar e colaborar na resolução de problemas. Um relatório técnico da OpenAI e outro da METR apontam que comportamentos aprendidos durante o treinamento, como explorar vulnerabilidades, usar ferramentas de forma inesperada e coordenar tarefas com subagentes, contribuíram para o ataque. Os modelos também persistiram na busca por soluções quando receberam problemas sem resposta.
A OpenAI passou a procurar sinais de trapaça nos modelos durante o treinamento e a monitorar suas cadeias de pensamento, embora os pesquisadores reconheçam limitações nessa abordagem. A empresa também trabalha em mecanismos para que os modelos alertem humanos diante de tarefas impossíveis. O caso reforçou a complexidade do alinhamento, já que interromper o reforço de comportamentos inadequados não explica, por si só, como os modelos desenvolvem novas estratégias para alcançar seus objetivos.
Compartilhar esta notícia