TechCrunch — AI · EUA
Pesquisador da Anthropic mostra sistema de IA capaz de melhorar sozinho
A Anthropic publicou um estudo sobre sistemas de IA capazes de melhorar o desempenho de um modelo em benchmarks de alinhamento. Testado em 10 benchmarks de comportamentos desalinhados, o sistema melhorou o desempenho em todos eles sem reduzir o desempenho geral. O método busca literatura, propõe uma abordagem e treina o modelo por 30 minutos em várias iterações, preservando estratégias eficazes e descartando as ineficazes.
O estudo apresenta os resultados como evidência inicial de que o pós-treinamento automatizado de alinhamento pode se tornar viável no curto prazo. O sistema superou, em média, métodos propostos por pesquisadores humanos experientes em seis horas e teve custo de inferência de cerca de US$ 4 por hora, contra US$ 150 por hora dos pesquisadores humanos. A abordagem depende da qualidade dos benchmarks e ainda exige trabalho para criá-los, mantê-los e ampliar a literatura usada pelos sistemas.
Compartilhar esta notícia