Hugging Face Blog · EUA
Seu agente concluiu a tarefa. Ele fará isso de novo?
A avaliação média pode esconder a inconsistência de agentes de IA. No AppWorld, um agente ReAct com GPT-4.1 teve sucesso em 77,4% das execuções, mas passou nas cinco repetições em apenas 53,0% das tarefas, uma diferença de 24,4 pontos percentuais. Para medir esse problema, o Consistency Analyzer reamostra decisões de uma trajetória já registrada, identifica pontos em que pequenas variações podem mudar o caminho e transforma esses diagnósticos em diretrizes reutilizáveis.
Nos testes com 168 tarefas, as diretrizes elevaram o Pass⁵ de 53,0% para 69,0% e o Mean@5 de 77,4% para 81,0%, reduzindo a diferença para 12,0 pontos percentuais sem perda de precisão média. Em tarefas relacionadas, o ganho de Pass⁵ foi de 13,0 pontos percentuais, indicando que as diretrizes podem se aplicar a mais de uma trajetória.
Antes nesta história
Compartilhar esta notícia