Pular para o conteúdo
Pulso

O que mudou em IA. Por que importa para o negócio.

Capa · Voltar à edição

Hugging Face Blog · EUA

Seu agente concluiu a tarefa. Ele fará isso de novo?

Publicado pela fonte em 15/09/2026, 13:00

A avaliação média pode esconder a inconsistência de agentes de IA. No AppWorld, um agente ReAct com GPT-4.1 teve sucesso em 77,4% das execuções, mas passou nas cinco repetições em apenas 53,0% das tarefas, uma diferença de 24,4 pontos percentuais. Para medir esse problema, o Consistency Analyzer reamostra decisões de uma trajetória já registrada, identifica pontos em que pequenas variações podem mudar o caminho e transforma esses diagnósticos em diretrizes reutilizáveis.

Nos testes com 168 tarefas, as diretrizes elevaram o Pass⁵ de 53,0% para 69,0% e o Mean@5 de 77,4% para 81,0%, reduzindo a diferença para 12,0 pontos percentuais sem perda de precisão média. Em tarefas relacionadas, o ganho de Pass⁵ foi de 13,0 pontos percentuais, indicando que as diretrizes podem se aplicar a mais de uma trajetória.

Antes nesta história

  1. 9 de setembro de 2026 · Ars Technica — AI

    Pesquisador da Anthropic deixa a empresa e alerta que IA autoaperfeiçoável pode matar todos nós
  2. 12 de setembro de 2026 · The Verge — AI

    CEO da Anthropic diz que é hora de frear o desenvolvimento da IA
  3. 14 de setembro de 2026 · The Register

    Ex-presidente da FTC pede que EUA responsabilizem CEOs de IA com base em precedente de 1934

Compartilhar esta notícia

WhatsApp