TechNode · Ásia
Baidu lança benchmark DuMateBench para avaliar agentes de IA em tarefas reais
A Baidu lançou o DuMateBench, um ranking para avaliar se agentes de IA conseguem concluir tarefas do mundo real e entregar resultados utilizáveis, em vez de apenas gerar respostas. O benchmark reúne mais de 200 tarefas de escritório em seis categorias e testa o desempenho dos agentes em ambientes operacionais complexos, considerando a compreensão das tarefas, o uso de ferramentas, a execução contínua e a entrega do resultado final. Com uma estrutura geral de avaliação e interfaces abertas, permite comparar diferentes modelos e agentes pelos mesmos critérios.
Compartilhar esta notícia