Hugging Face Blog · EUA
BenchMIRT: o que os benchmarks de LLM realmente medem?
O BenchMIRT é um método para auditar benchmarks de modelos de linguagem no nível de cada pergunta ou tarefa. Treinado com resultados de 100 modelos em 16 benchmarks e mais de 34 mil questões, o sistema identificou de forma independente duas dimensões predominantes: segurança e raciocínio geral. A análise mostrou que alguns benchmarks combinam sinais diferentes: o BBQ se associou mais ao raciocínio geral do que à segurança; o WMDP também teve relação mais forte com raciocínio geral; e diferentes grupos de questões do HarmBench mediram capacidades distintas.
A ferramenta também estima a dificuldade e o poder de discriminação de cada questão, permitindo selecionar conjuntos menores que preservam uma leitura semelhante das capacidades dos modelos. Com 10% das questões, os resultados geralmente mantiveram quase o mesmo quadro do conjunto completo, enquanto 50% frequentemente se aproximou ainda mais da medida original. O BenchMIRT previu corretamente 79% das respostas em questões não observadas, contra 70% de uma abordagem baseada no desempenho médio do modelo.
Compartilhar esta notícia