Hugging Face Blog · EUA
Quantization-Aware Healing: modelo comprimido de 4 bits supera versão de precisão total
A técnica Quantization-Aware Healing (QAH) foi aplicada a um modelo GPT-OSS 120B comprimido para 60 bilhões de parâmetros e quantizado para MXFP4. O modelo de 4 bits superou sua versão recuperada em bfloat16 em 7 de 9 benchmarks, com ganhos especialmente em raciocínio de contexto longo e matemática. Também usa cerca de quatro vezes menos memória para os pesos e aproximadamente metade do processamento por token em relação ao modelo de 120B.
Em uma comparação com quantization-aware training (QAT), o QAH atingiu desempenho máximo em cerca de 100 passos, contra 700 do QAT, e manteve resultados estáveis durante o treinamento. O QAT, por outro lado, perdeu quase 19 pontos após ultrapassar seu pico. A abordagem destila diretamente do modelo original, anterior à compressão, usando a distribuição de saída do professor em vez de rótulos rígidos ou do checkpoint recuperado.
Compartilhar esta notícia