Hugging Face Blog · EUA
LLMs Granite 4.2: como foram desenvolvidos
A Granite 4.2 é uma família de modelos de linguagem densos, decoder-only, voltados ao raciocínio, lançada em três tamanhos: 3B, 8B e 30B. Os modelos são pré-treinados do zero com aproximadamente 15 trilhões de tokens, em uma estratégia de cinco fases que amplia a janela de contexto para 512 mil tokens. Depois, passam por ajuste fino supervisionado com dados de raciocínio, seguimento de instruções e uso de ferramentas. Todos têm modos de pensamento e não pensamento, uma opção de raciocínio de baixo esforço e suporte nativo a chamadas de ferramentas, sob a licença Apache 2.0.
O pós-treinamento usa uma sequência de etapas de aprendizado por reforço voltadas a matemática, código, ciência, instruções, ferramentas e saídas estruturadas. Os modelos de 8B e 30B também passam por aprendizado por reforço agentivo para software, terminal e busca na web em ambientes sandbox. O modelo de 30B recebe ainda uma segunda fase de ajuste fino focada em programação agentiva. Cada etapa de reforço começa a partir do checkpoint da anterior, e todos os modelos terminam com RLHF.
Compartilhar esta notícia