The Register · Europa
Novo modelo da DeepSeek mostra como criar LLMs potentes que rodam com eficiência
A DeepSeek lançou o V4.1 Flash, um modelo com 763 bilhões de parâmetros que, apesar do tamanho, exige menos memória para operar. Mudanças nos mecanismos de atenção, um novo codificador-decodificador causal e a redução do consumo de cache KV para entre 13% e 25% do necessário na versão anterior permitem atender de quatro a oito vezes mais usuários no mesmo espaço de cache.
O modelo inclui 196 bilhões de parâmetros N-gram, usados como módulo de memória condicional. Esses parâmetros funcionam como tabelas de consulta que recuperam informações relevantes sem precisar ser lidos integralmente a cada token e podem ser armazenados na memória do sistema. Com isso, a exigência mínima estimada de memória de GPU cai de 763 GB para cerca de 567 GB. A abordagem também aparece em modelos do Google e da Alibaba, que indicou que ela servirá de base para a próxima geração do Qwen.
Antes nesta história
Compartilhar esta notícia