TechNode · Ásia
Xiaomi transmite ao vivo treinamentos de reinforcement learning do MiMo-V2.6
A equipe MiMo, da Xiaomi, transmite em um painel público o treinamento por reinforcement learning de dois modelos ainda não lançados: MiMo-V2.6-Pro e MiMo-V2.6-Flash. A página exibe métricas dos logs de treinamento, como curvas de recompensa, número de rollouts, tempo por etapa e custos computacionais acumulados, além do desempenho dos modelos em programação e de outros resultados de avaliação durante os testes.
A Xiaomi ainda não liberou os modelos para uso público nem anunciou especificações finais, preços ou uma API. Segundo Luo Fuli, chefe da MiMo, a equipe passou quase seis meses estudando até onde o reinforcement learning poderia avançar após o lançamento do MiMo-V2.5. O painel informa que a série MiMo-V2.6 está “chegando em breve”.
Compartilhar esta notícia