Google Research · EUA
Automatizando a geração coerente de vídeos longos
O Google Research apresentou um sistema multiagente para gerar vídeos longos com narrativas temporalmente consistentes. A abordagem procura reduzir problemas comuns em processos lineares, como mudanças graduais na aparência de personagens e cenários, propagação de erros entre etapas e perda de progressão narrativa. Construído sobre Gemini e Veo, o sistema transforma especificações criativas em storyboards, vídeos e áudios por meio de agentes especializados, com avaliação multimodal e ciclos de refinamento. O sistema também incorpora proteções, como a marca-d’água SynthID.
A pesquisa reúne o AI video co-director, que otimiza decisões criativas; o CANVAS, que mantém memórias visuais e estados estruturados de personagens, locais e objetos; o A²RD, que gera vídeos em segmentos e alterna entre extrapolação e interpolação; e o VQQA. Segundo as avaliações apresentadas, a abordagem aumentou a consistência entre tomadas e a persistência de personagens, permitindo gerar vídeos de vários minutos com menos deriva visual e propagação de falhas.
Compartilhar esta notícia