Canaltech · Brasil
Gemini agora clona sua voz em 30 segundos e atua com risos e sussurros
O Google anunciou os modelos Gemini 3.8 Flash TTS e Gemini 3.8 Flash-Lite TTS, voltados à geração de voz por inteligência artificial. As ferramentas podem reproduzir uma voz existente a partir de uma amostra de 30 segundos, criar vozes personalizadas ou do zero e interpretar instruções de atuação, incluindo risadas, sussurros, suspiros e interjeições. O Flash TTS também encena diálogos entre duas vozes e busca manter timbre e tom em áudios longos. Já o Flash-Lite TTS é voltado à dublagem e à localização em mais de 100 idiomas e dialetos, incluindo o português brasileiro.
Os dois modelos oferecem mais de 2.000 vozes prontas, exigem consentimento verbal para reproduzir uma voz existente e adicionam SynthID e credenciais C2PA aos áudios gerados. A clonagem de voz pelo Google AI Studio tem restrições regionais. Os modelos estão disponíveis na Gemini API e no Google AI Studio, com integração prevista ao Gemini Notebook e ao Google Vids.
Compartilhar esta notícia