Google lança modelos de texto para fala Gemini 3.8 flash e flash-lite para criação de áudio aprimorada
A Google introduziu dois novos modelos de texto para fala, Gemini 3.8 Flash TTS e Gemini 3.8 Flash-Lite TTS, projetados para transformar a geração de voz de configurações estáticas em ferramentas criativas dinâmicas.
Estes modelos permitem que criadores, desenvolvedores e empresas produzam experiências de áudio mais expressivas, aprimorando produtos como o Gemini Notebook e o Google Vids.
A versão Flash TTS é adaptada para design criativo e de personagens aprofundados, permitindo que os usuários gerem vozes personalizadas com prompts de linguagem natural, enquanto o Flash-Lite TTS é otimizado para casos de uso em grande escala e de baixo custo. Ambos os modelos oferecem controle fino sobre tom, ritmo e nuances de desempenho.
A versão Flash TTS obteve as melhores pontuações nos benchmarks da Hume AI, superando a concorrência em modelagem de sotaques e qualidade geral. Os recursos de replicação de voz incluem marcas d'água SynthID e credenciais C2PA para garantir a transparência e proteger os talentos de voz.
Os desenvolvedores agora podem acessar estas ferramentas através do Google AI Studio, com acesso empresarial em breve através das APIs Gemini Enterprise.