Google lanza modelos avanzados de texto a voz para la creación de voces personalizadas
Google ha presentado dos nuevos modelos de texto a voz, Gemini 3.8 Flash TTS y Gemini 3.8 Flash-Lite TTS, diseñados para ofrecer a creadores y desarrolladores capacidades de generación de voz altamente expresivas y personalizables. Estos modelos permiten la creación de voces realistas con un control preciso sobre los acentos, el tono emocional y la entrega del diálogo, y admiten más de 100 idiomas. Los modelos forman parte de la familia de audio de Gemini de Google, siguiendo lanzamientos anteriores como 3.5 Live Translate y 3.5 Transcribe.
Gemini 3.8 Flash TTS ha logrado el primer puesto en el índice de diseño de voz de Hume AI y lidera en el modelado de acentos, mientras que Flash-Lite TTS ocupa el segundo puesto en el índice de calidad general. Ambos modelos se están poniendo a disposición hoy y se han integrado en plataformas como Google AI Studio, Gemini Notebook y Google Vids. Google enfatiza las medidas de seguridad, incluyendo la verificación del consentimiento para la replicación de voz y las marcas de agua SynthID para prevenir la desinformación.
Las nuevas herramientas están siendo adoptadas por socios como Figma, HeyGen y Linguana para mejorar la traducción y la producción de medios localizados. Los desarrolladores ahora pueden crear e implementar experiencias de voz de alto rendimiento utilizando la API de Gemini, con soporte para contenido multilingüe y agentes de voz interactivos.