← Inteligencia artificial

NOVEDADES + GUÍA PRÁCTICA

Google presenta Gemini 3.8 Flash TTS y Flash-Lite TTS para generación de voz hiperrealista

Google ha introducido en su familia Gemini dos nuevos modelos de texto a voz orientados a creadores, desarrolladores y empresas, permitiendo diseñar identidades vocales desde cero o replicarlas mediante lenguaje natural con estrictas medidas de seguridad.

· 1 min · Redacción Punto y Polémica

Qué cambia con Gemini 3.8 Flash TTS

La compañía ha presentado Gemini 3.8 Flash TTS y Gemini 3.8 Flash-Lite TTS como herramientas destinadas a transformar la generación de voz estática en un estudio creativo dinámico. Estos modelos permiten crear identidades vocales originales y controlar la entrega de líneas de diálogo mediante instrucciones en lenguaje natural.

Entre sus funciones destacan la dirección de interpretaciones línea por línea, la compatibilidad con más de 100 idiomas y la capacidad de replicar perfiles vocales a partir de muestras de audio, incorporando salvaguardas como la verificación de consentimiento y marcas de agua SynthID.

Por qué importa para creadores y desarrolladores

Estas herramientas interesan a quienes desarrollan audiolibros, videojuegos, podcasts y agentes de voz interactivos, ya que optimizan la expresividad y el modelado de acentos regionales. Según los datos difundidos, los modelos buscan ofrecer un rendimiento fiable tanto en opciones orientadas a la creatividad profunda como en alternativas optimizadas para la escala y la eficiencia de costes.

Pruébalo paso a paso

Mini tutorial

Los desarrolladores pueden explorar las nuevas capacidades de generación de voz en Google AI Studio y mediante la API de Gemini. La función de replicación de voz no está disponible en Illinois, Texas, Espacio Económico Europeo, Reino Unido, Suiza e India.

  1. Abrir la fuente oficial en el blog de Google para consultar los detalles del anuncio y los enlaces a Google AI Studio.
  2. Identificar los requisitos y el estado de disponibilidad de las herramientas según la región y las políticas de la plataforma.
  3. Explorar la interfaz oficial para conocer las opciones documentadas de diseño y replicación de voz con lenguaje natural.

Fuentes y documentación