BookinglyTech News
Inteligencia artificial

Google lanza Gemini 3.8 Flash TTS: voces a medida en más de 100 idiomas

Dos modelos de texto a voz de la familia Gemini Audio llegan a AI Studio, la API de Gemini y Gemini Vids. El mayor promete diseño de voz desde un prompt y clonación con 30 segundos de audio.

2 min de lectura4 fuentes contrastadas0 vistas

Google ha presentado dos modelos de texto a voz dentro de la familia Gemini Audio: Gemini 3.8 Flash TTS y Gemini 3.8 Flash-Lite TTS. Ambos están disponibles desde hoy en Google AI Studio, la API de Gemini, Gemini Enterprise, Gemini Notebook y Google Vids, y el primero se coloca en cabeza del benchmark de diseño de voz de Hume AI con 71,4 puntos.

Voces a medida desde un prompt

La idea es pasar del catálogo de presets fijos a un estudio vocal. Con 3.8 Flash TTS se describe una voz en lenguaje natural —rol, acento, características— y se genera desde cero en más de 100 idiomas y dialectos, con variantes regionales como español de México, francés de Quebec o escocés. Google habla de más de 2.000 voces listas para producción, frente a las 30 originales de la generación anterior.

También hay replicación de voz: basta una muestra de 30 segundos de audio propio, o de alguien cuyos derechos se tengan, para reconstruir un perfil vocal consistente. El sistema exige una grabación de consentimiento verbal del dueño de la voz antes de crearla, y toda salida lleva marca de agua SynthID y credenciales C2PA.

Para quien dirige el audio, los dos modelos permiten escribir indicaciones por línea, mantener el timbre a lo largo de horas de contenido —podcasts y audiolibros— y montar conversaciones de dos hablantes desde un único guion. Se admiten señales no verbales dentro del propio texto, como , o , y respuestas de escucha activa. Más adelante llegará una función de remezcla para ajustar timbre, tono, ritmo y acento sobre cualquier voz del catálogo.

Flash-Lite apunta a lo contrario: volumen alto y coste bajo, pensado para doblaje masivo y agentes de voz con control fino sobre tono y ritmo.

Dónde está el interés real

Los números son de Google. Primer y segundo puesto en el índice de calidad global de Hume AI, cabeza en modelado de acento con 60,8, y buenos resultados en evaluaciones ciegas de preferencia humana en japonés, portugués de Brasil, vietnamita, árabe estándar moderno, español de México e hindi. Son mejoras medibles frente a Gemini 3.1 Flash TTS, pero el benchmark lo firma un tercero y las cifras las elige quien lanza el producto.

Lo relevante para quien integra es que el modelo entra en el mismo circuito que ya usan Agora, LiveKit, Pipecat o la pasarela de Vercel para sus capas de voz, así que la decisión no va solo de calidad: va de qué proveedor de TTS encaja en un pipeline de agentes y a qué precio por minuto. La documentación de generación de voz y la plataforma de agentes de Gemini Enterprise ya recogen los detalles de uso y los límites de cada modelo.