BookinglyTech News
Inteligencia artificial

Google lanza Flash TTS y Flash-Lite, modelos de voz que se diseñan con texto

Los dos nuevos modelos de Gemini cubren más de 100 idiomas, admiten indicaciones por línea de diálogo y se facturan por token de audio, con una hora de voz desde 0,54 dólares.

4 min de lecturaThe Decoder0 vistas

Google ha presentado Gemini 3.8 Flash TTS y Gemini 3.8 Flash-Lite TTS, dos modelos de síntesis de voz. El primero permite diseñar voces desde cero a partir de una descripción de texto; los dos cubren más de 100 idiomas y aceptan indicaciones de escena para cada línea de diálogo. La compañía ya los está desplegando a través de la Gemini API y Google AI Studio.

Voces a la carta

Flash TTS apunta a proyectos creativos: personajes de videojuego, audiolibros, pódcast. Flash-Lite prioriza el coste bajo a escala para doblaje, contenido de audio y agentes de voz. Con el primero, un prompt define el papel de la voz, su acento y sus rasgos vocales a lo largo de idiomas y dialectos. Quien no quiera partir de cero tiene una biblioteca de más de 2.000 voces predefinidas con variantes regionales: español mexicano, francés de Quebec, inglés escocés. También hay clonación a partir de una muestra de 30 segundos, con una condición: la persona clonada debe grabar una declaración de consentimiento y su voz en esa grabación tiene que coincidir con la muestra. Todo clip que generan los modelos de audio lleva marca de agua inaudible SynthID, según Google.

La compañía anunció además "Voice Remixing", para retocar timbre, tono, tempo y acento de las voces de la biblioteca. Todavía no está disponible.

El control del guion

Ambos modelos aceptan directrices por línea o las interpretan por su cuenta. Según Google, aguantan horas de audio con poca "deriva de hablante", es decir, la voz apenas cambia con el tiempo. Hay modo de dos voces que mantiene separados los interlocutores de un mismo guion, y se pueden escribir risas, suspiros y sonidos como "mhm" para colocar reacciones y pausas donde uno quiera.

En un par de pruebas con una voz predefinida y este prompt de estilo, el control de estilo produjo un acento y una entonación convincentes, pero en las dos apareció un silbido agudo de fondo en algunos tramos y en una de ellas la voz cambió al final del clip:

A native German man from Berlin speaking English as a foreign language, with a thick, unmistakable German accent. He is clearly not a native English speaker: he pronounces English words the German way, applying German rhythm and intonation to English sentences. "Th" becomes "z" or "d" ("ze," "sink," "dat"), "w" becomes "v" ("vat," "vell"), and final consonants become harder ("goot," "bat" for "bad"). The "r" is guttural and throaty, never the English "r." Vowels are flat and short, lacking the softness found in American or British English. The voice is nasal and slightly strained, in the mid-range, with a raspy quiver and a Kermit-like wobble, but grittier and less puppet-like. It sounds like a tired Berliner at 2 a.m. Delivery: quick, clipped, choppy. He hesitates briefly when searching for an English word and sometimes inserts the German word flatly without translating it. Occasional exasperated upward pitch breaks. Dry, sardonic, unimpressed, and slightly annoyed that he has to explain anything at all—and even more annoyed that he has to do it in English.

Precio y despliegue

Flash TTS también está en Gemini Notebook y Flash-Lite en Google Vids. El acceso a través de la Gemini Enterprise API llegará después, según la compañía. Agora, LiveKit, Pipecat y Vercel ya permiten la integración mediante la Gemini API.

El precio va en dólares por millón de tokens, con el texto de entrada facturado aparte del audio de salida. Hasta finales de 2026: 0,50 dólares de entrada y 9 de salida en Flash TTS; 0,50 y 6 en Flash-Lite. Desde el 1 de enero de 2027 suben a 1 y 18, y a 1 y 12. Un segundo de audio equivale a 25 tokens, así que una hora son 90.000 tokens: 0,81 dólares con Flash TTS y 0,54 con Flash-Lite hasta final de 2026, y 1,62 y 1,08 a partir de 2027.

Google dice que los datos del nivel gratuito se usan para mejorar sus productos y los del nivel de pago no, y que sus modelos lideran la mayoría de categorías del benchmark de texto a voz de Hume AI. Es una cifra suya, sin medición independiente. Tampoco ha publicado endpoints regionales, aunque modelos TTS anteriores sí ofrecían procesamiento de datos en la UE. Falta por ver cómo se comporta la clonación con consentimiento en producción y cuándo llega Voice Remixing.