BookinglyTech News
Inteligencia artificial

Google abre Gemini 3.8 TTS a desarrolladores con playground y más de 2.000 voces

El nuevo playground permite usar la API de texto a voz de Gemini 3.8 con claves propias y crear voces personalizadas en 30 segundos.

2 min de lecturaSimon Willison0 vistas

Google ha puesto a disposición dos modelos de texto‑a‑voz en la versión 3.8 de Gemini: gemini-3.8-flash-tts y gemini-3.8-flash-lite-tts. Ambos aparecen en el Gemini 3.8 TTS Playground de Simon Willison, una interfaz web que permite probar la API con una clave propia, generar narraciones monovoz o conversaciones con varios interlocutores y compartir la configuración mediante URLs marcables.

El playground soporta más de 2.000 voces predefinidas y, según Google, permite crear una voz personalizada a partir de una muestra de 30 segundos. La herramienta está construida sobre la política CORS abierta de la API, lo que facilita su integración en entornos de desarrollo sin necesidad de proxy.

Una característica destacada es la capacidad de definir diálogos multi‑personaje, asignando a cada personaje una voz distinta y estilos de entonación. En la publicación de Willison se incluye una demo de dos pelícanos discutiendo sobre el muelle Pacifica, cuyo guion fue generado por Claude 4.5 Opus y renderizado con el propio playground.

En pruebas internas, generar 1 min 18 s de audio con el modelo flash‑tts (no la versión lite) tomó alrededor de 20 segundos y costó 2,74 céntimos de dólar. La versión flash‑lite es más barata pero produce audio de menor calidad, lo que ofrece a los equipos la opción de equilibrar coste y fidelidad según el caso de uso.

Para los equipos de infraestructura y devops, la disponibilidad de URLs compartibles simplifica la automatización de pipelines que requieran síntesis de voz, por ejemplo en generación de contenidos dinámicos o en pruebas de asistentes conversacionales. Además, al poder usar la clave de la propia cuenta de Gemini, el control de facturación y cuotas se mantiene en la nube del cliente.

Queda por ver cómo evoluciona la adopción de estas voces personalizadas en entornos empresariales y si la política de uso de datos de voz (requiriendo derechos sobre la muestra) limitará su despliegue en productos de consumo masivo.