BookinglyTech News
Inteligencia artificial

Gemini 3.8 Flash TTS permite clonar voces por API con consentimiento verificado

Google abre la creación y réplica de voces en sus dos nuevos modelos de síntesis: dos grabaciones, un ID reutilizable y marcas SynthID y C2PA en el audio generado.

3 min de lecturaThe New Stack0 vistas

Google ha abierto la clonación de voces por API. Los modelos Gemini 3.8 Flash TTS y Flash-Lite TTS ya se pueden usar desde la Gemini API y AI Studio, y la novedad no está en la síntesis: está en que el desarrollador crea la voz en lugar de conformarse con las que ya venían en la biblioteca.

Replicar una voz: dos grabaciones y un consentimiento

Todo pasa por un endpoint nuevo, Voices (POST /v1beta/voices). Google exige dos grabaciones del mismo hablante: una muestra limpia de entre 10 y 30 segundos y un clip aparte en el que la persona lee una declaración confirmando que la voz es suya y que acepta que se genere una versión sintética. La compañía comprueba que quien consiente y quien pone la muestra de referencia son la misma persona antes de continuar. Si la validación pasa, devuelve un ID voice_… que se queda en el proyecto durante un año. Cada proyecto admite hasta 200 voces, y se pueden recuperar, listar o borrar por API como cualquier otro recurso almacenado.

Hay una variante sin guardar nada: con store=False la API devuelve un voicekey_… cifrado que vive en la aplicación y se vuelve a enviar cada vez que hace falta. Caduca a los siete días, así que encaja en trabajos de vida corta.

Dos detalles antes de construir encima. El audio generado lleva marca SynthID, y las voces replicadas incorporan credenciales C2PA para rastrear su origen. Y la función no está disponible en Illinois, Texas, el Espacio Económico Europeo, Reino Unido, Suiza ni India.

Diseñar la voz con una descripción

La otra vía es describir el personaje en lenguaje natural —rol, acento, carácter— y dejar que el modelo lo construya. Google dice que funciona en más de 100 idiomas y dialectos; la documentación lista 130 idiomas para Flash TTS y 101 para Flash-Lite. El anuncio habla de más de 2.000 voces listas para producción, aunque los documentos describen 30 voces de estudio predefinidas más una biblioteca ampliada que se filtra por idioma, acento, tono y caso de uso con GET /v1beta/voices. Un modo de remezcla para ajustar timbre, tono, ritmo y acento con prompts figura como próximamente.

El consejo de Google es crear la voz una vez y reutilizar su ID en lugar de describir el mismo personaje en cada petición: repetir descripciones largas es, según sus documentos, la causa más habitual de deriva de voz.

Ojo con la ruptura de compatibilidad si venías del preview 3.1: ahora el texto de entrada se trata como transcripción literal. Las indicaciones sostenidas (susurrar, sarcasmo, hablar rápido) van en una anotación speech_metadata, y los sonidos puntuales como <sigh>, <cough> o <short pause> se escriben entre ángulos dentro del propio guion. En diálogos de dos hablantes, las reacciones del oyente entre barras, del estilo de |mhm|, generan backchannels y solapamiento sin trocear el guion en más turnos.

La generación nativa de dos hablantes tiene un límite: solo funciona con voces predefinidas. Con voces diseñadas o replicadas hay que ir turno a turno y unir la salida PCM de 24 kHz. Las peticiones unarias devuelven WAV; las de streaming, PCM de 16 bits en crudo, con mu-law y A-law disponibles para pipelines de telefonía.

Ambos modelos comparten esquema de API, así que saltar de uno a otro es cambiar un parámetro. Flash-Lite es el reemplazo directo de gemini-3.1-flash-tts-preview y apunta a producción por volumen, lectura en voz alta y agentes en cascada.

Para el resto de la pila —transporte, reconocimiento de voz, detección de turno, interrupciones y estado de sesión— Google señala a Agora, LiveKit, Pipecat y el AI Gateway de Vercel como plataformas que ya integran la generación de voz de Gemini.

Lo que cambia de fondo es que la identidad de voz deja de ser algo que se configura a mano y pasa a ser un recurso más del proyecto, con cuota, caducidad y borrado. Quien tenga agentes de voz en producción tendrá que elegir entre guardar el ID durante un año o rotar claves de siete días, y comprobar que su framework propaga correctamente esos identificadores personalizados.