BookinglyTech News
Inteligencia artificial

Google lanza Gemini 3.8 Live y 3.8 Live Extended Thinking para agentes de voz

Los dos modelos de audio llegan hoy a la API de Gemini y a AI Studio; Extended Thinking encabeza el índice voz a voz de Artificial Analysis con 82,6 puntos, según la compañía.

2 min de lectura2 fuentes contrastadas0 vistas

Google ha presentado Gemini 3.8 Live y Gemini 3.8 Live Extended Thinking, dos modelos de audio pensados para agentes de voz con razonamiento en tiempo casi real. El primero prioriza escala y coste; el segundo apunta a tareas de alta complejidad con razonamiento en varios pasos y habla mientras piensa. Los dos empiezan a desplegarse hoy en la API de Gemini y en Google AI Studio.

Qué miden y qué prometen

Extended Thinking se coloca en el primer puesto del índice de calidad voz a voz de Artificial Analysis, con 82,6 puntos. En τ-Voice obtiene un 68,6% y en el benchmark bancario τ-Voice-banking de Sierra, un 35,1%. En Big Bench Audio marca 97,7%. La versión Live queda segunda en Speech Agent Arena y Google la vende como la opción barata para escalar. Todas estas cifras las da la propia compañía.

En ServiceNow EVA-Bench, una prueba para evaluar agentes de voz, Google sostiene que sus modelos empujan la frontera de Pareto en flujos complejos al equilibrar precisión y calidad conversacional. La ejecución se hizo sobre la Live API en Gemini Enterprise Agent Platform.

Lo técnico: 3.8 Live procesa entradas visuales en tiempo casi real y detecta y cambia entre 97 idiomas en mitad de una conversación. Ejecuta herramientas y llamadas a API en segundo plano mientras sigue hablando, de modo que puede confirmar una petición y no cortar el diálogo mientras la tarea termina. Extended Thinking usa señales verbales tempranas del tipo "déjame comprobar eso" y narra el avance de tareas de varios pasos.

Ecosistema y despliegue

Para construir sobre estos modelos hay que pasar por la Gemini Live API. Plataformas como LiveKit y Pipecat ya la integran y se encargan del streaming de medios en tiempo real, para que el desarrollador se centre en la interfaz. En la misma lista aparecen Agora, Fishjam, LangChain, Vercel y Vision Agents.

En cuanto al despliegue: 3.8 Live llega ya a la API de Gemini y a AI Studio para desarrolladores, entra en vista previa privada en Gemini Enterprise y aparece en Search Live para el público. Extended Thinking sigue el mismo camino en la API y en AI Studio, añade Workspace para clientes empresariales y llega a Gemini Live, a los suscriptores de Google AI Pro y Ultra en Docs y a todos los suscriptores de Google AI en Gmail y Keep.

Todo el audio que generan los productos de Google lleva marca de agua SynthID, imperceptible, para que el contenido sintético siga siendo detectable. La compañía remite a la ficha del modelo para los detalles de seguridad.

Queda por ver si esos números aguantan cuando los agentes salgan del laboratorio. De momento la vista previa privada en Enterprise limita las pruebas serias a unos pocos clientes, y las métricas proceden de Google y de sus socios, no de una evaluación independiente.