BookinglyTech News
Inteligencia artificial

Google incorpora avatares fidedignos para su agente de voz Gemini 3.8

La funcionalidad de Live Avatar añade sincronización labial y expresiones faciales en tiempo real para cuentas empresariales, eliminando la conversión intermedia de texto en el flujo de audio.

2 min de lecturaSlashdot0 vistas

Google ha desplegado la capacidad de 'Live Avatar' en su agente de voz Gemini 3.8, una funcionalidad dirigida a cuentas empresariales que busca dotar de presencia visual a las interacciones telefónicas o de soporte. El sistema genera experiencias faciales expresivas con sincronización lip-sync precisa, expresiones naturales y una gestión fluida de los turnos de habla, permitiendo a las organizaciones elegir entre una biblioteca de avatares predefinidos o crear sus propios modelos personalizados.

Arquitectura de audio directo

El cambio técnico más relevante no es el avatar en sí, sino la arquitectura subyacente. Gemini 3.8 Live, al igual que el GPT-Live de OpenAI, opera sobre audio crudo de principio a fin. En lugar del pipeline tradicional que transcribe la voz del usuario a texto, procesa el input y luego sintetiza la respuesta en voz, el modelo recibe y emite señales acústicas directamente. Esta eliminación del paso intermedio de reducción a texto reduce la latencia de respuesta a una fracción de segundo y, crucialmente, permite al modelo capturar matices paralingüísticos que el texto no transporta: el tono de voz, las pausas, el enfado o la ironía.

Las pruebas de usuarios, como las recopiladas en Android Police, indican que la respuesta es inmediata y adaptable; el modelo acelera el ritmo de habla si el usuario lo hace y puede cambiar de idioma varias veces dentro de la misma oración sin perder coherencia. Un ejemplo citado muestra al modelo identificando correctamente una palabra formada con números para simular letras invertidas (usando '3' por 'E').

Sin embargo, la percepción subjetiva de naturalidad sigue siendo limitada. Varios analistas señalan que, aunque la fluidez técnica es notable, la interacción no replica la conexión humana. La sensación predominante sigue siendo la de hablar con un representante de soporte técnico avanzado, no con una persona. La ausencia de la capa facial no es el principal obstáculo para la inmersión, sino la naturaleza misma de la generación lingüística por LLM, que amplifica la conciencia de la ausencia del interlocutor humano por muy fluido que sea el flujo de audio.