BookinglyTech News
Inteligencia artificial

Gemini 3.8 Live añade avatares de vídeo en tiempo real para agentes de empresa

Google mete vídeo generado en su modelo de diálogo en vivo: un personaje que escucha, ve y responde con sincronización labial, disponible solo en Gemini Enterprise.

2 min de lecturaGoogle DeepMind0 vistas

Google ha añadido cara a su modelo de voz en vivo. Gemini 3.8 Live with Live Avatar genera en tiempo casi real el rostro y la voz de un personaje que conversa, con sincronización labial, expresiones y turnos de palabra fluidos. Llega una semana después de Gemini 3.8 Live y se queda dentro de Gemini Enterprise: el Gemini de consumo no lo tiene.

El avatar procesa audio y vídeo de entrada a la vez, así que reacciona a lo que ve además de a lo que oye. La parte interesante para quien construye agentes es el encadenamiento asíncrono de herramientas: el modelo puede lanzar una llamada a una herramienta y traer datos por detrás mientras la conversación sigue. Google pone como ejemplo el registro de un huésped en un hotel, con la consulta al sistema corriendo en segundo plano sin cortar el diálogo. Ese patrón es el que hace utilizable un agente con presencia continua, porque evita el silencio de espera cada vez que hay que tocar un sistema externo.

Multilingüe y con marca de agua

En el apartado de idiomas, la compañía habla de sincronización voz a voz nativa en 97 lenguas, con el lip-sync y las expresiones adaptándose sin degradar el vídeo ni derivar visualmente. Puede cambiar de idioma a mitad de conversación.

Sobre la identidad visual, hay dos caminos. Uno es la biblioteca de avatares predefinidos. El otro es la creación a medida: a partir de una imagen de referencia, el desarrollador genera un avatar animado que conserva el parecido, el estilo de marca o la identidad del personaje. Eso sí, la creación de avatares personalizados está por ahora limitada a una lista de acceso para empresas, no abierta a cualquiera con cuenta.

Toda la salida de audio y vídeo lleva SynthID, la marca de agua imperceptible de Google, para que el contenido generado siga siendo detectable. La empresa remite a la ficha del modelo para el detalle de su enfoque de seguridad.

Lo que no dice

El anuncio es corporativo y se nota: hay demostraciones en vídeo, pero ningún número que un arquitecto pueda usar para dimensionar nada. No hay cifras de latencia, ni de resolución, ni de coste por minuto, ni de cuántas sesiones concurrentes aguanta el servicio. "Tiempo casi real" y "baja latencia" son las dos expresiones que sostienen toda la propuesta, y vienen sin medir.

Para quien tenga que evaluarlo, el punto de partida está en la documentación de la API, donde deberían aparecer límites y formatos. Las opciones cerradas y la ausencia de precios públicos indican que esto se vende por contrato con cada cliente, no como un servicio de autoservicio. La pregunta que queda abierta es si el vídeo generado aguanta una conversación de veinte minutos sin artefactos, y eso no lo responde un vídeo de demostración.