Meta lanza Hologram: avatares fotorrealistas por IA para sus gafas y visores
La función, similar a Persona de Apple, llega al otoño en Ray-Ban Display y Quest. Usa difusión generativa en la nube para renderizar rostros en llamadas de WhatsApp.

Meta ha confirmado el despliegue de Hologram, un sistema de avatares virtuales fotorrealistas que estará disponible este otoño en sus dispositivos. La función, que recuerda a la tecnología Persona de Apple Vision Pro, se integrará progresivamente en las gafas inteligentes Ray-Ban Display, los visores Quest y un nuevo dispositivo de cabeza más ligero que la compañía ha anunciado recientemente.
Aunque Meta mostró prototipos de avatares realistas hace siete años bajo el nombre de Codec Avatars, los productos actuales seguían limitándose a personajes estilizados. Hologram marca el cambio definitivo hacia la representación realista para el consumidor final. El proceso de creación requiere la app Meta AI en el smartphone: el usuario debe girar la cabeza y responder a preguntas abiertas durante varios minutos. El sistema analiza la fonética, las expresiones faciales y hasta la vestimenta para entrenar el modelo. Tras el procesamiento en la nube, el avatar queda listo.
La arquitectura técnica difiere según el dispositivo. En las gafas Ray-Ban Display, no se utiliza la cámara para capturar el rostro en tiempo real. En su lugar, un modelo de difusión generativa alojado en los servidores de Meta procesa el audio captado por los micrófonos de las gafas. Este modelo genera un flujo de vídeo 2D en tiempo real que muestra la cara del usuario al otro lado de la llamada de WhatsApp. Es una solución de rendering local al dispositivo, delegando el pesado cómputo de inferencia al backend.
En los visores Quest, la experiencia es distinta. El avatar se presenta en 3D a escala real. Durante una videollamada, primero se ve una versión reducida en una ventana; al activar el modo inmersivo, el holograma ocupa el espacio físico del usuario, con una proporción de cuerpo a cuerpo aproximada.
La implementación no está exenta de problemas técnicos evidentes en la versión actual. Meta admite que las proporciones del cuerpo pueden no coincidir perfectamente con la realidad, los detalles de los ojos a veces resultan borrosos y el modelo sufre distorsiones geométricas si el usuario inclina la cabeza lateralmente demasiado. Estas limitaciones son típicas de los modelos de difusión generativa aplicados a la síntesis de vídeo en tiempo real, donde la latencia y la coherencia espacial son los principales enemigos del usuario.
Para los arquitectos de sistemas y desarrolladores, el interés radica en cómo Meta está gestionando la inferencia de modelos de difusión en la nube para aplicaciones de baja latencia. Si el objetivo es una conversación fluida, la pipeline de speech-to-video generativo debe ser extremadamente eficiente. Ver si Meta logra estabilizar el rendimiento de este modelo en servidores públicos sin degradar la calidad o aumentar la latencia será clave para la viabilidad de esta tecnología en entornos empresariales o profesionales donde la discreción y la privacidad visual son factores determinantes.

