BookinglyTech News
Inteligencia artificial

NVIDIA amplía AI for Media con microservicios NIM de vídeo y detección de IA

NVIDIA amplía su colección de SDKs y microservicios NIM para medios con detección de vídeo sintético, generación de frames y superresolución, ya integrados por Dalet, Wowza y Ross Video.

3 min de lecturaNVIDIA Blog0 vistas

NVIDIA ha aprovechado el IBC de Ámsterdam, que se celebra del 11 al 14 de septiembre, para ampliar AI for Media, su colección de SDKs acelerados por GPU, microservicios NIM, playbooks y blueprints pensados para audio, vídeo y efectos de realidad aumentada. La pieza central es el detector de vídeo sintético SVD, un microservicio que estima la probabilidad de que un material sea auténtico o generado por IA, y que varios fabricantes del sector ya han empezado a integrar.

El SVD se anunció en SIGGRAPH y desde entonces, según NVIDIA, ha alcanzado una precisión del 99,3% en contenido de texto a vídeo y del 97,7% en imagen a vídeo, con las mayores mejoras en los casos difíciles de este último tipo. Dalet lo ha metido en un flujo de verificación alojado en la nube para redacciones: los equipos envían el material y revisan las puntuaciones y los metadatos desde la interfaz de Dalet.

TwelveLabs también lo ha integrado en Compliance by TwelveLabs, su primera aplicación sobre su plataforma de inteligencia de vídeo, que criba contenido contra normativas regionales y propias y añade señales de autenticidad por fotograma. Wowza, por su parte, distribuirá SVD a través de su Wowza Video Intelligence Framework: sus clientes podrán analizar directos y extraer objetos, escenas y signos de generación por IA en tiempo real. El despliegue se puede hacer en local, en el edge, en la nube, en híbrido o en un sistema completamente aislado (air-gapped).

Vídeo más fluido y con más resolución

La generación de fotogramas (VFG) usa IA generativa para interpolar imágenes nuevas entre las originales, y sube la tasa de refresco 2x o 4x manteniendo la consistencia temporal. Ross Video la ha llevado a Rio Replay para generar cámara lenta asistida de hasta 6x en producción deportiva, y hay trabajo en curso hacia 8x, lo que evitaría depender de una cámara de altísima cadencia para capturar cada fotograma.

La superresolución (VSR) escala el vídeo y reduce ruido, desenfoque y artefactos de compresión. La versión nueva añade soporte de 10 bits y modos que permiten elegir entre rendimiento en tiempo real y más calidad de imagen. TrueHDR convierte SDR a HDR en tiempo real, hasta unos 2.000 nits, ajustando el brillo al contenido. Los tres efectos se pueden encadenar en un mismo pipeline, algo pensado para reutilizar catálogos antiguos en streaming, transcodificado o creación de contenido.

En el apartado de movimiento, 3D Body Pose estima articulaciones y ángulos en 2D y 3D a partir de una sola cámara, sin trajes ni marcadores. Sirve para seguimiento de jugadores, biomecánica, repeticiones o arbitraje, y también como dato estructurado para animación y dobles digitales. Vizrt ya lo usa en platós virtuales para que el movimiento capturado mueva iluminación y reflejos en 3D. A esto se suman los microservicios LipSync y de detección de hablante activo, orientados a doblaje y localización.

Que todo esto salga de un mismo catálogo es la parte interesante: quien ya tenga un pipeline de vídeo sobre GPU puede añadir detección de contenido sintético, interpolación o HDR sin cambiar de stack. Lo que no ha dicho la compañía es cuánto cuesta licenciar cada microservicio ni qué hardware mínimo hace falta para los modos en tiempo real, dos datos que suelen decidir la adopción en producción.