Red Hat publica un quickstart de monitorización por IA con visión y LLM
Encadena etiquetado, entrenamiento de YOLOv8, servicio de modelos en tiempo real y consultas en lenguaje natural sobre PostgreSQL y MinIO.

Red Hat ha publicado un quickstart para OpenShift AI que monta de punta a punta un sistema de monitorización por vídeo: detección de objetos, seguimiento entre fotogramas, persistencia en base de datos y consultas en lenguaje natural sobre todo lo capturado. El proyecto, multimodal-compliance-monitor, sirve para vigilar cumplimiento en plantas y almacenes —cascos, chalecos, mascarillas— y también tráfico o fauna, sin tocar el código entre un escenario y otro.
El arranque es YOLOv8. Tal cual viene, entrenado sobre el dataset COCO, ya reconoce 80 clases —personas, coches, animales— y sirve para muchos casos sin más. Cuando hace falta detectar algo que no está en ese vocabulario hay que afinar el modelo con transfer learning sobre imágenes etiquetadas. La anotación se hace con una instancia de Label Studio con su propia ruta en OpenShift, apoyada en el mismo PostgreSQL y el mismo MinIO que el resto de la aplicación. Para no empezar de cero, el pipeline admite etiquetado asistido con Grounding DINO, que genera cajas delimitadoras iniciales para que una persona las revise.
Un notebook de Jupyter recorre el entrenamiento paso a paso: instalar dependencias, organizar el dataset, generar la configuración y lanzar el transfer learning de YOLOv8. El resultado es un fichero de pesos listo para desplegar. El proyecto menciona un pipeline de Kubeflow —auto-anotación, entrenamiento, validación y despliegue condicional— como siguiente paso natural, pero no lo demuestra.
Dos runtimes de servicio según el hardware
Con el modelo entrenado, el sistema lo sirve con poca latencia. En CPU usa OpenVINO Model Server: un contenedor de preparación exporta los pesos de PyTorch al formato intermedio optimizado de OpenVINO antes de que arranque el servidor. En GPU usa KServe con el Triton Inference Server de NVIDIA, siguiendo el protocolo estándar de inferencia abierta. Ambos hablan con el backend por gRPC y una capa de abstracción elige el cliente al arrancar, así que el resto de la aplicación no sabe qué hay debajo. Un mismo despliegue puede servir varios modelos a la vez: el demo trae detección de EPIs con 10 clases, identificación de especies de aves y monitorización de tráfico con un modelo preentrenado, conmutables en caliente.
Añadir una fuente de vídeo se hace desde la página de configuración: URL del servidor de modelos, nombre (ppe, bird, yolov8n), origen —fichero local, URL de S3 o stream RTSP— y un JSON que mapea los índices numéricos de clase a nombres legibles e indica cuáles se siguen. Los RTSP se reconectan solos; los ficheros se reproducen en bucle al ritmo nativo. La inferencia agrupa fotogramas en un único tensor por llamada desde un pool de hilos, y después aplica supresión de no máximos para limpiar detecciones duplicadas.
El esquema de base de datos es deliberadamente genérico: guarda pistas y observaciones con atributos JSONB en lugar de columnas por escenario, así que el mismo esquema vale para tráfico, fauna o una línea de producción.
Lo interesante para quien despliega no es el caso de uso, sino la plantilla: enseña a encadenar anotación, transfer learning, servicio de modelos y analítica conversacional sobre OpenShift AI sin atarse a un hardware concreto. Queda por ver si ese pipeline de Kubeflow llega al repositorio o se queda en sugerencia.
