BookinglyTech News
Software

Sistemas de análisis de datos no estructurados basados en ML reducen costes en diez órdenes

Un nuevo enfoque entrega respuestas aproximadas pero estadísticamente válidas sobre vídeo y otras fuentes no estructuradas, con un ahorro de costes que puede llegar a ser enorme.

2 min de lecturaLobsters0 vistas

En la última publicación de Lobsters, se detalla un conjunto de sistemas que sustituyen los modelos de aprendizaje profundo tradicionales por aproximaciones mucho más baratas, sin sacrificar la fiabilidad de los resultados. El objetivo es permitir a analistas, desde planificadores urbanos hasta investigadores de video, obtener información estructurada—por ejemplo, conteo de vehículos en un cruce—a partir de grandes volúmenes de datos no estructurados.

El trabajo parte de dos observaciones clave. Primero, muchos procesos analíticos pueden tolerar una leve pérdida de precisión siempre que se cuente con garantías estadísticas. Segundo, los métodos actuales para responder a consultas sobre datos no estructurados varían en costo hasta diez órdenes de magnitud, lo que hace prohibitivo el uso de ML puro en organizaciones de tamaño medio.

Con base en esto, los autores proponen una arquitectura que combina “piscinas” de muestras de datos con modelos de ML de baja complejidad para estimar métricas globales. En lugar de procesar cada frame de vídeo con una red profunda, el sistema extrae un subconjunto representativo, lo que reduce el gasto de cómputo en la nube de forma exponencial. Los resultados se reportan con intervalos de confianza, lo que permite a los usuarios comprender el nivel de incertidumbre.

Los experimentos, realizados sobre conjuntos de datos de tráfico urbano, muestran que los sistemas propuestos entregan respuestas dentro de un 5 % del valor exacto con una probabilidad de 95 %. Al mismo tiempo, el coste de ejecución cae entre 1 % y 10 % del método convencional, dependiendo de la complejidad de la consulta. Se incluyen casos de selección, agregación y límites, demostrando que la aproximación funciona en una variedad de escenarios.

Un punto relevante para la comunidad de infraestructura es la compatibilidad con entornos de big data. Los sistemas pueden integrarse con Apache Spark y Flink, aprovechando su motor de ejecución distribuido para escalar la selección de muestras y el cálculo de estimaciones. No obstante, se requiere una capa adicional de orquestación para gestionar la sincronización entre el subsistema de muestreo y el modelo de ML ligero.

El autor concluye que la adopción de aproximaciones estadísticas puede transformar el panorama de análisis de datos no estructurados, haciendo viable la extracción de información en tiempo real para organizaciones que antes se verían excluidas por el coste. Sin embargo, señala que la interpretación de los intervalos de confianza y la selección de la muestra adecuada siguen siendo tareas que demandan dominio técnico.

Para los responsables de infraestructura, la propuesta sugiere un camino claro: invertir en pipelines de muestreo y en modelos ligeros, mientras se mantiene la capacidad de escalado horizontal. Los ingenieros de datos deberán familiarizarse con la teoría de estimaciones y la gestión de incertidumbre, pues el rendimiento del sistema depende de la calidad de las muestras.

En definitiva, este enfoque abre la puerta a análisis de vídeo y otros tipos de datos no estructurados que antes eran prohibitivos por coste y complejidad, y plantea nuevas preguntas sobre cómo incorporar garantías estadísticas en los flujos de trabajo tradicionales.