BookinglyTech News
Inteligencia artificial

Ant Group libera Ling-3.0-flash-VL, un modelo multimodal de 124B con loop de vision

El modelo open source de Ant Group e inclusionAI opera con solo 5.5B parametros activos y se centra en tareas agenticas de GUI y medicina.

2 min de lecturaPandaily0 vistas

Ant Group e inclusionAI han publicado los pesos de Ling-3.0-flash-VL, un modelo de lenguaje multimodal basado en la arquitectura Mixture of Experts (MoE). La version llego a los repositorios publicos el 9 de septiembre, ofreciendo pesos en formato BF16 y FP8 para facilitar su despliegue en diferentes entornos de inferencia.

Aunque el modelo cuenta con 124.000 millones de parametros en total, solo activa 5.500 millones por inferencia. Esta eficiencia es clave para quienes necesitan capacidades multimodales sin el coste computacional de un modelo denso de gran tamano. La caracteristica tecnica mas destacada de esta version es la incorporacion de un bucle de retroalimentacion visual (vision feedback loop). Este mecanismo permite que el modelo ajuste sus acciones basandose en el resultado visual de su propia interaccion, un enfoque particularmente util para tareas agenticas donde la ejecucion requiere verificacion en tiempo real.

Enfoque en tareas especificas

El equipo de desarrollo ha optimizado el modelo para tres dominios concretos: navegacion y interaccion en interfaces graficas (GUI), desarrollo de codigo front-end y tareas medicas. En el caso de la GUI, el bucle de vision permite al agente corregir errores de clic o desplazamiento observando la pantalla actual, reduciendo la necesidad de reintentos manuales. Para el desarrollo front-end, esto se traduce en una capacidad mas fiable para generar y depurar interfaces que responden a estados dinamicos.

La disponibilidad inmediata en formatos de baja precision (FP8) es relevante para los administradores de sistemas que gestionan flotas de GPUs. Permite ejecutar el modelo en hardware de gama media-alta con mas eficiencia energetica, algo que los modelos multimodales de generaciones anteriores, mas pesados, hacian inviable en despliegues locales o de borde.

La licencia open source abre la puerta a adaptarlo en pipelines internos, aunque la especificidad de sus optimizaciones para tareas medicas y GUI sugiere que su mayor util inmediata estara en agentes autonomos que interactuen con software existente mas que en la generacion de contenido generalista. Queda por ver como se comporta frente a otros modelos MoE de similar tamano activo en benchmarks estandar de razonamiento, dado que el foco del lanzamiento ha sido la estabilidad operativa en flujos de trabajo complejos.