Alibaba publica Qwen-Drive, un modelo open source para conducción autónoma
El equipo de Qwen lanza un modelo de 4B parámetros que combina percepción 3D y planificación de trayectorias bajo licencia Apache 2.0.

El equipo de Qwen de Alibaba ha publicado Qwen-Drive-1.0-4B, un modelo de código abierto diseñado para gestionar tanto la comprensión de la escena de conducción como la planificación de los movimientos del vehículo. El desarrollo se ha realizado en colaboración con la Universidad de Ciencia y Tecnología de Huazhong y se centra en integrar estas dos funciones críticas en un único sistema.
La arquitectura se basa en Qwen3.5-4B como base de lenguaje visual, manteniendo su estructura original y su capacidad para responder preguntas visuales. Sobre este núcleo, el proyecto añade componentes específicos para la percepción en 3D y la generación de trayectorias de conducción. Dentro del módulo de planificación, se ofrecen dos variantes: una entrenada para imitar ejemplos de conducción existentes y otra optimizada adicionalmente mediante aprendizaje por refuerzo.
Toda la documentación, el código fuente, los pesos del modelo y los datos de demostración están disponibles bajo la licencia Apache 2.0. Esto permite a los equipos de ingeniería inspeccionar la implementación, reproducir los resultados e integrar los componentes en sus propias pipeline de desarrollo sin restricciones comerciales.
Implicaciones para la ingeniería
Para los profesionales de TI y los arquitectos de sistemas, la relevancia radica en la disponibilidad de los pesos y el código. Es posible descargar el modelo, cargarlo en entornos de inferencia locales o en la nube, y evaluar su rendimiento con datos propios de telemetría o simulación. La licencia Apache 2.0 facilita la adopción en entornos empresariales, siempre que se respeten las condiciones de atribución y distribución.
La separación de componentes permite una mayor flexibilidad operativa. Un equipo podría reentrenar el módulo de percepción con datos de sensores LiDAR o de cámaras específicas de su flota, o ajustar el planificador mediante técnicas de refuerzo supervisadas. La base Qwen3.5-4B actúa como el cerebro multimodal que interpreta el contexto visual, mientras que los módulos especializados ejecutan las tareas numéricas de posicionamiento y predicción de movimiento.
Alibaba no ha detallado en el anuncio inicial las métricas exactas de latencia o el consumo de cómputo requerido en tiempo real. Los interesados deberán realizar pruebas de estrés en su infraestructura para determinar si el modelo de 4B parámetros se ajusta a los requisitos de baja latencia típicos de los sistemas de conducción autónoma en producción.
