BookinglyTech News
Inteligencia artificial

Black Forest Labs publica FLUX 3 Action, un modelo abierto para robótica

El modelo de acción y mundo anticipa el siguiente movimiento de un agente a partir de vídeo multicámara y logra el mejor dato de éxito en RoboLab-120 con 7.000 millones de parámetros.

2 min de lecturaThe Decoder0 vistas

Black Forest Labs ha publicado FLUX 3 Action, un modelo abierto para robótica que toma los flujos de vídeo de varias cámaras de un espacio de trabajo y predice qué acción debería tomar el agente a continuación y cómo cambiará el entorno después. Los pesos ya están en la colección de Hugging Face y, según la empresa, el modelo firma el mejor dato de éxito en la clasificación RoboLab-120 con 7.000 millones de parámetros: menos de la mitad que el mejor modelo abierto anterior y hasta 3,95 veces más rápido.

Qué hace el modelo

La base es FLUX 3, el modelo multimodal de la casa entrenado sobre todo con vídeo, aunque también con imagen y audio. Sobre esa base, FLUX 3 Action se presenta como un world-action model: no se limita a reconocer lo que ve, sino que anticipa la siguiente decisión y el efecto que tendrá sobre el escenario. Alimentarse de varias cámaras a la vez es lo que le da esa lectura espacial del entorno.

Ahí está el argumento de venta. Los modelos de razonamiento grandes planifican bien, dice la compañía, pero para un robot resultan lentos y voluminosos; en un dispositivo con recursos contados eso no sirve. De ahí el interés por recortar tamaño y latencia sin perder acierto, que es lo que sostiene el factor de velocidad cercano a cuatro sobre el referente abierto anterior.

BFL también apunta a entornos digitales. Los videojuegos servirían como banco de pruebas para agentes que navegan y reaccionan rápido, y más adelante para agentes que operan ordenadores. Es una línea de trabajo, no un producto anunciado.

El modelo es abierto en cuanto a pesos, pero todas las cifras de rendimiento las da la propia empresa y no vienen de una evaluación independiente. Tampoco se detalla qué hardware hace falta para mover esos 7.000 millones de parámetros a la velocidad que promete, que es justo lo que decide si algo así acaba dentro de un brazo robótico o en un servidor con GPU al lado. Tanto la clasificación como los pesos están públicos, así que la comprobación queda en manos de quien los descargue.