BookinglyTech News
Inteligencia artificial

InstinctFlash, un runtime de inferencia para modelos de robotica con FP8

General Instinct publica el codigo fuente de un servidor de inferencia para ocho familias de modelos de robotica, con soporte para Jetson Thor, RTX 4090 y RTX 5090.

3 min de lecturaShow HN0 vistas

General Instinct ha publicado InstinctFlash, un runtime de servicio para modelos de robotica que promete acelerar la inferencia hasta 33,78 veces en un Jetson Thor. El proyecto llega con el codigo fuente completo, kernels de aceleracion y una API en Python y por WebSocket, y cubre ocho familias: LingBot-VA, LingBot-VLA-4B, LingBot-VLA-V2-6B, pi0.5, GR00T-N1.7-3B, las politicas Cosmos3 Edge y Nano, y DreamZero. El soporte para RTX 4090 y 5090 permite montarlo en una estacion de trabajo con la misma API que se usa en el modulo de NVIDIA.

Casi todo lo que se ensena son cifras de la propia empresa. La tabla de latencias p50 en Jetson Thor compara cada modelo consigo mismo bajo el mismo calendario de muestreo: pi05 pasa de 408,58 a 51,85 ms (7,88 veces mas rapido) con FP8, Cosmos3 Edge baja de 3.393,78 a 1.048,01 ms (3,24), y LingBot-VA en 25V/50A cae de 15.506,32 a 2.891,74 ms (5,36). En el otro extremo, GR00T N1.7 apenas mejora un 1,19, de 139,50 a 117,30 ms. El titular de las 33,78 veces no sale de esa tabla: enfrenta una configuracion de 25V/50A contra otra de 2V/4A, asi que incluye reducir los pasos de muestreo ademas del trabajo de los kernels. La compania afirma que no ha observado perdida de rendimiento en sus pruebas con robots reales.

Un runtime, varios entornos

El nucleo en Python 3.10 o superior inspecciona checkpoints y planifica sin GPU y sin PyTorch. La inferencia real corre en entornos aparte, uno por familia, con Python 3.12 o 3.13 segun el caso, instalados por un script que fija versiones y aplica parches de compatibilidad. El comando serve apunta a un checkpoint, detecta la familia y arranca el servicio; lo que el checkpoint no puede demostrar por si mismo se pregunta, no se adivina. Por red habla msgpack sobre WebSocket con el protocolo que ya usa el ecosistema openpi, de modo que un cliente existente conecta sin tocar nada.

La precision por defecto es nativa, con techo BITEXACT, y FP8 hay que pedirlo de forma explicita. Existen ademas un techo numerico y otro conductual, este ultimo necesario para el cache dinamico de DreamZero. Hay banderas para hacer preflight sin GPU ni pesos (--serve.dry_run), para cargar y emitir una sola accion (--serve.smoke) y para volcar observaciones, acciones y latencias al visor de Rerun. El segundo verbo, validate, comprueba que un checkpoint sea publicable y puede certificar no inferioridad frente a un modelo profesor. La publicacion no menciona la licencia, y los scripts de reproduccion que incluye estan pensados para la revision de checkpoint que ellos fijan.

Lo que importa aqui es que la aceleracion se mide en latencia de inferencia, no en tareas resueltas, y que no hay verificacion independiente de ninguna de esas cifras. Para quien despliega politicas de robotica, la parte util no es el 33,78 sino el protocolo abierto de servido, las banderas de diagnostico y la separacion entre planeacion sin GPU y ejecucion en FP8. Falta saber bajo que licencia se puede usar en produccion.