NVIDIA publica PAIR, un router de inferencia local para repartir peticiones entre equipos
El proyecto, en beta, reparte cada petición entre los nodos de la red local y expone endpoints compatibles con Ollama y OpenAI, sin sumar memoria de GPU.
NVIDIA ha publicado PAIR, siglas de Personal AI Router, un router de inferencia local pensado para un grupo de equipos compatibles que cuelgan de la misma red. El proyecto está en beta y vive en GitHub, con instaladores firmados para Windows, Linux y macOS. A las aplicaciones les presenta endpoints compatibles con Ollama y con OpenAI, de modo que un cliente que ya hable con cualquiera de las dos APIs no necesita cambios.
El programa descubre los nodos que participan, gestiona los motores de inferencia soportados y decide a qué máquina manda cada petición. La elección depende de tres cosas: qué motor está levantado, si ese nodo tiene el modelo pedido y cuánta carga arrastra en ese momento. PAIR prefiere los nodos que sabe que ya tienen el modelo en memoria. Cada petición independiente acaba en un solo nodo.
Lo que no es
Conviene fijar los límites antes de montar nada. PAIR no suma memoria de GPU, no convierte varias tarjetas en una GPU lógica mayor, no reparte un modelo entre máquinas ni divide una inferencia ya en marcha. Quien llegue buscando un sharding casero se ha equivocado de herramienta. Lo que hace es repartir trabajos concurrentes, que es justo lo que necesita una aplicación con varios agentes lanzando peticiones a la vez. NVIDIA también señala que, si todos los clientes, el origen del modelo, el motor y los nodos son locales, los prompts y las respuestas no salen de la red local.
En cuanto a plataformas: Windows 11, Linux y macOS, en x64 y arm64 en los tres. Windows sobre ARM está marcado como experimental. Hay instalador .exe, paquete .deb e imagen .dmg; en otras distribuciones de Linux toca compilar. Los nodos pueden mezclarse: uno con Windows, otro con Linux y otro con macOS se emparejan entre sí. Los motores soportados de momento son Ollama y LM Studio. Aquí hay una trampa habitual: que PAIR corra en una máquina no implica que un motor vaya a correr en ella. Cada motor impone sus requisitos de sistema, GPU y controladores, y cada modelo necesita memoria suficiente para cargar. Un nodo solo entra en el reparto cuando tiene un motor compatible en marcha.
Puesta en marcha
La ruta recomendada es el instalador publicado, que va firmado, levanta los servicios en segundo plano y la aplicación de escritorio, y añade las reglas de cortafuegos que hacen falta en Windows. También avisa cuando hay versión nueva y la instala desde Ajustes. Compilar desde el código y la interfaz de terminal existen, pero son para quien va a tocar PAIR o para máquinas sin escritorio.
Desde la aplicación se instala el motor y se descarga un modelo sin tener nada preparado de antes. Para probar, se puede lanzar desde Ajustes un minuto de inferencia generado por el propio PAIR, o mandar una petición a mano contra el puerto por defecto de Ollama, el 11434, en la ruta /v1/chat/completions. La respuesta es JSON con la forma de OpenAI. Para repartir entre varios equipos se empareja una segunda máquina desde Ajustes y Cluster: la que invita muestra un PIN de seis dígitos y ese PIN se teclea en la otra.
El interés está en quien ya tiene dos o tres estaciones con GPU y quiere atender cargas concurrentes sin montar un clúster de verdad. La letra pequeña sigue siendo la beta, y el rendimiento dependerá de qué motor aguante cada máquina.


