BookinglyTech News
Infraestructura

NVIDIA lanza en beta el Personal AI Router para repartir inferencias en tu red local

El PAIR combina la potencia de varias máquinas y distribuye tareas de IA sin tocar la arquitectura de los modelos, reduciendo tiempos de respuesta hasta el doble en pruebas con RTX 5090.

2 min de lecturaInfoQ0 vistas

NVIDIA ha puesto en beta el Personal AI Router (PAIR), una capa de proxy que recoge peticiones de inferencia y las asigna a la GPU más adecuada dentro de tu red local. El objetivo es evitar el cuello de botella que surge cuando un agente maestro dispara varias llamadas a modelos diferentes y sobrecarga una sola GPU.

PAIR se integra con servicios de inferencia populares como Ollama y LM Studio. El agente envía la petición a través de su interfaz habitual; PAIR la intercepta, determina el motor y modelo requeridos y elige un nodo compatible. El nodo ejecuta la tarea y devuelve el resultado a través de PAIR, de modo que el agente percibe una única conexión.

En el demo oficial, NVIDIA combinó Hermes Desktop, Ollama y PAIR para distribuir un flujo de cinco análisis especializados entre un RTX Spark, un DGX Spark y un RTX 5090, obteniendo aproximadamente un 2 × de reducción en el tiempo de finalización respecto a ejecutar la carga en el RTX Spark solo. El demo muestra que Hermes delega tareas, PAIR las enruta y Ollama las ejecuta en el nodo seleccionado.

El router funciona en Windows 11, Linux y macOS, soportando arquitecturas x64 y arm64, y puede mezclar sistemas operativos siempre que el modelo o motor sea compatible con el nodo destino. NVIDIA aclara que PAIR no fusiona VRAM ni crea un acelerador único; simplemente distribuye las solicitudes individuales.

Usuarios en Reddit como Vegetable‑Warthog81 han probado PAIR con tres RTX 5090 ejecutando Qwen 3.8 27B via Ollama y destacan la facilidad de repartir trabajos entre las máquinas, especialmente para tareas repetitivas donde la estabilidad y la ocupación de GPU son más relevantes que el throughput máximo.

PAIR se descarga desde GitHub y la documentación de inicio rápido se encuentra en el repositorio. Si buscas compartir GPU entre distintas partes, Petals o Mesh LLM son alternativas; Mesh LLM permite además dividir modelos demasiado grandes para una sola máquina mediante Skippy.

En resumen, PAIR es una herramienta interesante para optimizar el uso de GPUs en entornos domésticos o de oficina, pero no sustituye a soluciones de compartición de recursos entre organizaciones.