NVIDIA lanza en beta el Personal AI Router para repartir inferencias en tu red local
El PAIR combina la potencia de varias máquinas y distribuye tareas de IA sin tocar la arquitectura de los modelos, reduciendo tiempos de respuesta hasta el doble en pruebas con RTX 5090.

NVIDIA ha puesto en beta el Personal AI Router (PAIR), una capa de proxy que recoge peticiones de inferencia y las asigna a la GPU más adecuada dentro de tu red local. El objetivo es evitar el cuello de botella que surge cuando un agente maestro dispara varias llamadas a modelos diferentes y sobrecarga una sola GPU.
PAIR se integra con servicios de inferencia populares como Ollama y LM Studio. El agente envía la petición a través de su interfaz habitual; PAIR la intercepta, determina el motor y modelo requeridos y elige un nodo compatible. El nodo ejecuta la tarea y devuelve el resultado a través de PAIR, de modo que el agente percibe una única conexión.
En el demo oficial, NVIDIA combinó Hermes Desktop, Ollama y PAIR para distribuir un flujo de cinco análisis especializados entre un RTX Spark, un DGX Spark y un RTX 5090, obteniendo aproximadamente un 2 × de reducción en el tiempo de finalización respecto a ejecutar la carga en el RTX Spark solo. El demo muestra que Hermes delega tareas, PAIR las enruta y Ollama las ejecuta en el nodo seleccionado.
El router funciona en Windows 11, Linux y macOS, soportando arquitecturas x64 y arm64, y puede mezclar sistemas operativos siempre que el modelo o motor sea compatible con el nodo destino. NVIDIA aclara que PAIR no fusiona VRAM ni crea un acelerador único; simplemente distribuye las solicitudes individuales.
Usuarios en Reddit como Vegetable‑Warthog81 han probado PAIR con tres RTX 5090 ejecutando Qwen 3.8 27B via Ollama y destacan la facilidad de repartir trabajos entre las máquinas, especialmente para tareas repetitivas donde la estabilidad y la ocupación de GPU son más relevantes que el throughput máximo.
PAIR se descarga desde GitHub y la documentación de inicio rápido se encuentra en el repositorio. Si buscas compartir GPU entre distintas partes, Petals o Mesh LLM son alternativas; Mesh LLM permite además dividir modelos demasiado grandes para una sola máquina mediante Skippy.
En resumen, PAIR es una herramienta interesante para optimizar el uso de GPUs en entornos domésticos o de oficina, pero no sustituye a soluciones de compartición de recursos entre organizaciones.


