BookinglyTech News
Inteligencia artificial

Nvidia PAIR: un router local para gestionar inferencia IA en ordenadores ociosos

La herramienta open source descubre equipos en la red y distribuye peticiones de agentes a instancias de Ollama o LM Studio existentes, sin federar GPUs.

2 min de lecturaThe New Stack0 vistas

Nvidia ha publicado en versión beta Nvidia Personal AI Router (PAIR), un proyecto open source diseñado para gestionar la inferencia de modelos de lenguaje en equipos domésticos o de oficina. No es un motor de inferencia nuevo, sino un router virtual que organiza el tráfico de peticiones hacia instancias de Ollama o LM Studio que ya estén corriendo en la red local.

El funcionamiento se basa en la detección automática mediante mDNS. PAIR escanea la red, identifica los nodos disponibles y verifica si tienen el motor y el modelo específico requeridos. Cuando un agente principal, como NemoClaw o OpenClaw, necesita ejecutar una tarea, envía la petición al router. PAIR selecciona una máquina elegible que cumpla los requisitos y reenvía la solicitud completa a ese nodo. La ejecución ocurre de principio a fin en esa máquina concreta; no hay fragmentación de una sola petición entre varios dispositivos.

Nvidia es explícito al aclarar lo que PAIR no hace. No fusiona memorias VRAM de varias GPUs para formar un acelerador único ni permite el paralelismo de tensor a través de la red. La capacidad de cómputo no se suma, se multiplica la concurrencia. Si tienes dos PCs con la misma versión de un modelo, puedes correr dos procesos simultáneos en lugar de uno. El enrutamiento es binario: o la máquina tiene el modelo y el motor correctos, o la petición pasa a la siguiente opción disponible.

La gestión de recursos incluye una capa de cortesía con el usuario local. Si el propietario de la máquina recupera el control del equipo para trabajar o jugar, PAIR detiene el motor de inferencia local para liberar la GPU. Esto evita conflictos por recursos gráficos cuando el hardware vuelve a ser prioritario para la interfaz de usuario.

En cuanto a compatibilidad, el soporte abarca Windows, macOS y Linux. Por parte de Nvidia, el requisito base se sitúa en las tarjetas GeForce RTX de la serie 20 o posteriores. Para Apple, se requiere silicona M4 o más reciente. También se contempla el futuro hardware como los PCs basados en RTX Spark.

Nvidia ha publicado un benchmark de referencia donde dos PCs con RTX 5090 ejecutando el modelo Qwen3.6 35B lograron acelerar un flujo de trabajo con cinco subagentes en un factor de 1,6x. La cifra es ilustrativa de la ganancia en concurrencia, aunque el escenario de prueba usa hardware de gama alta que no es habitual en un entorno doméstico estándar. La utilidad real dependerá de tener múltiples equipos con GPUs decentes o chips Apple Silicon capaces de correr modelos pequeños en paralelo.

El proyecto está disponible ahora mismo en GitHub. La instalación requiere desplegar PAIR en cada nodo de la red. El asistente de configuración puede ayudar a instalar Ollama o LM Studio y descargar los modelos necesarios, pero la gestión de la infraestructura física y la red sigue responsabilidad del administrador.