BookinglyTech News
Inteligencia artificial

NVIDIA libera Switchyard, un router open source para agentes de IA

La libreria NeMo Switchyard actua como proxy para decidir en tiempo real que modelo LLM atende cada request, optimizando coste y latencia.

2 min de lecturaKDnuggets0 vistas

NVIDIA ha publicado Switchyard, una libreria de codigo abierto dentro del ecosistema NeMo que funciona como capa de enrutamiento para agentes de inteligencia artificial. El problema que ataca es comun en produccion: la mayoria de las aplicaciones envian cada request, desde clasificaciones simples hasta razonamiento complejo, al mismo modelo frontera de alta coste. Switchyard se interpone entre la aplicacion y los modelos upstream, decidiendo caso a caso que instancia debe procesar la tarea.

Como funciona el proxy

La herramienta opera como un proxy compatible con la API de OpenAI. El cliente envia peticiones a un endpoint unificado, por ejemplo /v1/chat/completions, y Switchyard selecciona el modelo real. Esto permite a los desarrolladores cambiar de estrategia de routing sin modificar el codigo de la aplicacion principal. La instalacion es directa mediante uv para la via CLI o cargo para el servidor nativo en Rust, que es la pieza central de la infraestructura.

El enrutamiento soporta dos modos principales. El primero es el aleatorio, util para pruebas A/B o para validar que el proxy responde correctamente, donde se define una probabilidad fija de dirigir trafico hacia un modelo "fuerte" o "debil". El segundo modo es el inteligente, que utiliza un clasificador LLM (por defecto un modelo economico) para estimar la probabilidad de que el modelo debil resuelva la tarea. Esta estimacion, llamada p_solve, se compara contra un umbral configurado. Si el modelo economico no tiene suficientes probabilidades de exito, el request se redirige automaticamente al modelo costoso. Si puede gestionarlo, se queda en el economico, reduciendo el gasto sin sacrificar la calidad en las tareas dificiles.

Configuracion y despliegue

La configuracion se maneja mediante archivos YAML donde se definen las rutas, los modelos destino y las politicas de respaldo. Un detalle operativo relevante es que no existe una opcion --dry-run en el comando serve; la validacion de la configuracion ocurre al iniciar el servidor, por lo que un error en el bundle de rutas hara que el proceso falle al arrancar. El estado del proxy se puede verificar facilmente con un endpoint de salud que devuelve un estado ok si el servicio esta activo.

Para los equipos que gestionan agentes con multiples modelos, esta capa de abstraccion elimina la logica de decision del lado del cliente. Permite centralizar la estrategia de coste y rendimiento, y facilita el cambio de proveedores o modelos subyacentes mediante OpenRouter u otros agregadores, siempre que la configuracion apunte a las claves y URLs correctas. Es una herramienta util para quien busca reducir la factura de inferencia manteniendo el rendimiento en los casos que realmente lo necesitan.