BookinglyTech News
Inteligencia artificial

Microsoft Foundry Local lleva la inferencia de IA dentro de la app, sin API de por medio

El runtime de inferencia de Microsoft se enlaza en el proceso de la aplicación en vez de llamar a un endpoint en la nube, con SDKs para Python, C#, JavaScript y Rust y aceleración por ONNX Runtime.

2 min de lecturaDev.to0 vistas

Microsoft ha metido la inferencia de IA dentro de la propia aplicación. Foundry Local es un runtime nativo que se enlaza en el proceso del programa —una librería, no un servicio— y que descarga, carga y ejecuta modelos en la máquina del usuario, eligiendo solo el acelerador disponible. La compañía lo plantea como alternativa a montar un endpoint en la nube para tareas pequeñas.

La diferencia con la nube no es de escala, es de forma. En sus preguntas frecuentes, Microsoft insiste en que Foundry Local no es un servidor web ni una herramienta de línea de comandos: es una librería que se embebe, más cerca de meter SQLite en una app que de llamar a una base de datos gestionada. Eso cambia el modelo de despliegue, los modos de fallo y la frontera de seguridad.

Qué trae

El núcleo nativo (.dll en Windows, .so en Linux, .dylib en macOS) se encarga de la descarga de modelos, la detección de hardware, la elección del execution provider, la gestión de sesiones y la inferencia. Por encima hay SDKs para Python, C#, JavaScript y Rust. El catálogo incluye variantes cuantizadas y ajustadas al hardware de Qwen, Phi, DeepSeek, Mistral y Whisper para audio, versionadas y cacheadas tras la primera descarga.

La aceleración la pone ONNX Runtime: hay execution providers para CUDA de NVIDIA, Vitis de AMD, las NPU de Qualcomm, OpenVINO de Intel y WebGPU para GPU multiplataforma, Apple Silicon incluido, con la CPU como fallback universal. Existe además un servidor local compatible con la API de OpenAI, pensado para integrar LangChain o dar acceso a varios procesos, pero Microsoft lo coloca como modo secundario: la vía principal es la llamada en proceso, con menos sobrecarga.

El escenario que sostiene todo esto son tareas acotadas y sensibles a la latencia: clasificación de intenciones, resúmenes cortos, embeddings para búsqueda local, voz a texto. Modelos cuantizados de 0,5 a 8 mil millones de parámetros ya dan resultado suficiente ahí, y en un portátil con NPU o GPU integrada hay aceleración de sobra.

Hay además un argumento que no es de rendimiento. Si el dato no sale del dispositivo, la conversación con legal y seguridad sobre residencia cambia de tercio, y aparecen escenarios que antes no eran viables: inspección de campo, kioscos, equipos sin red.

Queda por ver lo de siempre: cuánto ocupa cada modelo en disco, cómo se comporta en equipos sin NPU y qué pasa cuando el catálogo se actualiza por debajo. El material de partida anuncia secciones de rendimiento, coste y errores comunes que no desarrolla, así que de momento todo lo que hay son las cifras y las promesas de Microsoft, sin comparativas independientes contra alternativas como vLLM o Triton.