DeepSeek detalla DSec, su plataforma de sandboxes para entrenar agentes
El paper describe una capa que unifica sandboxes de función, contenedor, microVM y VM completa y ata su ciclo de vida a las cargas de aprendizaje por refuerzo.

DeepSeek ha publicado en arXiv un paper sobre DSec (DeepSeek Elastic Compute), una plataforma de sandboxes diseñada para entrenar agentes a gran escala. El sistema unifica cuatro niveles de aislamiento —llamada a funciones, contenedor, microVM y máquina virtual completa— detrás de una misma capa, y coordina el ciclo de vida de cada sandbox con las cargas de aprendizaje por refuerzo que los consumen. Entre los más de 130 firmantes del artículo aparece Liang Wenfeng, fundador de la compañía.
El detalle interesante para quien monta esto no es el aislamiento en sí, sino que la orquestación forme parte del bucle de entrenamiento. En un ciclo de RL con agentes, el modelo genera acciones, las ejecuta en algún entorno y recibe recompensa; si cada acción necesita un entorno limpio, el cuello de botella deja de ser la GPU y pasa a ser cuántos sandboxes puedes levantar y destruir por segundo.
Las cifras que da el paper
Según el artículo, una unidad de despliegue en producción ronda los 160 nodos y sostiene alrededor de 3 millones de sandboxes al día, con más de 380.000 concurrentes. La tasa de creación supera los 5.000 sandboxes por segundo. Son datos del propio DeepSeek, no de una medición independiente, y el paper no entra en coste por sandbox ni en qué hardware hay debajo de esos 160 nodos.
La mezcla de tipos de sandbox es lo que permite ajustar el coste a lo que se ejecuta. Una llamada a función se resuelve sin levantar nada; un contenedor sirve para código de confianza; una microVM o una VM completa entran cuando el agente ejecuta código que no controlas o necesita su propio kernel. Mantener los cuatro bajo la misma API es lo que evita que el equipo de entrenamiento escriba cuatro orquestadores distintos.
Puedes leer el artículo en arXiv para ver el reparto de responsabilidades entre el plano de control y los nodos de ejecución.
Lo relevante aquí es hacia dónde se mueve la infraestructura de agentes: el entrenamiento ya no se decide solo por el tamaño del modelo o la calidad de los datos, sino por cuántos entornos efímeros eres capaz de servir por segundo sin que se caiga la cola. Durante años eso se resolvió con contenedores y algo de glue; ahora las grandes casas publican sus propias capas de cómputo elástico, que es una forma de decir que el sandbox ha dejado de ser un detalle de implementación.
En el resumen no hay nada sobre licencia, liberación del código ni sobre si DSec se ofrecerá fuera de DeepSeek. Tampoco hay comparación con alternativas tipo Firecracker o gVisor. Queda por ver si esto se queda en paper o acaba siendo pieza de su oferta para terceros.

