DeepSeek detalla DSec, la plataforma de sandboxes que sostiene 380.000 entornos a la vez
El informe técnico describe una plataforma de ejecución elástica que sirve unos 3 millones de sandboxes al día y crea más de 5.000 por segundo en un solo despliegue de producción.

DeepSeek ha publicado el informe técnico de DeepSeek Elastic Compute (DSec), la plataforma con la que ejecuta los entornos aislados donde sus modelos inspeccionan repositorios, llaman a herramientas y lanzan comandos durante el entrenamiento y la evaluación de agentes. Un solo despliegue de producción ocupa alrededor de 160 nodos, sirve unos 3 millones de sandboxes al día y sostiene más de 380.000 entornos concurrentes con más de 5.000 creaciones por segundo.
El problema que ataca DSec no es levantar un contenedor, es levantarlos a ráfagas. Las cargas de entrenamiento agéntico piden sandboxes en picos, con requisitos de aislamiento muy distintos entre tareas, mantienen estado a lo largo de interacciones largas y tiran de un corpus enorme de imágenes donde la reutilización es baja. Con ese patrón, un runtime único no llega: hace falta coordinar colocación y ciclo de vida en todo el clúster. De ahí que el informe plantee DSec como plataforma y no como runtime.
Cuatro backends bajo un mismo SDK
DSec expone cuatro tipos de sandbox: FnCall, contenedor, microVM y VM completa, todos accesibles desde un SDK unificado. Por encima, compone entornos a partir de capas versionadas de forma independiente, de modo que no hay que reconstruir la imagen entera cada vez. Para densidad, combina memoria compartida y reclamación con planificación de CPU, y carga los datos de imagen bajo demanda desde 3FS, el sistema de ficheros distribuido que DeepSeek usa a escala de clúster.
La parte menos habitual es el acoplamiento con el framework de entrenamiento por refuerzo. DSec separa la ejecución con estado del rollout de la parte de entrenamiento en GPU, que es preemptible, y sincroniza el ciclo de vida de los sandboxes con el del entrenamiento: mantiene el estado del rollout cuando hace falta y reclama recursos cuando están ociosos. El informe también menciona mecanismos para frenar comportamientos indeseados del agente, como el reward hacking.
Qué dicen y qué no
Los números son de los autores y salen de su propia experiencia de despliegue, no de una medición de terceros. Lo que sostienen es que estos mecanismos reducen el coste de preparar entornos y de distribuir imágenes, mejoran el uso de memoria y mantienen el rendimiento en las latencias sensibles cuando el clúster va sobrecargado a propósito.
El documento tiene 31 páginas y 13 figuras, y esta versión amplía bastante un resumen de dos páginas que pasó la primera ronda de revisión del Operational Systems Track de ACM SIGOPS ATC 2026.
Para quien monta plataformas de agentes, el interés está en el diseño más que en el anuncio: es un caso documentado de sandboxing a densidad alta, con aislamiento heterogéneo y estado persistente, que es justo donde los montajes caseros con contenedores empiezan a romperse. Queda por ver si DeepSeek libera algo del código o si el SDK seguirá siendo interno, y si otras infraestructuras de entrenamiento adoptan el mismo enfoque de separar el rollout del cómputo en GPU.


