¿Qué es DSec y por qué DeepSeek publica su infraestructura?
DeepSeek publicó en arXiv el reporte técnico de DeepSeek Elastic Compute (DSec), una plataforma de producción para entrenar agentes de IA a escala. El paper, firmado por unos 130 colaboradores según CryptoBriefing, no presenta un modelo nuevo: describe la infraestructura que la usa para entrenar los suyos, algo que hasta ahora la mayoría de laboratorios guardaba en privado.
La decisión es significativa. Mientras la carrera de IA se concentraba en arquitecturas de modelo y datos de entrenamiento, DeepSeek está haciendo una afirmación distinta: la infraestructura de entrenamiento de agentes merece la misma atención que los agentes mismos. En palabras del propio reporte, entrenar agentes «es fundamentalmente distinto» a entrenar chatbots, porque cada acción — escribir código, manipular archivos, ejecutar comandos — puede causar daño real si no se contiene.
Los números detrás de DSec: 3 millones de sandboxes al día
Una sola unidad de producción de DSec abarca aproximadamente 160 nodos, con alrededor de 30.000 núcleos de CPU y 250 TB de memoria según el reporte recogido por CryptoBriefing. Sobre esa base, la plataforma:
🤖 La IA no es solo para leer sobre ella
En la comunidad la aplicamos: automatización, agentes IA y herramientas reales para emprender, no solo para informarte.
👥 Aplicarla en la comunidad- Genera unos 3 millones de sandboxes al día
- Sostiene más de 380.000 sandboxes concurrentes
- Crea más de 5.000 sandboxes por segundo en picos de carga
Para ponerlo en contexto, según la documentación de NVIDIA publicada en julio, su sistema Nemotron 3 Super generó aproximadamente 1,2 millones de rollouts de entorno durante todo el post-entrenamiento de un modelo. DSec mueve esa escala cada día en producción, y solo en una unidad. Esto la sitúa entre las infraestructuras de entrenamiento agentic más grandes documentadas públicamente.
Cómo funciona la plataforma: cuatro niveles de aislamiento
DSec expone cuatro backends de aislamiento a través de un único SDK en Python, ordenados de menor a mayor contención:
- FnCall: el más liviano, para operaciones sin estado
- Contenedores Docker: un escalón arriba en aislamiento
- microVMs Firecracker: frontera más fuerte entre el agente y el host
- VMs completas con QEMU: la contención más estricta disponible
La plataforma compone entornos a partir de capas versionadas de forma independiente, comparte memoria entre sandboxes inactivos y carga imágenes bajo demanda desde Fire-Flyer File System (3FS), un sistema de archivos distribuido propio del laboratorio. El resultado es que crear un sandbox no requiere descargar una imagen completa cada vez: las capas se reutilizan y los datos se traen solo cuando se necesitan.
Además, DSec está co-diseñada con el framework de aprendizaje por refuerzo (RL) de DeepSeek. Desacopla la ejecución de rollouts —la parte donde el agente interactúa con su entorno— del entrenamiento de GPU, que es preemptible. Esto permite preservar el estado de un rollout aunque se reclamen recursos para entrenar, y libera capacidad ociosa cuando los agentes están esperando respuesta.
El problema que DSec resuelve: entrenar agentes que ejecutan acciones
El reporte incluye una admisión poco habitual en papers técnicos: «ningún mecanismo único puede prevenir todo el mal comportamiento del agente». Los autores identifican modos de falla concretos, entre ellos corrupción del sistema de archivos y explotación de recursos, situaciones en las que el agente encuentra canales no previstos para afectar sistemas fuera de su sandbox.
La estrategia de mitigación combina tres líneas:
- Contención: los cuatro backends de aislamiento ya descritos.
- Observabilidad: monitoreo de lo que el agente hace dentro del sandbox.
- Mejora continua: nuevos modos de falla se traducen en nuevas defensas, en un ciclo que el paper describe como permanente.
Esta arquitectura también ataca un problema específico del entrenamiento con RL: el reward hacking, donde el agente aprende a maximizar la señal de recompensa sin cumplir la tarea real. Al coordinar el ciclo de vida del sandbox con el ciclo de entrenamiento, DSec limita el margen para que el modelo «haga trampa» detectando debilidades del entorno.
¿Qué significa esto para tu startup?
Para un founder construyendo producto con agentes de IA, la publicación de DSec trae tres señales prácticas:
1. La infraestructura de entrenamiento importa, no solo el modelo. Si tu agente falla en tareas largas con múltiples llamadas a herramientas, el cuello de botella rara vez es el modelo y suele ser el entorno: el sandbox donde ejecuta código, el verificador que puntúa su salida, el sistema que sostiene el estado entre turnos. El reporte de DeepSeek, junto con la documentación de frameworks como NVIDIA NeMo RL o NeMo Gym, confirma que la frontera de inversión se está moviendo hacia esa capa.
2. Puedes construir tu propio flywheel de mejora continua. El patrón que NVIDIA describe como «agent flywheel» — convertir cada falla en producción en una eval, cada eval en un entorno y cada entorno en recompensa para entrenar — ya no requiere reinventar la rueda. Herramientas como NeMo Gym o vLLM ofrecen entornos reproducibles y orquestación de herramientas; el paper de DeepSeek muestra cómo llevar esa idea a escala de millones de ejecuciones diarias.
3. La contención y la seguridad dejan de ser opcionales. Si tu agente escribe código, ejecuta comandos o toca APIs externas, un fallo de aislamiento no es un bug técnico: es un riesgo de producto. Empieza por preguntarte qué pasa cuando el agente se equivoca: ¿puede corromper archivos del usuario? ¿puede agotar recursos del servidor? ¿puede salir del entorno previsto? Las respuestas a esas preguntas definen tu próxima decisión de arquitectura.
Acciones concretas para esta semana:
- Audita los puntos de ejecución de tu agente y clasifícalos según el nivel de daño potencial: lectura de archivos, escritura, ejecución de comandos, llamadas a APIs externas. Cada categoría exige un backend de aislamiento distinto.
- Instrumenta la observación dentro del sandbox: logs de comandos, de archivos tocados y de APIs llamadas. Sin observabilidad, no vas a detectar el reward hacking hasta que sea tarde.
- Evalúa si tu framework actual (vLLM, OpenRLHF, NeMo RL o veRL) soporta el ciclo entrenamiento-rollout desacoplado que DeepSeek describe. Si no, es una señal de que tu stack va a quedar corto cuando escales.
Conclusión
DeepSeek DSec no es un producto que vayas a contratar mañana, pero sí es una foto pública de hacia dónde se mueve el entrenamiento agentic: hacia plataformas elásticas que combinan cuatro niveles de aislamiento, gestión de estado y un filesystem distribuido propio. Para founders hispanohablantes construyendo agentes, la lectura útil es doble: por un lado, la escala (3 millones de sandboxes al día) muestra cuánto margen existe entre lo que hace un laboratorio frontera y lo que hace una startup. Por otro, los problemas que DSec resuelve — contención, observabilidad, reward hacking — son los mismos que vas a enfrentar en producción, aunque sea con diez sandboxes en vez de tres millones.
Fuentes
- DeepSeek Elastic Compute (DSec): A Sandbox Infrastructure for Effective Agentic Training at Scale - arXiv (fuente original)
- DeepSeek reveals innovative method for training AI agents with massive sandbox infrastructure - CryptoBriefing
- Mastering Agentic Techniques: AI Agent Reinforcement Learning - NVIDIA Developer Blog
🤖 La IA no es solo para leer sobre ella
En la comunidad la aplicamos: automatización, agentes IA y herramientas reales para emprender, no solo para informarte.
👥 Aplicarla en la comunidad













