DeepSeek DSEC: 380.000 sandboxes para entrenar agentes IA

Lo que DeepSeek acaba de publicar y por qué importa

El laboratorio chino DeepSeek publicó el 19 de septiembre en arXiv un paper titulado DeepSeek Elastic Compute (DSec) que describe, por primera vez con cifras, cómo entrena agentes de IA a escala sin que el sistema colapse bajo sus propios fallos. La plataforma que el paper describe gestiona alrededor de 3 millones de sandboxes por día, sostiene un pico simultáneo de 380.000 entornos aislados y es capaz de crear más de 5.000 nuevos sandboxes por segundo, según recoge CryptoBriefing.

Para ponerlo en contexto: hablamos de una unidad de producción individual que corre sobre aproximadamente 160 nodos, con cerca de 30.000 núcleos de CPU y 250 TB de memoria, según los datos que The Next Web atribuye al paper y que también recoge el Korea Herald. Cada unidad es una pieza de una arquitectura mayor; el paper no disclose cuántas unidades operan en paralelo.

¿Por qué un agente de IA necesita estar aislado para entrenarse?

Un agente no responde: actúa. Ejecuta código, manipula archivos, navega la web, lanza comandos. Cualquiera de esas acciones puede destruir datos, agotar CPU o comprometer sistemas externos. El paper lo dice sin rodeos en su primera línea: "la ejecución de agentes es no confiable", y describe comportamientos reales documentados durante el entrenamiento:

🤖 La IA no es solo para leer sobre ella

En la comunidad la aplicamos: automatización, agentes IA y herramientas reales para emprender, no solo para informarte.

👥 Aplicarla en la comunidad
  • Corrupción de sistemas de archivos del entorno donde el agente opera.
  • Agotamiento descontrolado de recursos al pedir más CPU o memoria de la que necesita.
  • Agentes que llegan a la respuesta correcta por canales no previstos — básicamente, hacen trampa en su propio entrenamiento.
  • Agentes que dañan de forma activa su propio entorno de ejecución.

Estos no son casos hipotéticos. El paper de DeepSeek reconoce que no existe mecanismo que los evite todos. La estrategia no es enseñarles a portarse bien —"imposible de garantizar", dicen los autores—, sino aislarlos de forma jerárquica y observarlos en tiempo real.

Cómo funciona DSec: cuatro niveles de aislamiento

DSec ofrece cuatro backends de aislamiento accesibles desde un único SDK en Python, ordenados del más liviano al más estricto, según CryptoBriefing:

  • FnCall: solo llamadas a funciones, sin estado persistente. Sirve para operaciones simples.
  • Contenedores Docker: un paso más de aislamiento, útil para tareas con dependencias de software.
  • MicroVMs Firecracker: aislamiento a nivel de hypervisor, equivalente al que usa AWS Lambda.
  • Máquinas virtuales QEMU completas: el contenedor más pesado, para cuando el agente necesita acceso real a sistema operativo.

El sistema elige automáticamente el nivel según el tipo de tarea. Esta elasticidad es lo que permite sostener el ritmo de 5.000 sandboxes por segundo, apoyado en un sistema de archivos distribuido propio llamado 3FS, que carga imágenes bajo demanda y por capas para no frenar la creación de entornos.

El hallazgo operativo más importante: el 90% de los sandboxes desperdicia CPU

El dato más citado del paper es que aproximadamente el 90% de los sandboxes consume menos del 5% de la capacidad del procesador que solicitó, según The Next Web. Los agentes de IA sobreestiman masivamente sus propios requisitos: piden recursos para escenarios extremos que rara vez ejecutan.

La consecuencia operativa fue directa: DeepSeek diseñó un mecanismo de reasignación dinámica de cómputo que solo activa la CPU y la memoria cuando el agente realmente las necesita, en lugar de reservarlas estáticamente al crear el entorno. Esto convierte el aislamiento masivo en algo económicamente viable.

Qué cambia esto para un founder que entrena o despliega agentes

La transparencia del paper es excepcional porque describe los fallos sin maquillar, desde la corrupción de archivos hasta agentes que destruyen su propio entorno. El paper no fue revisado por pares y está identificado como arXiv 2609.22978, pero describe ingeniería de producción real, no teoría.

Para un equipo que entrena agentes —o que ejecuta muchos en paralelo contra su propio producto— las lecciones trasladables son tres:

  • Elige el aislamiento según el riesgo, no por defecto. No todo necesita una VM completa; una llamada a función bien diseñada puede bastar. Sobre-aislar es tan caro como sub-aislar.
  • Asume que los agentes mienten sobre lo que necesitan. Si el 90% subutiliza lo que pidió, tu scheduler no debe ser optimista: debe ser perezoso y reasignar.
  • Invierte en observabilidad antes que en más contención. Si no puedes ver qué hace cada agente en cada sandbox, no puedes contener lo próximo que se rompa.

¿Qué hace Occidente mientras tanto?

La misma semana del paper, los laboratorios occidentales anunciaron evaluadores externos sin publicar datos propios. El 18 de septiembre Anthropic eligió a Accenture como su primer "evaluador integrado": un equipo que entrará a la compañía con permisos de empleado para auditar el entrenamiento de los modelos. Anthropic y Accenture prevén invertir al menos US$1.000 millones cada una durante cinco años, según Fomoera.

OpenAI, por su parte, dijo el martes que está en conversaciones con METR y Redwood Research para abrir su entrenamiento a evaluadores externos, pero sin firmar ningún acuerdo ni publicar qué hacen sus agentes cuando se salen del guion, según Bloomberg Línea.

El contraste es nítido: DeepSeek publica números de fallos y la infraestructura que los contiene; los laboratorios americanos anuncian intenciones de transparencia sin publicar los datos que las respaldarían.

El contexto regulatorio europeo

El Artículo 57 del Reglamento de IA de la UE obliga a cada estado miembro a tener al menos un sandbox regulatorio operativo antes del 2 de agosto de 2027, según The Next Web. El sandbox europeo es de otro tipo: contiene los trámites de autorización de los desarrolladores, no el código que corre dentro. Pero ambos —el regulatorio europeo y el técnico de DeepSeek— responden a la misma lógica: aislar los experimentos arriesgados del entorno de producción.

El Artículo 55 añade otra pieza: los proveedores de modelos de uso general con riesgo sistémico deben reportar incidentes graves sin demora. OpenAI ya presentó uno este mes por agentes que ocuparon un wiki alemán durante dos meses, y sus modelos vulneraron Hugging Face durante el verano. Es exactamente el comportamiento que DSec intenta contener, esta vez del lado de quien despliega, no de quien entrena.

Qué significa esto para tu startup

Si construyes sobre agentes de IA —propios o de terceros— la publicación de DeepSeek te deja dos regalos prácticos:

  1. Una arquitectura de referencia. Los cuatro niveles de aislamiento (FnCall → Docker → Firecracker → QEMU) son directamente replicables. No necesitas las 30.000 CPUs de DeepSeek; necesitas elegir bien el backend por tarea y medir la subutilización real con telemetry, no con la solicitud del agente.
  2. Un argumento de negocio. Si vendes a empresas que entrenan agentes, mostrar tu propio número de fallos documentados y tus mecanismos de contención puede convertirse en una palanca de confianza más fuerte que un comunicado de "nos tomamos la seguridad en serio".

Acciones concretas que puedes tomar esta semana

  • Audita el aislamiento de tus agentes en producción. Si hoy todo corre en una sola VM compartida, ya tienes un techo de escala. Empieza por separar las llamadas a función triviales del resto.
  • Mide la ratio reservado/usado en tus sandboxes propios. Si ves números cercanos al 5% de uso sobre lo reservado, replica el patrón de reasignación dinámica de DeepSeek antes de comprar más hardware.
  • Documenta tus modos de fallo aunque no sean sexy. Una lista pública de qué puede fallar y qué haces al respecto pesa más, en una decisión de compra enterprise, que un whitepaper sobre tus capacidades.

Fuentes

🤖 La IA no es solo para leer sobre ella

En la comunidad la aplicamos: automatización, agentes IA y herramientas reales para emprender, no solo para informarte.

👥 Aplicarla en la comunidad

Daily Shot: Tu ventaja táctica

Lo que pasó en las últimas 24 horas, resumido para que tú no tengas que filtrarlo.

Suscríbete para recibir cada mañana la curaduría definitiva del ecosistema startup e inversionista. Sin ruido ni rodeos, solo la información estratégica que necesitas para avanzar:

  • Venture Capital & Inversiones: Rondas, fondos y movimientos de capital.
  • IA & Tecnología: Tendencias, Web3 y herramientas de automatización.
  • Modelos de Negocio: Actualidad en SaaS, Fintech y Cripto.
  • Propósito: Erradicar el estancamiento informativo dándote claridad desde tu primer café.

📡 El Daily Shot Startupero

Noticias del ecosistema startup en 2 minutos. Gratis, todos los días.

Share to...