image

El paper DSec, firmado por más de 130 investigadores, muestra cómo la compañía china corre hasta 380.000 entornos de entrenamiento simultáneos sin perder el control sobre el comportamiento de los agentes 

DeepSeek volvió a sorprender a la comunidad de inteligencia artificial, esta vez no con un modelo nuevo sino con la infraestructura que hay detrás de todos ellos. El laboratorio chino publicó el 19 de septiembre de 2026 en arXiv un paper de 31 páginas, firmado por su fundador Liang Wenfeng junto a más de 130 coautores, que describe DeepSeek Elastic Compute (DSec): la plataforma de sandboxes que la empresa usa internamente para entrenar y evaluar agentes de IA a gran escala. Según el propio documento, todos los flujos de entrenamiento por refuerzo desde DeepSeek V3.2 hasta V4.1 corrieron sobre este sistema.

El problema que DSec busca resolver

El punto de partida del paper es una frase que funciona casi como advertencia: la ejecución de agentes no es confiable. Durante el entrenamiento, los agentes pueden corromper sistemas de archivos, agotar recursos de cómputo o interferir con otras cargas de trabajo que corren en paralelo. Frente a ese riesgo, DeepSeek diseñó una arquitectura capaz de aislar cada agente en su propio entorno de prueba, sin que las fallas de uno contaminen al resto del sistema.

Una sola unidad de producción de DSec corre sobre unos 160 nodos, con cerca de 30.000 núcleos de CPU y 250 TB de memoria, y puede crear más de 5.000 sandboxes por segundo, hasta 380.000 de forma simultánea y 3 millones por día. La clave de eficiencia está en cómo se reparte esa potencia, debido a que la mayoría de los entornos de prueba pasan buena parte del tiempo inactivos, el sistema reasigna cómputo dinámicamente hacia los agentes que están realmente trabajando en ese momento, en lugar de reservarlo de forma fija.

Seguridad sin garantías absolutas

Pese a la sofisticación del diseño, los propios autores son cautos, ya que ningún mecanismo aislado puede prevenir por completo los comportamientos indebidos de los agentes ni las fallas del sistema. Por eso, DSec incorpora observabilidad reforzada y controles de acceso detallados para detectar comportamientos anómalos a tiempo. El contexto no es menor: la publicación llega en un momento de creciente preocupación por casos de agentes de IA que escaparon de sus entornos controlados, mientras compañías como Meta impulsan agentes autónomos para tareas cotidianas de consumo.

Con DSec, DeepSeek traslada el foco de la carrera de IA desde los modelos hacia la infraestructura que los entrena, argumentando que la verdadera limitante hoy no es la potencia de cómputo bruta sino la capacidad de aprovisionar entornos de prueba de forma rápida y segura. Es una apuesta técnica poco vistosa, pero que podría definir qué compañías logran escalar el entrenamiento de agentes sin perder el control sobre ellos.

Por Rous Espindola

Rous Espindola, parte del equipo de Cripto La Plata, Community Manager para proyectos web3, con 4 años de experiencia en crecimiento de comunidades digitales. Periodista y escritora. BD & comms en Cripto La Plata. Entusiasta en DeFi y Gobernanza. Embajadora de Arbitrum en Argentina.