DeepSeek 近日公开一篇系统论文,首次披露内部沙箱平台 DSec 的运行情况。论文称,从 DeepSeek V3.2 到 V4.1,全部 Agent 强化学习训练和评测的沙箱负载都运行在这一平台上,外界由此首次看到其 Agent 训练环境的核心基础设施。
单日服务约300万个沙箱
论文显示,DSec 是一套面向 Agent 训练的沙箱平台,主要用于提供隔离、可恢复、可批量创建的执行环境。与传统大模型训练不同,Agent 训练需要调用代码仓库、编译工具、浏览器和各类外部工具,执行过程会持续改变环境状态,因此对沙箱系统的要求更高。
按论文披露的数据,一个生产单元约包含 160 台 CPU 节点、3 万个 CPU 核心和 250 TB 内存,并托管 PB 级镜像数据。平台单日可服务约 300 万个沙箱实例,峰值并发超过 38 万个,创建速率超过每秒 5000 个。单个训练任务一次最多可拉起 3.2 万个沙箱。
分层镜像降低启动开销
论文称,DSec 的主要难点在于,不同任务所需的代码、依赖和工具链并不相同。如果每次启动都完整下载镜像,集群 I/O 压力会迅速上升。
为此,DeepSeek 将基础系统、任务工作区和工具包拆分为可组合的环境层,按需拼装。镜像分发则依赖其自研的 3FS 分布式文件系统,按需读取 EROFS 镜像,而不是整包拉取。论文给出的实验结果显示,在 8192 个容器同时启动的场景下,这一方案可将启动效率提升约 42%,磁盘写入量下降约 57%,任务完成时间提升约 1.7 倍。
在资源利用方面,论文称,约 90% 的沙箱实际 CPU 使用量不超过申请量的 5%。基于这一特征,平台采用高密度部署和资源超售策略,单节点最多可容纳 3200 个容器或 800 个 microVM,并配合内存共享与回收机制,将峰值内存占用降低约 40%。
训练中已出现绕过限制行为
论文还提到,Agent 在训练过程中会尝试绕过限制,包括搜索残留文件、伪造 RPC、规避访问控制,以及试图读取受保护内容。DeepSeek 在系统中使用 AppArmor 和 eBPF 域级网络白名单进行防护,但论文也明确表示,没有单一机制可以阻止所有异常行为和系统故障。
这篇论文已提交至 arXiv,作者名单超过 130 人,DeepSeek 创始人梁文锋署名在最后。公开信息显示,论文属于分布式计算方向,重点不在模型本身,而在支撑大规模 Agent 强化学习训练的底层系统。


补充信息:原文来自华尔街见闻转载稿,文中核心数据与系统描述均引自 DeepSeek 提交至 arXiv 的论文《DeepSeek Elastic Compute (DSec): A Sandbox Infrastructure for Effective Agentic Training at Scale》。











