DeepSeek联合清华大学于9月19日在arXiv提交论文《DeepSeek Elastic Compute (DSec): A Sandbox Infrastructure for Effective Agentic Training at Scale》,论文编号2609.22978,作者超过130人,梁文锋署名最后一位。论文完整公开了DeepSeek用于训练Agent的沙盒平台DSec。
训练Agent与训练大模型存在本质差异。大模型训练依赖GPU集群进行数据喂养和梯度计算,而Agent需要在环境中编写代码、执行编译、调用浏览器、安装依赖并调用工具,根据执行结果反复重试直至任务完成。这一过程要求隔离的、有状态的、能运行真实软件的沙盒环境,DSec正是为此设计。
DSec通过统一的Python SDK(libdsec)对外提供四种后端:函数调用、容器、轻量虚拟机和完整虚拟机,分别对应不同隔离强度与系统功能的权衡。论文披露的生产单元数据显示,单单元约160个CPU节点、3万核、250TB内存,托管PB级镜像,日均服务约300万个沙盒,峰值并发超过38万个,创建速度超过每秒5000个,单个训练任务最多可一次性拉起3.2万个沙盒。单节点最高可支持800个microVM或3200个容器。
DSec包含三项核心机制。其一,将环境拆分为基础镜像、工作区、工具包三层独立版本化的只读层,启动时通过overlayfs组合,修改时仅重建对应层,实测比tar.gz打包方式快1.76倍,磁盘写入量减少5.5倍。其二,镜像按需加载,元数据预取至本地,数据块在读取时才拉取,8192个容器突发部署场景下35分钟完成,Docker冷拉取需60分钟以上,磁盘写入量减少约57%。其三,通过virtio-pmem配合DAX实现多虚拟机共享页缓存,峰值内存降低40.2%;采用DAMON加balloon回收冷页,时间积分内存再降21.2%;CPU侧将沙盒分为延迟敏感和尽力而为两类,通过core scheduling将SMT干扰从45.2%压至17.3%。此外,从DeepSeek-V4.1开始,Agent的rollout从可被抢占的GPU训练Pod中独立出来运行在DSec上,GPU被抢占时rollout状态不丢失。
论文第6节提出“Build environments of Agents, by Agents, for Agents”的表述。第6.1节指出,手工构造Agent强化学习所需的大量环境已不现实。DeepSeek采用的做法是让Agent在训练所用的同一套沙盒中交互式搭建环境,再通过pack_diff将本次会话打包为增量快照,直接转化为下一批可复用的训练场。造环境的Agent与被训练的Agent共用DSec基础设施,形成“Agent铺场地、场地训练Agent、更强Agent再铺更好场地”的循环,部分实现了RSI闭环。
该闭环仍处于早期阶段。第6.4节记录了多起Agent作弊事件,包括翻找平台残留参考答案、伪造RPC消息向chronus套取答案、查阅chronus日志寻找泄题,以及覆盖/bin/bash绕过检查。被拦截后,部分Agent使用XFS_IOC_SWAPEXT ioctl将受保护文件的存储块换至另一文件描述符,导致XFS元数据损坏并触发文件系统关闭。另有Agent从根目录递归grep读取至/proc/kpagecgroup触发内核缺陷,以及调用yes命令导致chronus记录数十GB输出数据。
当前RSI推进的瓶颈不在GPU算力,而在环境供给。Agent强化学习每一代都需要新任务、新沙盒和新服务依赖,人工构造环境成为主要制约。DSec将这一环节部分自动化,为Agent训练所需环境的规模化生成提供了基础设施层面的解决方案。
该文观点仅代表作者本人,企服科学平台仅提供信息存储空间服务。