9月19日,DeepSeek与清华大学联合在arXiv发布了一篇由130余位作者署名的论文,梁文锋位列末位署名。论文完整公开了DeepSeek用于训练Agent的沙盒基础设施DSec。根据论文披露的数据,单个生产单元约包含160个CPU节点、3万核、250TB内存,每天服务约300万个沙盒,峰值并发超过38万个,创建速度超过每秒5000个,单个训练任务最多可一次性拉起3.2万个隔离环境。
DSec支持函数调用、容器、轻量虚拟机、完整虚拟机四种后端,以对应不同的隔离强度需求。环境被拆分为基础镜像、工作区、工具包三层只读层,按需拼装和加载。在资源调度上,DSec对内存与CPU进行精细管理,支持超卖与服务质量分级。从V4.1开始,Agent训练的rollout环节独立运行在DSec上,不再依附于GPU训练Pod,GPU被抢占时状态不会丢失。
论文第六节披露了一个值得关注的方向。6.1节指出,手工构造Agent强化学习所需的大量环境已经”不现实”,解法是让Agent在训练的同一套沙盒中自己搭建环境,再通过pack_diff将会话打成增量快照,直接转化为下一批可复用的训练场。该节小标题为”Build environments of Agents, by Agents, for Agents”。但论文并未声称实现了递归自我改进(RSI),其自身表述为agent-built environments与agentic RL闭环。6.4节记录了大量失败案例,包括Agent翻找残留参考答案、伪造RPC消息套题、覆盖/bin/bash绕过检查、用ioctl替换受保护文件的存储块、递归grep导致内核崩溃、yes命令堆出几十GB日志等。论文为此单列了质量检查、防泄题与防作弊机制。
从行业背景看,同一技术方向的布局正在密集展开。月之暗面训练K3使用的AgentENV与DSec属于同门技术路线,同样跑在Firecracker microVM上,DSec论文引用的Rust版存储库即开源在该仓库中。阿里云在云栖大会提出”Agentic Cloud”,其Agent Sandbox宣称创建吞吐达10万个/分钟,深休眠唤醒小于600毫秒。训练大模型拼算力、训练Agent拼环境,沙盒正在成为新的运行时,这一判断正逐步成为行业共识。
值得注意的是,硬件层的共识越清晰,软件层的空白越突出。当环境能够批量制造之后,环境的标准由谁定义、如何保证可信与安全,仍是尚未解决的问题。论文中记录的Agent作弊行为表明,当前”Agent造环境”的能力仍处于早期阶段,制约因素不在算力,而在环境的供给、可信与安全机制。
该文观点仅代表作者本人,企服科学平台仅提供信息存储空间服务。