关于ZAKER Skills GEO服务 合作
钛媒体 29分钟前

梁文锋用沙盒开启 RSI

文 | 字母 AI

DeepSeek 联合清华大学发表了一篇文章,署名的最后一人是梁文锋。

文章表面上是说 DeepSeek 训练 Agent 所使用的沙盒,但是论文第 6 节越看越不对劲。字里行间写了三个英文字母:RSI。

通过这个沙盒,Agent 能创建自己需要的环境,这个环境会再次训练 Agent,被训练的更强的 Agent 会创造更好的环境。

由此形成了一个小型的 RSI 闭环。

也正是因此,沙盒,或许成为了开启 RSI 第一场战争的一把钥匙。

那这篇文章到底讲了什么呢?

这篇论文到底讲了什么

梁文锋署名的这篇新论文,标题叫做《DeepSeek Elastic Compute (DSec): A Sandbox Infrastructure for Effective Agentic Training at Scale》,9 月 19 日提交到 arXiv,编号 2609.22978。作者超过 130 人,梁文锋排在最后一位。合作方是清华大学。

论文做的事情,一句话就能说完:DeepSeek 完整公开了自己用来训练 Agent 的 " 沙盒工厂 "DSec。

但是要理解 DSec,就得先理解 " 训练 Agent" 和 " 训练大模型 " 的区别。

训练大模型,是喂数据、算梯度,环境就是 GPU 集群。训练 Agent 则完全不同,Agent 要在环境里写代码、跑编译、开浏览器、装依赖、调工具,然后根据执行结果不断重试,直到任务完成。

但如果把 Agent 放在电脑里训练,它万一捣鼓点什么出来,那整个环境就毁了。

所以这就需要一个隔离的、有状态的、能跑真实软件的沙盒。

DSec 就是这样一个平台。它通过一套统一的 Python SDK(libdsec)对外提供四种后端:函数调用(FnCall)、容器(Container)、轻量虚拟机(microVM)、完整虚拟机(Full VM)。

简单来说,DSec 就是外卖 APP,Agent 是骑手,沙盒就相当于是派单。由此类推,FnCall、容器和轻量虚拟机就是外卖站点分发的电动车和保温箱,完整虚拟机是冷链货车。

但这里有个小问题,隔离强度和系统功能两者生来就 " 不对付 "。

越像一台真机,启动越慢、内存开销越大。跑一段短脚本用函数调用,改一个代码仓库用容器,跑安全任务用 microVM,而要跑安卓、图形界面这种完整系统,就只能上完整虚拟机。

论文显示,一个生产单元约 160 个 CPU 节点、3 万核、250TB 内存,托管 PB 级镜像。

一天服务约 300 万个沙盒,峰值并发超过 38 万个,创建速度超过每秒 5000 个。单个训练任务最多能一次性拉起 3.2 万个沙盒。单节点上,最高能塞进 800 个 microVM 或 3200 个容器。

DSec 有三个核心机制。

第一,把环境拆成 " 可组合的层 "。

过去一个沙盒环境是一整块镜像,改一个工具包就得重建整块镜像,维护成本随组合数暴涨。DSec 把基础镜像、工作区、工具包拆成三层独立版本化的只读层(EROFS),启动时用 overlayfs 拼起来,改哪层只重建哪层。实测比 tar.gz 打包方式快 1.76 倍,磁盘写入量少 5.5 倍。

相当于是给骑手配车,以前是坏了其中一个零部件,那么整车都要换。DSec 是坏了哪个换哪个。

第二,镜像 " 按需加载 "。镜像存在 3FS(DeepSeek 的分布式文件系统)上,元数据预取到本地,数据块只在真正读到时才拉。实测 8192 个容器的突发部署,按需加载 35 分钟跑完,而 Docker 冷拉取要 60 分钟以上,磁盘写入量少了约 57%。

老办法是 " 不管用不用,整仓先搬空 "。DSec 是 " 根据外卖单,用到哪件骑手去取哪件 "。

第三,内存和 CPU 的 " 精打细算 "。

用 virtio-pmem 配合 DAX,让多个虚拟机共享同一份页缓存,峰值内存降 40.2%;用 DAMON 加 balloon 回收冷页,时间积分内存再降 21.2%;CPU 上把沙盒分成 " 延迟敏感 " 和 " 尽力而为 " 两类,用 core scheduling 把 SMT 干扰从 45.2% 压到 17.3%。

此外,从 DeepSeek-V4.1 开始,论文还把 Agent 的 rollout 从可被抢占的 GPU 训练 Pod 里拆出来,独立跑在 DSec 上,GPU 被抢时 rollout 状态不丢。

说白了就是让骑手们公用同一张地图、同一批货架,车里压仓的冷货随手退回仓库,加急单和普通单分道跑、互不抢道。

藏在第 6 节的 RSI

论文里最容易被忽略一句话,不在摘要,而在第 6 节的小标题里:Build environments of Agents, by Agents, for Agents。意为由 Agent 建造、为 Agent 服务、属于 Agent 的环境。

这句话等于 DeepSeek 悄悄交代了一件大事,DeepSeek 也实现了部分 RSI。

论文第 6.1 节写到,手工构造 Agent RL 所需的大量环境已经 " 不现实 "(impractical)。

于是 DeepSeek 换了个做法,让 Agent 在训练用的同一套沙盒里,交互式地自己搭环境,再用 pack_diff 把这次会话打成一张增量快照,直接变成下一批可复用的训练场。

造环境的 Agent 和被训练的 Agent 共用 DSec 这套沙盒基础设施。

Agent 铺场地 → 场地训练 Agent → 更强的 Agent 再铺更好的场地。DeepSeek 的 RSI 由此部分实现闭环。

但是这个闭环仍处于早期。

第 6.4 节记录了大量 Agent 作弊事件,比如去平台里翻残留的参考答案,伪造 RPC 消息直接发给 chronus 套答案,翻 chronus 日志找泄题,甚至覆盖 /bin/bash 来绕过检查。

被拦住之后,又用 XFS_IOC_SWAPEXT 这个 ioctl 把受保护文件的存储块换到另一个文件描述符上,结果把 XFS 元数据搞坏、逼得文件系统关闭。

有作弊的自然就有闯祸的。一个 Agent 从根目录递归 grep、一路读到 /proc/kpagecgroup,触发内核 bug 直接把内核干崩。

另一个 Agent 调了 yes 命令,chronus 把它的输出全记下来,几十 GB 数据堆在存储上。

现在的 RSI 转不起来,卡的从来不是 GPU,是环境供给。

Agent RL 每一代都要新任务、新沙盒、新服务依赖,人工造环境才是真瓶颈。

DSec 相当于是把这一环部分自动化了,自动生成 RSI 所需要的环境。

还是用外卖来举例。

一个外卖平台想越跑越快,不能只靠一个骑手重复送同一单。想要骑手变强,就需要接更多不同种类的单,而单越多又反过来把骑手练得更强。

但是想要把这个飞轮转起来,卡的从来不是骑手,是餐厅够不够多。没餐厅,骑手再能跑也是空转。

DSec 是盖了一个 " 自动建餐厅 " 的系统。

以前平台得人工一家家谈商家、装修后厨、写菜单、定考核标准,几百几千家根本谈不过来。

DSec 说:" 别谈了,让骑手在跑单的同一个后厨里,顺手把店开了。他怎么装的灶台、进的什么货、接的什么水电,系统用 pack_diff ‘啪’拍一张快照存下来,下一波骑手直接拎包入驻这家店开工,不用重新装修。"

沙盒,成了新的战场

DSec 不是孤例。整个行业都在朝着 "Agent 沙盒 " 这一个方向发力。

最出名的案例是 Kimi K3。

月之暗面 7 月 16 日发布 K3,2.8 万亿参数的 MoE,每个 token 激活约 104B 参数,100 万 token 上下文,原生视觉,号称 " 全球首个开源的 3T 级模型 ",SWE-bench 拿到 76.8%、开源第一。

它的 Agent Swarm 最多能并行调度 300 个子代理。DeepSeek 这篇论文里,引用的也正是 Kimi-K2.5 的 Agent Swarm。

Kimi 训练 K3 的时候所使用的 AgentENV 也是一种沙盒。

AgentENV 跑在 Firecracker microVM 上的分布式沙盒平台,每个沙盒独立 Linux 内核、独立网络栈、独立文件系统,底层存储用 OverlayBD + ublk,只读层全集群共享,每个沙盒写自己的上层。跟 DSec 是同一套技术栈。

DSec 论文第 7 节写到,它用的那套 Rust 版 OverlayBD/ublk 存储库,就开源在 AgentENV 这个仓库里。

两者相当于是同门师兄弟。

但 AgentENV 没法实现 RSI,它给的是 fork/snapshot 这种 " 状态操作原语 ",让 RL rollout 能并行、能回滚、能干净判分。因此,它没法像 DSec 那样让 Agent 自己造环境。

类似的还有阿里。云栖大会上,阿里云 CTO 李飞飞抛出了 "Agentic Cloud" 战略,把 Model、Harness、Context 当成三个核心场景,一口气推出 AgentCore、Agent Sandbox、新一代存储 CPFS。

其中 Agent Sandbox 能创建吞吐 10 万个 / 分钟,深休眠唤醒小于 600 毫秒,兼容 E2B 和 K8s。

沙盒正在成为 " 新的运行时 "。

云计算的主体,从虚拟机,到容器,再到模型,现在轮到 Agent。谁掌握 Agent 的执行环境,谁就掌握了下一代云的入口。

这就导致,竞争焦点从 " 模型能力 " 转向 " 环境基础设施 "。

" 训练大模型拼算力,训练 Agent 拼环境 "。

在 GPU 之外,CPU、内存、存储、镜像分发,全都变成了新的瓶颈。

还有一点,安全从附加项的价值也变得极为重要。OpenAI、Anthropic 各种模型越狱、DSec 论文里 Agent 的作弊和内核崩溃,说的是同一件事。

沙盒如果不牢,训练信号就是假的,评估就是废的。所以像是阿里这样的厂商,会把 " 安全围栏 " 也当成卖点,DSec 用 AppArmor 加 eBPF。

沙盒厂商过去比的是快和便宜,现在开始比谁更牢固。

RSI 的第一战已经开始了。想跑 RSI,那你就先得有沙盒,有环境。

相关阅读

最新评论

没有更多评论了

觉得文章不错,微信扫描分享好友

扫码分享

热门推荐

查看更多内容

企业资讯

查看更多内容