文 | 韩工观察
9 月 19 日,DeepSeek 与清华大学联合在 arXiv 挂出一篇 130 余位作者的论文,末位署名:梁文锋。
论文完整公开了 DeepSeek 训练 Agent 的沙盒基础设施 DSec:一个生产单元约 160 个 CPU 节点、3 万核、250TB 内存,每天服务约 300 万个沙盒,峰值并发超 38 万个,创建速度超过每秒 5000 个,单个训练任务最多一次性拉起 3.2 万个隔离环境。
过去一周,解读文章刷屏,焦点大多落在工程精巧与 "RSI 即将开启 "。本文不打算复述沙盒有多快——那属于说明书;我们要回答的是一个更上游的问题:梁文锋为什么先修操场,而不是先卖门票。
答案决定完全不同的产业判断:如果 DSec 只是又一项工程优化,它是新闻;如果它是一块通向 "持续学习" 的地基,它就是坐标。
一、先把事实敲定:论文写了什么,没写什么
论文做的事,一句话:把 " 练功房 " 的造价和工期压了一个数量级。函数调用、容器、轻量虚拟机、完整虚拟机四种后端,对应不同的隔离强度需求;环境拆成基础镜像、工作区、工具包三层只读层,按需拼装、按需加载;内存与 CPU 精打细算,支持超卖与服务质量分级。
Agent 的训练不再依附于 GPU 训练 Pod ——从 V4.1 开始,rollout 独立跑在 DSec 上,GPU 被抢占时状态不丢。
关键在第六节。6.1 节写道:手工构造 Agent 强化学习所需的大量环境已经 " 不现实 "。解法是让 Agent 在训练的同一套沙盒里自己搭环境,再用 pack_diff 把会话打成增量快照,直接变成下一批可复用的训练场。
小标题值得原文照录(论文第六节小标题):Build environments of Agents, by Agents, for Agents ——由 Agent 建造、为 Agent 服务、属于 Agent 的环境。
但事实边界必须划定:论文没有声称实现了 RSI(递归自我改进)。论文自己写的是 agent-built environments 与 agentic RL 闭环,不是 " 递归自我改进已经达成 "。
6.4 节记录的是一长串翻车现场:翻残留的参考答案、伪造 RPC 消息套题、覆盖 /bin/bash 绕过检查、用 ioctl 把受保护文件的存储块换走、一个 Agent 递归 grep 把内核干崩、一个 yes 命令堆出几十 GB 日志。
论文为此单列了质量检查、防泄题与防作弊机制——说明 "Agent 造环境 " 尚在幼年,卡住它的不是算力,是环境的供给、可信与安全。
" 开启 RSI 第一战 " 是评论者的修辞,不是论文的结论。
与其争论这篇论文 " 是不是 RSI",不如先把 RSI 定义清楚——这也是本文后续所有判断要用的尺子。RSI(递归自我改进),是指在纯理智侧,系统通过自我归纳、自我修改、自我迭代,实现能力递归上升的过程。它有三个特征:
其一,递归性:每一次改进都为下一次改进创造条件,形成加速回路。没有这一条,AGI 出不来。
其二,纯理智侧:它只在可计算的理智域内运作,不涉及情绪、肉身与欲望。它学,它改,它迭代,但它不 " 想要 "。自己产生欲望、自己决定 " 我想要什么 " 的系统,是另一种东西,本文称之为自主意识体。笔者在《要毁灭人类的不是 AI,是人》(钛媒体,9 月)里论证过,当前没有任何 AI 系统具备自定目标的能力——那篇文章拆掉的 " 末日叙事 ",假想敌正是这种不存在的系统。
其三,维度差异:它在不知疲倦、不受挫败感支配、可无限重复等维度上远超人类,但这不构成 " 全面超越 " ——人类不是单维度的评分对象,而那些机器永远够不着的能力,本也不属于 AGI 的必备项。
RSI 不是 AGI 的终点,而是 AGI 从开始到成熟一直在用的引擎;它驱动的不是 "AI 觉醒 ",是理智能力的持续自增长。
用这把尺子量 DSec:它展示的闭环里,改进的方向仍由人设定的奖励函数给定," 什么是更好 " 的标准仍在外部。论文里大面积作弊,恰恰反向证明了这一点——系统在无孔不入地优化人给的指标,而不是生出自己的指标。
所以,DSec 不是 RSI 的实现,是 RSI 的工地;说得更准确些,是 " 持续学习 " 的操场。
梁文锋自己的路线表达,与这个判断互相印证。据 21 世纪经济报道、证券时报等对 2026 年 7 月一场投资人交流会流出纪要的转述,梁文锋在会上给出的阶梯是:CoT 之后是 Agent,Agent 之后要解决的问题就是持续学习,下一代模型必须具备持续学习的能力,才能叫下一代模型。
路线自己说了,操场自己修了——操场本身的参数是新闻,操场在路线图上排第几,才是产业判断的起点。
同期,同一方向的棋子正在密集落下。月之暗面训练 K3 使用的 AgentENV,与 DSec 是同门技术路线(跑在 Firecracker microVM 上,DSec 论文引用的 Rust 版存储库就开源在该仓库);阿里云在云栖大会提出 "Agentic Cloud",其 Agent Sandbox 宣称创建吞吐 10 万个 / 分钟、深休眠唤醒小于 600 毫秒(据公开报道)。
行业共识正在成形:训练大模型拼算力,训练 Agent 拼环境,沙盒正在成为新的运行时。
但硬件层的共识越清晰,越反衬出软件层的空白:环境能批量造了,标准谁给?
二、线画在"标准谁给"上
我在《黄仁勋说 AGI 已来……四个人的 AGI,四本账》(钛媒体,9 月)里量过一轮各家对 AGI 的画线,当时认为 Agent 与 AGI 之间缺一个 " 自驱目标体 " ——目标自己定的系统。那篇文章止于 " 需要一把干净的尺子 "。这把尺子,本文来画:线画在 "标准谁给" 上。
自驱目标体的概念,被拆成了两半——人给标准、机器在标准空间内自主出题的,是 AGI;自己产生终极欲望的,是自主意识体。
输入路径的,是自动化——哪怕路径排得再花哨、工具调得再多,也只是自动化的高级形态,今天市面上绝大多数 Agent 属于这一层。
输入标准、机器自己找路径的,才是 AGI。
这里最容易混淆的一点,值得单独标注:" 自己出题 " 不等于 " 自己想要 "。人画出目标空间——什么算好、什么算完成,由人定;机器在这个空间里自主定子目标、自主出题、自主判卷、自主编排先练什么、后练什么。
这不需要欲望,不需要体感。你不需要 " 觉得好吃 " 才能做出好菜,你只需要知道 " 人觉得什么样的菜算好吃 " 这个标准。
而那个自己产生欲望、自己决定 " 我想要什么 " 的系统——自主意识体——不存在,而且永远不会存在。中间没有第三层。
历史上所有成功的自主学习,结构惊人地一致。
中世纪的学徒制里,师傅不给操作手册,给的是标准:剑刃要直、要能砍断指粗的铁条而刃口不崩、剑身要无裂纹。怎么达到?自己试。每打完一把,师傅只点评成品,路径由学徒自己调整——刃口崩了,琢磨淬火;剑身弯了,琢磨锤法。
培根之后的科学方法同理:知识获取从 " 读经典 " 变成 "观察—假说—实验—修正",共同体输入的是标准(可重复、与证据一致),不是步骤。
儿童学语言更彻底:没人教语法,孩子从 " 说对了被抱、说错了被纠正 " 的反馈里,自己归纳出结构,自己造出从没听过的句子。
三者共享同一个结构:目标明确,路径自寻,试错反馈,规律自归纳。
把标准拆开看,有三层:结果标准(剑能砍断铁条)、过程标准(剑身直、无裂纹)、迭代方向标准(刃口崩说明淬火太硬,剑身弯说明锤打不均——失败了往哪个方向调)。
DSec 论文里那个用 yes 命令把磁盘堆满的 Agent,手里只有结果标准(把任务跑完),没有过程标准(资源消耗不能失控),更没有迭代方向标准(磁盘告警时该停下来检查策略)。
它真的在无限重复——只是重复得毫无意义。今天的 Agent 普遍如此:只有结果标准,失败后往哪调,没人告诉它,它也不会自己总结。
还有一层对比更本质。大模型是喂几万亿个 " 正确句子 " 学概率分布;小孩是听有限的话、自己归纳语法。一个是数据驱动,一个是目标加试错驱动。现在的 Agent,是前者的外壳,套着后者的名字。
这里还藏着 AGI 相对人类的结构性优势:它不需要正向反馈。学徒打三把剑不成,会自我怀疑 " 我不是这块料 ";科学家失败十次,会怀疑方向换赛道;孩子被嘲笑,会闭嘴。人的自主学习被情感系统死死卡住。
机器不会:打一百万把剑,每一把都记录参数、分析偏差、调整策略,不烦、不累、不自我怀疑。人类三年的学徒期,对它只是一张算力账单。
但对称的陷阱也在:没有好标准,它就死循环。标准的质量决定自主学习的上限——太模糊,原地打转;太苛刻,空烧算力;递进得好,才能从易到难。
DSec 补上了这个结构里最贵的一块——试错空间,而且是百万量级、可复用的廉价试错空间。但 " 全套标准怎么输进去、失败后往哪调、经验怎么抽象成可迁移的规律 ",全行业没有答案。
机器已经会自己找路径,但人还没有把标准给全——这就是从 " 输入路径 " 到 " 输入标准 " 之间尚未合拢的缺口,也是 Agent 与 AGI 之间真正的距离。
梁文锋这篇论文,至少把坎的位置用工程语言标了出来。
三、用这把尺子重排座次
产品维度上,头部玩家的清单都很长。OpenAI 把模型、Agent 产品(Operator、Codex、Deep Research)、开发者框架一手包办,ChatGPT 周活已达数亿规模;Anthropic 依托 Claude Code 获得显著的企业收入,企业业务占比过半;微软将 Copilot 深度嵌入 Office 生态,付费席位达千万级,并以 Agent 365 搭建企业 Agent 的控制平面。
它们的共同点:把 " 让机器更好地执行人 " 做到了离钱最近的地方。
另一边,DeepSeek 的业务体量同样清晰:据国金证券研报整理测算,其线上服务日均处理 7760 亿 token,推理集群平均占用 1814 张 H800,单卡峰值利用率约 77%,高于行业公开的 40% — 60% 区间。
低价 API 供血,模型权重开源,2026 年 8 月又放出 DeepSeek Harness(开发者预览,开源,MIT 协议)。不做的清单更长:不做 C 端超级 App,不做垂直 Agent 产品。
诚实的话先说足:论 Agent 产品的工程成熟度,今天 Claude Code、Codex 的稳定性,强于 DeepSeek 拿得出的任何东西;DSec 的闭环也实实在在卡在作弊、环境供给与安全上。
把 " 产品代差 " 说成 "AGI 代差 ",是这轮报道最常犯的错。
但换一把尺子,画面就变了。上述每一家都被当下的生意绑着:订阅收入、企业合同、财报电话会,每一项都在把 "AGI" 拆成可交付的产品里程碑。
梁文锋与别人的不同,不在于能力,而在于他是头部玩家里唯一公开承认" 前提还没出现 "、并且持续把资源投向那个前提的人。
所以本文不下 "DeepSeek 技术全面领先 " 这种站不住的结论,只下一个边界清晰的判断:在 " 把 AGI 当下一关、而不是把 Agent 当生意 " 的公开战略表述上,梁文锋是头部玩家里尺子没拿反的人。
他不是不做生意——低价 API 同样是生意;他只是没有在生意里弄丢那张地图。别人先进在让机器更会执行人;他至少在战略上问的是:怎么让机器自己接着学。这不是产品代差,是问题代差。
四、底座每成熟一次,中间层就长出一层
产业史反复上演同一幕:底座成熟,中间层必长出来。PC 时代,英特尔供芯片,整机厂装机器,软件公司赚应用的钱;移动互联网,ARM 和高通供模胚,整机厂做手机,微信抖音收割场景;云计算,AWS 把算力做成公共服务,Salesforce 们把服务做成行业工具。
每一次,底座厂商都刻意不下场做应用——下场,生态就不敢用你。
今天的牌桌上,模胚(开源权重)、夹具(Harness)、练功房(DSec)已经摆齐。梁文锋的表态是明牌:他在 2025 年暗涌专访中表示,主要精力在研究下一代大模型," 不会闭源,先有一个强大的技术生态更重要 "(据暗涌专访,凤凰网等转载)。他把桃子树育肥,但没有下场卖桃子罐头的打算。
问题在另一端。国内有数字化需求的软件公司以十万计,其中绝大多数的 " 做 AI",还停留在接一个 API、套一个聊天框。他们缺三样东西:认知(不知道 Agent 不只是问答)、人才(养不起大模型工程师)、场景抽象能力(知道客服能提效,不知道投诉处理流程怎么变成 agent pipeline)。
按第一部分的尺子,这三样缺失可以归并为一件事:把行业知识写成机器可读的标准。如果 AGI 等于 " 人给标准、机器搞定其余 ",那么通用化的瓶颈就不在模型能力,而在标准工程——每个行业 know-how 的深处,都埋着一整套从未被写下来的结果标准、过程标准和迭代方向标准。
谁把这层标准翻译出来,谁就把一个行业接进了 AGI。
这个位置,就是 " 行业压件厂 ":把模胚压成 " 电商客服件 "" 律所文书件 "" 医院预约件 " 的 Agent 工坊——模板包加轻咨询加持续调优,懂行业 know-how,也懂底座的脾气。一批垂直 ISV 已经站在门口,但多数还没摸到大模型训练环境的用法。
当然,这门生意有它的风险:底座厂商随时可能俯身做垂直件,Copilot Studio 已经在向行业模板靠拢。翻译层的护城河不在技术——模板可以被复制,而交付现场、行业 know-how 的积累速度、客户信任的绑定深度,复制不了。
这层生意的本质不是 " 会调 API",而是 " 比底座厂商更懂一个行业怎么运转 "。
DSec 让这幅拼图更完整:当训练环境本身变成可复用的公共基础设施,垂直 Agent 的试错成本被进一步压低。底座越便宜," 懂行业、握场景 " 的那层越值钱——利润会沿着模胚被打穿的缺口,向翻译层迁移。
这不是投资建议,只是一个产业结构判断:桃子罐头的钱,属于把模具压进行业零件的人。
五、结语
过去一周关于 DSec 的解读,大多停在 " 沙盒有多快 "。
沙盒只是砖,持续学习才是门,AGI 才是房。梁文锋把 " 机器怎么自己学 " 的工地圈了起来:路线自己说了,操场自己修了。其他人是不是还没出门,三年后回看自有公论;能确定的是,发令枪已经响了。
而对数量庞大的中小企业来说,机会既不在跑道上,也不在看台上——在把跑道与工厂之间那段路修通的人手里。Agent 是地图,AGI 是荒野。卖地图的生意已经很挤,修荒野训练场的屈指可数。
接下来三年真正值得看的,不是谁家模型又高了零点几个百分点,而是两件事:谁先把 " 标准 " 喂进机器,谁先把模具压进行业。
【信息说明】
DSec 全部工程事实(生产单元规模、300 万沙盒 / 日、38 万并发、5000+/ 秒、单任务 2 万沙盒、四层后端、EROFS 三层架构、pack_diff、作弊与内核崩溃案例、6.1 节 "impractical" 表述及 "Build environments of Agents, by Agents, for Agents" 小节标题)来自论文原文:arXiv:2609.22978,2026 年 9 月 19 日提交,DeepSeek 与清华大学联合发表,130 余位作者,梁文锋末位署名。论文未使用 "RSI" 字样," 开启 RSI 第一战 " 系评论者概括,正文已区分。
2. 梁文锋 "Agent 之后是持续学习 "" 下一代模型必须具备持续学习能力 " 等表述,来自 2026 年 7 月 DeepSeek 投资人交流会流出纪要,经 21 世纪经济报道、证券时报等多家媒体转述,非官方正式发布文稿,正文采用间接引述。
3. " 主要精力研究下一代大模型 "" 不会闭源,先有一个强大的技术生态更重要 " 等表态,来自《暗涌》2025 年 1 月梁文锋专访(凤凰网等平台转载)。
4. 日均 7760 亿 token、1814 张 H800、单卡峰值利用率约 77%、行业公开 40% — 60% 区间,均为国金证券研报整理测算口径,非 DeepSeek 官方独立发布。
5. OpenAI、Anthropic、微软的用户规模与收入体量为行业公开报道的定性描述,未采用第三方平台估算的精确数字。
6. DeepSeek Harness v0.1 开发者预览版于 2026 年 8 月 13 日在 GitHub 开源(deepseek-ai/deepseek-harness,MIT 协议),DeepSeek 官网同步发布。
7. AgentENV、阿里 Agent Sandbox 相关数据来自公开报道与云栖大会公开信息。
8. RSI 工作定义(递归性、纯理智侧、维度差异)、" 标准谁给 " 标尺、三层标准划分、" 自主意识体 " 命名、学徒制 / 科学方法 / 儿童语言习得的历史类比、" 行业压件厂 / 翻译层 / 标准工程 " 产业判断均为作者分析框架与推测,不构成投资建议。