关于ZAKER Skills 合作
钛媒体 7分钟前

DeepSeek “推倒重来”

文 | 字母 AI

DeepSeek V4.1 Flash 发布后,不仅速度变快,而且内容更准确,还有原生多模态。

全网对 DeepSeek V4.1 Flash 好评如潮,梁文锋再次被奉为 " 梁圣 "。

相较于 V4 Flash,V4.1 Flash 最大的特点是推倒重来,采用了和 V4 Flash 完全不同的非对称结构。

这也就是说,V4 在结构上积累的训练配方、优化技巧、工程适配,到了 V4.1 这里,大部分都作废了。

现在的 DeepSeek 早就不是一家小作坊了,而是一个拥有数百名员工的企业,想要重起一个新的结构不仅费时,还很费力。即便如此,梁文锋也要狠下心,对 V4 推倒重来。

新结构听起来确实很像一个营销用的噱头,不过答案其实就在 DeepSeek V4.1 Flash 的官方论文当中,DeepSeek 的旧架构,已经装不下新的训练目标了。

那么这个新的目标又是什么呢?我认为,很可能是 " 入口 "。

DeepSeek 为什么要推倒重来?

通常来讲,先有模型,后有 Harness。厂商根据模型的能力和特点来构建 Harness。然而 DeepSeek V4.1 Flash 却是被 DSH 给 " 反哺 " 出来的。

官方论文表示,V4.1 Flash 的后训练遵循标准的 SFT → RL → 在线蒸馏(OPD)范式,没有任何算法改动。关键的地方在于,所有实质性变化都在数据流水线当中,大规模自动合成 Agent 任务与环境,数据、任务、rollout 渐进式扩增。

RL 训练时让模型在 6 种不同的 Agent 框架里反复试错,数据量、任务种类、试错轮次一路放大。DSH 是这 6 个训练场里最重要的一个,V4.1 Flash 还专门针对 DSH 的不同操作模式做了定向训练。

DSH 从 DeepSeek V4 Pro 的伴生产品,摇身一变成了 V4.1 Flash 的老大哥。

为了满足 DSH 的偏好,DeepSeek V4.1 采用了全新的结构。

论文里是这么介绍的,新结构让模型在 prefill 阶段每 token 只需要激活 8B 的参数、decode 阶段激活 16B,进而大幅改善 " 输入密集的 agent 工作负载 " 的成本效率。

为什么 " 输入密集 " 会成为麻烦?

过去的模型结构是为 " 聊天 " 设计的,用户问一句,模型答一句。这就造成了输入短、输出长,模型只会记住当前这一轮对话的上下文。

但在 Agent 时代,几十轮的中间状态一直挂在上下文里,输入动辄几十万 token,远大于输出。

2026 年 4 月,密歇根大学、斯坦福大学等院校联合发布论文《AI 是怎么花你钱的?》(How Do AI Agents Spend Your Money?),其中就提到这样一件事,在 agentic 代码任务中,输入与输出的 token 比高达 154:1。

于是 DeepSeek 选择推倒重来。V4.1 Flash 采用了非对称结构 Causal-Encoder-Decoder(CED)。

V4.1 Flash 的语言主干共 40 层,如果按照以前的 Transformer(decoder-only)那样,这 40 层应该是一模一样的。每一层都同时负责 " 读 " 和 " 写 ",同时处理给它的输入,也处理输出,而且每一层都要自己攒一份 KV Cache。

CED 的 " 非对称 ",指的是把这 40 层拆成前 20 层编码器、后 20 层解码器,编码器只负责 " 读 ",把输入压成摘要,解码器只负责 " 写 ",照着摘要生成回答。

就像汽车的流水线一样。过去是一个车间完成所有活,想增加产能就得一直复制这一个车间。现在是流水线,冲压车间就负责冲压,电泳车间就负责电泳。

并且记忆只产生一次,解码器的全局 KV Cache 直接从编码器的最终结果投影出来。DeepSeek V4.1 Flash 的全局 KV Cache 压到了 890 字节 /token,降低至 V4 Flash 的 1/4。

这是因为 DeepSeek V4.1 Flash 采用了 CSA2(Compressed Sparse Attention 2),第二代压缩稀疏注意力。

V4 的时候 DeepSeek 使用的是第一代 CSA,到了第二代,可以让不同层之间共享 KV 和索引,也就解决了前面所提到的痛点。

依然是像汽车流水线一样,CSA2 中把这 40 层分成了三个不同的车间,分别为 Full、Reindex 和 Reuse。

Full 负责完整记录,就像传统 Transformer 的每一层一样。Reindex 负责提炼重点,再根据提炼的结果做事。Reuse 则直接照着 Full 的技术抄,连提炼都省了。

虽然说除了第一层用 Full,剩下 39 层全用 Reuse 是最节省成本的做法,但每层关注的重点不同,能力也不同,浅层做的是 " 字面理解 ",深层做的是 " 逻辑推理 ",它们需要的上下文内容不同。如果全用 Reuse 只会生成没有价值的回答。

去年还是先有车、再修路,今年已经是先修路,再造车。

模型性能强弱、性价比高低,都不是叙事的核心,唯有掌握了入口,才能吸引更多用户。

但梁文锋不是第一个这么做的,姚顺雨的 Hy4 preview 走在他之前。

Hy4 preview 官方技术报告里表示,通过腾讯内部的软件工程师、游戏开发者、金融分析师、安全专家,围绕他们真正交付的工作共建数据,再和 CodeBuddy、WorkBuddy 这些产品共同设计。

在 163 名内部专家参与的 203 个真实工程任务盲测中,Hy4 preview 平均 2.99 分,GLM-5.3 是 2.92,Kimi K3 是 2.94。

入口的重要性不言而喻,腾讯产品矩阵的优势得以发挥。

DSH 和 WorkBuddy 本质上是一种产品闭环,是整条训练流水线的一部分。

有意思的是,2026 年 7 月 24 日,腾讯撤销大语言模型部和多模态模型部,合并成立基础模型部,姚顺雨统一负责。他将混元多模态的发展重点,放在了 Agent 强相关的多模态理解上,和梁文锋此前对多模态的看法一致。

现如今,梁文锋又在模型上靠拢了姚顺雨,互相学习。

智谱与 Kimi 有类似的闭环吗?

智谱和月之暗面这两家不是没有工具,Kimi 有 Kimi Claw,智谱也有 ZCode、AutoClaw 和 GLM Coding Plan。

但这些工具没办法像 DSH 和 WorkBuddy 那样 " 反哺 " 模型。智谱和 Kimi 的工具是后挂的外壳,模型先在合成环境里练好,再做个产品给用户用。

智谱现在把所有精力都放在了模型自进化上。8 月 31 日,在智谱半年度业绩会上,唐杰首次明确表示,GLM-6.0 是一款 Full Self-Training(完全自训练)模型,与 OpenAI 的 RSI(Recursive Self-Improvement,递归自我改进)相似。

唐杰表示,从预训练、中训练到后训练,全流程让模型自己训自己,不再靠人写代码、清洗数据、调参、设计实验。人只负责给模型定目标,以及做最后的验收工作。

在 GLM-5.3 上,智谱就已经展示过他们自进化方法的一部分了。GLM-5.3 和 5.2 使用的基座相同,但是性能却大幅提升。

具体情况是这样的,GLM-5.3 建了一套端到端的任务环境合成流水线,Agent 从真实世界的软件工程和终端操作场景收集种子任务,接下来模型自己头脑风暴,生成大量可验证的任务草稿,再构建做题用的 Agent,把这些草稿实例化成具体的可运行环境。

将 Agent 输出的回答进行精炼,根据研究员定义的评分标准,检查并迭代优化任务质量。

最终就产出了数千个多样化、可验证的终端 Agent 环境。GLM-5.3 的长程任务环境数量是 GLM-5.2 的几十倍,而且都是 Agent 自己建的。

月之暗面走的是 " 在自建合成环境里把 Agent 能力练到极致 " 的路线,相当于是闭关修炼。

具体做法是通过 AgentENV 来完成模型的训练,这是基于 Firecracker 微虚拟机的分布式沙箱系统,

在 K3 训练期间跑了 5100 万个沙箱,支持暂停、恢复、复制、快照,专门解决长程 Agent 强化学习里 " 任务跑不完、环境容易污染 " 的基础设施难题。

Agent 的强化学习训练和普通大模型 RL 不一样。普通 RLHF 就是给模型一个 prompt,模型生成一段回答,打个分,更新参数。环境是无状态的,跑完就完了。

但 Agent 训练不一样。模型要在一个真实的运行环境里干活,一个任务可能跑几十步甚至几百步,持续几分钟到几小时。

如果在干活过程中,模型发现缺少某个依赖,那么它会为了完成任务,自己在沙箱里装个依赖、改个配置文件。

虽然任务完成了,不过这个环境也就改变了,即环境被污染了。那么下一轮训练不能接着用,得重新起一个干净环境。重起的过程大约需要几秒,虽然不长,可大规模训练时就会浪费大量时间。

就像学开车一样,如果你一上来就从科目三开始,那必定会成为马路杀手。所以就需要驾校,准备一个不会有行人和来往车辆的空地,练习起步、上坡和侧方停车。

AgentENV 就是 Kimi 的驾校,让 Kimi 可以在训练时大展拳脚,还不会受到环境因素的影响。

所以智谱和月之暗面不是没有闭环,只是这个闭环没有触达外界,练得再好也是闭关修炼。

DSH 和 WorkBuddy 的是入口,用户在真实环境里干活,数据自然回流,模型在实战里被养大。

梁文锋要抢入口

就在 DeepSeek V4.1 Flash 发布的同时,DSH 也宣布更新到了 v0.1.5 版本。新版为插件作者提供了更多标准化的 UI 扩展入口,新增了文件上传、侧边栏文件预览等功能,优化了 UI 的性能与交互,并持续增加与模型研究前沿深度结合的实验性功能。

DSH 在刚发布的时候,与其说它是一个产品,倒不如说它是一个属于极客的玩具。就连安装都能难倒一大片。

DSH 的理念是一切皆插件,需要用什么插件,DSH 自己安装,用完了再删除。结果就是真正好用的插件,全是社区提供的,包括连 UI 都是。

到了 0.1.5 版本,DSH 已经从 " 框架 " 逐渐蜕变成了 " 产品入口 "。除了适配 V4.1 Flash 以外,全是终端用户产品功能。

举个例子,0.1.5 版本中,Agent 可以显式交付文件。生成的代码、文档、分析报告直接作为文件出现在侧边栏,用户可以预览、打开、定位到本地文件夹。

以前的 DSH 里,Agent 只能输出文字和代码到回答框里,用户必须得亲自复制粘贴到文件里才行。

不仅如此,新版本还有一个极其实用的功能,叫做 " 支持在保留已有 KV Cache 的情况下更新系统提示词 "。

传统 Agent 有个痛点,长会话跑到一半,你想改系统提示词,比如让 Agent 从 " 写代码模式 " 切换到 " 写文档模式 ",那就必须清掉整个 KV Cache 重新 prefill。

在 1M 上下文的前提下,切换系统提示词,就意味着 Agent 要花几十万甚至上百万 token 去重新规划任务。

所以现有 Agent 产品基本不允许中途改系统提示词,Agent 的角色和目标从会话开始就锁死了。

这就说明,DeepSeek 在有意识地把 DSH 从 " 极客工具 " 往前推,让它成为一个面向更多用户的 Agent 产品。核心目的就在于扩大入口,放更多人进来。

现在的 DeepSeek,反而有点像卖剃须刀的吉列。它的刀架不赚钱,甚至免费,它主要挣的是刀片的钱。可真正锁定客户的反而是刀架。

DeepSeek 也一样,想换新模型,复制粘贴一段 API Key 就完事了。但是想换新 Harness,那得需要适应很长一段时间。

所以 DSH 大量优化用户体验,不仅仅是为了继续 " 反哺 " 未来的 DeepSeek V4.1 Pro,乃至 5、6、7、8,更是为了抢占入口。

DeepSeek 已经在朝着 " 入口公司 " 看齐了。

相关阅读

最新评论

没有更多评论了

觉得文章不错,微信扫描分享好友

扫码分享

企业资讯

查看更多内容