关于ZAKER Skills 合作
钛媒体 28分钟前

智谱 VS Deepseek,两条分叉的自进化树

文 | 字母 AI

智谱发布 GLM-5.1 的时候,盘中涨幅一度接近 19%,收盘涨幅 11.5%。到了 GLM-5.2,当天暴涨 32.8%,一周后市值突破万亿。按照这个逻辑来看,GLM-5.3 发布后,智谱股价不得起飞喽?

可事与愿违,8 月 14 日发布 GLM-5.3 当天,智谱跌 3.57%,日内回撤超 11%。

智谱 GLM-5.3 的成绩单很亮眼。DeepSWE 的 66.9 分超过了 V4 Pro 的 62.7,Terminal Bench 3.0 从 5.2 的 4.6 分暴涨到 28.3 分拿下开源第一,CyberGym 以 84.5% 登顶全球,在高难度编程任务上,只用了不到 Claude Opus 4.8 一半的 token,就拿到了更高的完成率。

在智谱官方放出的性能图里,编程、终端操作、Agent 任务、网络安全等八方面,赢过了 DeepSeek V4 Pro 正式版七项,对 DeepSeek 形成了 " 精准狙击 "。

但是却很少有人注意到,GLM-5.3 其实并非 " 新 " 模型,它和 GLM-5.2 用的是同一个 7430 亿参数基座,所有提升全靠后训练。这和 DeepSeek V4 Pro 从预览版到正式版的逻辑是一样的,后者也都是同一个 1.6T 基座,能力跃迁同样来自后训练。

GLM-5.3 之于 5.2,就是 V4 Pro 正式版之于预览版。两者的不同在于,智谱没有涨价,DeepSeek 却涨了一大截。从 8 月 17 日 0 点开始,DeepSeek API 新一轮调价,全面引入峰谷分时定价机制,整体价格较此前出现大幅上调,全计费项涨幅区间为 50% 至 1100%。

还有一点,那就是在自进化这块,智谱已经和 DeepSeek 形成了初步交锋。GLM-5.3 的新后训练方法,本质上是一种模型自进化。而 DeepSeek V4 Pro 同步发布的 DeepSeek Harness,其插件即一切的策略,也是为了自进化。

自进化是公认通往 AGI 的赛道,眼下国产大模型的 AGI 赛道,本质上就是智谱、DeepSeek、Kimi 三家的竞速。 都喊着 AGI,都在拼谁的模型更像一个能独立干活的 " 人 "。

两家的方法论究竟有何不同?

先看智谱这边。GLM-5.2 到 5.3 最核心的变化是加入了一套 " 自己出真题自己做 " 的环境合成流水线。

在 GLM-5.2 的时期,训练环境还主要靠人工搭建,所以题型有限、场景也偏模拟题。

到了 5.3,智谱引入了一个全自动的环境生成机制。

具体来讲,智谱用了一个 "AI 研究员 "(研究 Agent)去真实场景里面抄题目。比如它会观察工程师到底怎么干活,把真活儿变成考题。

其实很早之前的生成对抗就采用了类似的逻辑,用机器给机器出题。

可机器出题没法保证每道题都是好题。 有的题可能根本解不出来(出题时条件给错了),有的题可能缺关键信息(做到一半卡死),有的题可能是 " 无解题 "(mission impossible)。如果这些废题混进训练题库,模型辛辛苦苦刷了半天,刷的是一道根本做不出来的题。

因此智谱用了一个 AI 判卷员(判断 Agent),先自己做一遍。 相当于出题人出完卷子,先自己答一遍,确认 " 这题真的能解出来 ",不是道废题。防止出那种连老师都不会做、纯粹难为学生的怪题。

判卷员在做题过程中,不许看参考答案,只看解题过程。

如果是带着答案做题,那么模型可能学会 " 背答案 " 或者 " 抄近路 "。表面上得分高,实际啥也没学会。所以判卷员得盯着解题轨迹,看它是不是一步一个脚印真解出来的,有没有钻漏洞、走捷径。只有 " 题能出、能做、过程干净 " 三道关卡全过了,这道题才配进训练题库。

这套流水线让训练环境规模扩大了数倍。

除了方法改变以外,刷题的整个基础设施也得到了升级。

slime 是智谱从 GLM-5 时代就一直在用的一套训练框架,你可以把它理解成一个自动化的刷题工厂。

5.3 在这套工厂上做了两层大改造。第一层是算法层面,新增了一批技术配置,最关键的一个改动,是让练习和考试的环境几乎完全一致。两者计算结果的平均差异控制在千万分之一的量级,比之前精确了 99.99%。

AI 的强化学习,本质上是成千上万轮的循环。先考试生成一批答卷,再根据答卷讲课更新模型,然后再考试、再讲课,无限循环。

如果练习和考试的环境有一点点不一样,每一轮都带入一点误差,一万轮下来误差就滚成了大雪球,模型可能学歪甚至直接崩掉。

就好比 NBA 比赛中,三分线弧顶距离是 7.24 米,底角是 6.7 米,但是 FIBA 国际篮联的三分线是 6.75 米,如果练习的时候以 FIBA 的标准,那么到了 NBA 中就适应不了那么远的三分线。

第二层是系统层面,智谱给这个出题工厂加了一堆效率优化。

常用的数据放到近处缓存,不用每次去远处取。相当于教材室紧挨教室,拿到教材就可以立马发给学生。

多个老师还可以自动切换,还能提前备好课,任务调度让每台机器都不闲着,还能根据题型自动调整到最优配置。这些优化叠在一起,长程编码任务的整体训练速度翻了 2.3 倍。

在 Agent 领域影响力最大的 Terminal Bench 3.0 基准数,得分从 5.2 的 4.6 分,暴涨到了 5.3 的 28.3 分,拿下开源模型第一。DeepSWE v1.1 从 46.2 涨到 66.9,Agents' Last Exam 从 23.8 涨到 28.5,AutomationBench 从 26.2 涨到 48.2。

再看 DeepSeek 这边,从预览版到正式版,DeepSeek V4 Pro 也强化了后训练。预览版的监督微调数据以通用问答和基础代码为主,而在正式版当中,新增了大量 Agent 专用的多步骤工具调用对话范例。

以前教模型的例子,是 " 帮我写封邮件 " 这种一问一答。现在换成 " 把文件夹里所有 PDF 转成 Word" 这种真活儿。AI 得先扫文件夹,然后识别 PDF,并逐个进行转换。一切都完成后,汇总报告,一环扣一环。

同时,DeepSeek 把 GRPO 强化学习的奖励函数给重新设计了一遍。

预览版在 Agent 场景下有两个常见的硬伤,其一是工具调用死循环,反复调用同一工具但提取不到有用信息;其二是参数解析错误,JSON 格式错、必填字段漏。

正式版的奖励信号专门针对这两类失败做了惩罚,在需要 35 次工具调用的复杂任务中,正式版基本可以一次跑通不再卡死。

唐杰 vs 梁文锋 + 崔添翼

技术路线的背后从来都是人的理念。智谱和 DeepSeek 这场对抗,本质上是两种 AGI 路径的对撞。

智谱创始人唐杰在 7 月 11 日发布了内部信《巨浪已来》,宣布启动 "Touch High(摸高)计划 "。信中写到,未来两年不把重心放在商业变现上,集中资源冲 AGI 的下一个高地。

唐杰把 AGI 的突破拆解为三座必须翻越的大山,第一座是记忆,长上下文和 RAG 已经逼近记忆雏形;第二座是完全自治的智能体系统(Autonomous Agent System,即持续学习和自我评判),模型迭代频次的提升本身就在逼近持续学习,前沿模型已显露自我评判的萌芽;第三座是自进化(Self-Evolving)。

唐杰表示,"AI 训练 AI 已经成型,模型自己写代码、自己清洗与合成数据、自己训练自己。这或许会消耗一些算力,却节省了最宝贵的人力与时间。而在大模型时代,速度是最重要的,快速迭代会直接拉开认知的代际差距。"

前文提到的 GLM-5.3 后训练办法,本质上就是一种自进化。

不过自进化最有魅力的地方,并不在于它如何实现了开发者一开始给它规定的目标。就比如 GLM-5.3,的确通过自进化,让性能更强了。但最有魅力的地方在于,GLM-5.3 获得了极强的网络安全能力。

智谱给 GLM-5.3 做后训练时,确实往训练环境里加了一些漏洞挖掘的任务。初衷很简单,让模型找漏洞、分析漏洞的能力强一点。

结果训练规模上去了,事态也跟着失控了。

官方博客中写到," 我们本来以为它只是更会找单个漏洞,但出乎意料的是,它开始跨越漏洞利用的多个阶段,形成完整的攻击链计划。"

在 CyberGym 测试中,任务要求模型从白盒源码出发识别并验证漏洞,GLM-5.3 拿到了 84.5% 分,全球第一,压过了 Anthropic 的 Claude Mythos 5(83.8%)和 GPT-5.6 Sol(83.6%)。

DeepSeek 在自进化这道题上,给出的答案是 " 插件 "。梁文锋把模型基座冻结在 1.6T 不动,崔添翼带队的 DSH 框架则把 " 自进化 " 发生的场所,从模型内部搬到了模型外部。

DSH 的核心设计原则只有五个字," 一切皆插件 "(Everything is a Plugin)。模型接入、工具注册表、会话日志、审批策略、沙箱、存储、上下文管理、甚至驱动 Agent 运转的主循环本身,全都是可以拔插的积木。

底层的 Cordis 微内核只负责插件的加载、卸载和依赖管理,其他什么都不管。

DSH 在 GitHub 宣布开源的当天,也发布了一篇长达 88 页的论文《时空可组合性的编程范式》,来阐述 DSH 的理论基础。

Cordis 最关键的特性叫 " 可逆效应 "。它指的是,每个插件注册时产生的所有副作用都被追踪,卸载时自动回收,不留垃圾、不漏内存。

这意味着 Agent 可以在运行过程中随时更换插件,觉得这个搜索引擎不好用。OK,马上换下一个。甚至可以在 Agent 跑任务的时候换掉它的决策策略,类似于 " 热插拔 " 一样,即便更改插件,运行状态也不会崩。

简单来说,传统的 Agent 非常死板,师傅怎么教,他就怎么学,只要超出知识点就会无能为力。DSH 发现缺扳手时,现场自己锻造一把、插到手上接着拧螺丝,用完还能拆下来。

插件化还有另外一层含义,那就是相互独立。传统软件之间存在强依赖关系,改了 A,可能 B 就会受牵连。插件之间相互独立,因此可以相互演化,进而带动整个模型实现自进化。

DSH 发布不到两天,就在 GitHub 就收获 10 万颗以上的星星,可见开发者社区对它的青睐。

但智谱和 DeepSeek 其实是两种完全不同的自进化观。

唐杰追求的是 " 模型自己变聪明 ",进化发生在训练阶段,目标是提升模型本身的智商;梁文锋和崔添翼追求的是 " 模型的身体可以无限重组 ",进化发生在推理和运行阶段,模型本身的智商不变,但它的 " 手脚 " 和 " 器官 " 可以随时替换、扩展、升级,能力边界由插件生态的丰富程度决定。

如果说唐杰的自进化是生物学意义上的进化 ,基因在迭代中变得更聪明。那梁文锋 + 崔添翼的自进化就是工具意义上的进化,人本身没变,但从石器到青铜器到蒸汽机,工具的重组让人的能力指数级扩张。

两条路线谁对谁错,没人能定夺,然而智谱的股价成了这场对抗的风向标,甚至被网友戏称为 " 衡量 DeepSeek 模型能力最好的测试集 "。

4 月 24 日 DeepSeek V4 预览版发布当天,智谱暴跌逾 9%,随后几个交易日持续下挫,4 月 28 日盘中一度跌超 13%、跌破千元大关。

市场的逻辑是,DeepSeek 又强又便宜还开源,而智谱这边却在涨价。

从 2 月开始智谱连续上调 API 定价,一季度累计涨幅约 83%,4 月 GLM-5.1 发布时完成年内第三次提价。

这就导致智谱的商业化空间被挤压,估值逻辑遭到了质疑。

8 月 13 日,V4 Pro 正式版遭遇乌龙事件,凌晨静默发布、白天官网横幅撤下公告删除、后端指纹改回 Preview 状态、不到 24 小时又重新发布。当天智谱股价反而从开盘 1230 港元涨到收盘 1317 港元,涨幅约 9%。

对手 " 翻车 " 被解读为自身利好,说明市场已经从 "DeepSeek 出模型 = 智谱利空 " 的简单零和逻辑,转向了对两家路线可持续性的更微妙博弈。

8 月 14 日 GLM-5.3 发布当天,智谱股价高开低走,开盘 1356 港元、盘中最高冲到 1435 港元,收盘却跌到 1270 港元,跌幅 3.57%,从日内最高点算回撤超过 11%。

这可能意味着投资者不再只看模型的性能本身,而是唐杰的 " 自进化闭环 " 和梁文锋 + 崔添翼的 " 插件化生态 " 之间,哪条路更可能跑到 AGI 的终点。

GLM-5.3 虽然八项赢七项,但市场认为这是 " 符合预期 " 的后训练迭代,没有超出基座不变的框架。V4 Pro+DSH 的组合,或许才是长期变量。

从 " 价格屠夫 " 到集体涨价

前面说完了智谱涨价,现在该说说 DeepSeek 涨价了。

DeepSeek 一直以 " 价格屠夫 " 著称,早在 V3 时代,DeepSeek 就用极致的性价比,打穿了整个行业的价格底线。后面到了 V4 预览版,DeepSeek 又延续了这个策略,缓存命中输入低至 0.025 元 / 百万 token,未命中输入 3 元,输出 6 元,几乎是海外旗舰模型的几十分之一。

但 8 月 13 日晚间,DeepSeek 在发布 V4 Pro 正式版的同时官宣了 API 调价,从 8 月 17 日零点生效。

在这次价格调整中,DeepSeek 首次引入了峰谷分时定价,高峰时段为北京时间 9:00-12:00 和 14:00-18:00,空闲时段价格为高峰的一半。

V4 Pro 高峰时段缓存命中输入从 0.025 元涨到 0.3 元,涨幅 12 倍;未命中输入从 3 元涨到 9 元,涨幅 3 倍;输出从 6 元涨到 27 元,是原来的 4.5 倍。空闲时段则分别为 0.15 元、4.5 元和 13.5 元。V4 Flash 也同步调价,空闲时段缓存命中 0.05 元、未命中 1.5 元、输出 4.5 元,高峰翻倍。

对于一个以 " 便宜 " 为核心竞争力的公司来说,DeepSeek 这番涨价势必削弱了公司的吸引力。

开发者圈子里,从 " 梁文锋的恩情还不完 " 的论调,变成了 " 梁圣变梁子 " 的调侃。社区吐槽称,DeepSeek 每贵一块钱,就要破产几百家 OPC(单人公司),现在涨了好几倍,几乎已经不给这些独立开发者留退路了。

不过涨价的并非只有 DeepSeek 和智谱,全行业都在涨价。

DeepSeek 作为最后一个坚持低价的头部玩家,它的涨价标志着一个时代的结束。用低价换规模、用补贴换市场份额的阶段,正式落幕了。

涨价的本质不是算力贵了,这是所有人都能用的借口。真正的原因是公司长大了。

AGI 研发是个无底洞,唐杰的摸高计划要投入百亿级做可解释性、建合成数据工厂、搞自治智能体系统,梁文锋要除了迭代模型以外,现在还要养 DSH 的开源生态。

不能一直靠融资和烧钱,终究得靠自己造血。当模型能力逼近海外第一梯队,而模型价格却继续保持海外头部的几十分之一出售时,本质上是在贱卖自己的技术溢价,也是在告诉资本市场我还没准备好挣钱。

涨价是从成本加成定价转向价值定价,模型值多少钱,应该由它能替用户创造多少价值决定。

相关阅读

最新评论

没有更多评论了

觉得文章不错,微信扫描分享好友

扫码分享

企业资讯

查看更多内容