关于ZAKER Skills 合作
钛媒体 54分钟前

GLM-5.3 发布,基座没变,能力却涨了

过去的几个月,国内外大模型厂商都迎来了新一轮的版本更新,4 月,OpenAI 发布 GPT-5.5 版本,并于近日将免费用户默认模型升级为 GPT-5.6 Luna;7 月中旬,月之暗面发布 Kimi K3;8 月初,DeepSeek V4 Pro 正式上线;阿里 Qwen3.8-Max 以 2.4 万亿参数规模开放 API 访问 ......

8 月 3 日,ZCode 官网短暂上线了 "ZCode for GLM-5.3" 页面,官方说明文档也对外开放了大约一个小时。那次 " 意外泄露 " 让智谱股价当天涨超 8%。一周后,高盛上调智谱收入预期 35%。直到

8 月 14 日,智谱 AI 也正式发布了新一代基座模型 GLM-5.3。该模型总参数规模 7430 亿,在编程能力和复杂工程执行等核心人物上取得突破。

让人意外的是,GLM-5.3 的技术路径——基座模型没变,但能力却提升了不少。智谱在官方公告中明确写道:" 与 GLM-5.2 相比,基座模型没变,但通过极致的后训练 Scaling 大大提高了模型的智能上界。"

此外,GLM-5.3 在白盒代码审查与漏洞推理等安全任务中的表现接近 Mythos 5,在网络安全防御场景中的表现让人眼前一亮。

GLM-5.3 到底要 " 升 " 什么?

要理解 GLM-5.3 的分量,得先看看 GLM-5.2 走到了哪一步。

6 月 13 日,智谱开源了旗舰模型 GLM-5.2。这款模型交出了一份相当漂亮的成绩单:混合专家(MoE)架构,总参数量约 7530 亿,上下文窗口达 100 万 token。在国际人工智能独立评测机构 Artificial Analysis 的综合能力评测榜单上,GLM-5.2 拿下 51 分,位列开源模型最佳水平。富瑞发布研报称,GLM-5.2 在 Artificial Analysis 模型智能指数中排名全球第三,为中国模型首次打入前三位,在编程及智能体能力上分别排名全球第四及第二。

换句话说,GLM-5.2 已经是国产开源模型里跑得最快的那一个。但大模型这行,没有 " 守成 " 一说,直白点说,你不跑,别人就会超过你。

与 GLM-5.2 相比,GLM-5.3 基座模型并没有改变,但通过极致的后训练 Scaling 大幅提升了模型的智能上界,主要体现在了数十倍的长程任务环境、更丰富的环境类型,以及超长的后训练时间。

具体到能力层面,在编程能力方面,相比 GLM-5.2,GLM-5.3 体感评测提升 50%,据智谱 AI 方面透露,GLM-5.3 在包括 Terminal Bench 3.0 在内的公开基准测试中,在开源模型方面排名第一。其中,在 Terminal Bench 3.0 上,GLM-5.3 的得分从 4.6 提升到 28.3;在 DeepSWE v1.1 上,得分从 46.2 提升至 66.9;在 Agents' Last Exam 上,得分也从 23.8 提升至 28.5。在 GDPval-AA v2 中,GLM-5.3 得分 1769,展现基于编程能力涌现的专业任务执行能力。

这些结果表明,GLM-5.3 不只擅长做出一个好看的 Demo,更能接住复杂的大目标,在数万行代码、上百个文件和多个相互依赖的系统之间持续推进。在极少人工干预的情况下,它也能长时自主开发、反复验证,最终把项目推进到可交付状态。

从 GLM-5.2 开始,智谱引入了 effort level(思考档位)控制。在相近 Token 预算下,GLM-5.3 在任务完成质量、执行速度和使用成本之间取得了更好的平衡。

安全能力值得期待

如果说编程能力的提升是 GLM-5.3 的基本操作,那么网络安全能力的涌现就是一条更值得关注的惊喜。

在网络安全能力方面,GLM-5.3 在白盒代码审查与漏洞推理等安全任务中的表现接近 Mythos 5,相信后续再网络安全防御实战场景中能发挥比较大的价值。

智谱在官方公告中坦承:" 安全能力的出现并不偶然,安全工作本质上是约束严格的编程能力。" 从 2025 年 9 月开始,智谱就在这个方向投入研究,与国内多家头部安全实验室一同推进更多长程任务环境,构建更专业化的评测与执行框架。

在 CyberGym 测试中,模型从白盒源代码出发,通过触发程序故障来识别和验证漏洞。GLM-5.3 得分为 83.5%,高于 GLM-5.2 的 77.2%,与 Mythos 5 的 83.8% 和 GPT-5.6 Sol 的 83.6% 基本相当。

在更考验深度推理能力的 ExploitBench 中,模型需要进一步理解真实漏洞的成因并完成相应的利用。GLM-5.3 得分为 54.4%,是 GLM-5.2(24.4%)的两倍多,但仍低于 Mythos 5 的 78.0% 和 GPT-5.6 Sol 的 73.5%。

在 ExploitGym 中,模型在限定时间内完成漏洞利用任务的数量。GLM-5.3 在两小时内完成 105 项任务,六小时内完成 130 项,而 GLM-5.2 分别只完成 29 项和 39 项。Mythos 5 仍然领先,两个时间段分别完成 181 项和 247 项。

这三个基准呈现出一个清晰的趋势:越接近漏洞利用链的前端,GLM-5.3 的提升越明显;越深入完整的漏洞利用,模型与 Mythos 5 等闭源前沿模型之间的差距也越大。

换句话说,GLM-5.3 在发现漏洞这个环节已经追上了全球顶尖水平,但在利用漏洞这个更深的环节还有不小的距离。这既是差距,也是方向。

之所以让笔者对 GLM-5.3 在网络安全的能力有所期待的是,智谱 AI 官方发布的真实案例。GLM-5.3 联合国内安全团队发现 2404 个漏洞,其中 1088 个为中高危,最早可追溯至约 40 年前,部分漏洞存在于 Android、Windows、macOS、APP 等人们每天使用的软件中。

GLM 未来猜想

GLM-5.3 交出了一份漂亮的成绩单,但它面前仍然摆着三个必须回答的问题。

首当其冲的就是视觉。GLM-5.3 的升级有一个容易被忽略的细节:它依然是一个纯文本模型。

此前,智谱首席科学家唐杰在社交平台上发起全球意见征集,为 GLM-5.3 收集功能建议,浏览量超过 40 万。评论区被一个词刷屏了:视觉。

开发者想要的,是能看懂截图、能解析表格、能从 UI 设计图直接生成代码的模型。而 GLM-5.2 虽然性能强劲,但偏偏没搭载视觉编码器,看不了图,也造不出图。

智谱并非没有视觉技术。这家公司此前发布过 CogVLM 视觉编码器和 GLM-5V-Turbo 原生多模态模型。但唐杰此前认为多模态对提升 AGI 智能帮助有限,主张分开发展。这一策略如今看来需要调整了—开发者的呼声和市场的竞争态势都在迫使智谱做出改变。

其次是深度漏洞利用的差距怎么追?ExploitBench 上 54.4% 对 Mythos 5 的 78.0%,ExploitGym 上 130 项对 247 项,这两组数字清晰地划出了 GLM-5.3 与全球顶尖水平之间的距离。

GLM-5.3 在漏洞发现(CyberGym)上已经追平了 Mythos 5,但在漏洞利用(ExploitBench、ExploitGym)上仍有显著差距。智谱自己也承认:" 越深入完整利用,模型与 Mythos 5 等闭源前沿模型之间的差距也越大。"

这个差距意味着什么?在真实的网络安全攻防中," 发现漏洞 " 只是第一步," 验证漏洞 " 和 " 修复漏洞 " 同样关键。如果模型只能发现而不能验证,安全团队的工作量依然巨大。智谱需要在这条路上继续追赶。

最后,也是很多大模型公司都需要面对的,商业价值如何体现?智谱 2025 年全年总营收达 7.24 亿元。这个数字放在大模型赛道里不算小,但对比其市值(即便是经历了大幅回撤之后)依然显得不成比例。资本市场对大模型公司的估值,本质上是在为未来的可能性买单。但这种可能性需要被不断验证。

国内排名前十的互联网公司中有 9 家深度集成了 GLM 系列模型。这是一个不错的起点,但远非终点。在政企市场之外,智谱需要在更广阔的商业化场景中证明自己。

不过,外部环境正在向有利于智谱的方向变化。8 月 6 日,DeepSeek 发布公告计划近期整体上调 API 服务定价。业内人士认为,这一动作打破了此前大模型行业以低价竞争为主的格局。智谱年内已多次上调 API 价格,如果行业整体涨价成为趋势,智谱的定价策略将不再显得 " 突兀 "。

高盛已经上调了智谱今年的收入预期 35%。但高盛同时将智谱的目标价下调,评级维持 " 中性 "。上调收入预期、下调目标价——这组看似矛盾的操作传递了一个清晰的信号:市场看好行业的增长空间,但对具体公司的竞争位置仍持观望态度。

两个月的迭代周期放在大模型时代是一个不算慢的节奏,GLM-5.3 的发布证明了后训练 Scaling 的潜力(在不更换基座的前提下,靠极致的长程任务训练和更丰富的环境交互,照样能榨出大模型更多的智能空间)。这对行业来说是一个值得留意的信号:参数竞赛或许不是唯一的路,把现有模型的能力 " 挖透 " 同样能带来可观的回报。

(文|Leo 张 ToB 杂谈,作者|张申宇,编辑丨杨林)

觉得文章不错,微信扫描分享好友

扫码分享

企业资讯

查看更多内容