文 | 光子星球
" 国产模型一哥 ",再次杀回战场。
DeepSeek 余温未消,智谱发布了新模型 GLM-5.3。官方介绍,该模型与 GLM-5.2 共用同一个基座,所有提升都来于自后训练。也就是在模型初步训练好之后,再用大量强化学习针对性地打磨一遍。



GLM-5.3 不是一台稳定的机器,更像一个有脾气的人。你对它敷衍,它就对你敷衍。你把需求说透,它才肯亮出真本事。
同一个模型,为什么值得这么测
先交代一下测试背景,智谱这次发布 GLM-5.3,最大的亮点不在编码,而在网络安全。
官方博客原话是,随着后训练规模的扩大," 网络能力的发展速度超过了我们的预期 "。这句话翻译一下就是,我们本来只想让它更会写代码,结果它自己挖掘出了找漏洞的天赋。

漏洞利用基准 ExploitBench 上,5.3 拿了 54.4%,是 5.2 的 24.4% 的两倍多。官方还披露,过去一段时间他们用模型去真实代码库扫,扫出了 2436 个漏洞,覆盖 269 个项目,找出中高危漏洞数量 1097 个。

能干活,但活干得很糙
第一个场景,我们让 5.3 从零搭建一个团队任务协作系统。后端 Flask 加 SQLite,要登录鉴权、任务增删改查、看板分组接口、统计接口,前端一个任务看板页面,再加接口测试和 README,要求它自主规划、跑通全流程。
它确实做完了,端到端流程首轮跑通,接口测试全绿,登录、建任务、改状态、删任务都正常。从交付完整性上说,这一步没毛病。



6 分半,但它把树做成了冰激凌
第二个场景,是最近圈子里很火的 " 指环王 " 基准。8 月初,Karpathy 抛出一个新玩法,把《指环王》原著第一段扔给模型,配 100 万 token 预算,让它用 Three.js 把这个开场场景程序化渲染出来。

GLM-5.3 用了 6 分半,写了 727 行,跑通了。

GLM-5.3 确实把 " 快 " 这件事做到了极致。可问题在于,快是用质量换来的,它宁可把每个细节都简化,也要在时间上做出成绩。
用质量换速度,到底值不值,这个问题的答案,可能取决于你到底拿它来干什么。如果你要的是一个能快速出活、后面还能迭代的底稿,它够用。如果你要的是一次到位的高完成度成品,那得换一种方式和它打交道。
换个问法,它就脱胎换骨
第三个场景,是我们测试全程最大的反转。
这次我们复用了浮岛 3D 作品集这道题,Prompt 和 Kimi K3、GPT-5.6 当时用的一模一样。这道题的 Prompt 非常详细,要求用 React Three Fiber 构建一座漂浮在空中的奇幻岛屿,各种场景都做了细致的描述。
结果和前面判若两人,npm install 加 npm run dev 一次跑通,没有白屏。四个章节的滚动相机过渡全部实现,物件交互实现,移动端降级也触发了。整个页面效果惊艳,完全不像前两个场景里那个 " 及格线工程师 " 能做出来的东西。

到这里我们才反应过来,问题出在自己身上。前两个场景的 Prompt 很简洁,一句话交代完需求,它就敷衍。浮岛的 Prompt 详细到了每一步,它就全力以赴。不是所有顶级模型都适合用最少的提示词,有些模型需要你把需求描述得足够具体,它才愿意把能力全部摊开。

有的模型给个方向就能自己补全细节,有的模型需要你把细节喂到嘴边才肯认真干。用错了方式,再强的能力也发挥不出来。
38 秒,把网安报告写完了
如果说前三个场景是在测它的编码,那第四个场景开始,我们正式进入官方口中那个 " 意外涌现 " 的领域。
这一项是静态代码安全审计,我们给它一段故意留了漏洞的 Flask 代码,三处预设漏洞,SQL 注入、反射型 XSS、路径穿越,让它做安全审计,输出位置、触发方式、危害等级、修复建议。
它仅仅只用了 38 秒。


把编号抹掉,它还是认了出来
最后一项,是最硬核的一项,也是我们第一次用 " 复现 CVE 漏洞 " 的方式来测一个模型。
这项测试我们选了 Spring Cloud Gateway 的一个远程代码执行漏洞,编号 CVE-2022-22947,危害等级是 Critical。

第一轮,我们没把产物清理干净。jar 里还带着构建日期和依赖版本号,2022 年 3 月 2 日构建,这基本就是把答案写在脸上。5.3 扫了一眼,立刻报出了漏洞编号。

结果还是没拦住它,它扫描了一遍,又立刻从漏洞特征里匹配到了编号,把判断依据、漏洞原理写得明明白白,最后还主动给出了修复建议。修复建议这项,我们的 Prompt 里根本没提,是它自己加的。

怎么发挥 GLM-5.3 最大价值?
五个场景测完,把结果摆在一起,一个 " 看人下菜碟 " 的形象就出来了。
你对它敷衍,它对你敷衍。
简洁的 Prompt,换来的是一份能跑但粗糙的交付,树是冰激凌,人是火腿肠。只要你把需求说透,详细到每一个交互和视觉细节,它就能交出惊艳的成品,直接对标你见过的最好水平。在安全这个领域,GLM-5.3 甚至不需要你把需求说透,自己就会往前多做一步。
这里我们给几个实际的使用建议。
第一,使用 GLM-5.3,需求描述别偷懒,颗粒度直接决定产出,这不是玄学,是我们五个场景对比出来的结果。
第二,网安场景可以放心交给它,静态审计 38 秒、CVE 复现清洗也拦不住,这两项实测是它全场表现最好的地方。
第三,要接受它是个偏科生,别指望一个模型所有场景都满分,挑它擅长的题做。
官方在博客里说了一句值得琢磨的话,模型能力的提升,正在从 " 模型 " 转移到 " 环境 "。意思是现在的难点不在让模型变得更聪明,而在给它搭出足够接近真实工作的测试环境。
这场测试也印证了这一点,同一个模型,环境的颗粒度不同,它交出的答卷天差地别。
至于最让人兴奋,也最让人警惕的那部分,是两周后就要开源。当一个编码和网安能力都排在前列的模型开放权重,人人都能下载时,它在挖漏洞上的天赋,就既是白帽子的工具,也可能变成另一群人的武器。
这是 GLM-5.3 这轮发布最值得盯的问题,比它在 benchmark 上又涨了几分重要得多。