过去几年,大模型的竞争点几乎没有悬念:更多参数、更多数据、更多算力,换来更强智能。
Scaling 远没有结束,但当模型开始从 " 回答一个问题 " 走向 " 完成一项可能连续数小时的任务 ",新的竞争点也开始出现:模型当然还是要足够聪明,但只把能力上限推高已经不够了。同样重要的问题是,要用多少计算、多少成本、才能把这些智能更有效率地转化为结果。
换句话说,大模型竞争不仅要继续向上 Scaling,也要不断重塑智能与成本之间的最优边界——帕累托前沿。
阶跃星辰最新发布的旗舰模型 Step 5 Preview,正是把这条前沿,再次向前推进一步。
在 Artificial Analysis 最新评测中,Step 5 Preview 的 Intelligence Index 达到 44 分,达到全球开源模型前二水平;与此同时,其 Intelligence Index 单任务成本约为 0.7 美元。

在 AA 的测试任务中,它平均生成约 6.4 万个输出 Token,加权平均解码时间约 12.1 分钟。这说明它要解决的并不是如何更快地给出一个答案,而是如何在长时间推理中持续推进任务。

在真实任务里寻找 " 帕累托前沿 "
模型在真实任务中面对的困难并不相同:有些任务考验空间理解和视觉实现,有些考验复杂工程的组织能力,还有一些要求模型处理专业知识、冲突信息与可复核的数字。
我们首先选择制作 3D 互动游戏《我们的岛》,因为 3D 开发是一个很容易暴露模型能力边界的场景。它要求模型同时处理空间结构、几何建模、材质、光影、镜头和交互状态。任何一处修改,都可能引发穿模、遮挡或渲染异常。模型不仅要把功能写出来,还必须不断观察结果、发现问题并调整。

更重要的是,游戏中的岛屿、树木、房屋和灯塔没有借助 Blender 等外部建模工具,也没有调用现成的 3D 素材,而是全部由 Step 5 通过代码生成。它第一次交付就搭起了场景、玩法和反馈机制,后续主要调整光影、构图与交互细节,没有推翻原来的架构重新开始。


一个网页摘要扩展并不只是做出摘要按钮。它还要适配不同网页,处理长文切分、模型调用、流式输出、原文引用、本地存储和浏览器权限;完成代码后,还要经过测试、构建和打包,才能真正安装使用。因此,我们让 Step 5 Preview 开发了一款 Chrome AI 网页摘要扩展。
最终交付物包含正文提取、长文分段、流式摘要、原文问答、引用定位、历史记录和模型设置,也包含 Manifest V3、Service Worker、扩展安装包、商店素材、隐私政策和权限说明。我们实际操作了摘要、问答和历史页面,主要流程可以正常完成,项目自带的 13 项单元测试也全部通过。

最后,我们测试了金融的专业问题,金融场景是 Step 5 Preview 官方重点展示的专业能力之一:阶跃设置了实时信息检索、公司估值和深度研究三类内部金融评测;在外部的 FrontierFinance 测试中,Step 5 Preview 的表现也接近 Claude Opus 5。为了验证这种能力能否进入真实工作流,我们选择让它完成一项英伟达投资分析。
英伟达是一个难度较高的研究对象。公司增长快、财务口径变化多,实际业绩、管理层指引和第三方预期之间还存在大量冲突。模型不能只找到数字,还要判断数字属于哪个时期、使用什么口径,以及哪些信息是事实,哪些只是尚未得到验证的假设。
Step 5 Preview 最终交付了两份 Excel 模型、一份投资备忘录和一份证据清单。它从 SEC 文件、公司财报与电话会记录中提取数据,建立了从历史财务、收入预测到 DCF 和相对估值的完整链条,并通过不同增长率、毛利率和折现率测试估值结果。最终给出的加权目标价为 263.06 美元,较基准股价高 18.4%。


从 Step 5 Preview 看懂阶跃
Step 5 Preview 不只是阶跃对现有模型的一次升级,它也体现了阶跃对下一代模型进化方向的判断:模型可以继续扩大,但真正的突破不能只依靠增加参数和算力,还要让模型思考得更深、让计算真正有效,并让 Agent 进入模型自身的数据与训练循环。
围绕这一目标,阶跃同时调整了模型架构、稀疏计算、数据生产和训练系统。Step 5 Preview 采用 92 层 " 窄而深 " 的设计,希望以更充分的计算深度处理复杂 Agent 任务中的长链路依赖;600B 总参数每个 Token 仅激活约 27B,并通过稀疏注意力等方式减少长上下文中的无效计算。与此同时,Agent 也开始参与高难度训练任务的构建,让真实执行过程中产生的轨迹和反馈重新进入下一轮训练。
这些变化并不依赖某一个单点创新。它要求模型、训练、推理和数据系统围绕同一个目标协同工作,也更考验一家基模公司的综合研发能力。
Step 5 Preview 的发布,因此也成为了一个重新观察阶跃的窗口。过去一个季度,阶跃先后更新 Step Edge、StepAudio 3 和旗舰基模 Step 5 Preview,完成了新一轮模型体系升级。前沿基模继续向上突破,全模态能力覆盖听、说、看、生成和操作,端侧模型则把这些能力进一步带到手机、汽车等真实设备中。
如果说 Step 5 Preview 回答的是 " 模型能够思考到什么程度 ",那么全模态解决的是模型如何感知和理解更丰富的世界,而终端,则决定这些能力能否真正进入人的日常生活。据披露,阶跃模型已经规模化进入超过 4200 万台终端,日均服务近 2000 万人次。对模型而言,这意味着面对的不再只是 Benchmark 和实验环境,而是低时延、复杂噪声、高并发,以及持续发生的真实交互。
前沿基模决定智能上限,全模态拓宽智能边界,终端让智能进入现实。当这三项能力开始同时成熟,Step 5 Preview 的意义也就不再局限于一张榜单或一次模型发布,它更像一个节点:阶跃收束回到 "Frontier 竞争 " 的主线剧情 ,此前在全模态和真实终端上积累的能力,也开始与前沿基模重新汇合。
所以,当大模型竞争从单点能力走向系统能力,对一家基模公司的判断也不再只取决于某一款模型能力多高,而在于它能否持续抵达 Frontier,并把这种能力带到真实世界。
如今,Step 5 Preview 已登场,阶跃的位置,也需要被重新审视了。