关于ZAKER Skills GEO服务 合作
钛媒体 19分钟前

谁在为超节点买单?

图片来源 @unsplash

2026 年,超节点赛道骤然升温。华为、浪潮信息、阿里云、百度等几乎所有主流算力厂商,都在各自发布会上将其推向了最核心的位置。热闹之下,一个基础问题被反复追问:到底什么算超节点?以及什么样的客户为此买单?

《超节点定义与实践白皮书》指出,超节点必须具备三个技术特征:超大带宽、超低时延、内存语义与统一内存编址。其核心任务不再是简单叠加更多 xPU,而是围绕 xPU 间通信、HBM 容量、机柜功率密度、散热效率和可维护性等系统瓶颈进行协同优化。

打个比方,真正的超节点像把整个城市的路网统一编码,车可以直接开到任何地方,伪超节点则像每个区域之间通行都要经过收费站和翻译。

浪潮信息首席 AI 战略官刘军近日与我们交流时给出了更直接的判断:超节点的核心特征是 " 显存统一寻址 ",这是它与传统节点集群的最大区别。但打通统一寻址只是基础,超节点还需要实现对称直连,让芯片间数据像 " 串门 " 一样直接传输,减少中间调度开销;同时,还需要针对超节点架构优化算子,将原本分散的计算与通信融合起来,让模型少 " 等 "、少 " 搬 "、少 " 算 "。

用户对超节点的需求,最终要转化为大模型推理响应速度,尤其是 Token 生成速度。浪潮信息此次发布的元脑 SD200 Ultra 超节点 AI 服务器,运行 2.8 万亿参数 Kimi K3 时,Token 生成时延低至 5.85 毫秒,单用户输出速度达到 170 Tokens/s,成为国内首个达到国际一线方案同一数量级的产品。在此基础上,浪潮信息还实现了 " 对称直连 ",让 GPU 能够像访问本地显存一样直接访问远端 GPU 显存数据,Allreduce 通信时间降低 3.5 倍。

结合过去两年算力集群的技术演进来看,超节点之所以能够实现这种像访问本地显存一样访问远端显存的能力,底层依赖的是芯片间互联方式的根本性改变。例如,传统 Scale-out 互联集群通过增加节点数量扩展算力,但节点间通信在万卡集群时代的模型训练已经存在明显瓶颈,而同时引入面向 Scale-up 互联技术,将南向单节点内部把芯片之间的带宽和时延做到极致,撑起单节点的算力峰值,是当下算力厂商构建十万卡集群互联协议的共识。

越大越好?超节点的规模之争

怎样具体落实,各家有不同的路线,其中一个重要分歧是超节点的规模之争。

一部分厂商的判断是,随着大模型参数、上下文长度和推理并发量持续增加,单个计算域需要容纳更多芯片和更大的内存空间。业界不乏一些厂商推出了从几百卡到几千卡的超节点服务器,如华为昇腾 950 超节点。

还有一批厂商并不认同规模越大越好。阿里云灵骏真武 M890 以 64 卡为一个 Scale-up 单元,再通过 Scale-out 网络扩展。去年 8 月浪潮信息推出了 64 卡超节点,今年升级到 128 卡基于本土的 AI 芯片超节点。浪潮信息认为,超节点是在现有技术、生态和成本约束下,从系统层面去最大化用户价值。

刘军此次提出了更直接的回应:超节点不是越大就越好,因为核心是要让数据和计算离得越近越好。如果隔很长时间才能将数据跑进去,整个通信和调度成本可能会远远超过所获得收益。同时,可靠性成本也会迅速上升。

这实际上点出了超节点规模之争的本质,它不是单纯的工程能力比拼,而是一道经济学题。更大的 Scale-up 域意味着更大的内存池和更低的跨节点通信开销,但也意味着更高的故障域风险和更复杂的调度成本。真正的平衡点在哪里,取决于客户在跑什么任务、能承受什么成本。

刘军透露了一个细节:" 现在很多客户都想用 Kimi K3,但怎么能用得上,我们在算力方面还是存在比较大的瓶颈。"

从需求侧来讲,对于像 Kimi 这样的大模型厂商,在此之前多按调用量和 API 次数售卖 Token。现如今,大模型厂商的商业模式正在发生转变:从卖算力变成抽佣,即按照模型产生的下游收入与全球云厂商展开分成结算模式。这样意味着,市场并不会减少对算力的总需求,反而可能从结构和质量上提出更高的要求,进一步推高算力消耗的总量。

刘军观察到,首先用上先进算力的客户基本不需要厂商去教育。本身他们的企业、团队就敢于尝试新鲜事物。其共同特征基本在两点:一是需要能力很强的模型,二是希望 Agent 更多、更快、更便宜。

他进一步指出,当前阶段的客户需求并不能按行业进行划分:比如银行业也有很多通用客户。这意味着,传统按行业划分客户、按场景定义产品的思路,在 Agent 时代可能正在失效。真正驱动客户采购的,不是 " 你是哪个行业 ",而是 " 你要跑多强的模型、要多少 Agent、能承受多低的成本 "。

浪潮信息此次提出的 Capability(能力型智算)和 Capacity(容量型智算)双主线,正是对这种需求的回应:SD200 Ultra 面向前沿模型和复杂 Agent,突破智能上限;HC2000 面向持续、大规模推理需求,实现智能充分供给。

从买芯片,到买 Token 产能

超节点的竞争,最终会汇聚到客户的落地场景中。

2026 年 9 月,工信部明确提出 " 有序部署万卡、十万卡或更大规模的智能算力集群 ",并强调适配国产算力芯片。这意味着十万卡集群正在从企业行为上升为中国的产业政策方向。2026 上半年浪潮信息等国产算力厂商业绩增长明显,头部云厂商已开始建设基于国产 GPU 的十万卡级集群,标志着国产算力从备用选型向首选方案转变。

但当前国产算力落地存在一个相当尴尬的现实:客户不缺模型,缺的是能把模型跑起来的系统能力。过去两年,国产芯片虽相较于美国整体上仍有一定差距,主流算力芯片和加速能力基本来自于英伟达,客户对国产芯片作为备选方案的需求仍然不足,其关键仍然在于适配的难度。

国产算力真正进入大规模应用,面临的挑战也已经从 " 有没有芯片 " 转向 " 能不能把芯片用起来 ",产出 Token。芯片适配、软件栈、算子优化、集群调度等系统能力,正在成为影响国产算力实际使用效率的重要因素。

刘军坦言," 这也是当前厂商非常重要的工作,从提供算力到生产智能,不仅仅交付一个 AI 服务器,还要负责客户把 Token 生产出来,把平台能够调度起来。" 这是思路上的一个重要转变 , 这种转变直接体现在产品设计上。

与此同时,过去更多是围绕多元芯片的兼容展开,而现在则是从一种新的协同方式,在同一个业务单元里,有多元的芯片,大家一起去生产、工作。而产业伙伴也从过去的零和博弈,变成了共同做大产业蛋糕。

从全球来看,谷歌 A5X 实例单站点集群最多支持 8 万个 Rubin GPU,而借助 Virgo 平台跨多站点聚合后,可支持多达 96 万个 GPU。微软在 Fairwater 数据中心采用单一扁平网络,集成了数十万块英伟达 GB200。

未来的竞争并不是谁有更多芯片,而是谁能让更多芯片像一台机器一样工作。

(本文首发于钛媒体 APP,文 | Tech Horizon,作者 | 杨丽,编辑 | 杨林)

觉得文章不错,微信扫描分享好友

扫码分享

热门推荐

查看更多内容

企业资讯

查看更多内容