文 | 反熵
今年 WAIC 最热闹的展区是机器人,最安静却同样受到关注的展品,当属一排排算力机柜。
华为、阿里、百度、中兴、沐曦等厂商集中展示超节点和算力集群,算力与具身智能也成为大会两条最清晰的产业主线。一边是会走路、能搬运的机器人,另一边是几乎不会动的服务器,看起来相距甚远,但却有着同一套产业逻辑。

人工智能浪潮中,英伟达是最受益的企业之一。
从 GPU 芯片和 CUDA,到服务器、网络互联与数据中心解决方案,英伟达已经建立起一套覆盖硬件、软件和基础设施的完整计算体系。黄仁勋在 2025 年 GTC 大会上曾表示,英伟达正在从芯片公司转向 AI 基础设施公司。这也道出了它真正的优势。
GPU 性能是进入 AI 时代的门票,CUDA 生态则构成了更长期的壁垒。
2006 年推出 CUDA 之后,大量开发者、算法工具和企业应用逐渐围绕这套体系建立,PyTorch、TensorFlow 等主流 AI 框架也长期深度支持 CUDA。企业如果更换计算平台,需要重新进行软件适配、流程调整、人才培养和已有应用迁移,付出的远不只是采购一批新芯片的成本。
这也是英伟达能够保持较高盈利能力的重要原因之一。客户购买的不只是一块 GPU,而是一套已经被产业验证过的 AI 计算基础设施。
01 英伟达为何领先
英伟达最初并不是一家人工智能企业。
1993 年成立时,它主要做游戏显卡。GPU 最初的用途,是提升图形处理能力,让游戏画面更流畅。
深度学习兴起后,研究人员发现,GPU 非常适合处理神经网络训练中的并行计算任务。传统 CPU 拥有少量高性能核心,更擅长复杂逻辑处理。GPU 拥有大量并行计算单元,可以同时完成海量矩阵运算,而人工智能模型训练,恰恰需要不断进行这类计算。
2012 年,AlexNet 在 ImageNet 图像识别竞赛中取得突破,深度学习由此进入快速发展阶段。GPU 也逐渐从图形处理设备变成 AI 计算的重要工具。
大模型时代进一步放大了这一需求。模型规模越大,需要协同工作的 GPU 越多,训练周期和计算成本也越高。但英伟达真正难以复制的优势,并不只在硬件性能。经过近二十年积累,CUDA 已经连接起芯片、软件工具和开发者生态。
芯片性能可以通过一代代产品追赶,开发习惯和软件生态却很难在短时间内复制。这也是国产 AI 芯片必须面对的核心挑战。
02 AI 为何越来越吃算力
一个模型从研发到应用,需要经历预训练、微调、对齐和推理等多个阶段。
预训练阶段通常消耗最大。模型需要从海量数据中学习语言规律、知识结构和复杂关系,大规模模型训练往往需要数千张计算卡持续运行数周甚至更长时间。
微调和对齐,则是让模型适应具体任务。一家银行训练客服模型,需要让它理解业务规则和金融产品;一家医院开发辅助诊断模型,需要让它掌握专业知识和医疗规范。
但真正让算力需求持续增长的,是推理。
模型训练完成后,每一次客服问答、代码生成、办公协作和内容创作,依然需要计算资源。智能体进一步放大了推力需求:普通聊天通常是一问一答,智能体为了完成一项工作,还要拆解任务、查找资料、调用工具并反复检查结果。一次看似简单的用户指令,背后可能对应多轮模型调用。
今年 WAIC 上,智能体从聊天框走向工作台,成为贯穿模型、终端和行业应用的重要主线。AI 从 " 回答一个问题 " 走向 " 完成一项工作 " 之后,计算消耗不再只取决于用户问了多少次,还取决于任务链条有多长。

训练能力决定模型能够达到怎样的水平,推理能力则决定这些能力能服务多少用户。
03 中国如何补上算力短板?
大模型竞争看起来发生在云端,真正的起点却在机房。
对于中国而言,建设自主 AI 算力体系,既关系到产业发展,也决定着未来人工智能应用能扩展到多大规模。
目前,中国企业正在围绕不同技术路线探索 AI 计算能力。
华为昇腾是其中最具代表性的方向之一。它没有把竞争局限在单颗芯片,而是围绕昇腾处理器、Atlas 服务器、CANN 软件平台、高速互联和开发生态,建立一套完整的计算体系。
2025 年,华为推出昇腾 384 超节点方案,通过 384 张计算卡协同提升系统算力。今年 WAIC 上,Atlas 950 SuperPoD 完成真机首展,最大可扩展至 1024 张计算卡,并通过高速互联和统一内存编址,降低设备之间的数据传输损耗。

国内其他厂商也在沿着不同路径推进。寒武纪、海光信息从芯片切入,在训练和推理场景中寻找突破。百度昆仑芯、阿里平头哥与自身云计算业务结合,以内部应用带动芯片迭代。摩尔线程、沐曦则瞄准通用 GPU,希望在图形计算、通用计算和 AI 加速之间建立更广泛的能力。
今年 WAIC 上,多家厂商集中展示了超节点或集群方案。它们的互联架构、芯片配置和软件体系并不相同,但行业共识已经达成。国产算力的竞争单位,已经从一颗芯片扩大到由芯片、互联、整机和软件构成的完整系统。
国产算力需要补上的,也从来不只是一颗芯片。
04 算力竞争走向系统
大模型通常需要被拆分到多张计算卡上运行,芯片数量越多,数据交换越频繁。如果互联速度不足,大量时间便会消耗在设备之间搬运数据,形成 " 通信墙 "。如果不同设备的显存无法被统一、高效调度,模型规模和算力利用率又会受到 " 显存墙 " 限制。
机器增加一倍,算力未必增长一倍。有时规模越大,协调损耗反而越严重。
超节点要解决的,就是如何让几十张、几百张甚至上千张计算卡更像一台机器。英伟达通过 NVLink 和 InfiniBand 网络提高 GPU 集群的协同能力。华为、阿里、百度、中兴等国内厂商也在高速互联、统一内存编址、液冷和软件调度方面推出系统级方案。
竞争的重点因此从谁的单卡更快,逐渐转向了谁能让更多芯片高效协同。
根据 WAIC 相关报道,昇腾上一代 384 卡超节点已累计发货 750 套,覆盖互联网、运营商、金融、教育、医疗、交通和制造等多个行业。超节点开始离开展台,进入真实业务。
客户关心的也不再只是理论峰值,而是系统能否稳定运行、软件是否容易迁移,以及每投入一度电,最终能够产出多少有效 Token。
能源供应和数据中心建设也随之进入竞争范围。一个万卡级训练集群,功率可能达到数十兆瓦。数据中心的选址、电力成本、液冷散热和算电协同能力,都会影响最终的算力价格。
今年 WAIC 上,超聚变等厂商集中展示高密度液冷和多元算力集群方案,国家电网、南方电网等企业也在推进算电协同。算力竞争已经不只是半导体产业的问题,它开始将通信、电力、能源和工程建设卷入同一套体系。

但系统竞争并不等于依靠数量堆叠。芯片、互联、软件和能耗中的任何一项出现短板,都可能拖累整体效率。国产算力真正要完成的跨越,是从 " 能够运行 " 走向 " 稳定、好用和经济 "。
05 算力最终要变成智能
互联网时代,服务器、通信网络和数据中心支撑了数字经济的发展。AI 时代,算力正在成为新的基础设施。
大模型训练需要算力,智能体运行需要算力,机器人理解环境、规划动作,同样需要算力。超节点、智能体和机器人之所以在今年 WAIC 同时成为焦点,也正因为他们处在同一个循环中。更大的模型推动算力系统升级,更低的计算成本让智能体和机器人打开商业空间,更多应用又会产生新的计算需求。
但算力本身不是终点。一座数据中心建设得再大,如果无法转化为更好的模型、更便宜的 Token 和真正有人使用的产品,也只是一台昂贵的机器。
所以,AI 竞争为什么先比算力?
因为算力决定了参赛资格。模型决定 AI 能够完成什么,算力则决定这些能力能否以足够低的成本服务更多人。
拿到参赛资格之后,真正决定胜负的,仍然是模型能够创造多少实际价值。
下一篇,我们讨论 DeepSeek 之后,大模型竞争正在进入怎样的新阶段。