关于ZAKER Skills 合作
钛媒体 21分钟前

AI 竞争,为什么先比算力?

文 | 反熵

今年 WAIC 最热闹的展区是机器人,最安静却同样受到关注的展品,当属一排排算力机柜。

华为、阿里、百度、中兴、沐曦等厂商集中展示超节点和算力集群,算力与具身智能也成为大会两条最清晰的产业主线。一边是会走路、能搬运的机器人,另一边是几乎不会动的服务器,看起来相距甚远,但却有着同一套产业逻辑。

模型负责产生智能,机器人和智能体负责把智能带进现实,数据中心里的芯片、服务器和网络则支撑它们持续运行。AI 应用越接近落地,算力问题反而更重要。

人工智能浪潮中,英伟达是最受益的企业之一。

从 GPU 芯片和 CUDA,到服务器、网络互联与数据中心解决方案,英伟达已经建立起一套覆盖硬件、软件和基础设施的完整计算体系。黄仁勋在 2025 年 GTC 大会上曾表示,英伟达正在从芯片公司转向 AI 基础设施公司。这也道出了它真正的优势。

GPU 性能是进入 AI 时代的门票,CUDA 生态则构成了更长期的壁垒。

2006 年推出 CUDA 之后,大量开发者、算法工具和企业应用逐渐围绕这套体系建立,PyTorch、TensorFlow 等主流 AI 框架也长期深度支持 CUDA。企业如果更换计算平台,需要重新进行软件适配、流程调整、人才培养和已有应用迁移,付出的远不只是采购一批新芯片的成本。

这也是英伟达能够保持较高盈利能力的重要原因之一。客户购买的不只是一块 GPU,而是一套已经被产业验证过的 AI 计算基础设施。

01 英伟达为何领先

英伟达最初并不是一家人工智能企业。

1993 年成立时,它主要做游戏显卡。GPU 最初的用途,是提升图形处理能力,让游戏画面更流畅。

深度学习兴起后,研究人员发现,GPU 非常适合处理神经网络训练中的并行计算任务。传统 CPU 拥有少量高性能核心,更擅长复杂逻辑处理。GPU 拥有大量并行计算单元,可以同时完成海量矩阵运算,而人工智能模型训练,恰恰需要不断进行这类计算。

2012 年,AlexNet 在 ImageNet 图像识别竞赛中取得突破,深度学习由此进入快速发展阶段。GPU 也逐渐从图形处理设备变成 AI 计算的重要工具。

大模型时代进一步放大了这一需求。模型规模越大,需要协同工作的 GPU 越多,训练周期和计算成本也越高。但英伟达真正难以复制的优势,并不只在硬件性能。经过近二十年积累,CUDA 已经连接起芯片、软件工具和开发者生态。

芯片性能可以通过一代代产品追赶,开发习惯和软件生态却很难在短时间内复制。这也是国产 AI 芯片必须面对的核心挑战。

02 AI 为何越来越吃算力

一个模型从研发到应用,需要经历预训练、微调、对齐和推理等多个阶段。

预训练阶段通常消耗最大。模型需要从海量数据中学习语言规律、知识结构和复杂关系,大规模模型训练往往需要数千张计算卡持续运行数周甚至更长时间。

微调和对齐,则是让模型适应具体任务。一家银行训练客服模型,需要让它理解业务规则和金融产品;一家医院开发辅助诊断模型,需要让它掌握专业知识和医疗规范。

但真正让算力需求持续增长的,是推理。

模型训练完成后,每一次客服问答、代码生成、办公协作和内容创作,依然需要计算资源。智能体进一步放大了推力需求:普通聊天通常是一问一答,智能体为了完成一项工作,还要拆解任务、查找资料、调用工具并反复检查结果。一次看似简单的用户指令,背后可能对应多轮模型调用。

今年 WAIC 上,智能体从聊天框走向工作台,成为贯穿模型、终端和行业应用的重要主线。AI 从 " 回答一个问题 " 走向 " 完成一项工作 " 之后,计算消耗不再只取决于用户问了多少次,还取决于任务链条有多长。

根据国家数据局披露的数据,中国公有云大模型 Token 调用量已从 2024 年初的日均约 1000 亿,增长至 2025 年底的日均百万亿级规模。DeepSeek 等模型降低调用成本后,更多应用开始具备落地条件。应用规模越大,调用频率越高,对算力的需求也越强。

训练能力决定模型能够达到怎样的水平,推理能力则决定这些能力能服务多少用户。

03 中国如何补上算力短板?

大模型竞争看起来发生在云端,真正的起点却在机房。

对于中国而言,建设自主 AI 算力体系,既关系到产业发展,也决定着未来人工智能应用能扩展到多大规模。

目前,中国企业正在围绕不同技术路线探索 AI 计算能力。

华为昇腾是其中最具代表性的方向之一。它没有把竞争局限在单颗芯片,而是围绕昇腾处理器、Atlas 服务器、CANN 软件平台、高速互联和开发生态,建立一套完整的计算体系。

2025 年,华为推出昇腾 384 超节点方案,通过 384 张计算卡协同提升系统算力。今年 WAIC 上,Atlas 950 SuperPoD 完成真机首展,最大可扩展至 1024 张计算卡,并通过高速互联和统一内存编址,降低设备之间的数据传输损耗。

这并不意味着国产单卡已经全面追平英伟达,但可以说明竞争有了另一种解法。在单颗芯片和先进制程仍有差距的情况下,通过更大规模的系统协同提高整体计算能力。

国内其他厂商也在沿着不同路径推进。寒武纪、海光信息从芯片切入,在训练和推理场景中寻找突破。百度昆仑芯、阿里平头哥与自身云计算业务结合,以内部应用带动芯片迭代。摩尔线程、沐曦则瞄准通用 GPU,希望在图形计算、通用计算和 AI 加速之间建立更广泛的能力。

今年 WAIC 上,多家厂商集中展示了超节点或集群方案。它们的互联架构、芯片配置和软件体系并不相同,但行业共识已经达成。国产算力的竞争单位,已经从一颗芯片扩大到由芯片、互联、整机和软件构成的完整系统。

国产算力需要补上的,也从来不只是一颗芯片。

04 算力竞争走向系统

大模型通常需要被拆分到多张计算卡上运行,芯片数量越多,数据交换越频繁。如果互联速度不足,大量时间便会消耗在设备之间搬运数据,形成 " 通信墙 "。如果不同设备的显存无法被统一、高效调度,模型规模和算力利用率又会受到 " 显存墙 " 限制。

机器增加一倍,算力未必增长一倍。有时规模越大,协调损耗反而越严重。

超节点要解决的,就是如何让几十张、几百张甚至上千张计算卡更像一台机器。英伟达通过 NVLink 和 InfiniBand 网络提高 GPU 集群的协同能力。华为、阿里、百度、中兴等国内厂商也在高速互联、统一内存编址、液冷和软件调度方面推出系统级方案。

竞争的重点因此从谁的单卡更快,逐渐转向了谁能让更多芯片高效协同。

根据 WAIC 相关报道,昇腾上一代 384 卡超节点已累计发货 750 套,覆盖互联网、运营商、金融、教育、医疗、交通和制造等多个行业。超节点开始离开展台,进入真实业务。

客户关心的也不再只是理论峰值,而是系统能否稳定运行、软件是否容易迁移,以及每投入一度电,最终能够产出多少有效 Token。

能源供应和数据中心建设也随之进入竞争范围。一个万卡级训练集群,功率可能达到数十兆瓦。数据中心的选址、电力成本、液冷散热和算电协同能力,都会影响最终的算力价格。

今年 WAIC 上,超聚变等厂商集中展示高密度液冷和多元算力集群方案,国家电网、南方电网等企业也在推进算电协同。算力竞争已经不只是半导体产业的问题,它开始将通信、电力、能源和工程建设卷入同一套体系。

对于后发者而言,这种变化提供了新的空间。即使单颗芯片暂时存在差距,也可以通过互联、调度、整机和应用适配,提高整个系统的有效计算能力。

但系统竞争并不等于依靠数量堆叠。芯片、互联、软件和能耗中的任何一项出现短板,都可能拖累整体效率。国产算力真正要完成的跨越,是从 " 能够运行 " 走向 " 稳定、好用和经济 "。

05 算力最终要变成智能

互联网时代,服务器、通信网络和数据中心支撑了数字经济的发展。AI 时代,算力正在成为新的基础设施。

大模型训练需要算力,智能体运行需要算力,机器人理解环境、规划动作,同样需要算力。超节点、智能体和机器人之所以在今年 WAIC 同时成为焦点,也正因为他们处在同一个循环中。更大的模型推动算力系统升级,更低的计算成本让智能体和机器人打开商业空间,更多应用又会产生新的计算需求。

但算力本身不是终点。一座数据中心建设得再大,如果无法转化为更好的模型、更便宜的 Token 和真正有人使用的产品,也只是一台昂贵的机器。

所以,AI 竞争为什么先比算力?

因为算力决定了参赛资格。模型决定 AI 能够完成什么,算力则决定这些能力能否以足够低的成本服务更多人。

拿到参赛资格之后,真正决定胜负的,仍然是模型能够创造多少实际价值。

下一篇,我们讨论 DeepSeek 之后,大模型竞争正在进入怎样的新阶段。

觉得文章不错,微信扫描分享好友

扫码分享

热门推荐

查看更多内容

企业资讯

查看更多内容