关于ZAKER Skills GEO服务 合作
财联社-深度 4小时前

首个采用 NPO 的昇腾 960 超节点来了!华为新款 AI 芯片将提前推出

《科创板日报》9 月 17 日讯(记者 黄心怡)今日,华为全联接大会 2026 在上海启幕。华为发布业界首个采用 NPO 技术的昇腾 960 超节点,并升级鲲鹏超节点、推出 OceanStor M900 AI 记忆存储系统;基于灵衢 UnifiedBus 统一互联,构建 Agentic 超节点集群,支持百万卡超大规模集群。

《科创板日报》还从会上获悉,截至目前,鲲鹏全球开发者超过了 416 万,全球生态合作伙伴超过 7200 家,支持了 560 多个全球开源项目,openEuler 装机量也已超过 2000 万套,成为中国服务器操作系统第一份额。CANN 社区月活开发者突破 5200 名,基于昇腾 +CANN 的原生训练模型已超过 40 个,也是国内唯一支持预训练的技术路线。

▍华为 AI 战略的核心是算力

华为副董事长、轮值董事长汪涛表示,AI 变革的速度超过历史上任何一次技术革命。今天大模型参数已经快速迈向 10 万亿,到 2030 年将达到 100 万亿以上;智能体已经可以按小时级连续工作,到 2030 年将以月为单位执行任务;中国每日推理 Token 已增长到每日 500 万亿左右,到 2030 年将达到百万万亿级。端侧智能也在快速增强,手机模型从 2024 年的 3B 发展到今天的 30B,未来将进一步走向 100B 级。这些变化,都对 AI 基础设施的规模、性能和可靠性提出了更高的要求,只有打造更加强大的 AI 基础设施,才能筑牢智能世界的坚实底座。

汪涛称,华为 AI 战略的核心是算力,坚持硬件变现,围绕 " 超节点 + 集群 ",通过系统架构创新构建竞争力,打造中国坚实算力底座,为世界构建新的选择;坚持构建开源开放的算力生态,支持主流大模型基于昇腾原生训练、积极拥抱 " 百模千态 ";面向客户,我们提供线下、线上的灵活算力方案,加速千行百业智能化;面向丰富的端侧场景,通过提供大中小微多样性算力,推进 AI 入端、上车,物联轻智能升级,让智能真正无所不及;围绕 " 用算 " 构筑新一代通信网络,把智能传递给每个人、家庭和企业。

▍业界首个使用 NPO 的昇腾 960 超节点发布

截至目前,昇腾 910C 超节点已部署超 1000 套,昇腾 950 超节点也已规模商用。超节点是一种在物理上由多个计算节点通过高效的互联协议紧密连接组成,具备跨物理节点统一内存编址能力,逻辑上具备 " 一台计算机 " 特征的计算系统。

汪涛表示,超节点已成为建设超大规模 AI 基础设施的必然选择。当前,10 万卡集群已成为训练十万亿级 SOTA 模型的标配,但传统服务器架构导致集群内通信超过训练时间的 40%,严重制约了 MFU(模型浮点算力利用率)。根据华为马尔科夫实验室仿真结果显示,4K 超节点组成的 10 万卡集群相比由 8 卡服务器组成的 10 万卡集群 MFU 提升了 2.75 倍。

会上,汪涛宣布昇腾 960 芯片研发进度超出预期,实现性能翻番。其中,昇腾 960DT 将于 2027 年 Q1 推出,比原计划提前三个季度;昇腾 960PR 将于 2027 年 Q3 推出,比原计划提前一个季度。后续将坚持一年一代的演进节奏,昇腾 970 计划 2028 年推出,昇腾 980 计划 2029 年推出。依托 τ 定律的创新方向,实现算力规格继续翻倍,访存带宽、访存容量、互联带宽等也将大幅提升。

超节点的设计理念是通过互联实现多 NPU 的协同。华为研发了新一代 NPO(Near-Packaged Optics)形态的光互联产品—— Hi-ONE,基于华为自主创新技术,通过光、机、电、磁、热等要素的均衡设计,实现了单引擎 7.2T 的传输容量。这是业界首个量产的 NPO 产品,是行业目前最大传输能力的 NPO 产品,也是唯一实现内置光源的 NPO 产品。

基于昇腾 960 芯片和 Hi-ONE,华为打造了业界首个采用 NPO 技术的超节点——昇腾 960 超节点,单个超节点为 4096 卡规模,最大可提供 8E FP8 的算力,高达 1PB 的 HBM 容量。超节点中用 5500 个 Hi-ONE,替代原本需要的 4 万 8 千颗 800G 光模块,降低了超 550 千瓦功耗,系统无故障运行时间提升一倍,系统可用度达到 99.8%。

▍鲲鹏超节点与 AI 记忆存储亮相,构筑百万卡超节点集群

随着 SOTA 模型的参数规模达到 10T 级,其训练、推理系统不再是单一的 AI 服务器或单一的智算超节点,而是一个复杂的算力系统。该系统包括智算超节点、通算超节点、一套平等互联且免协议转换的互联系统,在推理系统中还需要部署 PB 级的 KV 缓存集群。

据悉,鲲鹏超节点进行了升级。基于灵衢全光组网,鲲鹏超节点最大支持 4096 节点,并形成 256TB 的统一内存池。

此外,华为基于灵衢打造 AI 记忆存储 -OceanStor M900。Agent 与长序列需要多层次 KV Cache 架构,面向 Agent 推理系统,华为提出了多层 KV 缓存架构,推出基于灵衢 UnifiedBus、支持 " 一跳直连 " 的华为 L3.5 层 PB 级 KV 缓存—— OceanStor M900 集群。同时,M900 采用混合介质加优化 Retention 算法,可将 SSD 读写寿命提升 16 倍,从底层保障 KV 命中和长稳可靠。

同时,华为带来全新的 Agentic 超节点集群,加速 10 万亿大模型训练和推理。基于灵衢 UnifiedBus 统一互联,把多种互联协议统一为灵衢协议,大幅减少协议转换开销,实现昇腾超节点、鲲鹏超节点、KV 缓存集群等子系统平等互联,提供多层次、高带宽、大容量的存储系统,且各类 KV 缓存均可一跳直达的 KV 缓存。通过二层 CLOS 四平面组网,最大集群规模可达到 51.2 万卡,再结合多轨道拓扑技术,最大可支持 100 万卡昇腾超节点集群。

相关标签

相关阅读

最新评论

没有更多评论了

觉得文章不错,微信扫描分享好友

扫码分享

热门推荐

查看更多内容

企业资讯

查看更多内容