关于ZAKER Skills GEO服务 合作
财联社-深度 18分钟前

剑指英伟达 CUDA!DeepSeek 开源华为昇腾全套组件

《科创板日报》9 月 30 日讯(记者 黄心怡),DeepSeek 今日宣布正式开源面向华为昇腾平台的全套基础设施组件,涵盖编程语言 TileLang、计算库与分布式通信库,且与此前面向英伟达平台的开源组件一一对应。

此次开源的核心是 TileLang 昇腾版本,它对昇腾底层指令进行了封装,让开发者能用更简单的高级语言编程,同时不损失硬件性能,目标是成为对标英伟达 CUDA 语言的 " 工具箱 "。

DeepSeek 方面表示,要建立新一代自主可控的 GPU 软件生态,首要的事情是先建立一个通用的、编程简单的,同时能达到硬件性能上限的高级语言。TileLang 在这样的历史背景下诞生。

一方面,相对于英伟达的 CUDA 语言,TileLang 的编程更简单,能显著提高开发效率、简化代码逻辑。

另一方面,相对于其它同类高级语言,TileLang 的编程模型可以充分发挥芯片的特性,达到硬件的性能上限。

TileLang 路线首先在英伟达成熟平台上得到了验证,如今已承载了 DeepSeek V4 系列模型训练中大部分算子的实现,是其探索 AGI 新范式、开发高性能算子的核心工具。

▍双方共同推进基于昇腾 950 的 128 卡超节点方案

从披露的细节看,这并非简单的单向适配。华为团队提供了较大的支持,双方共同推进了基于昇腾 950 的 128 卡超节点方案,并对计算与通信进行了深度优化。

这种 " 芯模协同 " 的深度,是组件能达到接近硬件上限性能的关键。相关技术成果也已在华为的 CANN 社区同步开源,形成了双向的生态共建。

《科创板日报》记者获悉,华为向 DeepSeek 团队提供了联合定义的昇腾超节点 SuperPoD Flex 和 UBL128 组网方案,可实现 128 卡 3.2Tbps 单层交换 Scale-up 网络和 256K 卡两层交换 Scale-out 网络,可以支持超低时延推理和前沿基座模型的大规模训练的需求。

基于全互联的 UBL128 超节点,昇腾提供了 ASC-COMM 高性能自定义通信编程库,支撑用户通信算子与通算融合算子高性能编程。Deepseek 团队开发了高性能 DeepEP 通信库,涵盖 EP/CP/PP/FSDP 等模式下的通信算子,为更大模型向更大集群扩展提供支持,互联带宽实测达到 Dispatch 375GB/s、Combine 347 GB/s 的通信性能,接近硬件上限。

为支持开发者基于昇腾 950 及超节点集群部署 DeepSeek 模型,华为将此次联合创新的成果在 CANN 社区开源,包括大 EP 低延时推理部署、单卡 / 单机部署、大规模训练、超长文本 KVcache 池化与 Agentic RL。其中面向大规模推理场景,基于 EP32 部署策略,offline 推理模式下 DeepSeek-V4.1-Flash 不带框架纯模型性能可实现 TPOT=5ms,每卡输出吞吐 2469tokens/s;TPOT=10ms,每卡输出吞吐 5102 tokens/s。

此外,DeepSeek 还开源了五个关键的计算与通信组件,覆盖了模型训练的核心环节:DeepGEMM 加速通用矩阵运算;DeepEP 提供高效的大规模跨设备通信;TileKernels 提供数据处理所需的常规向量计算和访存算子;FlashMLA 提供稀疏注意力算子,提升长上下文处理效率;DeepSelect 则实现了高效的数据筛选。

在多项关键测试用例中,上述组件的计算与通信性能已接近硬件上限。多项关键测试显示,这些组件的计算与通信性能均已接近硬件上限。

▍降低大模型训练与推理代码的迁移成本

这次开源的战略意义,远大于其技术细节。

业内人士王敏坚告诉《科创板日报》记者,过去三年,中国 AI 芯片的真正瓶颈从来不在晶体管,而在软件。英伟达的护城河不是芯片算力,而是 CUDA 十八年积累的软件生态,数百万开发者、无数调优过的算子、以及 " 写一次到处能跑 " 的开发体验。国产芯片算力规格一次次逼近,客户却总在最后一步犹豫:迁移成本太高。

DeepSeek 在此次公告中提到,DeepSeek 训练中用到的每一个 TileLang 算子,在昇腾上都有对应的高性能实现。这句表述,翻译成产业语言就是:训练 DeepSeek 级别的前沿模型,从此在软件栈层面不再唯一依赖英伟达。

王敏坚表示,对国产芯片而言,TileLang 的战略价值在于换轨,与其在 CUDA 的主场上追模拟生态,不如在更高一层,对硬件中立的算子语言建立新标准。算子写在 TileLang 里,后端可以指向英伟达、昇腾,也可以指向任何愿意实现编译后端的 AI 芯片。

有券商研报早在去年就指出:TileLang 或将解决国产 AI 芯片高性能计算平台之间接口互不兼容的问题,降低大模型训练与推理代码的迁移成本。

▍国产 AI 芯片有望共享算子生态

根据公开资料,TileLang 是一款由北京大学计算机学院团队主导开发的开源高性能 AI 算子编程语言,属于领域特定语言(DSL),于 2025 年 1 月开源。其核心设计基于 "Tile"(张量分块)抽象,采用类 Python 的声明式语法,开发者可用接近数学公式的形式描述计算意图,由编译器自动完成循环优化、内存调度等底层硬件适配,旨在降低 AI 算子开发门槛并实现 " 一次编写,多架构运行 "。

TileLang 于 2025 年 9 月应用于 DeepSeek-V3.2-Exp 等大模型研发,并与华为昇腾、摩尔线程、算能、沐曦等硬件厂商达成适配合作。

在华为全联接大会 2025 的开发者日上,TileLang 团队成员董宇骐介绍了 TileLang 实现 FlashAttention 算子开发,代码量从 500+ 行减少至 80 行,并保持了与官方版本持平的性能。

这次 DeepSeek 公告中另一句值得细读的话:TileLang 昇腾版本作为一个开源工作,希望能对更多 AI 芯片建立高可用软件生态起到示范作用。

王敏坚认为,这个示范作用指向的是寒武纪、海光、摩尔线程、沐曦等一众国产芯片公司:与其各自为战地造轮子,不如共同对接 TileLang 这样的中立语言层。芯片厂只需提供编译后端和底层指令接口(昇腾为此开放了 Ascend C 与 PTO ISA 底层指令体系),上层算子生态即可复用。若这一路径成立,国产 AI 芯片有望第一次拥有跨芯片共享的算子生态,碎片化困局出现真正的解法。

不过,在肯定此次开源战略价值的同时,也需看到现实的挑战。英伟达 CUDA 生态积累了十余年,拥有数百万开发者和海量工具。TileLang 昇腾版是一个重要的起点,但要从 " 可用 " 到 " 好用 " 再到 " 开发者主动选择 ",仍需持续的社区运营和迭代。

此外,虽然软件优化能逼近硬件上限,但硬件本身的算力天花板仍是基础。昇腾芯片的持续迭代能力,将决定这套软件生态最终能支撑多大的模型和场景。而 DeepSeek 的示范能否带动更多模型厂商跟进,则是生态能否真正繁荣的关键。

相关标签

相关阅读

最新评论

没有更多评论了

觉得文章不错,微信扫描分享好友

扫码分享

热门推荐

查看更多内容

企业资讯

查看更多内容