很抱歉,当前没有启用javascript,网站无法正常访问。请开启以便继续访问。
剑指英伟达CUDA!DeepSeek开源华为昇腾全套组件
原创
2026-09-30 20:40 星期三
科创板日报记者 黄心怡
责编 毛明江
①DeepSeek开源面向华为昇腾平台的全套基础设施组件,与此前面向英伟达平台的开源组件一一对应。
②要建立新一代自主可控的GPU软件生态,首要的事情是先建立一个通用的、编程简单的、同时能达到硬件性能上限的高级语言。TileLang在这样的历史背景下诞生。

《科创板日报》9月30日讯(记者 黄心怡),DeepSeek今日宣布正式开源面向华为昇腾平台的全套基础设施组件,涵盖编程语言TileLang、计算库与分布式通信库,且与此前面向英伟达平台的开源组件一一对应。

此次开源的核心是TileLang昇腾版本,它对昇腾底层指令进行了封装,让开发者能用更简单的高级语言编程,同时不损失硬件性能,目标是成为对标英伟达CUDA语言的“工具箱”。

DeepSeek方面表示,要建立新一代自主可控的GPU软件生态,首要的事情是先建立一个通用的、编程简单的,同时能达到硬件性能上限的高级语言。TileLang在这样的历史背景下诞生。

一方面,相对于英伟达的CUDA语言,TileLang的编程更简单,能显著提高开发效率、简化代码逻辑。

另一方面,相对于其它同类高级语言,TileLang的编程模型可以充分发挥芯片的特性,达到硬件的性能上限。

TileLang路线首先在英伟达成熟平台上得到了验证,如今已承载了DeepSeek V4系列模型训练中大部分算子的实现,是其探索AGI新范式、开发高性能算子的核心工具。

▍双方共同推进基于昇腾950的128卡超节点方案

从披露的细节看,这并非简单的单向适配。华为团队提供了较大的支持,双方共同推进了基于昇腾950的128卡超节点方案,并对计算与通信进行了深度优化。

这种“芯模协同”的深度,是组件能达到接近硬件上限性能的关键。相关技术成果也已在华为的CANN社区同步开源,形成了双向的生态共建。

《科创板日报》记者获悉,华为向DeepSeek团队提供了联合定义的昇腾超节点SuperPoD Flex和UBL128组网方案,可实现128卡3.2Tbps单层交换Scale-up网络和256K卡两层交换Scale-out网络,可以支持超低时延推理和前沿基座模型的大规模训练的需求。

基于全互联的UBL128超节点,昇腾提供了ASC-COMM高性能自定义通信编程库,支撑用户通信算子与通算融合算子高性能编程。Deepseek团队开发了高性能DeepEP通信库,涵盖EP/CP/PP/FSDP等模式下的通信算子,为更大模型向更大集群扩展提供支持,互联带宽实测达到Dispatch 375GB/s、Combine 347 GB/s的通信性能,接近硬件上限。

为支持开发者基于昇腾950及超节点集群部署DeepSeek模型,华为将此次联合创新的成果在CANN社区开源,包括大EP低延时推理部署、单卡/单机部署、大规模训练、超长文本KVcache池化与Agentic RL。其中面向大规模推理场景,基于EP32部署策略,offline推理模式下DeepSeek-V4.1-Flash不带框架纯模型性能可实现TPOT=5ms,每卡输出吞吐2469tokens/s;TPOT=10ms,每卡输出吞吐5102 tokens/s。

此外,DeepSeek还开源了五个关键的计算与通信组件,覆盖了模型训练的核心环节:DeepGEMM加速通用矩阵运算;DeepEP提供高效的大规模跨设备通信;TileKernels提供数据处理所需的常规向量计算和访存算子;FlashMLA提供稀疏注意力算子,提升长上下文处理效率;DeepSelect则实现了高效的数据筛选。

在多项关键测试用例中,上述组件的计算与通信性能已接近硬件上限。多项关键测试显示,这些组件的计算与通信性能均已接近硬件上限。

▍降低大模型训练与推理代码的迁移成本

这次开源的战略意义,远大于其技术细节。

业内人士王敏坚告诉《科创板日报》记者,过去三年,中国AI芯片的真正瓶颈从来不在晶体管,而在软件。英伟达的护城河不是芯片算力,而是CUDA十八年积累的软件生态,数百万开发者、无数调优过的算子、以及“写一次到处能跑”的开发体验。国产芯片算力规格一次次逼近,客户却总在最后一步犹豫:迁移成本太高。

DeepSeek在此次公告中提到,DeepSeek训练中用到的每一个TileLang算子,在昇腾上都有对应的高性能实现。这句表述,翻译成产业语言就是:训练DeepSeek级别的前沿模型,从此在软件栈层面不再唯一依赖英伟达。

王敏坚表示,对国产芯片而言,TileLang的战略价值在于换轨,与其在CUDA的主场上追模拟生态,不如在更高一层,对硬件中立的算子语言建立新标准。算子写在TileLang里,后端可以指向英伟达、昇腾,也可以指向任何愿意实现编译后端的AI芯片。

有券商研报早在去年就指出:TileLang或将解决国产AI芯片高性能计算平台之间接口互不兼容的问题,降低大模型训练与推理代码的迁移成本。

▍国产AI芯片有望共享算子生态

根据公开资料,TileLang是一款由北京大学计算机学院团队主导开发的开源高性能AI算子编程语言,属于领域特定语言(DSL),于2025年1月开源。其核心设计基于“Tile”(张量分块)抽象,采用类Python的声明式语法,开发者可用接近数学公式的形式描述计算意图,由编译器自动完成循环优化、内存调度等底层硬件适配,旨在降低AI算子开发门槛并实现“一次编写,多架构运行”。

TileLang于2025年9月应用于DeepSeek-V3.2-Exp等大模型研发,并与华为昇腾、摩尔线程、算能、沐曦等硬件厂商达成适配合作。

在华为全联接大会2025的开发者日上,TileLang团队成员董宇骐介绍了TileLang实现FlashAttention算子开发,代码量从500+行减少至80行,并保持了与官方版本持平的性能。

这次DeepSeek公告中另一句值得细读的话:TileLang昇腾版本作为一个开源工作,希望能对更多AI芯片建立高可用软件生态起到示范作用。

王敏坚认为,这个示范作用指向的是寒武纪、海光、摩尔线程、沐曦等一众国产芯片公司:与其各自为战地造轮子,不如共同对接TileLang这样的中立语言层。芯片厂只需提供编译后端和底层指令接口(昇腾为此开放了Ascend C与PTO ISA底层指令体系),上层算子生态即可复用。若这一路径成立,国产AI芯片有望第一次拥有跨芯片共享的算子生态,碎片化困局出现真正的解法。

不过,在肯定此次开源战略价值的同时,也需看到现实的挑战。英伟达CUDA生态积累了十余年,拥有数百万开发者和海量工具。TileLang昇腾版是一个重要的起点,但要从“可用”到“好用”再到“开发者主动选择”,仍需持续的社区运营和迭代。

此外,虽然软件优化能逼近硬件上限,但硬件本身的算力天花板仍是基础。昇腾芯片的持续迭代能力,将决定这套软件生态最终能支撑多大的模型和场景。而DeepSeek的示范能否带动更多模型厂商跟进,则是生态能否真正繁荣的关键。

阅2.86W
要闻
股市
关联话题
7.25W 人关注
1.25W 人关注
关于我们|网站声明|联系方式|用户反馈|网站地图|友情链接|举报电话:021-54679377转617举报邮箱:editor@cls.cn财联社举报
财联社 ©2018-2026上海界面财联社科技股份有限公司 版权所有沪ICP备14040942号-9沪公网安备31010402006047号互联网新闻信息服务许可证:31120170007沪金信备 [2021] 2号