075582814553
华为官宣,DeepSeek开源昇腾基础组件

香港天翔電子有限公司 / 09-30 15:55

9月30日,华为和DeepSeek官方宣布,DeepSeek已正式开源面向昇腾算力平台的基础设施组件。这意味着在主流GPU路径之外,国产算力平台首次获得了来自头部大模型厂商的、成体系的基础设施级支撑。

9月30日,华为和DeepSeek官方宣布,DeepSeek已正式开源面向昇腾算力平台的基础设施组件,覆盖TileLang高级语言编译工具、高性能计算库与分布式通信库,所有组件与此前面向英伟达平台的开源组件一一对应。这一举措对中国AI软件生态具有里程碑意义——它意味着在主流GPU路径之外,国产算力平台首次获得了来自头部大模型厂商的、成体系的基础设施级支撑。

把性能空间真正交还给开发者

工欲善其事,必先利其器。建立新一代自主可控的GPU软件生态,首要的事情是先建立一个通用的、编程简单的、同时能达到硬件性能上限的高级语言。TileLang 在这样的历史背景下诞生的。

DeepSeek方面表示,相对于英伟达的CUDA语言,TileLang的编程更简单,能显著提高开发效率、简化代码逻辑。另一方面,相对于其它同类高级语言,TileLang的编程模型可以充分发挥芯片的特性,达到硬件的性能上限。

昇腾侧,本次开源包含DeepGEMM、FlashMLA、TileKernel、DeepSelect等高性能昇腾算子库组件,以及DeepEP分布式通信库。昇腾平台提供了稳定、开放的Ascend C API接口,使用户能够对访存路径与计算流水线进行深度调优,完成高性能算子开发。同时依托开放的Ascend C编程接口与PTO ISA底层指令体系,支撑了DeepSeek的TileLang编程开源工作。

“在多项关键测试用例中,上述组件的计算与通信性能已接近硬件上限。”

为超大规模训练与低时延推理铺路

华为向DeepSeek团队提供了联合定义的昇腾超节点SuperPoD Flex与UBL128组网方案,可实现128卡3.2Tbps单层交换的Scale-up网络,以及256K卡两层交换的Scale-out网络,兼顾超低时延推理与前沿基座模型的大规模训练需求。基于全互联的UBL128超节点,昇腾提供ASC-COMM高性能自定义通信编程库,支撑通信算子与通算融合算子的高性能编程。

DeepSeek团队则开发了高性能DeepEP通信库,覆盖EP、CP、PP、FSDP等模式下的通信算子,为更大模型向更大集群扩展提供支撑。实测互联带宽方面,Dispatch达375 GB/s、Combine达347 GB/s,已接近硬件上限。

成果落地CANN社区,部署方案同步开放

为支持更广泛的开发者基于昇腾950及超节点集群部署DeepSeek模型,华为将本次联合创新成果在CANN社区开源,内容包括大EP低延时推理部署、单卡/单机部署、大规模训练、超长文本KVcache池化与Agentic RL。其中面向大规模推理场景,基于EP32部署策略,offline推理模式下DeepSeek-V4.1-Flash在不带框架的纯模型性能上,可实现TPOT=5ms时每卡输出吞吐2469 tokens/s;TPOT=10ms时,每卡输出吞吐达5102 tokens/s。

生态设计上也兼顾了不同开发范式,既允许资深开发者进行精细的手工调优,也支持TileLang等高级语言的编译对接。


Processed in 0.087856 Second , 37 querys.