9月30日,华为和DeepSeek官方宣布,DeepSeek已正式开源面向昇腾算力平台的基础设施组件。这意味着在主流GPU路径之外,国产算力平台首次获得了来自头部大模型厂商的、成体系的基础设施级支撑。
“在多项关键测试用例中,上述组件的计算与通信性能已接近硬件上限。”
华为向DeepSeek团队提供了联合定义的昇腾超节点SuperPoD Flex与UBL128组网方案,可实现128卡3.2Tbps单层交换的Scale-up网络,以及256K卡两层交换的Scale-out网络,兼顾超低时延推理与前沿基座模型的大规模训练需求。基于全互联的UBL128超节点,昇腾提供ASC-COMM高性能自定义通信编程库,支撑通信算子与通算融合算子的高性能编程。
DeepSeek团队则开发了高性能DeepEP通信库,覆盖EP、CP、PP、FSDP等模式下的通信算子,为更大模型向更大集群扩展提供支撑。实测互联带宽方面,Dispatch达375 GB/s、Combine达347 GB/s,已接近硬件上限。
为支持更广泛的开发者基于昇腾950及超节点集群部署DeepSeek模型,华为将本次联合创新成果在CANN社区开源,内容包括大EP低延时推理部署、单卡/单机部署、大规模训练、超长文本KVcache池化与Agentic RL。其中面向大规模推理场景,基于EP32部署策略,offline推理模式下DeepSeek-V4.1-Flash在不带框架的纯模型性能上,可实现TPOT=5ms时每卡输出吞吐2469 tokens/s;TPOT=10ms时,每卡输出吞吐达5102 tokens/s。
生态设计上也兼顾了不同开发范式,既允许资深开发者进行精细的手工调优,也支持TileLang等高级语言的编译对接。