DeepSeek 开源昇腾基础组件:375GB/s 互联、5102 tokens/s

2026年9月30日,DeepSeek正式开源面向华为昇腾算力平台的基础设施组件,对应此前面向GPU平台开源的全套工具,涵盖TileLang高级语言编译工具、高性能计算库与分布式通信库,标志着头部基座模型厂商首次系统性适配国产AI芯片生态,具有里程碑意义。

DeepGEMM/FlashMLA/DeepEP:128卡3.2Tbps,375GB/s互联带宽

本次开源组件包括DeepGEMM、FlashMLA、TileKernel、DeepSelect等高性能昇腾算子库,以及DeepEP分布式通信库。DeepEP在EP/CP/PP/FSDP等全模式下的实测互联带宽达到Dispatch 375 GB/s、Combine 347 GB/s,逼近硬件理论上限。基于华为定义的128卡SuperPoD Flex和UBL128组网方案,可扩展至256K卡两层交换网络,单层交换带宽达3.2Tbps,支持超低时延推理和前沿基座模型的大规模训练需求。

推理性能:TPOT 10ms下单卡5102tokens/s,TileLang编译支持

基于Ascend 950超节点部署DeepSeek-V4.1-Flash,Offline推理模式下TPOT=10ms时每卡输出吞吐达5102 tokens/s;TPOT=5ms时亦可输出2469 tokens/s(ContextLength=128K)。昇腾提供Ascend C底层编程接口,支撑TileLang高级语言编译开源工作,兼顾资深开发者的手工精细调优与高级语言的快速编译对接两种范式。

首个头部基座模型系统性适配国产算力,昇腾+DeepSeek芯模协同落地

这是中国AI软件生态的标志性事件。DeepSeek率先将头部基座模型的全套基础设施向国产AI芯片做系统性开源,昇腾提供Ascend 950及超节点集群的完整部署支持,双方联合定义的UBL128超节点方案可复制度高,为国内算力自主化提供了一条可落地的芯模协同路径。

相关阅读:DeepSeek 开源昇腾组件:375GB/s 互联、5102 tokens/s 推理,首个头部基座模型系统性适配国产 AI 芯片