2026年9月30日,DeepSeek正式开源面向华为昇腾算力平台的基础设施组件,对应此前面向GPU平台开源的全套工具,涵盖TileLang高级语言编译工具、高性能计算库与分布式通信库。标志着头部基座模型厂商首次系统性适配国产AI芯片生态,是当年AI算力领域最具实质性意义的开源事件。
里程碑:头部基座模型首次系统性适配国产算力
DeepSeek率先将头部基座模型的全套基础设施向国产AI芯片做系统性开源,打破了过往国产算力适配”尾随跟进”的局面。昇腾提供Ascend 950及超节点集群的完整部署支持,双方联合定义的UBL128超节点方案可复制度高,为国内算力自主化提供了一条可落地的芯模协同路径。
这意味着国产大模型训练不再依赖英伟达生态的”黑箱”工具链,昇腾用户可以直接使用DeepSeek开源的高性能算子,无需自行从零开发。
核心组件解析:DeepGEMM / FlashMLA / DeepEP
本次开源组件包括DeepGEMM、FlashMLA、TileKernel、DeepSelect等高性能昇腾算子库,以及DeepEP分布式通信库。
DeepEP在EP/CP/PP/FSDP等全模式下的实测互联带宽达到Dispatch 375 GB/s、Combine 347 GB/s,逼近硬件理论上限。基于华为定义的128卡SuperPoD Flex和UBL128组网方案,可扩展至256K卡两层交换网络,单层交换带宽达3.2Tbps,支持超低时延推理和前沿基座模型的大规模训练需求。
推理性能:TPOT 10ms下单卡5102tokens/s
基于Ascend 950超节点部署DeepSeek-V4.1-Flash,Offline推理模式下TPOT=10ms时每卡输出吞吐达5102 tokens/s;TPOT=5ms时亦可输出2469 tokens/s(ContextLength=128K)。这一性能在国产AI芯片上属于领先水平,与英伟达H100单卡推理能力基本持平。
昇腾提供Ascend C底层编程接口,支撑TileLang高级语言编译开源工作,兼顾资深开发者的手工精细调优与高级语言的快速编译对接两种范式。
横向对比:昇腾 950 vs H100 推理性能
以DeepSeek-V4.1-Flash为统一测试基准,昇腾950与英伟达H100在推理场景下的关键指标对比如下:
| 指标 | 昇腾 950(DeepSeek-V4.1-Flash) | 英伟达 H100 |
|---|---|---|
| TPOT=10ms 单卡吞吐 | 5102 tokens/s | 约 5500 tokens/s |
| TPOT=5ms 单卡吞吐 | 2469 tokens/s | 约 2800 tokens/s |
| 128卡互联带宽 | 375 GB/s | 约 900 GB/s(NVLink) |
| 超节点最大规模 | 256K卡 | 16K卡 |
| ContextLength | 128K | 128K |
从单卡推理性能看,昇腾950与H100差距已收窄至约10%以内;但在超大规模集群的横向扩展能力上,昇腾通过UBL128方案实现了更大的单层交换带宽(3.2Tbps),在超大规模部署场景反而更具优势。
开发者如何接入:TileLang 编译链路
TileLang是DeepSeek此次专为昇腾平台推出的高级语言编译工具链,核心价值在于降低高性能算子开发门槛。传统做法需要开发者用Ascend C手写CUDA级别的精细调优代码;TileLang允许用户用高级语言描述算子行为,由编译器自动生成接近手工优化水平的低层代码。
接入路径:首先从DeepSeek GitHub仓库(github.com/deepseek-ai)拉取TileLang源码;根据昇腾官方文档配置Ascend 950驱动与Ascend C工具链;运行TileLang编译器将模型转化为适配昇腾的算子格式;最后通过DeepEP分布式通信库在多卡集群上完成部署。
对中国AI生态的意义
DeepSeek开源昇腾组件的直接影响是降低了国内AI开发者对英伟达生态的依赖程度。过往国内AI模型的昇腾适配往往是在英伟达版本发布后数月才跟进,且适配质量参差不齐。DeepSeek此次做到了”同期开源、同步适配”,是国产AI软件生态成熟度的重要标志。
间接影响在于,昇腾+DeepSeek的芯模协同模式为其他国产基座模型提供了可参考的适配范本,有望推动更多头部模型将国产算力纳入一等支持。
FAQ
DeepSeek 昇腾组件适合哪些场景?
最适合需要大规模推理和训练的政企用户,尤其是已有昇腾集群或正在采购昇腾设备的机构。中小开发者如果只有单卡或小规模集群,直接使用Ascend 910B等已有型号的性价比可能更高。
已有基于英伟达的DeepSeek模型,能无缝迁移到昇腾吗?
不能完全无缝。TileLang编译器负责算子转换,但部分依赖CUDA特定特性的优化代码需要手动适配。建议在测试环境中完成完整基准测试后再迁移生产环境。
昇腾 950 与昇腾 910 系列兼容吗?
不兼容。UBL128是950独有的组网方案,910系列不支持。已在910集群上的用户需要新采购950超节点才能使用本次开源的全套组件。
相关阅读
- DeepSeek Harness 桌面版发布:开箱即用免配环境,6元赠金可跑1.2亿缓存命中
- OpenAI DevDay 2026 全景解读:20+项更新、GPT-6.1 Sol与Pro
- 快手可灵4.0下月全面上线:支持8000 Token、立体声唇形同步,21:9超宽画幅
相关阅读:DeepSeek知乎首次公开V4.1训练底座DSec:每秒创建5000个沙盒、CPU超卖50倍
延伸阅读
- OpenAI高管透露:80%至90%研发力量已转向GPT-7及后续模型3 天前
- DeepSeek V4 Flash 正式版来了:Terminal Bench 2.1 冲到 82.7,Agent 能力大幅超越预览版2 月前
- 阶跃星辰 600B MoE 旗舰 Step 5 Preview 上线 22 小时 GPU Kernel 优化到 508 TFLOPS5 天前
- OpenAI、微软高管内部承认 AI 可替代新闻文章,法院文件曝光2 周前
