资讯 · 高影响返回资讯

DeepSeek 开源昇腾版全套 AI 基础设施:对齐 CUDA 工具链,适配 128 卡超节点

DeepSeek 宣布开源面向华为昇腾(Ascend)算力平台的完整生产级 AI 基础设施,包括算子编译工具 TileLang、矩阵乘法库 DeepGEMM、通信库 DeepEP 及稀疏注意力算子 FlashMLA,实现与英伟达 CUDA 工具链的 1:1 对齐,并在 128 卡超节点集群上逼近硬件极限性能。

核心开源组件与功能对齐

2026 年 9 月 30 日,DeepSeek 正式开源其面向华为昇腾(Ascend)算力平台的整套 AI 基础设施组件。此次发布的算力底座直接移植自 DeepSeek 实际生产环境,实现了与此前在英伟达 CUDA 平台上开源的核心工具链 1 镜像对齐 的架构设计,为前沿大模型在国产算力集群上的高效训练与低时延推理提供了工业级解决方案。

此次开源的昇腾版软件栈覆盖从底层算子编写、显存优化到大规模分布式通信的完整关键链路,主要包含五项核心工具与算子库:

  • TileLang 编译工具:作为轻量级 Python 领域特定语言(DSL)与编译器,对昇腾底层 Ascend C 指令集进行结构化封装,使开发者能够在统一的高级语言下自主定义分块与访存策略,底层自动完成线程绑定与流水线排布。
  • DeepGEMM-Ascend 矩阵计算库:针对混合专家(MoE)与密集计算负载打造的高并发算子库,支持 FP8、FP4 与 BF16 精度,通过轻量抽象昇腾矩阵乘加(MAD)原语逼近芯片物理算力峰值。
  • DeepEP-Ascend 分布式通信库:专为专家并行(Expert Parallelism, EP)与 MoE 跨节点通信设计,基于 Ascend C、HCCL 与 UBMEM 深度优化,完整支持跨设备 All-to-All Token 高效分发与聚合。
  • FlashMLA 稀疏注意力算子:面向 DeepSeek-V3 与 V4 系列模型的多头潜在注意力(MLA)架构优化,结合 Paged KV 缓存显存管理机制,专用于长上下文推理阶段的解码加速。
  • TileKernels 与 DeepSelect:提供高吞吐的通用向量计算与高频访存算子集合,并针对复杂动态数据流提供轻量筛选与快速过滤能力。

超节点互联与通信协同

在万亿参数混合专家模型中,跨卡与跨节点的网络通信开销往往是限制线性扩展比的核心瓶颈。华为与 DeepSeek 团队针对新一代 昇腾 950(含 Ascend 950DT) 硬件平台进行了深度的软硬件联合优化,重点引入昇腾 SuperPoD Flex 超节点与 UBL128 全互联网络架构。

该超节点组网方案在不同通信层级上分别提供了极具竞争力的扩展能力:

  • 单层横向扩展(Scale-up):基于全互联 UBL128 组网实现 128 卡单层直接交换,单卡互联双向带宽达到 3.2Tbps,显著消除了多跳路由带来的额外延迟。
  • 双层纵向扩展(Scale-out):依托两层交换网络拓扑支持平滑扩展至 256K 卡超大规模集群,满足万亿基座模型在海量并发下的训练与实时调度需求。
  • 专用底层通信库协同:配合昇腾为超节点量身定制的 ASC-COMM 高性能通信库,DeepEP 在跨卡分发 Token 时能够跑满底层链路带宽,减少计算核心等待开销。

实测表现与生产验证

这套基础设施并非实验室演示方案,而是已经历大规模真实业务流量考验的生产级系统。在离线推理实测中,工程团队采用 EP32 并行策略 部署了 DeepSeek-V4.1-Flash 模型,整套软件栈在维持 高并发吞吐 与极低时延的同时,计算与通信性能均已达到硬件物理利用率的理论上限。

在实际部署规划方面,DeepSeek 位于内蒙古等地的千亿参数模型推理集群,已计划大规模采用昇腾 950DT 芯片构建底层算力。通过在算子级绕过通用框架的额外包装层,直接结合 DeepJIT 即时编译特化代码,系统在多种矩阵尺寸下均实现了极低时延与显存占用。

开源清单与工程价值

长期以来,国产芯片在承载前沿大模型时面临“能跑通但跑不满算力、能单机运行但跨节点通信开销巨大”的工程断层。DeepSeek 将自身打磨成熟的底层软件全盘交付社区,直接填补了国产算力生态在 高性能 DSL 编译器与分布式通信 上的空白,使开发者能够免去从零编写底层汇编的繁重工作。

此次开源的所有组件均已在 GitHub 上线,包含完整的构建文档与昇腾环境适配指南:

组件名称核心定位与功能GitHub 仓库路径
TileLang跨硬件高性能算子编译 DSL 与高级语言工具链tile-ai/tilelang
DeepGEMM-Ascend针对 MoE 与低位宽浮点优化的昇腾矩阵乘法加速库deepseek-ai/DeepGEMM-Ascend
DeepEP-Ascend专家并行(EP)高吞吐低时延跨设备通信库deepseek-ai/DeepEP-Ascend
FlashMLA多头潜在注意力(MLA)长上下文解码加速算子deepseek-ai/FlashMLA
TileKernels向量运算、访存优化与数据筛选专用算子集deepseek-ai/TileKernels

下一步

把变化转化为下一步

沿着同一主题继续阅读。

查看实战指南