DeepSeek开源6个昇腾底层组件,国产芯片软件栈补齐关键一环

首页 / AI资讯 / 泛AI领域

0:00
0:00
1x
定时

9月30日,DeepSeek团队集中开源了6个面向华为昇腾平台的底层软件组件。这不是新模型,也不是开箱即用的应用,而是一批分布在算子开发、矩阵计算、MoE通信、注意力机制与TopK选择等环节的基础设施代码。更值得注意的是它们的对应关系:这批项目与此前面向英伟达平台的开源组件一一对应,目标是把在英伟达上验证过的整套算子方法论完整移植到国产芯片上。有开发者评论认为,这相当于给更多AI芯片打了个样。

六个组件分别补上哪一环

先把这六个项目的作用说清楚。TileLang是写高性能算子的领域专用语言,本次新增了对昇腾950后端的支持,它相当于国产芯片上的通用表达层。TileKernels基于TileLang封装了数十个经过深度优化的算子,覆盖向量计算等常用场景。DeepGEMM负责矩阵计算,这是大模型推理中占比最高的计算环节。DeepEP负责跨设备通信,在混合专家架构里承担专家之间的数据交换。FlashMLA面向稀疏注意力,支撑长上下文场景下的高效推理。DeepSelect则聚焦TopK算子,服务于稀疏注意力的词元筛选与推理采样器。

把这六项放在一起看,覆盖的是一条完整的链路:用什么语言写算子、算子怎么写得更快、矩阵怎么算、多卡之间怎么通信、注意力怎么稀疏化、以及稀疏化之后怎么选。缺任何一环,模型在国产芯片上的效率都会出现明显短板。过去国内做适配的常见做法是逐个项目打补丁,每个模型团队自己解决自己遇到的问题,成果难以复用。这次以成套组件的形式开源,改变的是适配工作的组织方式。

TileLang为什么被放在第一位

在这六个项目里,TileLang的位置最特殊。它不是某个具体算子,而是一层用于描述高性能算子的语言。用它可以表达出编译器能够优化的计算结构,而不必手写底层指令。对硬件厂商来说,支持一种上层表达语言意味着生态门槛的降低,因为开发者不必为每种芯片重新学习一套编程模型。对模型团队来说,语言层统一之后,同一份算子逻辑有机会在多个硬件平台上复用。

这也是为什么这批开源的深层意图被解读为方法论移植。真正难的不是把某个算子写快,而是把一整套从问题定义到性能调优的工作方法复制到新平台上。如果这层语言与配套的算子库能够稳定工作,那么后续其他模型团队做适配时,起点就不再是空白,而是已经有了可参照的范本。对一个希望扩大芯片使用范围的生态来说,这种范本的价值往往高于单个算子的性能数字。

性能数字背后的口径问题

官方与项目方公布了一批性能数据。DeepGEMM在昇腾平台上的表现是BF16达到硬件上限的99.8%,FP8为99.5%,FP4为98.3%。DeepEP在昇腾950DT超节点外部网络下,分发持续带宽达到物理载荷带宽上限的90%到95%。FlashMLA支撑DeepSeek-V4.1推理,在昇腾950上预填充阶段达到410TFLOPS,约为理论峰值的95%,解码阶段达到360TFLOPS,约为83%。

这些数字需要配合口径来读。它们来自项目方公开的测试或技术报告,属于算子层面的微基准,不能直接换算成端到端的线上速度。真实业务里,模型性能还受调度策略、批处理规模、显存带宽与网络拓扑等因素影响,任何一项不匹配都会让实际表现明显低于微基准。因此对准备迁移的团队来说,这些数字的意义是判断某个环节的理论天花板在哪里,而不是承诺迁移之后就能获得同等幅度的提速。按自己的模型与负载做一次复测,是必要的步骤。

为什么说这是一次方法论移植

把这批开源放到国产算力的整体语境里,会看到一条更清晰的线索。过去几年,国产AI芯片在硬件指标上的追赶速度不慢,但软件栈的成熟度始终是短板。硬件能不能跑通一个模型,与能不能高效跑通并稳定运行,是两个难度完全不同的问题。前者依赖编译工具链是否支持,后者依赖算子库、通信库、注意力实现与调度框架是否都经过充分优化。

DeepSeek此前在英伟达平台上开源过一批同名的底层组件,并在自己的模型训练与推理中实际使用,这相当于完成了一次方法论验证。此次把这套方法移植到昇腾平台,等于把验证过的东西复制到另一条硬件路线上。对国内算力生态来说,这种移植比单纯增加一个可运行的模型更有意义,因为它降低的是所有模型团队共同面对的适配成本。当适配工作从每个团队各自摸索变成有范本可循,国产芯片被采用的阻力才会实质性下降。

国产芯片软件栈的真实差距在哪里

需要避免把这次开源理解为差距已经抹平。算子性能接近硬件上限,说明在特定计算模式上优化已经做得很好,但软件栈的竞争还包括编译器对复杂模型结构的支持程度、调试与性能分析工具的完善度、算子库的覆盖广度,以及社区积累的深度。这些方面的差距不会因为一批组件的开源而立刻消失,它们依赖长期的迭代与大量开发者的实际使用反馈。

对使用者来说,更务实的判断标准是三件事:迁移一个现有模型需要多少人力,迁移之后端到端性能相比原平台下降多少,以及遇到问题时能否快速定位。这三点决定了迁移在经济上是否划算。从产业趋势看,随着国产算力供给持续扩大与模型团队适配意愿提升,软件栈的完善速度会比过去几年更快,而这次开源是这条曲线上的一个明确节点。接下来值得关注的是其他模型团队是否会基于这批组件提交适配成果,以及这些成果能否被复用,这才是衡量生态是否真正启动的关键指标。

素材来源:心眸AI笔记、新浪硬件、DeepSeek、IT之家 发布时间:2026-10-01