---
title: "DeepSeek把压箱底的算子工具开源了，英伟达最怕的那道墙要塌？"
date: 2026-10-02
category: 算力芯片
site: 脑机网
canonical: https://www.logic.wang/a/njw-ec0644
language: zh-CN
---

# DeepSeek把压箱底的算子工具开源了，英伟达最怕的那道墙要塌？

> 芯片圈有句老话：硬件决定下限，软件决定上限。

芯片圈有句老话：硬件决定下限，软件决定上限。

很多人以为国产AI芯片的差距在制程、在算力，其实真正卡脖子的是另一件事——开发者用惯了英伟达的CUDA，换一套硬件，意味着十几年积累的代码几乎要重写。

9月30日上午，这道墙被凿开了一个口子。

## 一次"一一对应"的开源
DeepSeek宣布开源面向华为昇腾算力平台的基础设施组件，涵盖三样东西：TileLang高级语言编译工具、高性能计算库、分布式通信库。

关键在于一句表述：所有组件与此前面向英伟达平台的开源组件一一对应。

这次放出来的五个项目分别是：

- DeepGEMM，负责矩阵运算
- DeepEP，负责跨设备通信
- TileKernels，负责常规向量计算与访存
- FlashMLA，负责稀疏注意力
- DeepSelect，负责数据筛选
这五项合起来，撑起了模型运行中计算、通信、访存的关键环节。它们原本跑在英伟达平台上，如今在昇腾上有了对等实现。

## TileLang到底简化了什么
关于TileLang，官方给的解释很直白：相对于英伟达的CUDA，它的编程更简单，能显著提高开发效率、简化代码逻辑。

但它不是简单的"易化版"。相对其他同类高级语言，TileLang的编程模型可以充分发挥芯片特性，达到硬件性能上限。

这条路子是先在英伟达成熟平台上验证过的——它已经承载了DeepSeek V4系列模型训练中大部分算子的实现。

这次开源的昇腾版本，对昇腾Ascend C底层指令做了封装，提供高级语言编程方式，同时不损失硬件性能。

用一句话概括：开发者以后不用从汇编层面重写算子了。

## 华为这边同步放了大招
同日，华为把双方围绕昇腾950及超节点开展的联合创新成果，在CANN社区开源。

内容包括模型部署、大规模训练、超长文本KV Cache池化与Agentic RL等实践，并披露了DeepSeek-V4.1-Flash的部分离线推理性能数据。

双方还共同推进了基于昇腾950的128卡超节点方案，对计算与通信做了深度优化。

## 这对普通人意味着什么
短期看，这是开发者的利好：底层工具开源，做优化不必从零开始。

中期看，它意味着国产算力第一次有了"能用的软件生态"雏形。芯片的理论算力只是起点，运算怎么拆、数据怎么搬、计算和访存怎么衔接，才决定硬件最终能发挥几成功力。

长期看，全球AI算力生态可能因此裂成两套体系。

不过要清醒：开源只是第一步。生态的胜负不在代码放出来那天，而在有多少人真的愿意把自己的训练任务迁移过去。CUDA用了近二十年建起的护城河，不会因为一次开源就消失。

---

来源：脑机网（https://www.logic.wang/）｜原文：https://www.logic.wang/a/njw-ec0644
本内容仅供参考，不构成投资建议。
