芯片圈有句老话:硬件决定下限,软件决定上限。
很多人以为国产AI芯片的差距在制程、在算力,其实真正卡脖子的是另一件事——开发者用惯了英伟达的CUDA,换一套硬件,意味着十几年积累的代码几乎要重写。
9月30日上午,这道墙被凿开了一个口子。
一次"一一对应"的开源
DeepSeek宣布开源面向华为昇腾算力平台的基础设施组件,涵盖三样东西:TileLang高级语言编译工具、高性能计算库、分布式通信库。
关键在于一句表述:所有组件与此前面向英伟达平台的开源组件一一对应。
这次放出来的五个项目分别是:
- DeepGEMM,负责矩阵运算
- DeepEP,负责跨设备通信
- TileKernels,负责常规向量计算与访存
- FlashMLA,负责稀疏注意力
- DeepSelect,负责数据筛选
这五项合起来,撑起了模型运行中计算、通信、访存的关键环节。它们原本跑在英伟达平台上,如今在昇腾上有了对等实现。
TileLang到底简化了什么
关于TileLang,官方给的解释很直白:相对于英伟达的CUDA,它的编程更简单,能显著提高开发效率、简化代码逻辑。
但它不是简单的"易化版"。相对其他同类高级语言,TileLang的编程模型可以充分发挥芯片特性,达到硬件性能上限。
这条路子是先在英伟达成熟平台上验证过的——它已经承载了DeepSeek V4系列模型训练中大部分算子的实现。
这次开源的昇腾版本,对昇腾Ascend C底层指令做了封装,提供高级语言编程方式,同时不损失硬件性能。
用一句话概括:开发者以后不用从汇编层面重写算子了。
华为这边同步放了大招
同日,华为把双方围绕昇腾950及超节点开展的联合创新成果,在CANN社区开源。
内容包括模型部署、大规模训练、超长文本KV Cache池化与Agentic RL等实践,并披露了DeepSeek-V4.1-Flash的部分离线推理性能数据。
双方还共同推进了基于昇腾950的128卡超节点方案,对计算与通信做了深度优化。
这对普通人意味着什么
短期看,这是开发者的利好:底层工具开源,做优化不必从零开始。
中期看,它意味着国产算力第一次有了"能用的软件生态"雏形。芯片的理论算力只是起点,运算怎么拆、数据怎么搬、计算和访存怎么衔接,才决定硬件最终能发挥几成功力。
长期看,全球AI算力生态可能因此裂成两套体系。
不过要清醒:开源只是第一步。生态的胜负不在代码放出来那天,而在有多少人真的愿意把自己的训练任务迁移过去。CUDA用了近二十年建起的护城河,不会因为一次开源就消失。