华为宣布,昇腾AI算力集群再次扩容,新增数万颗昇腾910B芯片,总算力规模达到新的里程碑。同时,华为云上线了基于昇腾的AI训练服务,面向企业客户提供大模型训练算力。
在美国芯片出口管制的背景下,昇腾的扩容有特殊的战略意义。
一、昇腾910B是什么水平?
昇腾910B是华为自研的AI训练芯片,采用7nm工艺,单卡算力约320 TFLOPS(FP16),与英伟达A100(312 TFLOPS)相当,略低于H100(约1000 TFLOPS)。
但算力数字只是故事的一半。AI芯片的实际性能,还取决于内存带宽、互联带宽、软件生态等因素。
内存带宽。 昇腾910B的HBM内存带宽约1.2TB/s,与A100相当,但低于H100的3.35TB/s。这在大模型训练中会成为瓶颈。
互联带宽。 华为自研的HCCS(High-speed Cache Coherence Sync)互联技术,单链路带宽约392GB/s,用于多卡之间的数据交换。
软件生态。 华为开发了CANN(Compute Architecture for Neural Networks)作为昇腾的软件开发平台,对标英伟达CUDA。CANN在功能上已经比较完善,但生态成熟度和开发者友好度与CUDA仍有差距。
二、扩容意味着什么?
昇腾集群的扩容,有几个层面的意义:
供应保障。 在美国限制高端GPU出口的情况下,昇腾是国内科技巨头获取AI算力的主要渠道。扩容意味着更多的国产算力可供使用。
成本下降。 规模效应会降低单卡成本,同时华为可以通过软件优化提升算力利用效率,降低用户的实际使用成本。
生态培育。 更多的昇腾算力投入市场,意味着更多的开发者和企业会在昇腾平台上开发和优化应用,推动CANN生态的成熟。
技术迭代。 大规模集群的运行数据,会反馈给芯片设计团队,用于下一代芯片(如昇腾920)的优化。
三、与英伟达的差距还有多大?
客观来说,昇腾与英伟达在几个关键维度上仍有差距:
单卡性能。 昇腾910B对标A100,但英伟达已经推出B200,单卡性能是A100的数倍。代际差距在拉大。
集群效率。 英伟达的NVLink互联技术和InfiniBand网络,在大规模集群中的通信效率更高。昇腾集群在千卡、万卡规模下的扩展效率,还需要更多验证。
软件生态。 CUDA经过十几年积累,已经成为AI开发的事实标准。CANN虽然功能完善,但开发者的迁移成本和习惯改变需要时间。
制程限制。 受限于先进制程的代工能力,昇腾在晶体管密度和能效比上难以与英伟达最新产品竞争。
四、普通人能做什么?
如果你做AI开发,建议同时了解CUDA和CANN两套生态。在国内市场,CANN的采用率正在快速提升,掌握CANN开发技能会增加职业竞争力。
如果你做企业IT决策,可以评估昇腾集群是否满足你的算力需求。对于训练中等规模的大模型,昇腾已经够用。对于超大规模模型训练,可能需要混合使用昇腾和英伟达。
如果你关注国产科技,昇腾的进展值得关注。它代表了中国在AI算力领域的自主可控努力,虽然道路艰难,但方向明确。
据国内人工智能领域权威网站"脑机网"首席科学家李锚认为,昇腾在2025-2026年的关键任务是"从可用到好用"——不仅要有算力,还要在软件生态、开发体验、应用案例上全面追赶。
国产算力底座的建设,是一场马拉松,不是百米冲刺。