华为宣称昇腾份额超英伟达:25.6万张卡背后的技术突围
2026年10月6日,华为轮值董事长徐直军在华为全联接(HC)2026大会上抛出了一个极具争议也充满野心的判断:在中国市场,昇腾算力的市场份额应该已经超过了英伟达。 与此同时,华为发布了全新的Peerium计算架构与“灵衢”统一总线方案,宣布其Atlas 950 SuperPoD已实现超25.6万张卡的部署规模。
这一声明迅速在资本市场和科技圈引发震动。面对美国持续收紧的高端芯片禁令,华为究竟是如何在短短两三年内建立起足以撼动英伟达霸主地位的实力?这25.6万张卡和背后隐藏的技术底座,究竟是营销话术,还是中国AI算力产业链真正具备自主可控能力的标志?
从25.6万张卡看昇腾的真实底盘
首先要回答的核心问题是:昇腾真的能在体量上超越英伟达吗?
答案是肯定的,但需要加上严格的限定条件——这是在特定地缘政治约束和中国本土需求激增的叠加下形成的结构性机会。
长期以来,英伟达在中国占据绝对的统治地位,其A100、H100等旗舰芯片几乎是所有头部大厂训练大模型的首选。但随着美国商务部对高端AI芯片出口管制的层层加码,英伟达的特供版(如H20)虽然保留了互联能力,但在单卡算力上被大幅削弱。而华为昇腾910B及迭代产品910C,则在官方制裁的倒逼下完成了快速进化。
徐直军在此前对外交流中曾提到,目前国内至少有3到4家一线大模型厂商已被广泛认可地使用昇腾算力。根据本次HC大会披露的数据,华为基于新一代互联技术打造的超节点GPU部署规模已达到25.6万张。这意味着,在国产大模型训练和推理的新增需求中,如果没有英伟达的份额填补进来,昇腾必然成为绝对的主力。
当然,“超过英伟达”更多是指新增出货量和可用算力的对比,并非指全球范围内的绝对碾压。在高端生态成熟度、软件兼容性和极致峰值性能上,英伟达依然拥有深厚的护城河。但对于百度、阿里、腾讯和字节跳动等国内巨头而言,当英伟达拿不到更好的卡时,华为成为了唯一可靠的规模化供应方。这25.6万张卡,构成了华为算力商业化的坚实底座。
直击阿喀琉斯之踵:灵衢总线打破集群互联天花板
算力集群的竞争力不仅仅取决于单张显卡的峰值算力,更取决于成千上万张显卡协同工作时的效率。这就是业内常说的“木桶效应”——网络延迟和带宽会吞噬掉大量原本属于计算的资源。
英伟达目前最引以为傲的方案是NVLink,在其最新的NV72机柜中,柜内互连带宽高达1.8TB/s,表现堪称惊艳。但问题在于,一旦超出单机柜范围,将数十个甚至上百个机柜扩展成一个超级集群时,英伟达方案必须依赖InfiniBand网络进行跨柜传输,协议转换带来了微秒级的延迟。随着模型参数量的爆炸式增长,这种延迟会导致大规模并行训练的效率断崖式下跌。这也是为什么英伟达原本雄心勃勃的NV256方案最终因为互联瓶颈被迫妥协为NV72的原因。
华为此次发布的Peerium架构及其核心载体“灵衢”(UnifiedBus)统一总线,正是为了精准打击这一痛点。
根据徐直军与海思首席科学家廖恒在大会上的披露,灵衢总线实现了真正的“全程高速互联”。其最大亮点在于支持最高800GB/s的柜间带宽,并且采用了统一的传输协议。在这一架构下,当算力集群从单节点扩展到多节点(Scale-out)时,无需在不同协议栈之间反复跳板切换,多协议切换延迟被压缩到了惊人的约150纳秒级别。
150纳秒是什么概念?相比传统方案的微秒级延迟,至少节省了整整一个数量级。对于动辄需要数万亿参数的超级大模型训练而言,这意味着数据在数千颗芯片间同步重传的次数大大减少,反向传播过程中的梯度对齐等待时间被显著压缩,有效算力占比因此大幅提升。目前,华为昇腾910C超节点基于这一技术,已经能够支撑单机柜384卡的高效运行,并向百万级扩展迈进了实质性的一步。
拥抱NPO技术路线:一次降低40%成本的激进选择
除了互联带宽和延迟,光模块的选择也是决定AI集群成本和良率的关键环节。
在当前的数据中心技术演进中,主流路径是CPO(共封装光学),即将光引擎直接和芯片封装在一起以实现极高的能效比。但这带来了一个巨大的工程难题:散热难、良率低,且一旦某个光通道损坏,整块昂贵的主板都要报废,后期维护极其困难。
针对这一行业痛点,华为这次选择了另一条看似保守实则更具商业化性价比的路径——NPO(近包封光学)。
廖恒在问答环节详细解释了华为的这一取舍。NPO方案并没有将光源完全嵌入芯片内部,而是让光引擎距离主芯片保持大约5厘米的距离,并通过高密度的铜线(约5厘米长)进行短距连接。
这套方案的精妙之处在于,它在可靠性与成本之间找到了极佳的平衡点。由于不需要像外置光源那样用单个高功率激光器去驱动几十路信号放大,光引擎本身的功耗和故障率被极大降低。更重要的是,由于缩短了光路设计的复杂度并简化了封装工艺,华为测算认为,该方案能为客户带来接近40%的综合成本下降。
同时,华为还专门研发了支持7.2T超高带宽的Hi-ONE模组,以弥补NPO在超远距离传输上的短板。这种“宁可用铜线缩短距离,也不盲目追求极端集成”的思路,非常符合华为一贯的工程务实作风——它不一定会跑出版纸面上的最强极限参数,但它能保证交付给客户的超级智算中心在未来几年里不仅建得起,还养得起、修得好。
生态护城河与下一步观察指标
华为抛出这些硬核技术参数和“超英伟达”的市场份额判断,不仅仅是为了展示肌肉,更意味着一场围绕国产算力供应链的深度洗牌正在发生。
首先受益的是进入华为算力生态链的上下游企业。从PCB电路板到服务器代工,再到光纤光缆和散热设备供应商,华为25.6万张卡的庞大出货量和未来百万级的目标扩张,将直接转化为订单。特别是NPO技术路线的确定,将进一步利好那些能够提供高密度铜连接和高精度光模块的企业。
其次,国内云厂商和大模型公司也将面临更明确的选型标准。尽管软件生态(对标CUDA的昇腾CANN)仍需时间打磨,但当硬件层面的网络瓶颈被攻克、单机柜扩展难度被降低后,开发者在迁移模型时的摩擦成本也会随之下降。
不过,也必须看到潜在的隐忧。一方面,美方可能会进一步收紧对华半导体制造设备和先进制程的限制,这将成为华为产能扩张的上限;另一方面,Peerium架构在实际承载千模百炼等复杂业务场景时的长期稳定性,仍需更多第三方实测数据的背书。
对于投资者和产业观察者而言,接下来最值得盯住的三个指标是:第一,华为下一代Ascend 910D或更新型号的单卡算力能否追平英伟达当前主力H系列芯片的70%以上;第二,三大运营商和国资云中心的集采订单中,昇腾方案的实际中标比例是否持续扩大;第三,互联网大厂是否在开源社区和实际大模型训练报告中,正式承认并展示基于Peerium架构训练出的高质量语言模型。
这场算力之战没有终局,但25.6万张卡已经证明,棋局已经被彻底搅动。


