华为发布昇腾960超节点:4096卡的野心何时成真
9月17日,华为全联接大会2026在上海开幕。华为副董事长汪涛在主题演讲中抛出一个重量级产品:业界首个采用NPO技术的昇腾960超节点。单节点搭载4096卡,最大可提供8E FP8算力、1PB HBM容量。
这组数字如果只看峰值,足以让国内AI算力玩家侧目。但真正值得关注的不是这个超节点有多强,而是它什么时候能真正跑起来——960DT预计2027年第一季度就绪,960PR则要等到2027年第三季度。从发布会到实际交付,中间隔着至少半年甚至一年的距离。对于急需AI算力的企业和科研机构而言,等不起的只能先靠现有产品线顶住需求。
用5500颗Hi-ONE替代4.8万颗光模块
昇腾960超节点的差异化亮点落在通信技术层面。
在传统多GPU或CPU加速集群中,卡间通信高度依赖大量高速光模块来完成数据交换。一个4096卡规模的集群,按照传统方案的架构设计,大约需要4.8万颗800G光模块来维持各节点之间的互联带宽。而华为在此次发布会上提出的NPO方案,则用自研的Hi-ONE组件将这些互连器件大幅压缩到了5500个——也就是说,光模块用量减少了约九成以上。
华为给出的量化收益包括:降低超550千瓦功耗,系统无故障运行时间提升一倍,整体可用度达到99.8%。对于一个动辄投入数亿元建设的智算中心来说,功耗的显著下降意味着数据中心运营成本(OPEX)的直接改善;系统可用度的提升则直接决定了客户业务连续性的保障能力。
NPO不是行业通用术语,而是华为内部的技术命名。从公开披露的技术逻辑来看,其核心思路是用定制化互连芯片(Hi-ONE)替代传统的光模块作为卡间通信的中枢枢纽,从而简化整个互联拓扑结构、降低信号损耗与系统功耗。这一方向在物理层上是站得住脚的——光模块不仅是大规模AI集群中最昂贵的非计算部件之一,同时也是整机功耗的主要来源和硬件故障率的重要触发点。
不过问题也随之而来。NPO技术的具体实现细节、与现有开放标准如CXL跨加速器互连协议的兼容情况,以及能否被第三方硬件厂商和系统集成商广泛接受,目前仍然缺乏独立第三方的技术验证和产品评测。如果这项技术只能绑定在昇腾芯片上使用,那它在更多时候更像是一个优化闭环而非行业通用的基础设施标准。这意味着,即便昇腾960在性能上取得突破,其市场扩展速度也将受限于华为自身产业链的推进节奏。
当下靠910C和950撑场子
昇腾960虽然在此次大会上风头正盛,但现阶段撑起国产AI算力基本盘的,其实是更早推出并已步入商用阶段的产品线。
根据发布会上公布的数据,昇腾910C超节点已部署超过1000套,昇腾950超节点已进入规模商用阶段。这两个型号是当前国内数据中心实际运转的昇腾主力,承担着大量的训练和推理任务。
昇腾910系列此前已在鹏城实验室等科研机构和部分头部互联网企业中完成部署测试,是国内少数具备大规模模型训练能力的AI加速芯片之一。然而,与英伟达H100或H200进行直接性能对比,至今没有公开的权威第三方基准数据支撑。华为官方也从未提供昇腾910C或昇腾960在主流深度学习训练任务上的MLPerf成绩或其他可横向比对的基准分数。这让任何声称"追平"或"超越"的性能对标讨论,都只能停留在推测和估算层面,而非确凿的事实结论。
据公开渠道了解,阿里云、百度智能云等头部云计算厂商曾引入昇腾芯片用于部分推理场景和训练任务,但具体部署规模、客户结构、算力利用率以及续约率等核心运营数据均属于商业机密范畴,未向公众或第三方研究机构披露。这意味着昇腾系列在实际市场份额、客户黏性和长期复用率方面的真实表现,仍存在明显的信息缺口。投资者和行业观察者很难仅凭有限的发布会数据对昇腾的市场竞争力做出准确判断。
装机两千万套后的生态棋局
如果说昇腾芯片是华为对外拓展的矛,那么开源生态就是它向内构建的护城河。
汪涛在发布会上同时公布了多条生态线的关键进展。openEuler装机量已超过2000万套,成为中国服务器操作系统份额第一。值得注意的是,这个数字背后的统计口径——是累计安装量、活跃服务器数量还是分发总量——不同的定义会导向截然不同的市场规模含义和市场格局评估。无论如何,2000万套是一套Linux操作系统在中国政企领域累积渗透的重大里程碑事件,反映了国产操作系统在关键基础设施领域的持续突破。
鲲鹏全球开发者已超过416万,生态合作伙伴超过7200家。CANN(华为自主AI计算软件栈)的外部开发者占比已达61%,社区月活跃开发者突破5200人。更具标志意义的是:昇腾正式成为可在PyTorch官网上直接安装配置的算力平台,这也是首款来自中国的本土AI加速芯片获得这一地位。
这三步递进构成了一套清晰的生态战略路线图:先用openEuler锁定操作系统层面的用户粘性和迁移成本壁垒,再通过鲲鹏加开发者社区积累人才储备和技术创新能力,最后借助PyTorch原生适配大幅降低开发者的学习曲线和迁移门槛。对于一个正在建设中的AI加速芯片生态系统而言,软件层的壁垒往往比硬件更难打破——昇腾在这一点上取得的实质性突破,或许比单个芯片的峰值算力指标更有长远价值和战略意义。
接下来看什么
华为公布的年度迭代路径相当明确:一年一代产品节奏。2028年推出970,2029年推出980。但这条节奏能否持续兑现,取决于以下五个可观察的硬指标:
第一,昇腾960DT是否能在2027年Q1如期交付并上线首批客户的实际业务负载。 发布会参数再漂亮,也要等到真实训练场景中接受检验,这是衡量华为工程兑现能力的第一块试金石。
第二,MLPerf等国际标准化基准测试中出现昇腾芯片的排名成绩。 这是海内外唯一可进行横向客观比对的窗口。长期缺席权威基准意味着性能讨论永远只能在各自的话语体系中进行。
第三,openEuler装机量的留存率和新增增速。 2000万是存量成果,真正考验的是系统在真实生产环境中的稳定表现、新客户的追加意愿以及现有客户的续约续购能力。
第四,第三方云厂商对昇腾的大规模采购公告。 阿里云、腾讯云、中国移动移动云是否有更大规模的昇腾计算实例上架,是市场需求最直接的体温计和风向标。
第五,CANN对主流深度学习框架的兼容广度。 特别是TensorFlow和JAX的支持进展,将直接影响开发者迁移成本和昇腾生态边界的扩展速度,也是决定国产AI算力能否融入国际主流技术栈的关键一步。
华为昇腾的整体叙事不是一个单芯片逆袭的英雄剧本,而是从芯片到操作系统再到开源社区的体系化竞争长跑。短期看,910C和950将继续扛下大旗满足市场刚需;中长期看,这套生态护城河的深度将最终决定整个体系能否真正实现从进口依赖到自主可控的根本性转变。


