50%换8%:华为昇腾如何夺下中国AI芯片半壁江山
10月3日,华为全连接大会(Huawei Connect)现场,华为轮值董事长徐直军的发言划出了一条清晰的分水岭。过去四年间,曾占据中国人工智能AI训练芯片市场95%份额的英伟达(Nvidia),如今在中国市场的占比已滑落至约8%;取而代之的是华为昇腾(Ascend)系列,其份额已攀升至50%。
这是一个极具符号意义的数字翻转。若将时间轴拉回2022年,彼时国内头部互联网大厂与智算中心仍无可选择地依赖黑盒、A800及H800等特定型号,昇腾仅能勉强切入边缘推理场景,份额不足3%。而到了2026年的今天,不仅总量发生了逆转,背后的技术底座与市场逻辑也经历了一场静默但彻底的重塑。
这并非一次单纯的产品迭代胜利,而是极端外部压力倒逼下,中国算力基础设施完成的一次系统性换血。
用系统级堆叠弥补单卡代差
华为能够完成份额反超的最直接支撑,来自硬件底层设计思路的根本转变。
由于先进制程受制于外部供应链限制,华为无法像英伟达那样,单纯依靠单颗GPU晶体管密度的指数级增长来换取算力跃升。昇腾系列选择了另一条技术路径:既然单点性能有物理天花板,就用系统的规模来抹平差距。
徐直军在大会上重点推介了SuperPoD(超级集群)架构方案。该方案由自研的Peerium片间互联技术与灵衢总线组成,本质上是把多台AI计算卡在高速网络中封装成一个“巨型虚拟处理器”。通过这种方式,华为实现了最高100万处理器核心的对等互连能力。
这意味着什么?当业界还在比拼单卡FP16浮点运算精度时,华为已经进入了算力“军团化”阶段。目前,针对国内6至7家前沿实验室正在部署测试的超级节点,规模已达到惊人的6.7万张Atlas 950计算卡。这套系统直接瞄准了训练参数量在10万亿至40万亿级别的基础大模型。
这种以组网方式硬扛制程差距的策略,虽然在极限吞吐率和能效比上可能尚未完全追平全球顶尖水平,但在实际的大模型分布式训练中,已足以形成有效的商用替代。算力不再是一台台服务器的孤立比拼,而是变成了整体工程调度能力的较量。
政策铁壁下的采购规则重塑
技术路线的切换只是硬币的一面。如果剥离美国出口管制带来的特殊市场环境,单纯讨论产品力,昇腾很难在极短时间内自然吞掉英伟达的庞大基本盘。真正让市场份额发生雪崩式转移的暗线,是强制性的供应链断供与政策护航。
自2023年以来,针对高端AI加速器的出口许可不断收紧,后续甚至覆盖了更广泛的计算单元。这就产生了一个极其残酷但也极其高效的现实约束:中国本土的主流云厂商、科研机构与政企智算中心,失去了继续大量采购英伟达高端产品的合法渠道。
需求并没有因为供应中断而消失,相反,随着国内各大语言模型的参数膨胀,对算力的胃口只会越来越大。当海外巨头主动退场后,原本庞大的采购订单必须寻找承接者。在这一真空期,华为昇腾凭借多年研发积累的存量和产能迅速补位。
这是一种典型的“防御性采购”向“战略性自主”转化的过程。客户从最初的“试一试”,变成如今的“主力机”,不仅是出于地缘政治风险的对冲,更是基于本地化维保响应速度、专属适配服务以及国家数据安全合规要求的综合考量。采购规则的隐形改变,决定了谁能拿到真金白银的订单。
软件生态迁移的真实摩擦
如果说硬件层面的组网突围解决了“能不能跑”的问题,那么软件生态的兼容性则决定了“好不好用”。这也是过去几年悬在国产算力头顶的最大阴影。
长久以来,英伟达的真正护城河并非显卡本身,而是CUDA软件栈。绝大多数主流深度学习框架、学术开源代码乃至工业界优化算法,都以CUDA为默认基准。对于许多工程师而言,切换到任何非英伟达平台都意味着高昂的代码重写成本和漫长的调试周期。
面对这道软件高墙,华为没有采取硬碰硬的兼容策略,而是走向了编译器和框架层的深度融合。华为海思首席科学家廖恒在大会上透露,新一代编译器已通过深度优化,大幅降低了对原有CUDA指令集的路径依赖。结合MindSpore等原生AI框架的推广,开发者迁移至昇腾生态的实际障碍正在被快速填平。
但这依然是一个伴随摩擦的过程。尽管宏观数据表明份额已实现超越,但在具体落地场景中,不同精度类型的混合训练、异构集群的动态负载均衡,以及复杂算子的自定义开发,仍需华为团队提供贴身定制化的技术支持。软件粘性是需要时间和无数行报错日志喂养出来的,目前的局面可视为“入门门槛已过,深水区仍在攻坚”。
谁在买单?算力的定价权转移
算力格局的巨变,不可避免地要落到财务报表和产业链利润分配上。
在过去,每一张高价流入国内的顶级AI芯片,其溢价都流向了硅谷的设计方及其代工、封测上下游。现在,随着订单大规模转向国内,这部分巨额利润开始留在本土。华为云及相关芯片产品线的逆势扩张,本质上是在收割因制裁而释放出的本土市场蛋糕。
然而,这种替代并非没有成本。为了维持数万台级别的超级节点稳定运转,国内半导体制造、存储配套、液冷散热及高端PCB板块承受着极大的交付压力。整个国产算力供应链正处在爬坡过坎的关键期,良率提升与成本控制是决定这一波红利能否持续的核心变量。一旦下游模型应用端(如生成式AI商业化变现)的增长乏力,上游算力投资便极易面临资本开支缩水的反噬。
未来半年到一年内,这块市场的博弈将从“有无”转向“优劣”。价格战可能在边缘推理市场率先打响,而在核心训练端,谁能提供更稳定的PUE指标和更高的端到端利用率,谁就能锁定下一轮预算。
接下来关注什么?
格局已经翻开新的一页,但关于国产算力的长跑才刚刚进入最关键的赛段。对于产业投资者与技术观察者而言,建议重点关注以下三条具有前瞻性的验证指标:
其一,第三方权威统计机构(如IDC或Counterpoint)正式发布的中国区AI加速器季度追踪报告。届时需核对出货量与销售额的背离情况——出货量大涨是否意味着ASP(平均售价)在下行,从而引发利润率担忧。
其二,国内头部企业大模型训练的底层架构迁移进度。观察是否有更多千亿参数级模型宣布全面脱离CUDA环境、纯基于昇腾架构进行原生训练。这是衡量软件生态能否真正形成闭环的试金石。
其三,先进封装与半导体材料端的实际产出能力。算力集群规模越大,对CoWoS类封装产能及周边元器件的消耗就越呈指数级放大。本土配套产业的成熟度,最终会反过来制约华为昇腾后续迭代的节奏与边界。
算力主权的争夺从未像今天这样赤裸且紧迫。50%对8%的份额更替或许只是一个起点,在这场关乎底层基础设施的博弈中,真正的分水岭在于生态黏性与商业造血能力的双重兑现。


