AI推理内存荒加剧:订单排至明年,核心供应商季度暴增158%
一、 反常的增速:当GPU不再是唯一的“硬通货”
在过去两年的AI基础设施建设中,市场资金和算力军备竞赛的目光几乎全部锁定在了图形处理器(GPU)上。然而,一份刚刚公布的美国企业财报,揭示了这条拥挤赛道背后正悄然滋生的另一种严重短缺——内存。
10月9日,美国AI计算与内存解决方案提供商Penguin Solutions公布了其2026财年第四季度的相关经营情况。受大语言模型应用从“训练”向“推理”加速转移的影响,该公司的核心内存模组业务呈现出了极为罕见的爆发态势。据财联社基于该公司财报电话会的内容报道,本季度其内存业务单季营收已达到3.41亿美元,较去年同期实现了158%的同比增长。
这一158%的增速并非昙花一现,而是呈现出加速膨胀的趋势。回顾上一财年第三季度,该业务的同比增速尚为111%,而到了今年四季度,这个数字不仅没有放缓,反而进一步跃升了47个百分点。更为直观的是其订单积压状况:截至财报发布时,Penguin Solutions手中尚未交付的订单规模已经超过了当季单季3.41亿美元的营收体量。这些积压的订单至少要排期交付至未来四个季度,也就是直接顺延覆盖到了下一整年。
对于这家公司而言,AI浪潮不再是遥不可及的宏观叙事,而是实打实的财务报表。2026财年,其高利润率的内存业务占据了公司总营收的53%,正式超过了一半的体量分水岭。而在前瞻指引中,管理层更是明确预期,2027财年的内存业务营收将在今年基础上再增长约50%。
二、 为什么是现在?从“计算密集”到“访存受限”
要理解为什么内存需求会在短时间内出现如此剧烈的结构性挤兑,需要将视线拉回到人工智能大模型运行的底层物理机制中。
过去,大型算力集群主要服务于模型的“训练(Training)”阶段。在这个阶段,计算机需要进行海量的矩阵乘法运算,属于典型的“计算密集型”任务。其算力与数据传输的比率(GFLOPs/Byte)通常维持在较高的水平,这意味着绝大多数时候,系统的性能瓶颈在于计算核心能跑多快。
但当大模型走出实验室,进入面向海量用户的实际应用“推理(Inference)”阶段时,游戏规则发生了根本性的倒转。以目前主流的自回归生成模式为例,大模型每输出一个词元,都需要从庞大的Key-Value(KV)缓存中重新读取一遍全量的上下文信息。这种被称为“读绑定(Read-Bound)”的架构特性,导致推理阶段的算力/数据比率急剧萎缩至不足0.5。
这意味着在推理服务器上,高达80%甚至更多的物理能量和时间,并没有花在“思考”上,而是消耗在了等待数据从内存传输至计算核心的过程之中。这直接催生了两个结果:一是传统的高频内存彻底无法满足吞吐要求,必须依赖HBM(高带宽内存)等能在极小面积内实现TB/s级别带宽的3D堆叠技术;二是由于单次请求需要加载的上下文窗口成倍拉长,服务器对内存绝对容量的渴求呈指数级上升。
在高端推理服务器的物料清单(BOM)成本结构中,曾经作为辅料的存储模块及其高速互连通道,目前的成本占比已经突破了50%,甚至在某些配置中超过了GPU核心本身的制造成本。这就是上游内存厂商订单爆满的最底层经济学逻辑。
三、 CXL协议与全球供应链的价值重分配
面对硬件层面的物理天花板,技术路线正在经历一场静默的重组。在这场重组中,Penguin Solutions选择了一条颇具代表性的路径:其与全球存储器巨头SK海力士在CXL(Compute Express Link)技术领域展开了深度合作。
CXL是一种新兴的CPU与加速器之间的互连协议。在传统的数据中心架构里,CPU的系统内存(DRAM)与GPU的独立显存(VRAM)是两座互相隔绝的孤岛。CXL的出现,使得服务器可以将分散在各处的内存池化,允许CPU直接跨总线调用原本属于GPU的高速显存。这在物理层面上极大缓解了单个节点因显存容量不足而产生的卡脖子现象,让数据中心能够以更低的资本支出部署更大参数量的模型集群。
对于像Penguin Solutions这样的下游方案整合商来说,代理加工与客户自购芯片并存的混合商业模式,使其无论在哪种合作形态下,都在直接拉动对上游高品质存储颗粒的需求。然而,这种看似繁荣的订单表象之下,产业链内部的利润分配结构却出现了严重的不对等。
一方面,处于链条顶端的存储芯片原厂——尤其是掌握HBM核心技术并占据全球主导地位的企业,拥有了极强的定价话语权。他们享受的是供不应求带来的超额毛利红利;另一方面,身处中游的方案集成商和组装代工厂则面临着截然不同的处境。为了争夺极其稀缺的高端芯片产能,这些企业往往不得不接受更严苛的商务条款,叠加快速扩张过程中产生的研发与良率爬坡成本,其自身整体的利润率空间实际上是被持续向上游挤压的。
四、 尾声:这不是短期狂欢,而是数据中心物理极限的重写
从ChatGPT引爆的算力争夺战,到如今真正深入产业腹地的推理端访存危机,整个AI基础设施的建设正在逼近硅基材料的物理极限。对于关注该赛道的观察者而言,单纯将目光停留在哪款芯片销量最高早已不够,衡量一家科技公司能否穿越周期的关键,在于它如何设计自己的“记忆系统”。
未来一到两年内,以下三个指标将是检验这轮内存狂潮成色及投资逻辑的重要风向标:
第一,观察国际头部存储厂商新一代HBM产线的实际扩产进度与良率爬坡曲线。若短期内供给跟不上,AI集群的部署周期将被迫拉长,进而倒逼下游云厂商重新评估算力规划的节奏。第二,密切跟踪采用CXL协议的超大规模云服务商的实际采购比例,这是判断该技术能否从边缘补充角色跃升为行业标准主路的硬性门槛。第三,关注液冷散热技术与高密度内存插槽在机架层面的物理融合效率。毕竟,如果热量无法高效散去,再大的内存带宽也只能是一台空转的高温机器。
在这场由算法驱动的基础设施狂潮中,谁能最先摸清楚每一块硅片背后的真实成本边界,谁就能在下一轮技术迭代中拿到主动权。


