BT财经

境内金融信息服务备案编号:

【京金信备(2021)5号】

2026年10月07日

注册 / 登录

英伟达芯片容量腰斩,AI算力的隐形瓶颈显形了

英伟达正在向客户交付“缩水版”的下一代芯片平台Rubin。

原来每块GPU搭载288GB的高速缓存HBM,将变成只有192GB。每台服务器的LPDDR5内存容量从54TB直接腰斩到28TB。这不是供应链出了问题——恰恰相反,是因为AI训练和推理的需求已经多到现有产能根本跟不上了。

这背后的信号并不悲观,甚至可以说是主动的战略调整。但当整个AI产业被迫改变硬件架构来适应内存供应时,意味着一个更深层的转变已经开始:存储不再是AI服务器的附属组件,而是决定算力释放效率的核心瓶颈。

压下来的不只是数字,是供需失衡的信号弹

理解这件事的关键在于看清楚英伟达为什么这么做。

模型规模在LLM时代大约每六个月翻一倍——这是一个极其陡峭的曲线。上下文窗口长度以每年约五倍的速度扩张,推理并发量的增加让每个会话都需要独立存储KV缓存。这三股力量叠加的结果就是:AI几乎会吸收市场上所有可用的DRAM和HBM产能,没有剩余。

所以,当看到英伟达缩减Rubin平台的内存配置时,不要误以为是不需要了。摩根士丹利在最新研报中说得非常直白:“降价并非因需求消退,而是源于产能约束的治标之策。”

降规的本质是压力转移。当你切掉了某一层内存容量,数据处理的负担不会消失——它会被推到下一个层次。具体来说,HBM和LPDDR的缩水反而为NAND闪存和网络互联带来了增量需求。这意味着什么?对于同时提供多种组件的厂商来说,业务结构可能在发生变化。

更重要的是,这种“压缩”被定位为临时措施。一旦未来供应有所缓解,行业会迅速回补至更高规格,被压抑的需求会在短时间内释放。这也解释了为什么市场对内存股的看法存在分歧。

把推理拆成两半:不同阶段匹配不同硬件

如果说降规是被动的妥协,那么负载分离则是更具前瞻性的主动解法。

AI推理过程实际上由两个截然不同的阶段构成:预填充(prefill)负责并行处理输入提示词,计算密集但不太依赖大容量内存;解码(decode)则逐token生成输出,对内存带宽和容量的要求极高。这两个阶段原本挤在同一套硬件上运行,效率天然受限。

把二者拆开,分别交给最适合的硬件处理,是当前AI生态中最清晰的架构演进方向之一。

这条路线上的玩家正在加速布局。英伟达收购Groq后,将其基于SRAM的高带宽加速器整合进Vera Rubin平台:Rubin GPU负责预填充和大容量KV缓存相关的解码环节,Groq处理前馈和专家混合部分。AWS宣布采用Trainium做预填充、Cerebras做解码的异构组合,计划于2027年第一季度在Amazon Bedrock上线。Cerebras与AMD的合作方案预计2026年底投产,而Matrix的Corsair产品已经进入量产阶段。

为什么这条路线值得持续关注?因为负载分离能够实质性地改善推理经济性。据Cerebras和AMD披露,联合系统在维持Cerebras原有推理速度的前提下,可以将吞吐量提升最高5倍——每部署单元的收入显著提升,每token成本同步下降。如果这个收益能兑现,将对云服务商的单位经济模型产生实质性影响。

CXL:从CPU到AI的跨圈扩张

CXL(Compute Express Link)协议在过去几年主要在通用CPU服务器领域小范围渗透。它的核心价值在于打破了传统架构中内存与特定处理器强绑定的限制——允许多个处理器访问同一个内存资源池,从而减少闲置浪费。

三年前你可能不太关注这个概念。但现在情况变了。随着AI推理对长上下文、智能体工作负载和KV缓存的容量需求急剧上升,大量数据不再需要全部驻留在昂贵的HBM中。CXL挂载普通DRAM作为更低成本、更大容量的第二层内存,找到了自己的立足空间。

这正是摩根士丹利将CXL可寻址市场规模预测从此前超40亿美元上调至2030年约60亿美元的核心逻辑——增量主要来自于AI服务器侧的新部署场景。

受益者已经明确。Astera Labs推出了Leo系列内存控制器芯片(含针对KV缓存卸载的定制设计,预计2027年量产),Marvell则覆盖从单机内存扩展(Structera X)到机架级池化(Structera S)的全线产品。Marvell管理层此前已将CXL定位为其在2028年前贡献超10亿美元收入的潜在增长引擎。

这里有一个重要区别需要注意:CXL目前的预测性数据和商业化路线图都还比较早。很多产品还在早期部署或量产前夕,实际的市场渗透节奏取决于客户的接受速度和技术成熟度。

谁在吃肉,谁承压?

拆解这条产业链,我们可以清晰地画出受益者和承压者的轮廓:

确定受益的方向: - CXL相关芯片公司:Astera Labs、Marvell等提供CXL内存控制器和池化方案的企业正处于商业化早期窗口期,收入增量可期但波动也大 - NAND Flash供应商:HBM/LPDDR的缩水平移出需求空间,NAND可能承接部分溢出压力 - 具备异构集成能力的厂商:像Groq那样拥有差异化SRAM架构的玩家,在负载分离趋势下获得了新的议价位置

承压的一面: - 纯HBM和DRAM厂商:短期看,降规策略确实压制了单设备的内存采购量;中长期来看,周期持续时长仍然关键——只要短缺不结束,价格就有支撑 - 试图用堆料解决一切问题的AI芯片初创公司:在存储成本飙升且供应紧张的背景下,单纯依靠增大缓存来提升性能的模式将面临越来越严峻的经济账挑战

接下来该盯什么

与其听信任何人的短期判断,不如盯住几个可验证的观察指标:

第一,英伟达Rubin平台后续的实际出货配置。目前市场看到的是压缩规格版本,但最终有没有客户愿意买高配原版、高配版是否会逐步回归主流配置,这将决定降规是长期趋势还是阶段性现象。

第二,CXL产品的实际出货量与客户采用率。Astera Labs Leo和Marvell Structera系列的订单进展可以在各自的财报或投资者日上追踪——这是衡量CXL能否从“潜力”变“收入”的关键节点。

第三,HBM价格曲线与库存变化。如果降规只是推迟了而非消除了需求,那么在供应恢复时会出现报复性采购。留意Micron、SK海力士的季度库存和产能利用率信号。

第四,云服务商的推理单位经济学。Cerebras-AWS方案在2027年Q1上线后,per-token成本和吞吐量的实际表现,将直接影响负载分离模式的推广速度。

第五,基础设施层面的制约是否加剧。摩根士丹利提到一种可能性:AI放缓可能不是因为需求不足,而是因为土地、电力、厂房等物理基建跟不上。如果是这样,内存板块面临的冲击逻辑会完全不同于算力芯片板块。

AI产业的竞争从来不只是比谁的GPU更强——谁能用更少的内存实现更高的算力释放效率,谁就能在下半场建立壁垒。这场关于存储的静默战争,已经在英伟达芯片规格的纸面修改开始了。



版权声明:本文版权归BT财经所有,未经允许任何单位或个人不得转载,复制或以任何其他方式使用本文全部或部分,侵权必究。
帮助中心
联系我们
联系我们

 

商务合作:

 

公司地址

北京市丰台区汉威国际广场一区一号楼629

 

 

商务合作

周先生

Tel: +86-17743514315

Email: info@btimes.com.cn

官方微信公众号

北京领讯时代信息技术有限公司 | Copyright ©️ 2026 财经时报 版权所有 京ICP备19043396号-7

京公网安备 11010602007380号 | 境内金融信息服务备案编号:京金信备(2021)5号

网信算备110106674807801230011号


声明:未经授权,不得复制、转载或以其他方式使用本网站的内容。BT财经尽最大努力确保数据准确,但不保证数据绝对正确。