BT财经

境内金融信息服务备案编号:

【京金信备(2021)5号】

2026年08月25日

注册 / 登录

英伟达200亿收购后Groq机架量产,推理芯片战争开打

当地时间8月24日,英伟达高级总监Dion Harris宣布,Groq 3 LPX机架已进入全面量产阶段,将与Vera中央处理器和Rubin图形处理器协同部署于新型云服务商Nebius的数据中心,计划于今年晚些时候上线。这台每个机架整合256颗Groq 3芯片的推理加速器,在Artificial Analysis基准测试中达到每秒3400个token的吞吐量。英伟达于去年12月以200亿美元获得Groq技术授权及核心团队,这是该公司史上最大规模收购案。Groq机架的首次商业化交付,标志着英伟达在AI推理芯片领域的双轨战略正式落地。

最新产品动作:Groq 3 LPX进入量产交付

今年3月,英伟达正式发布了为Vera Rubin平台研发的推理加速器Groq 3 LPX。根据财联社报道,每个LPX机架可整合256颗Groq 3芯片,单颗芯片在裸片上集成了500兆字节的高速静态随机存储器(SRAM)。这种架构设计的核心目的是减少推理过程中频繁访问外部显存带来的延迟瓶颈。

在Artificial Analysis的基准测试中,运行Gemma 4 31B模型、100K token上下文时,整合后的机架可实现每秒3400个输出token的吞吐量。Groq官方博客补充称,在延迟敏感型智能体工作负载上,其交互性能比最接近的替代平台高出约4倍。

英伟达高级总监Harris表示,Groq芯片由三星制造,而英伟达的GPU则由台积电生产,这意味着两条独立的供应链体系。他同时指出,云服务商可以针对这类低延迟token服务收取更高费用,"对于那些提供token服务的企业而言,这让他们能够为对延迟极其敏感的用户和客户提供高级服务套餐。"

核心商业判断:不是取代GPU,而是做增量

这项技术或商业变化最终改变了什么?答案在于AI推理工作负载的成本结构拆分。

Harris明确表态:"这并不是要取代GPU,而是要针对工作负载的不同环节,使用价格合适、处理能力合适的处理器。"GPU既能够执行训练,也能够进行通用推理,同时具备足够的灵活性以适应新模型。而Groq这类低延迟芯片专注于模型服务中的"解码"阶段——也就是智能体与用户交互时的实时token生成环节。

黄仁勋此前的战略表述更为具体:他计划将面向编程应用的数据中心空间中约四分之一分配给Groq芯片,"我的数据中心其余部分将100%采用Vera Rubin。" 这意味着在英伟达自己的数据中心规划中,Groq并非替代者,而是在特定场景下与GPU形成互补的专用推理加速器。

黄仁勋还预计,到2027年,当前一代Blackwell芯片和新一代Vera Rubin系统的累计销售额将达到1万亿美元。Groq的引入是这一万亿美元版图中针对推理侧的增量布局。

从技术到商业:成本优势能否兑现

Groq 3 LPX能否转化为实际商业订单,核心在于一个简单问题:在编程等延迟敏感场景中,它的单位token成本是否显著低于GPU?

目前公开信息中尚未出现Groq与GPU在推理场景下的直接成本对比数据。Artificial Analysis的3400 token/秒是性能基准测试数据,不等于商业化定价。如果Groq的单位token成本能够低于同级别GPU推理方案,云服务商就有动力将编程工具、实时智能体等低延迟应用迁移至Groq机架;如果成本优势不明显,客户可能仍倾向于使用已大规模部署的GPU集群。

黄仁勋规划的"1/4数据中心空间"提供了一个量化参考——但这属于战略愿景,而非已签订的商业合同。该比例能否实现,取决于Groq在接下来几个季度的实际客户导入进度和定价策略。

谁受益、谁承压

受益方:英伟达本身是最大受益者——200亿美元收购后快速实现商业化,既扩大了AI芯片的总可寻址市场,又通过双轨战略覆盖了从训练到低延迟推理的完整链条。Nebius作为首批部署Groq机架的云服务商,有望在低延迟推理服务赛道建立差异化优势。

承压方:低延迟推理赛道正在快速拥挤。AMD今年早些时候宣布将其机架级系统与Cerebras芯片整合;Cerebras近期刚上市,业务重点同样是低延迟推理;OpenAI推出的"Ultrafast"模式承诺每秒处理750个token,由Cerebras提供支持。当越来越多的玩家进入同一赛道,价格竞争和性能内卷可能压缩各家利润率。

能否持续:三个关键观察指标

未来两个季度,以下指标将决定Groq双轨战略的实际成效:

  1. 客户导入数量:除Nebius外是否有更多云服务商签约部署Groq机架;
  2. 定价透明度:英伟达是否会公布Groq推理服务的定价或单位token成本,以便与GPU方案直接比较;
  3. 量产规模与交付节奏:"全面量产"的首批实际出货量,以及今年晚些时候Nebius数据中心上线后的实际运行数据。

风险边界

需要明确的是,"全面量产"的表述来自英伟达高管对媒体的发言,Groq官方博客的原始措辞为"首批推向市场",NVIDIA官方IR渠道尚未发布独立公告确认该消息。量产规模、首批出货量、客户订单等关键商业数据目前均未披露。3400 token/秒来自第三方基准测试,不等于生产环境中的实际表现。上述不确定性均不影响事件本身的新闻价值,但投资者和行业读者在解读时应区分战略表态与已兑现的商业成果。

参考数据来源

  • Groq:《Groq Among the First to Bring NVIDIA Groq 3 LPX and Vera Rubin NVL72 to Market》,groq.com官方博客
  • 财联社:《英伟达高管称Groq机架已全面量产 AI推理"低延迟"大战升温》,2026年8月25日,https://www.cls.cn/detail/2462920
  • Artificial Analysis基准测试数据(经Groq官方引用)


版权声明:本文版权归BT财经所有,未经允许任何单位或个人不得转载,复制或以任何其他方式使用本文全部或部分,侵权必究。
帮助中心
联系我们
联系我们

 

商务合作:

 

公司地址

北京市丰台区汉威国际广场一区一号楼629

 

 

商务合作

周先生

Tel: +86-17743514315

Email: info@btimes.com.cn

官方微信公众号

北京领讯时代信息技术有限公司 | Copyright ©️ 2026 财经时报 版权所有 京ICP备19043396号-7

京公网安备 11010602007380号 | 境内金融信息服务备案编号:京金信备(2021)5号

网信算备110106674807801230011号


声明:未经授权,不得复制、转载或以其他方式使用本网站的内容。BT财经尽最大努力确保数据准确,但不保证数据绝对正确。