OpenAI自研推理芯片首测:特定工况能效超英伟达百倍
2026年8月底,OpenAI公布了自研推理芯片Jalapeno的首批测试结果。在DeepSeek R1 670B模型的低延迟推理测试中,Jalapeno每千瓦吞吐量达到12,258 mixed TPS/kW,而英伟达GB300系统为118——同等功耗预算下,前者能处理的推理请求量是后者的104.3倍。Sam Altman在X上只说了一句话:"我们制造了一款芯片,它的速度很快。"
这颗芯片不替代英伟达,但它指向一个正在发生的产业变化:当AI公司开始自己造芯片,算力供应链的权力结构还能维持原样吗?
第一幕:变化发生
OpenAI不再只是英伟达最大的客户之一。
Jalapeno是OpenAI首款自研推理芯片,额定功耗700瓦,测试工作负载中实际持续功耗始终不超过550瓦。据36氪援引机器之心报道,OpenAI使用SemiAnalysis公开的InferenceX基准测试,在三款模型上完成了与英伟达GB200和GB300系统的对比。
结果如下:在GPT-OSS 120B上,Jalapeno峰值每瓦吞吐量是对比系统的1.9倍;DeepSeek R1 670B上是1.7倍;Kimi K2.5 1T上是1.5倍。端到端延迟降低至对比系统的1/1.7到1/3.6,高度交互式工作负载性能优势达2.1到4.1倍。
而104.3倍这个数字出现在DeepSeek R1测试中——在满足特定低延迟约束的条件下,Jalapeno每千瓦吞吐量12,258 mixed TPS/kW,GB300仅118。同样一度电,Jalapeno能多处理两个数量级的推理请求。
但需要注意这个数据的适用边界。104.3倍是特定低延迟工况下的每千瓦吞吐量对比,不等同于通用性能全面领先。OpenAI未公开具体的延迟门槛数值,峰值能效增益在1.5到1.9倍之间——这已经很好,但与百倍差距悬殊。换言之,104.3倍是特定测试条件下的最优解,而非日常使用的平均表现。
第二幕:旧规则
过去十年,AI算力市场遵循一套简单规则:训练和推理都买英伟达GPU。
从V100到A100到H100再到GB200/GB300,英伟达用硬件迭代加CUDA生态构建了双重护城河。AI公司没有选择——要训练大模型,只能买英伟达;要部署推理服务,还是买英伟达。代价是持续攀升的采购成本和不断膨胀的数据中心电力账单,而英伟达的定价权几乎无人能挑战。
这套规则有一个隐含前提:通用GPU是处理所有AI工作负载的最优解。
直到大模型进入推理时代,这个前提开始松动。模型训练是一次性投入,推理则是持续性支出——用户每一次对话、每一次API调用都在消耗算力。当模型参数从千亿级迈向万亿级,推理成本在AI公司运营成本中的占比越来越高。而推理对算力的需求方式与训练不同:训练追求绝对算力峰值,推理追求在延迟约束下的吞吐效率和每瓦性能。
用通用GPU做推理,就像用卡车送外卖——能送,但不够经济。
第三幕:新变量
Jalapeno正是为推理而生。OpenAI明确表示,它"并不是用于训练下一代GPT模型的芯片,而是针对模型上线后的运行阶段进行优化"。公司同时声明将继续大规模部署英伟达及其他合作伙伴的加速器,"同时覆盖训练和推理工作负载"。
换言之,Jalapeno不替代英伟达,而是要在推理这个细分环节建立独立于通用GPU的技术路线。
OpenAI凭什么造出这颗芯片?两个关键变量。
第一是与Cerebras的合作。这家以晶圆级芯片闻名的公司提供了独特的硬件架构,让Jalapeno绕开传统GPU设计框架,针对推理工作负载做定制优化。
第二是AI本身参与了芯片设计。从设计到Tape-out,Jalapeno仅用9个月。传统芯片公司从架构定义到流片通常需要18到24个月,OpenAI将周期压缩了一半以上。OpenAI还透露,用Codex在两个月内让三款开放权重模型在Jalapeno上实现高性能运行,部分GPT-OSS的Attention和MoE模块,Codex生成的代码版本比人类手写版本快1.5到1.8倍。
当AI公司用AI造芯片,传统芯片公司的设计周期优势正在被压缩。
第四幕:产业和商业结果
对英伟达而言,Jalapeno带来的直接冲击不是市场份额立刻下降,而是定价权的结构性压力。
当最大的客户开始自研替代品——即便只针对推理场景——采购谈判的筹码已经改变。更深层的变化是:如果OpenAI验证了自研芯片在推理场景的可行性,其他头部AI公司会加速跟进。谷歌有TPU,亚马逊有Inferentia,Meta在探索MTIA,现在OpenAI也加入了自研阵营。英伟达在推理侧的定价空间,将面临来自上下游的双重挤压。
对OpenAI自身,Jalapeno的意义在于成本结构。推理成本是AI服务公司的核心支出。自研芯片若能在能效比上实现量级提升,意味着每次API调用、每个用户对话的边际成本显著下降。在AI服务竞争进入价格战的当下,这是直接的利润空间或定价优势。
但产业格局的变化不会一夜发生。Jalapeno目前仍处于生产验证和软件完善阶段,OpenAI计划在2026年底前才开始部署到自己的计算基础设施。从测试数据到大规模稳定运行之间,还有良率、散热、驱动兼容等工程挑战需要跨越。更关键的是,英伟达CUDA生态的优势不在硬件本身,而在数百万开发者依赖的工具链和模型库——这是任何新芯片都需要时间跨越的生态壁垒。
第五幕:与读者相关
如果你是一个使用AI服务的人,这个变化最终会传导到你的账单上。当推理芯片的竞争从英伟达一家独大变成多方参与,API调用的单价有下降空间。更直接的影响是:推理效率提升意味着更多模型能以更低成本部署,AI服务的可用性和响应速度会持续改善。
如果你是技术从业者或硬件投资者,需要关注的是:推理芯片的垂直整合正在从趋势变成现实。英伟达在训练侧的地位短期内无人能撼动,但推理侧的市场正在被重新划分。谷歌、亚马逊、OpenAI各自走上自研路线,芯片设计公司Cerebras也因此获得新的产业位置。
算力供应链的权力结构,正在从单一供应商主导走向更分散的格局。这不是一场替代战,而是一次重新切分——而切分的方式,才刚刚开始。
参考数据来源
- 机器之心(经36氪转载):《OpenAI「掀桌」:自研推理芯片「墨西哥辣椒」跑赢英伟达》,2026年8月26日 https://www.36kr.com/p/3955555203447945
- OpenAI官方博客:《Jalapeno First Results》,2026年8月(页面截至发稿时返回403,数据通过上述媒体报道交叉验证) https://openai.com/index/jalapeno-first-results/


