BT财经

境内金融信息服务备案编号:

【京金信备(2021)5号】

2026年08月28日

注册 / 登录

OpenAI用9个月造出推理芯片,能效超英伟达旗舰近两倍

2026年8月,Computex舞台上,OpenAI公布了首款自研AI芯片Jalapeño的测试成绩:每瓦完成的AI推理工作量是英伟达GB200的1.5到1.9倍,端到端延迟压缩到对照系统的30%至60%。从正式立项到流片,这支团队只用了9个月——行业通常需要18到24个月。一家AI软件公司,造出了可能在推理环节跑赢全球最强GPU的芯片,这件事本身就值得拆解。

一颗为推理而生的芯片

Jalapeño的技术规格指向一个明确的设计目标:不是做通用计算,而是把推理环节的效率推到极致。

它配备216GiB HBM4内存,带宽达到15.4TB/s,约为微软Maia 200和Google Ironwood的两倍。标称功耗700W,实测持续功耗低于550W——而英伟达GB200标称功耗1200W,GB300更高达1400W。在SemiAnalysis InferenceX基准测试中,运行DeepSeek R1模型时,8K输入加1K输出的推理延迟从5.99秒降至1.65秒,token间隔从5.90毫秒压到1.43毫秒。

这些数字的核心含义是:Jalapeño用不到英伟达一半的能耗,完成了更快的推理任务。

这并不意外。Jalapeño由OpenAI与前Google TPU核心成员Richard Ho组建的硬件团队主导,博通联合设计,专门针对ChatGPT的推理环节优化。Richard Ho在Google主导了多代TPU架构设计,他的团队将谷歌十余年积累的定制芯片经验直接移植到了OpenAI的硬件体系中。推理是AI服务日常运营成本的最大组成部分——模型已经训练完毕,每次用户提问都需要实时运算,直接决定响应速度和用户体验。

OpenAI CFO Sarah Friar同步发表的战略文章概括了这套逻辑:"以广度建生态,以自营握杠杆。"训练和通用计算继续外采英伟达,推理由自研芯片分担。第一代Jalapeño不出售、不出租,产能全部自用。第二代产品已进入开发中段,第三代初具雏形。

英伟达的护城河与裂缝

英伟达在AI芯片市场的统治地位建立在CUDA生态之上。十余年积累的开发工具、模型库和开发者社区,构成了极高的迁移成本。全球数百万AI开发者在CUDA框架上构建应用,切换平台意味着重写代码、重新调试、重新验证——对大多数企业来说,这个成本远高于硬件本身的价差。

但推理场景有一个关键区别:模型已经训练完成,工作负载相对固定,优化目标明确——这正是定制芯片(ASIC)最容易突破的领域。ASIC为特定任务量身定制电路,不需要像通用GPU那样兼顾各种计算场景,因此在目标场景下可以做到极致效率。

Jalapeño在推理性能上的领先,本质上是场景特异性优化的结果,而非通用算力的全面超越。定制芯片的局限性同样清晰:它针对特定模型和推理任务设计,面对新模型架构或多模型混合调度时,灵活性不如通用GPU。此外,Jalapeño的实际生产环境稳定性和大规模部署效果,仍需时间验证。

但真正重要的不是这一颗芯片能跑多快,而是它代表的趋势方向。

大厂自研芯片正在成为常态

Google的TPU已迭代至第六代Ironwood,Amazon的Trainium2面向云端AI训练,Microsoft的Maia 100瞄准Azure上的AI推理。如今OpenAI也加入自研行列。这些公司的共同特征是:AI算力需求大到足以支撑定制芯片的研发成本,且对特定工作负载的理解深度超过通用芯片厂商。

博通是这轮趋势的核心受益者。作为定制芯片设计合作伙伴,博通2025年6月宣布获得百亿美元级定制AI芯片订单,客户包括xAI等多家大厂。从Google TPU到OpenAI Jalapeño,定制芯片设计商正在成为AI算力供应链中不可忽视的角色。

对英伟达而言,这不是一个"被颠覆"的故事,而是一个"高端客户开始选择性分流"的故事。训练市场仍然稳固,但推理市场的份额正在面临结构性压力。当头部客户的推理工作负载可以由自研芯片承担,英伟达在这部分需求上的定价能力会被削弱。

英伟达并非没有应对。公司正在推出针对推理优化的芯片方案,同时通过软件生态和系统级解决方案巩固客户黏性。竞争格局的变化不是英伟达失去市场,而是市场从"唯一选项"变成"选项之一"。

算力产业链的连锁反应

对AI行业而言,定制推理芯片的普及将直接压低推理成本。推理成本下降意味着AI服务定价有进一步下探的空间。过去两年,大模型竞争已从能力比拼转向成本和效率比拼——谁能在同等质量下提供更便宜、更快的推理,谁就掌握商业主动权。OpenAI选择自研芯片,本质上是在模型能力之外,把硬件效率也变成核心竞争力。

这个选择的底层逻辑是:当AI公司的规模大到一定程度,继续完全依赖通用芯片供应商不再是经济最优解。芯片设计的门槛仍然很高,但从设计到流片的周期正在缩短,定制芯片的商业可行性在提升。OpenAI用9个月完成这一过程,本身就在证明定制芯片的开发效率正在被重新定义。

未来三到五年,AI算力市场可能形成三条路线并行的格局:通用GPU继续服务训练和通用计算,定制ASIC承接头部公司的特定推理需求,云端自研芯片满足中小规模的专用场景。英伟达仍然会是这个市场的重要参与者,但不再是唯一选择。

参考数据来源

  • Reuters:《OpenAI plans custom chips to challenge Nvidia domination in AI data centers》,2025年1月29日(https://www.reuters.com/technology/artificial-intelligence/openai-plans-custom-chips-challenge-nvidia-domination-ai-data-centers-2025-01-29/)
  • 博通(Broadcom)官网:定制AI芯片及企业信息披露,2026年8月访问(https://www.broadcom.com/)
  • 爱范儿:引用SemiAnalysis InferenceX基准测试原始数据报道,2026年8月(https://www.ifanr.com/1676824)


版权声明:本文版权归BT财经所有,未经允许任何单位或个人不得转载,复制或以任何其他方式使用本文全部或部分,侵权必究。
帮助中心
联系我们
联系我们

 

商务合作:

 

公司地址

北京市丰台区汉威国际广场一区一号楼629

 

 

商务合作

周先生

Tel: +86-17743514315

Email: info@btimes.com.cn

官方微信公众号

北京领讯时代信息技术有限公司 | Copyright ©️ 2026 财经时报 版权所有 京ICP备19043396号-7

京公网安备 11010602007380号 | 境内金融信息服务备案编号:京金信备(2021)5号

网信算备110106674807801230011号


声明:未经授权,不得复制、转载或以其他方式使用本网站的内容。BT财经尽最大努力确保数据准确,但不保证数据绝对正确。