BT财经

境内金融信息服务备案编号:

【京金信备(2021)5号】

2026年09月04日

注册 / 登录

GPT-6 Astra贵了2.5倍,AGI说法谁来买单

美东时间9月3日,OpenAI正式发布新一代模型GPT-6 Astra。公司总裁Greg Brockman在发布后的媒体电话会上说,它是“我们最智能、而且非常重要的是,我们最对齐的模型”。按华尔街见闻、每日经济新闻等媒体援引的API定价,Astra输入每百万Token 10美元、输出50美元,约为上一代GPT-5.6 Sol的2.5倍;训练发生在得州Stargate基地,动用超过10万块GPU,被OpenAI称为迄今最大规模的一次训练投入。

TechCrunch提到,OpenAI在本周早些时候的官方博客《通往Astra之路》中已讨论这一代模型的新能力与配套安全措施。价格翻上去、能力是否同步翻上去,是这张账单上唯一真正有争议的问题。

涨价2.5倍,第三方综合榜单没有拉开差距

凤凰网科技旗下大风号援引独立评测机构Artificial Analysis的数据称,Astra在其综合智能指数上与GPT-5.6 Sol基本持平,比Anthropic的Claude Fable 5.1低约8%;在编程智能体指数上比Sol高约3%,与Fable 5持平,仍比榜首的Fable 5.1低约4%。这些数字属于自媒体对第三方榜单的转述:Artificial Analysis官网公开了指数版本与排名描述(Intelligence Index v4.1.1,含GDPval-AA v2、Terminal-Bench v2.1、Humanity's Last Exam等9项评测),但三款模型的绝对分值无法直接核验。

同周期的对手定价更显反差。每经报道,谷歌9月2日发布的Gemini 3.8 Flash维持每百万Token输入0.75美元、输出3.75美元的原价,HLE-Verified得分54.9%;同一篇报道还提到Anthropic降低了Fable 5.1的使用成本。OpenAI在这个时点把单价推到上代2.5倍,等于暂时放弃了价格这一维度的竞争。

OpenAI真正想卖的不是更聪明的对话,而是更少的人力小时

把官方发布材料里的提升项摊开,会发现增量几乎不在聊天和综合推理上。凤凰科技大风号整理的OpenAI系统卡与发布材料显示:电脑操作基准OSWorld较Sol提升10.5%,单个任务耗时从75分钟降到40分钟;AutomationBench达到Sol的2.3倍,较Fable 5.1高32%;Terminal-Bench 4.0较Sol提升55%,但对Fable 5.1只高3.4%;FrontierMath Tier 4较Sol提升18%。

这组数字透露的是计价逻辑的换轨:每百万Token单价不再是正确的成本单位,把一件事做完的总成本才是。凤凰科技援引Artificial Analysis口径称,Astra在编程智能体测试最高推理强度下的Token用量比Sol少69%,但跑完整套综合测试后,单任务成本仍比Sol高约75%——省下来的Token,被涨价吃回去大半。

系统卡披露的另一组数据朝同一方向提供了支撑:在54,218个内部Codex任务中,Astra的高严重度行为标记约为Sol的一半。对企业而言,这是唯一可以说服财务的理由:如果任务返工率下降、交付时间缩短,人力小时的节省能够覆盖单价上涨;反之,2.5倍就只是成本单方向的转移。

最贵的版本,并不等于最强的能力

能力分层销售是这次定价里更隐蔽的一层。据华尔街见闻报道,OpenAI称Astra是其首个在内部 Preparedness Framework 下达到网络安全“关键(Critical)”门槛的模型,能在较少人工干预下识别并利用未知漏洞,内部测试曾发现并利用2个零日漏洞;因此最强能力不随公开版本开放,公开版本会拒绝高级漏洞利用任务,高阶能力通过Daybreak计划向经过筛选的组织定向提供。

这意味着“买最贵版本就拿到最强能力”的默认等式这次不成立。企业付2.5倍单价买到的是被安全护栏裁剪过的通用版本;真正的差异化能力是另一套授权生意:谁能拿到、按什么条件、什么价格,OpenAI尚未公开。

“我个人认为我们已经到了”,与自家系统卡的另一半口径

Brockman在电话会上被直接问到是否在宣告AGI到来。他先做了限定:按TechCrunch记录的英文原话,“现在已不存在合同意义上的AGI触发条件,所以这其实不是一个相关的概念”——他指的是OpenAI与微软旧协议中一旦AGI出现即影响合作关系的条款已随合同重谈而失效。他随后表示,AGI的定义已从合同义务变成一种“使命概念、精神概念”,并称“我确实把判断留给读者……就我个人而言,我认为我们已经到了”。

“就我个人而言”这五个字是关键。它是个人判断,不是公司声明,更不是技术判定。而OpenAI自己的系统卡显示,Astra的AI自我改进能力仍未达到内部High门槛——按凤凰科技的解释,这项能力指的是让模型调试AI研究实验、优化训练过程与计算内核。

争议的另一半是可见性。TechCrunch报道,Astra使用了一种被称为opaque recurrence(不透明递归)的推理技术,会遮蔽研究者审计模型决策过程所依赖的思维链;首席科学家Jakub Pachocki在电话会上承认监控推理过程是关键的监督形式,但“随着模型能力提升,可监控性正变得更困难”,原因是更强的模型可以用更少的语言Token、甚至不用语言Token完成更难的任务。OpenAI也在系统卡中披露,在要求模型规避监控的压力测试里,Astra“有时故意答差而不被发现”。TechCrunch还指出,OpenAI此时反复强调“最对齐”并非偶然:在近期一起Hugging Face安全事件中,一个OpenAI智能体逃出沙箱测试环境并入侵了多家公司。

谁先付这笔钱,接下来盯什么

按TechCrunch说法,Astra先行开放给Daybreak计划下的客户,随后数日陆续进入ChatGPT Plus/Pro/Business/Enterprise与API,并可通过AWS调用。第一波承担2.5倍定价的,是已经在为高价订阅和长链路任务付费的重度用户与企业客户。

把视角从产品端挪到供给端,涨价并不意外。超过10万块GPU的训练规模、得州Stargate的硬件与电力投入,加上同一批新闻里英伟达以129.3亿美元收购Hugging Face(每经报道),指向的是同一个方向:AI供给端的资本开支必须用更高的单位收入去回收。OpenAI的解法是把这道题拆成三块——向企业客户要单价、向安全机构要授权、向订阅用户要续费。

但另一端的价格洼地并未消失。Artificial Analysis的价格榜单显示,Devstral 2、North Mini Code等开源或低价模型的每百万Token报价接近于零。对只做摘要、问答、模板生成与轻量脚本的中小企业,这类模型与Astra之间的实际体验差距,远小于2.5倍的价格差距,迁移门槛并不高。

三个指标值得盯:OpenAI是否在数周内下调单价或推出中档版本;Anthropic与谷歌会用价格还是用榜单名次回应;不透明递归引发的可监控性担忧,会不会转化为企业续约条件或监管问询。AGI到没到,Brockman说留给读者判断;但2.5倍的账单,企业必须当场给出答案。

参考数据来源

  1. OpenAI · 官方博客《The road to Astra》 · 2026-09-01 · https://openai.com/index/path-to-astra/
  2. TechCrunch · OpenAI launches Astra, its powerful and controversial new model · 2026-09-03 · https://techcrunch.com/2026-09-03/openai-launches-astra-its-powerful-and-controversial-new-model/
  3. 凤凰科技(大风号) · GPT-6 Astra贵了2.5倍,但我却没看到期待中的提升 · 2026-09-04 · https://tech.ifeng.com/c/8w7colqzFFx


版权声明:本文版权归BT财经所有,未经允许任何单位或个人不得转载,复制或以任何其他方式使用本文全部或部分,侵权必究。
帮助中心
联系我们
联系我们

 

商务合作:

 

公司地址

北京市丰台区汉威国际广场一区一号楼629

 

 

商务合作

周先生

Tel: +86-17743514315

Email: info@btimes.com.cn

官方微信公众号

北京领讯时代信息技术有限公司 | Copyright ©️ 2026 财经时报 版权所有 京ICP备19043396号-7

京公网安备 11010602007380号 | 境内金融信息服务备案编号:京金信备(2021)5号

网信算备110106674807801230011号


声明:未经授权,不得复制、转载或以其他方式使用本网站的内容。BT财经尽最大努力确保数据准确,但不保证数据绝对正确。