GPT-6定价2.5倍于前代:编程跃升,写作测评退步
美国当地时间9月3日,OpenAI 发布新一代旗舰模型 GPT-6 Astra,并开始分批上线。官方 API 标准价为每百万输入 token 10美元、每百万输出 token 50美元;上一代 GPT-5.6 Sol 为4美元和20美元,即输入与输出价格都提高到前代的2.5倍。第三方评测机构 Artificial Analysis 对 OpenAI 官方接口的实测价格与上述一致,并记录缓存输入享受90%折扣。
价格上调的另一面是一张分化的成绩单。OpenAI 称 Astra 在计算机操作、长程编码、工程设计和科学研究上明显领先前代;但据腾讯科技、华尔街见闻援引 Artificial Analysis 数据,Astra 在 GDPval-AA v2 基准上出现约80个 Elo 的下滑,在 τ³-Banking、SciCode 和 AA-LCR 等项目上也有不同程度退步。
于是问题变成企业采购会上真会问的那一句:贵2.5倍的单价,到底买到了什么。
2.5倍价签上的三行小字
单看 token 单价,Astra 属于当前最贵的一档。Artificial Analysis 的模型页显示,其输入价格是同类中位数(每百万2美元)的5倍,输出价格是中位数(每百万10美元)的5倍;按该机构"智力指数任务"口径测算,Astra(max 档)单任务成本2.57美元,GPT-5.6 Sol(max 档)为1.25美元,Anthropic 的 Claude Fable 5.1 为6.12美元。
同一页面上还有两组容易被忽略的口径:Astra 上下文窗口为100万 token、知识截止2026年4月;官方文档同时设了一条阶梯价——当单次请求输入超过约27.2万 token 时,整个请求的输入与缓存费率翻倍,输出费率升至1.5倍。对反复读取整个代码仓库、整套财务文件的应用来说,长上下文并不是免费的。
再往下是一层成本结构。OpenAI 在其部署安全页面披露,Astra 是其首个在网络安全能力上触及内部 Preparedness Framework"Critical"阈值的模型,公司因此对所有对外部署的工具调用推理链路加入"未对齐监控",并明确写到这会带来"显著的算力成本"。换言之,2.5倍价格中有一部分买的不是能力上限,而是让能力被监督地使用。
跃升集中在"把活干完"
OpenAI 公布的成绩里,涨幅最大的项目都不是文本生成。
OSWorld 2.0 离线子集上,Astra 任务完成率72.6%,GPT-5.6 Sol 为65.7%;按 OpenAI 模拟真实网络与服务延迟后的测算,平均单任务用时从约75分钟缩短到约40分钟,减少47%。Terminal-Bench 4.0 得分57.9%(Sol 为37.3%),BenchCAD 三维重建几何重叠度得分95.9%(Sol 为83.3%、Claude Fable 5.1 为84.3%),ExploitBench 达100%(Sol 为78.5%)。
这里要保留一个口径提醒。OSWorld 2.0 由 xlang 团队于2026年6月发布,官方站点衡量的是108条长程电脑操作工作流的严格二值奖励,其展示图表中模型完成率大致在两成附近,与 OpenAI 公布的72.6%不在同一评测配置下。OpenAI 也说明,除非另有注明,其评估中的模型均以最大性能档运行——分数更高,代价是延迟和 token 消耗同时上升。
真正把能力提升换算成钱的,是 OpenAI 提出的"任务成本"叙事:在 BenchCAD 上单任务成本预计比 Sol 低约43%、比 Claude Fable 5.1 低约86%;在 Terminal-Bench 4.0 上分别低约9%和63%。逻辑很直接——一次做对、少跑三轮迭代,token 单价更高也可能总账更省。这是典型的从"按字数收费"切换到"按任务收费"的定价话术。
退步的恰好是"写给人看的东西"
GDPval-AA v2 建立在 OpenAI 自己提出的 GDPval 数据集上:覆盖44个职业、9个行业、1320项任务,Artificial Analysis 取其中220项,通过盲测两两对比得出 Elo 分,产出物是文档、幻灯片、图表和电子表格这类真实职业成品。这恰好是 Astra 表现最差的方向之一。
一个细节值得记录:OpenAI 这次没有把 GDPval 成绩放进主要发布材料,而 GDPval 正是它用来衡量"模型能否承担现实经济工作"的那把尺子。
内容型企业的处境因此有些别扭:营销文案、报告叙述、客服话术这些以"写得好"为核心的工作负载,是上一代模型最能打的场景,如今要用2.5倍单价去换一次可能退步的生成。反证同样存在——Cognition 高级研究副总裁塞拉斯·阿尔贝蒂公开称,其内部测试中 Astra 的计算机使用、写作和代码库理解能力都有明显改善;华尔街见闻则援引 Artificial Analysis 及其研究员 Louis-François Bouchard 的测试,认为写作风格匹配度大幅落后前代。两种说法都没有公开可复核的原始评分表,企业只能拿自己的任务集重跑一轮回归测试。
谁付钱,谁受益
对使用方,成本分三层:API 账单、迁移工时、人工复核。Artificial Analysis 的 Coding Agent Index 显示 Astra 得67.0分,与 Claude Fable 5 的67.2分、Claude Opus 5 的68.1分接近;但该机构认为在 Codex 运行环境下,Astra 完成同类任务所需 token 明显更少,最高推理档下单任务成本与 Sol 接近,相对 Claude Fable 5 不到一半。这意味着在开发者工具链场景,涨价的可承受度较高;在以内容产出为主线的 SaaS 场景,这笔账并不划算。
客户样本也偏向同一侧。Jane Street 负责 AI 助手的 John Crepezzi 称,Astra 在其内部编程基准上达到当前领先水平,生成代码只需更少迭代即可达到生产质量;Lovable 首席技术官 Fabian Hedin 称,在低、中、高三档推理强度下均明显优于 Sol。法律科技公司 Legora 披露的一组数字更能说明"分化":Astra 在一套涉及41份文件的财报勾稽流程上表现改善近40%,几分钟内找出全部四处预埋错误,其中包括收入附注里一处50万英镑差额;但在整个 BAR 任务集上,平均改善只有约3%。两个数字必须同时保留——它证明专项收益很大,也证明不能把单项结果推广为整体能力提升。
供应商侧的动机写在收入结构上。据 CNBC 报道,OpenAI 首席财务官 Sarah Friar 上月告知员工,企业部门营收已超过消费者业务;公司已于6月向 SEC 秘密递交招股文件,Friar 称 OpenAI"2027年会成为上市公司"。在这个节点发布一个明显更贵、且能力偏科指向企业自动化的旗舰模型,等于把定价权押在增长最快的那块收入上。
接下来盯四件事
其一,Astra 的 GDPval 与写作类成绩是否会在后续补齐——发布材料中的选择性披露本身就是信号。其二,90%缓存折扣叠加长上下文加价,会推动多少企业把预算从"换模型"转向"改工程"。其三,未对齐监控带来的减速、暂停乃至任务中止是否会成为投诉点,它既是安全承诺,也是隐性服务风险。其四,Anthropic 与 Google 是否跟进提价,还是反向用价格抢占通用写作与企业内容场景。
对企业采购来说,Astra 的合理用法已经比较清楚:把编程、桌面操作、工程建模这类长链条执行任务切给它,把"写给人看"的文本留在原来的模型上。用两个模型的账单结构,去替换一个模型的溢价。
参考数据来源
- OpenAI · GPT-6 Astra 部署安全页(Deployment Safety / System Card)· 2026年9月3日 · https://deploymentsafety.openai.com/gpt-6-astra
- CNBC · OpenAI begins rolling out Astra model after warning of its advanced cyber capabilities · 2026年9月3日 · https://www.cnbc.com/2026-09-03/open-ai-astra-gpt-6-cyber.html
- Artificial Analysis · GPT-6 Astra (max) 与 GPT-5.6 Sol (max) 模型评测页 · 2026年9月 · https://artificialanalysis.ai/models/gpt-6-astra


