只降20%,账单少82%:GPT-5.6砍的不是模型钱
2026年8月24日,OpenAI公布了一项与AWS共同完成的测试结果:在Terminal-Bench 2.1上,GPT-5.6 Terra在Kiro里做成一个任务的成本,比此前基线降了约82%。转引该结果的报道没有披露对照基线的具体口径,也没有给出降前降后的绝对金额。
同一款Terra,最近一次官方调价是7月30日,幅度20%。Kiro在次日跟进,把它的credit倍数从1.2倍压到1.0倍——这一条能在AWS一方页面上直接对上。
单价降两成,账单砍八成。中间那六十个百分点不是从价格表里出来的,它决定了接下来一年开发者给AI编程工具算账的方式。
差0.7个百分点,账单差近4倍
Terminal-Bench的榜单最近多了一栏。官方排行榜的表头里,模型、智能体、解决率之外,并排列着COST和TOKENS。新智元转引的2.1版榜单四行读数把矛盾摊开了:
Claude Code配Fable 5:83.8%,552.67美元
Codex配GPT-5.5:83.1%,2059.19美元
Codex配GPT-5.6 Terra:78.4%,421.15美元
Codex配GPT-5.6 Luna:75.7%,241.45美元
前两行解决率只差0.7个百分点,一轮跑下来的花费差了近4倍。第三行和第一行之间,Terra组合的准确率落后5.4个百分点,成本便宜约24%。
同一个模型换个框架也不是同一个价:Kiro官方评测表里,Terra在Terminal-Bench 2.1上的成绩是87.4%,榜单上Codex配Terra是78.4%。两个数字口径不同——前者是模型在Kiro环境中的自测,后者是第三方榜单在Codex框架下的读数——不能混着用。但同一款模型能被拉开9个百分点,本身说明考卷不只发给模型。
这套题的玩法决定了对比的性质:把模型丢进终端环境,给一个模糊目标,让它自己规划路径、调工具、写脚本、处理报错、反复迭代。成绩是「智能体+模型」这个组合的成绩,账单也是。
最贵的token,是白烧的那些
AI编程的账单可以拆成两半:一次做对的开销,和一次没做对的开销。智能体把任务做砸一次,账单照记;中途选错路径、跑偏三轮再回头,这些token也照收。官方降价只作用于前一半的单价,框架层同时管着两半。
Kiro自己披露过这套机制长什么样。IDE里智能体改完文件,diagnostics工具立刻调用静态分析器——TypeScript的tsserver、Java的jdtls、Python的Pyright、Rust的rust-analyzer、Go的gopls、C/C++的clangd——把本该在构建阶段才暴露的类型错误、找不到的模块、模型凭空造出来的属性,拦在编辑动作里,形成「生成→校验→修正」的循环。
2026年8月26日,Kiro发布了一项内部研究:2026年1至6月的约150万次会话里抽出40.6万次诊断调用,覆盖Opus 4.5到4.8、Sonnet 4到4.6共7款Claude模型。结论比「新模型错误更少」更微妙——错误率在降,但错误的种类在换,老一代高频出现的错误类别消失,新的类别冒出来。返工的结构一直在变,省返工的钱就得反复重算。
省钱的抓手在中间那层
OpenAI在官方博客里把效率来源拆成三层:发起请求并组织上下文的智能体框架,中间调度请求的编排系统,最后才是GPU上跑的模型本身。每一层都在省,加起来才是账单。
中间层的动作很实在。Kiro在8月3日披露,早期IDE、CLI、Web各自养一套智能体框架,分别用TypeScript、Rust、Python写,会话存储、权限语法、上下文压缩策略各行其是,一个功能做三遍,一个bug修三遍,会话还无法跨端迁移。后来三套合成一套独立的agent harness进程,通过Agent Client Protocol(ACP,2026年6月达到1.0版)与客户端通信。这个harness管的是智能体循环、工具执行、子智能体委派和会话管理——它决定模型一次拿到多少上下文、调几次工具、走不走回头路。
spec-driven是这套框架的门面玩法,规则一句就能说完:不许上来就写代码。先把用户那句含糊的目标拆成需求文档、技术设计、可执行任务清单,再交给模型。模型拿到手的不是一句话,是一份理清楚的活儿。
模型分工也落在这一层。OpenAI举过一个用法:编码流程先用Sol把问题想清楚、把计划定下来,再换Luna去实施定义清楚的改动、写测试、跑评估。同一条流水线,不同环节配不同档位的智能。
Claude没退场,选择器里也不只两家
GPT-5.6确实是第一批进Kiro的OpenAI模型。Kiro在7月14日发博客把Sol、Terra、Luna摆进IDE、CLI和Web,正好是Kiro公开预览一周年;转引报道还提到,AWS在7月13日宣布这三款模型在Amazon Bedrock正式可用。
但「Claude失守」这个说法要补几笔。
其一,这个下拉菜单早就不是Anthropic独占。2026年4月2日,MiniMax M2.5以0.25倍credit、GLM-5以0.5倍credit上线Kiro,MiniMax M2.1、Qwen3 Coder Next、DeepSeek V3.2同月向全部用户开放。开源权重模型比OpenAI更早进到这个货架。
其二,Anthropic在GPT-5.6入驻后十天内继续加码。7月1日Sonnet 5上线Kiro,7月24日Claude Opus 5上线,带100万token上下文和2.2倍credit倍数,AWS Agentic AI副总裁Deepak Singh为它站台,理由是「为长时程、多步骤工作而生」。这个倍数比旗舰Sol的2.4倍更低,上下文则是Sol(272K)的近4倍。
其三,能力上GPT-5.6没有全面反超。Kiro官方评测表里,SWE-Bench Pro上Claude Fable 5拿80%,GPT-5.6三档最高只是Sol的64.6%;而在Coding Agent Index和Terminal-Bench 2.1上,Sol的80分和88.8%确实压过Fable 5的77.2分和83.1%。
所以更准确的说法是:AWS把两家前沿闭源模型和一排开源权重模型凑进同一个选择器,让一个此前不显形的成本科目第一次可比。
接下来看什么
三档模型在Kiro里走的是隐藏思维链,看不到推理步骤,只看最终输出。Kiro在发布页主动说明这是预期行为、不影响输出质量;模型只向Pro、Pro+、Pro Max和Power用户灰度,区域限于美国弗吉尼亚北部和欧洲法兰克福,标记为实验性支持。省下来的钱换走了一部分可解释性,这笔取舍各家自己权衡。
评测本身也在被追着改。Terminal-Bench官方在2026年5月6日发布2.1版,修正28个任务;7月30日发布3.0版;8月28日又推出4.0版,理由是校准任务资源、修正任务、剔除已被刷饱和的任务。榜单版本会换,成本这一栏大概率不会退回去。
对企业采购,账要重算一遍:以前问「这个模型一百万token多少钱」,现在得问「让它把这件事做完要花多少、失败一次要不要照付」。Terra在Kiro官方给出的Coding Agent Index上是77.4分,Claude Fable 5是77.2分,差0.2分。真正的卖点不是这个分数,是这个分数对应的价钱。
参考数据来源
- AWS Kiro官方博客 · GPT‑5.6 is now available in Kiro · 2026-07-14 · https://kiro.dev/blog/gpt-5-6/
- AWS Kiro官方博客 · GPT‑5.6 update: lower credit multipliers for Terra and Luna · 2026-07-31 · https://kiro.dev/blog/gpt-5-6-pricing/
- AWS Kiro官方博客 · Claude Opus 5 is now available in Kiro · 2026-07-24 · https://kiro.dev/blog/opus-5/
- AWS Kiro官方博客 · One agent, every surface: how we built the Kiro agent harness · 2026-08-03 · https://kiro.dev/blog/one-agent/
- AWS Kiro官方博客 · Are AI coding agents actually getting better? · 2026-08-26 · https://kiro.dev/blog/diagnostics-over-time/
- AWS Kiro官方博客 · MiniMax M2.5 and GLM-5 are now in Kiro · 2026-04-02 · https://kiro.dev/blog/minimax-m25-and-glm-5/
- Terminal-Bench官方 · Leaderboard(含COST/TOKENS列)与News(2.1/3.0/4.0版本发布记录) · 2026-08-28 · https://www.tbench.ai/leaderboard ;https://www.tbench.ai/news
- 新智元(36氪授权转载) · 只降价20%,账单却少八成,GPT-5.6杀入Claude地盘重算编程账 · 2026-08-28 · https://www.36kr.com/p/3958567373864320
- OpenAI · GPT‑5.6 in Kiro(原页抓取受限,未能直读,相关内容按转引归因) · https://openai.com/index/gpt-5-6-in-kiro/
- OpenAI Developers · X帖(未能直读,按转引归因) · https://x.com/OpenAIDevs/status/2091966982015103068


