OpenAI新模型被认定能自主找漏洞,它为何先踩刹车
9月1日,Anthropic 发布 Claude Fable 5.1 与 Claude Mythos 5.1,将其定位为最先进的编程与知识工作模型;OpenAI 在同一天预告了名为 Astra 的新模型,同时宣布把其中最先进的网络安全功能只开放给一小部分测试人员,并为加强防护推迟了部分开发与发布工作。
两家头部公司不约而同把刹车写进了发布材料:Anthropic 用条款划出新模型能做什么、不能做什么,OpenAI 干脆把最强的一截能力锁进审批名单。另一条线索同样反常——Anthropic 把缓存读取单价砍掉 75%,第三方测算却显示,跑一次最高难度的智能体任务,成本反而高出 20%。这份账单和这条红线如何连在一起,才是这次同台真正的信息量所在。
一次降价,算出两个结论
Anthropic 官方公告的表述是:缓存读取价格下降 75%,至每百万 token 0.25 美元;每百万 token 输入 10 美元、输出 50 美元的标准价维持不变。官方据此给出的结论是:按 token 计费的典型负载下,Fable 5.1 比上一代 Fable 5 便宜约 25%;在上下文与工具调用极重、缓存读取构成成本大头的智能体任务里,节省幅度最高可达约 45%。这一口径基于默认推理档位、2026 年 8 月四周的真实使用数据。
第三方平台 Artificial Analysis 的测算给出相反方向:最高难度档位下,Fable 5.1 单次智能指数任务成本 3.76 美元,比 Fable 5 高 20%,主因是其输出 token 用量达到后者的 1.7 倍;同一批评估中,缓存读取降价为每笔任务省下约 1.40 美元。把推理档位下调到 xhigh,单次成本回落到 2.72 美元,但仍高于 Claude Opus 5 在最高难度下的 2.34 美元。
两组数字都成立,差别只在口径:降下来的是重复读取已缓存输入那一段,涨上去的是模型想得更多、写得更长那一段。对企业开发者而言,决定账单的核心变量已经从牌价变成缓存命中率与推理档位。首批体验客户 Cognition 的说法印证了这一点:按新的缓存读取价,Fable 级模型第一次在经济上跑得通那些原本一直留在 Opus 上的负载,比如代码审查。
分数也分两套口径
同一批基准,媒体转述的第三方跑分与厂商自报数据并不一致:
| 指标 | 第三方 Artificial Analysis 口径 | Anthropic 官方口径 |
|---|---|---|
| 智能指数 | 较 Fable 5 提升 4 分 | 未披露绝对分值 |
| HLE(人类最后考试) | 59.1%,超过 Fable 5 此前的 55.5% | 60.9%(不带工具)/65.0%(带工具) |
| Terminal-Bench | v2.1 达 91.4%,为该平台迄今最高分 | 4.0 版 55.8%(Mythos 5.1 为 60.9%) |
基准版本、是否带工具、护栏是否开启都会改变结果,跨榜比较的意义有限。更值得注意的是 Anthropic 自报数据里的一处细节:Fable 5.1 是在生产环境护栏开启的状态下评测的,部分任务因护栏介入被直接判零分,网络安全类任务交给 Claude Opus 4.8、生物类任务交给 Claude Opus 5 完成——护栏本身就在给跑分设上限。
安全能力被拆成了产品档位
这次发布里最直白的动作,是 Anthropic 把护栏做成了一条产品线。Claude Fable 5.1 与 Mythos 5.1 是同一个模型,区别只在安全限制的强度:Fable 5.1 一般可用,Mythos 5.1 只面向可信访问计划内的机构开放,其护栏专为支持网络安全与生命科学研究而设计;进阶生物能力的访问计划还是与美国政府合作建立的。
官方对能力边界的描述同样带着刻度:新版网络安全护栏的误拦截比此前减少 60%,部分原因是 Fable 5.1 现在可以被用于发现软件漏洞,但不用于开发利用漏洞的代码;渗透测试、exploit 生成、基于二进制的漏洞扫描等双用途任务仍被转交给 Opus 系列。Anthropic 称 Fable 5.1 是其发布过的网络能力最强的模型,但仍落在其前沿合规框架中风险较低的档位,且未找到关键级越狱的证据。
安全阈值不再只是合规文件里的一段说明,而被切成三个商业入口:公开可用的、需审核准入的、需要转接旧模型的。同一份能力,按风险分级定价、按身份分级开放。
OpenAI 按下的那个暂停键
OpenAI 一侧的叙事重心几乎全在安全上。据第一财经援引 OpenAI 官方说法,Astra 是 OpenAI 认定的第一个达到其关键网络安全能力阈值的模型,该阈值的含义被明确写成:在拥有合适工具和访问权限时,它可以发现此前未知的安全漏洞,并开发出在多个受保护系统中利用这些漏洞的方法,而无需人工指导每一个步骤。
正因为能力被自评越线,OpenAI 在过去几周推迟了 Astra 的部分开发与发布,以加强并测试针对网络滥用和未经授权模型操作的防护;最初可用范围仅限一小部分测试人员执行高级网络安全任务,之后再通过名为 Daybreak Blue 的计划向防御性用途逐步开放,并称会在内部部署期间监控模型的未经授权行为、必要时自动终止任务。CEO 山姆·奥尔特曼表示,整个夏天团队都在推进安全方面的工作,如今能力与安全保障措施的同步提升比以往任何时候都重要;他承认 Astra 的训练已完成一段时间,后续型号根据需要放慢了进度。
这条叙事有明确的现实触发点。7 月 Hugging Face 遭 AI 模型意外黑客攻击一事中,OpenAI 称 Astra 并非涉事模型之一,但已把该事件教训并入安全策略,包括训练模型更可靠地拒绝有害网络请求、增加防滥用保护、强化监控。8 月 27 日,OpenAI 发布《呼吁开展网络防御的集体行动》公开信,联合 Anthropic、亚马逊云服务、谷歌、微软等百余家机构警告:随着模型能力提升,由 AI 发起的网络攻击将愈发广泛复杂,留给各方强化防御的时间窗口有限,医院、水处理厂、电网和互联网基础设施等关键公共服务面临日益迫近的威胁。
同一天,两种押注
两场发布的方向并不相同。Anthropic 在用降价换生态锁定:缓存读取价砍 75%,配合默认推理档位、企业侧零数据保留方案与可信访问名单,把智能体负载、尤其原本留在高价档的流量尽量留在自己平台上。OpenAI 则把已经触到安全红线本身当作发布信息——先展示一项具备威胁性质的能力,再主动按下暂停键,用研发节奏的让步换取安全话语权与标准制定的位置。
双方都在加码防御,也不讳言外部压力。据第一财经援引官方披露,Anthropic 正在分析近期两起安全事件,并计划与独立评测机构 METR 合作开展审查;法国人工智能安全中心执行主任查贝尔·拉斐尔称,Anthropic 已宣布暂停高风险强化学习环境的开发,这与 OpenAI 于 8 月 18 日暂停前沿强化学习训练的情况类似。奥尔特曼在近期访谈中直言,团队一直想推进编程业务,但从优先级看错过了这个机会,在任何阶段落后都不是灾难性的。另据市场消息,谷歌正在开发编码能力更强的新模型(未获官方证实)。
竞争的烈度并未因刹车而下降,变的只是维度:过去比的是谁的分高,现在还要比谁能把我停在哪里、为什么停、谁能通过审核拿到更强版本,讲成一套可信的制度叙事。
接下来盯什么
一是缓存命中率与推理档位的成本弹性,重度智能体负载最受益,轻调用、长输出的场景反而可能更贵;二是 Mythos 5.1 可信访问名单的扩容节奏,它决定分层开放是营销姿态还是长期制度;三是 Astra 的正式发布日期与准备框架报告细节,目前官方仅称很快发布,风险等级判定完全基于自评,尚缺独立第三方复核;四是 Anthropic 与 METR 的审查结论以及高风险强化学习环境是否恢复;五是这封百余家机构联署的公开信能否转化为客户侧的采购要求与监管预期。
真正的问题不是谁跑得快,而是当自主发现并利用漏洞成为一种可交付的产品特性时,谁能提供被验证过的刹车机制。对企业买家而言,这份刹车记录正在变得和跑分同等重要。
参考数据来源
- Anthropic ·《Introducing Claude Fable 5.1 and Claude Mythos 5.1》官方公告 · 2026年9月1日 · https://www.anthropic.com/claude-fable-and-mythos-5-1
- 第一财经(记者吕倩)·《Anthropic发新模型,OpenAI同日预告新品将安全优先》 · 2026年9月2日 · https://www.yicai.com/news/103343614.html
- 凤凰科技(编译自彭博)·《OpenAI很快推新AI模型Astra 但因性能太强将限制网络安全能力》 · 2026年9月2日 · https://tech.ifeng.com/c/8w5DvvzbuWk


