Anthropic确立AI安全三层门槛,已查12.9万漏洞
2026年4月到7月,不到四个月时间,Anthropic的合作伙伴用Claude模型扫描出了至少12.9万个已验证的软件漏洞——其中超过3.3万个被评级为严重或高危。这是截至当时的下界估计,因为不到一半的参与方报告了修补数量,Anthropic自己的判断是真实影响可能高出五倍。
如此密集的安全成果没有让Anthropic把门敞开。10月6日,这家公司在官方博客宣布扩展其网络安全验证计划(Cyber Verification Program),将Claude模型的网络安全能力访问权限正式划分为三层:防御接入、红队接入和专业接入。每一层的审批门槛和权限范围各不相同。核心问题是:一个刚刚证明自己在漏洞挖掘方面具备超强能力的AI公司,为什么选择在成绩最亮的时候收紧准入?
三层分级:谁能拿到什么工具
这次扩展后的CVP计划不是简单的注册制。三个层级分别对应不同深度的授权审查。
第一层是防御接入(Defense Access)。面向从事SOC运营、事件响应、恶意软件逆向工程的专业团队——包括公司的安全部门、关键基础设施运营者如医院和市政设施、小型安全公司、开源项目维护者,以及有已报告漏洞记录的个人独立研究者。审批周期在数天内完成。获得该层级后,Anthropic会减少对安全工作的模型拦截,但仍保留基础限制。
第二层是红队接入(Red Team Access)。除了防御功能外,额外授权渗透测试和红队演练,但仅限组织使用——内部红队、政府红队和安全/渗透测试公司可以进入,明确排除了个人研究者。这一层的审批需要几周。Anthropic披露了一个值得关注的数字:在未施加防护的情况下,Claude对红队任务的完成率在早期测试中约24/50;而在实施拦截机制后,完成率回升到34/50,但对可能造成物理伤害或大规模中断的操作仍有实时阻止,例如部署勒索软件或攻击高风险安全系统。
第三层是专业接入(Specialized Access)。权限最宽松,允许测试可能影响生命安全或扰乱市场的系统——飞行操作系统、电网、电信网络、银行间转账基础设施、政府行政网络。这一层目前对所有申请机构进行深度审查,且是与美国政府联合进行的。现有Project Glasswing成员直接转入,无需重新审批。在CyScenarioBench评估框架下,该层级的零拦截率得到了官方确认。
三层架构的核心逻辑很清晰:风险越高的使用场景,审查越严、权限越宽。这是一种制度化的风险对冲。
为什么在成绩最好的时候收紧?
这个决定看起来有些反常——通常在某项技术展现出强大价值时,厂商更愿意扩大开放以占领市场。Anthropic选择了相反的路径。
驱动因素来自过去六个月的试运行经验。从4月开始启动的Project Glasswing项目已经覆盖了40多个构建和维护关键软件基础设施的组织,初始伙伴名单包括AWS、Apple、Cisco、Google、JPMorganChase、Linux Foundation、Microsoft和NVIDIA等。这些参与者利用Claude Mythos / Mythos Preview模型扫描自身系统,产出了上述庞大的漏洞数据。
与此同时,Anthropic自己的安全研究团队也在同步推进技术摸底。2025年10月发布的研究《Building AI for cyber defenders》显示,Claude在某些网络安全竞赛中已经超越人类团队,能在各大操作系统和浏览器中发现长达27年的旧漏洞。2026年4月的另一份研究则记录了Claude自主开发复杂exploit的能力,以及DARPA AI Cyber Challenge中使用LLM从数百万行代码中发现此前未被发现的真实漏洞的案例。
能力跃迁的速度远超预期。Anthropic自己承认了一个现实:如果不谨慎管理,前沿模型的能力短期可能被攻击者滥用,而防御者真正受益需要更长的时间窗口。这就是所谓的“过渡期风险”——在安全护栏足够完善之前放开使用,造成的损害可能远大于收益。
双重使用困境的制度化回应
AI领域的“双重使用困境”一直是一个经典难题:同一套技术既可用于防御也可用于攻击。OpenAI早期对ChatGPT实施访问控制的历史也证明了这一点——当生成代码的能力变得过于强大时,平台不得不引入额外的安全过滤层。
Anthropic这次的三层分级本质上是在尝试回答这个问题:如何让真正需要这些工具的人用上,同时不让恶意使用者轻易获取。它不是一个纯技术问题,而是一个治理设计问题。
其中专业接入层级涉及与美国政府的联合审查,这是一个值得关注的事实锚点。根据Anthropic在2025年10月发布的原文,其Safeguards团队曾检测并干扰过利用Claude进行复杂间谍活动的威胁行为者,该行为者表现出与特定国家APT行动一致的特征(原文表述为“consistent with Chinese APT operations”,未作定性断言),目标是关键电信基础设施。这解释了为什么最高级别的访问需要政府层面的联合审查。
当然,这里存在一个需要注意的边界:这只是Anthropic单方面在其平台监控中发现的一个案例,并未提供具体的受害者名称、技术细节或时间线。将其作为第三方指控引用时需要保持归因的清晰度。
行业格局变化的三条观察线索
Anthropic的分层验证模式如果得到持续执行,将对AI安全和防御生态产生结构性影响。以下是三个可追踪的观察指标:
第一,安全研究人员的工作方式是否将从“自行试用模型”转向“申请准入资格”。这种转变意味着安全研究资源将被集中到有资质认证的机构手中,个人或小型团队的探索空间可能缩小。
第二,AI模型部署企业的合规策略调整。如果行业头部厂商都采用类似的分级授权模式,那么在关键基础设施领域运行的AI系统可能需要通过外部审核才能接入高级安全功能,这将增加相关企业的合规成本。
第三,其他AI公司的跟进意愿。OpenAI、Google和微软是否会在自身产品中复制类似的分级验证框架,还是选择不同的平衡路径?这决定了AI安全标准最终由谁定义。
当前阶段,Anthropic的方案还只是一个起点。12.9万个漏洞的发现量提供了足够的证据说明需求确实存在,而三层分级的制度设计能否在实际运行中兼顾安全与效率,仍需时间检验。


