ChatGPT等三大AI同时掉线,用户报告超1.2万
2026年9月3日13时26分(UTC),Anthropic在官方状态页记下一笔:Claude多个模型请求错误率升高。几乎同一时段,OpenAI的ChatGPT与Codex、xAI的Grok也相继公告异常。三家分别排查、分别修复,又在同一个下午先后恢复。据财联社、华尔街见闻援引Downdetector数据,事发时段报告OpenAI存在问题的用户超过1.2万份,Claude约1200份,Grok约1000份。截至9月4日凌晨服务全部恢复后,没有一家公司公布根因。
单家模型出错早已不新鲜,三家头部厂商在同一时段各自挂出故障公告才罕见。真正的信息量藏在状态页的时间戳里,而不是“又宕机了”这件事本身。
官方记录能确认的,只有时间线
Anthropic的状态页是本次事件中记录最完整的一份。13时26分进入调查;13时41分标记为“已定位原因”;13时50分给出受影响模型的完整清单:Mythos/Fable 5.1、Mythos/Fable 5、Opus 5、Opus 4.8、Opus 4.6;15时25分收窄到只剩Opus 4.8和Opus 5;16时06分部署修复;16时16分(太平洋时间9时16分)宣告影响结束,前后2小时50分。状态页同时列出受影响对象为claude.ai、Claude API、Claude Code与Claude Cowork。
OpenAI的记录标题是“ChatGPT和Codex出现高错误率”,从进入调查到宣告解决跱度约2小时,末尾提示部分Codex远程控制用户需要重新配对移动设备。这份记录的一个细节是,页面未标注时区,因此它只能提供“持续约两小时”的相对时长,无法与Anthropic的时间戳逐分钟对齐。
Grok一侧,21财经转述其状态页称安卓应用出现模型级中断、正在恢复服务;本次未能直接打开xAI状态页原文核验,因此这一条只能作为媒体转述。
需要在此划一条线:把本次事件称为“有报告以来最大规模AI宕机”,是部分媒体作者的定性表述,没有给出统计出处,本文不采用这个说法。可以确认的是范围与时长:三家同时、各自公告、持续两到三小时。
一个反常细节:“已定位原因”之后的两个半小时
13时41分说已经找到原因,16时06分才把修复部署上线——中间2小时25分。这个节奏和“自家代码写错、回滚一版”的常见路径并不吻合:如果修复动作完全在Anthropic自己手里,两个多小时的空档偏长。更可能的解释是修复需要变更上游配置,或者需要等基础设施侧的动作完成。Anthropic没有解释这段时间在做什么,所以这只能停留在推断。
第二个细节更值得注意:受影响清单集中在最新一代模型。Anthropic官方newsroom显示,Claude Fable 5.1与Mythos 5.1发布于9月1日,Opus 5发布于7月24日。9月1日上线、9月3日出故障,时间上只差48小时。但Anthropic从未把二者联系起来,官方记录里只有“已定位原因”五个字。新模型上线与集体故障之间的关系,目前是未被证实的问号,不是结论。
不过对商业侧而言,受影响的对象清单比原因更直观。claude.ai是订阅收入入口,Claude API是按token计费的对外生意,Claude Code和Cowork则是被企业写进日常工作流的执行入口。一次错误率升高,同时命中了“用户聊天”和“机器调用”两条线。
两条根因猜测,其中一条与官方记录对不上
媒体给出的猜测集中在两条线上。一条指向微软Azure:华尔街见闻称这三家AI平台均依赖Azure提供云计算服务,同期Azure的宕机报告也在飙升,同时它们的算力架构中包含谷歌等其他服务商。另一条指向Cloudflare:财联社与21财经均引述分析人士观点,认为可能与这一层互联网基础设施有关,理由是Cloudflare状态页当天出现了两个问题——影响R2自定义域名的HTTP/3问题,以及部分WARP用户地理位置识别错误。
直接去看Cloudflare的官方事件历史页,9月3日当天记录的条目全部标注为Minor级别,除了上述两条,其余是若干城市节点的例行维护与局部5xx、延迟问题,最晚一条在当天晚间标记Resolved,没有出现全球性重大事件条目。这让“Cloudflare全球层出问题拖垮三家AI”这条猜测的力度明显下降——但它不构成否证,因为轻微级别条目同样可能在特定链路上放大。
截至发稿,微软和Cloudflare都没有确认与本次AI宕机存在关联,三家公司也没有说明彼此故障是否同源。
为什么这条猜测链值得单独写一段?因为共享层的横向复制有明确先例。Cloudflare在2025年11月18日的官方复盘里写道:当天11时20分(UTC)起,一次数据库权限变更让Bot Management使用的feature file体积翻倍,超出了网络路由软件的文件大小上限,导致核心流量投递失败,14时30分核心流量恢复、17时06分全部系统正常,并明确否认与任何攻击有关。那次事故里,ChatGPT、xAI等大批站点同时报错。也就是说,九个月前互联网刚刚演示过一次:底层共享组件的一个尺寸上限判断,可以变成上层一堆互不相干公司的集体故障页。单点故障不按行业边界传播,它按依赖关系传播。
掉线的不只是聊天框,故障沿API往下游走
AI编程工具Cursor已确认,其部分服务因Claude、ChatGPT和Grok的故障受到影响。这条信息的意义大于一次报错本身:AI服务的分销结构是批发的,模型层出问题,下游开发者的产品可用性同步失守,而后者对用户承诺的服务等级并不由自己的状态页决定。
同一时段,谷歌Gemini与微软Copilot的用户中断报告数量也明显上升,但谷歌并未确认存在全网服务中断。这里不能反推出“自建云、自有分发就更稳”,报告数上升说明用户体验并不好,只是官方通报口径更保守。真正有信息量的差异是确认口径的不一致:依赖多方算力的公司倾向于快速挂出故障条目,掌握全栈的公司更倾向不确认。
市场侧的反应同样被媒体记录下来。财联社9月3日电,Palantir美股盘中涨幅一度达9%,报184.829美元/股,总市值约4442亿美元;21财经给出的口径为上涨7.81%,属于盘中不同时点的数据。有市场观点把“AI本地化概念股”走强与本次集体宕机联系起来,视作资金对私有化部署的追捧。这一因果链条既无公司说明,也无交易数据佐证,只能作为当日市场叙事看待。
还有一点不能漏:据财联社报道,正是在主流AI集体下线之际,OpenAI在社交媒体发布了暗示“GPT-6”(Astra)即将上线的预热内容,并引发用户吐槽。发布节奏与基础设施稳定性之间的张力,本身就是这一轮AI竞争的写照。
接下来该盯哪四个信号
第一,看有没有事后复盘。截至9月4日早间,OpenAI与Anthropic的状态页都只记录到“已解决”,均未附根因分析。谁先发、怎么写,等于第一次公开各家在基础设施冗余上的真实家底。
第二,看可用性条款会不会被重新定价。企业客户的AI采购正从“谁模型强”转向“谁能承诺不掉线”,一旦多起集体故障成为常态,合同里的服务等级、赔付与终止条款会先于技术架构发生变化。这目前是趋势判断,尚未成为已发生的结果。
第三,看多供应商路由是否从宣传话术变成采购指标。Anthropic状态页上同时出现五个模型代际的事实提醒一件事:模型版本可以并存,算力入口未必可以并存。
第四,看数字能否被证实。Downdetector的报告数是用户主动提交,媒体未说明统计窗口与峰值时间;网络上还流传着“峰值超3.7万份”“7万份”等更大口径,均未能从原始来源核验。要判断这是不是行业级的基础设施事故,需要的不是更大的数字,而是公司侧的可用性指标。
三家头部公司同时报错、却没有一家说清原因,这本身就是最诚实的结论:AI应用层的繁荣,目前仍建立在少数几个没人愿意公开谈依赖关系的底层上。
参考数据来源
Anthropic 官方状态页 · Elevated errors for multiple models(Incident 461yvfrzpwtt,2026年9月3日) · 2026-09-03 · https://status.claude.com/incidents/461yvfrzpwtt
OpenAI 官方状态页 · Elevated errors across ChatGPT and Codex(Incident 01M1KWEDH417T2CF44YYHZDFCR,2026年9月3日) · 2026-09-03 · https://status.openai.com/incidents/01M1KWEDH417T2CF44YYHZDFCR
Cloudflare 官方博客 · The Cloudflare outage on 18 November 2025 · 2025-11-18 · https://blog.cloudflare.com/18-november-2025-outage/


