
作者梅雅达编程笔记关键词AI宕机、ChatGPT、Claude、Agent、基础设施、服务可用性2026 年 9 月 3 日晚上全球无数程序员经历了一个魔幻时刻。你正用 Cursor 赶代码Cursor 突然报错。切到 ChatGPT 想查个 bug——页面转圈。打开 Claude——500 错误。你心想算了Grok 试试——也挂了。你没网崩WiFi 满格。是 AI 三巨头同时躺了。而且这一躺就是 3 小时 40 分钟。先说数据免得你觉得我在编这不是一个都市传说是有据可查的集体翻车。根据 Downdetector 和各家状态页的数据OpenAIChatGPT Codex1.2 万故障报告。15 个 ChatGPT 组件 4 个 Codex 组件同时标记为降级覆盖对话、登录、搜索、文件上传、语音模式、图像生成、Deep Research、Agent 等核心功能。Codex 的 VSCode 插件和 CLI 也跟着一起歇菜。AnthropicClaude约 1200 份报告。受影响模型包括 Claude Mythos 5.1、Fable 5.1、Opus 5、Opus 4.8、Opus 4.6。Claude Code 和 Cowork 全部报错。xAIGrok约 1000 份报告。美东 API、美西 API、Web 端、iOS、Android、X 平台上的 Grok全挂。还没完。Google Gemini 和微软 Copilot 也收到大量用户投诉虽然 Google 和微软没正式承认。AI 编程工具 Cursor 直接在公告里说因为 Claude、ChatGPT、Grok 同时故障我们部分服务不可用。一个晚上整个 AI 工具生态几乎全线瘫痪。时间线93 分钟的至暗时刻把三家的时间戳摊开来看Anthropic最先发现问题北京时间 9 月 4 日 08:26 开始报错15 分钟后说定位到原因了。但直到 11:16 才宣布影响结束。注意——它到现在都没公开说具体原因是什么。xAI08:30 开始出问题一直持续到次日凌晨 00:05总共宕了 3 小时 35 分钟。后来说是他们孟菲斯计算中心出了故障。OpenAI09:43 出现路由错误ChatGPT 和 Codex 部分用户用不了。10:17 说修好了——结果 14:58 又来了一轮更大规模的故障。这次直到 23:55 才彻底恢复。三家最严重的时间段重叠了93 分钟——从 21:43 到 23:16。这意味着什么如果你在这一个半小时里需要 AI 干活对不起三家你一个都打不开。最讽刺的部分宕机当天OpenAI 在发新模型对你没看错。就在全球 AI 服务集体瘫痪的时候OpenAI 在社交媒体上发布了 GPT-6 Astra 的预热视频宣称这是目前全球最智能、且对齐程度最高的模型。OpenAI 总裁 Greg Brockman 在发布会上说“人们未来或许会回头将’这个时间、这个模型’视为 AGI 到来的节点。”最后他加了一句“欢迎进入 AGI 时代。”网友评价先把机房修好再发新模型吧。这条评论被顶上了热门。你说冤不冤——花了几亿美元、烧了 10 万块 GPU 训出来的最强模型发布当天的头条是ChatGPT 挂了。为什么三家能一起挂这才是值得深挖的问题。按理说三家用的云服务不完全一样——OpenAI 靠微软 AzureAnthropic 跟 Amazon 有合作xAI 在孟菲斯自建了计算中心。理论上基础设施应该是隔离的。但实际情况是有分析指出几个可能的共同因素Cloudflare 问题。Cloudflare 状态页当天显示两个故障一个是 R2 自定义域名的 HTTP/3 问题另一个是 WARP 用户地理位置识别错误。三家都用 Cloudflare 做 CDN这成了一个潜在的共因。而且 2024 年 11 月就出过类似的事——Cloudflare 一次故障同时搞挂了 xAI 和 ChatGPT。Azure 嫌疑。有消息称微软 Azure 同期宕机报告飙升。虽然 Cloudflare、AWS、Azure、Google Cloud 四家的状态页都没有记录重大故障但 OpenAI、Anthropic、xAI 三家都以不同形式依赖 Azure 提供部分服务。流量转移效应。还有一种更隐蔽的可能当用户打不开 A 模型时会涌向 B 模型。如果 B 也同时出问题就形成了连锁过载。Anthropic 和 xAI 在 2026 年 5 月宣布了计算合作伙伴关系这让流量转移的可能性更大。但——三家给出的官方原因完全不同OpenAI 说路由错误xAI 说孟菲斯数据中心故障Anthropic 说基础设施问题具体没说你品品。三家同时出事三家都说不是同一个人干的。另外补一个数据Anthropic 官方统计的 Claude 可用性是99.35%。这个数字看着挺高对吧换算一下就是——一年大概会挂47 小时。而且不只是 9 月 3 号。光是 9 月份Claude 就经历了9 月 1 日平台 Office 365 插件降级9 月 2 日Sonnet 5 短暂报错9 月 3 日全家桶集体宕机6 月 22 日还出过一次 90 分钟的全球性宕机头部 AI 的稳定性真没有宣传的那么靠谱。对 Agent 开发者意味着什么如果你只是偶尔用用 ChatGPT宕机了等恢复就行。但如果你在搞 Agent 开发——比如你做了一个智能客服 Agent底层调的是 Claude API那 Claude 一挂你的 Agent 就是个废人。用户发消息过来Agent 想回复API 返回 500用户等了三秒没反应直接关页面走了。这不是理论问题。Cursor 就是一个活生生的例子——它自己没挂但它依赖的底层模型挂了它也跟着残了。如果你不想重蹈覆辙有几个东西值得在设计阶段就想清楚熔断机制。当上游 API 连续报错时快速失败别傻等。给你的 Agent 一个Plan B 回复哪怕是一句我现在有点忙稍后回复你也比让用户对着一个转圈的加载图标干等强。多模型 fallback。别把鸡蛋放一个篮子里。主模型挂了自动切备用模型哪怕备用模型笨一点至少有响应。你现在做 Agent 的时候就应该在代码里写好 fallback 链——主用 GLM-4.7-Flash挂了切 Qwen再挂切本地小模型。本地缓存 降级回复。当所有 API 都挂了你的 Agent 至少还能返回一些预缓存的基础回复而不是直接变成一块砖。监控告警。别等用户来告诉你你的 AI 不好使了。自己监控 API 的健康状态出问题了主动通知比被动挨骂强。资本市场已经给出了答案这次宕机在美股市场激起了一个有意思的反应AI 本地化概念的龙头 Palantir 当天暴涨7.71%收报 182.53 美元。市场的逻辑很直白云端 AI 靠不住私有化部署才是出路。Palantir 涨不全是这个原因但这个信号够明显了——当几家美国 AI 巨头能让全球用户在一个晚上同时断粮企业对把核心业务绑在别人 API 上这件事的焦虑已经从技术层面上升到了董事会层面。中国开发者怎么看说实话这次事件反而让我觉得——国内的 AI 开发生态没有我们平时吐槽的那么差。GLM-4.7-Flash 永久免费200K 上下文编程能力不弱Qwen3.8-Max 刚拿下 CodeArena 全球榜首DeepSeek 的代码生成能力也早就不用多解释了。与其把所有业务押在几家美国 API 上不如从第一天就把国产模型接进你的 fallback 链。不是情怀是生存策略。你想想美国 AI 服务宕机的时候你的 Agent 如果底层走的是国内模型这波 3 小时 40 分钟的全球故障对你来说就是无感。这才是真正的竞争优势。写到最后我想说的其实很简单。这次集体宕机最讽刺的地方不是三家一起挂而是——OpenAI 在同一天发布了号称对齐程度最高的模型结果连自己的服务器都没对齐到在线状态。AI 行业卷到今天大家都在比谁模型更强、参数更大、benchmark 更高。但一个基本的事实是当你的模型强到能跑遍全世界的工作流你的基础设施却弱到撑不住一个晚上——这种反差才是真正的 AI 安全问题。不是模型不安全是服务不安全。对做 Agent 的人来说最该记住的就一句话别信任何 99.9% 的可用性承诺自己的 fallback 链才是最后的安全网。