美东时间9月3日早晨,OpenAI旗下ChatGPT、Anthropic旗下Claude以及xAI旗下Grok三款主流大模型产品在92分钟内相继发生大规模服务中断,网页端、App与API全部无法访问。故障监测平台Downdetector数据显示,OpenAI收到的用户报告超过1.2万份,Claude约1200份,Grok约1000份,三家合计超过1.4万份。受影响的不止聊天界面,OpenAI的编程工具Codex、依赖Claude和ChatGPT的AI编程工具Cursor等服务也同步受损。
此次宕机始于美东时间9月3日上午9点半左右,Claude率先报告异常,随后Grok和ChatGPT相继出现连接失败、请求报错等问题。三家公司的状态页先后确认服务中断并启动修复,但均未在故障期间发布详细的正式通报。服务在持续近4小时后陆续恢复,截至北京时间9月4日凌晨1点10分前后,三家产品的状态页均已转绿。谷歌Gemini与微软Copilot的中断报告数量在同期有所上升,其中Gemini大体维持可用,成为少数未受明显影响的主流大模型服务。
关于故障原因,OpenAI与Anthropic尚未公布具体说明,仅在状态页标注问题已解决。行业内的推测指向底层云基础设施,有分析认为问题可能出在AWS或Azure等共享计算资源上,也有观点提出“多因素叠加”的可能性。唯一发布明确声明的是xAI。该公司在简短声明中表示:“对于今晨孟菲斯计算中心发生宕机、可能导致您在Grok上遇到的问题,我们深表歉意。”声明中提到的“计算合作伙伴”一词,侧面印证了头部AI公司共用底层算力的事实。
值得注意的是,宕机发生的当天,正是OpenAI原计划发布旗舰模型GPT-6 Astra的日子。在服务中断期间,ChatGPT官方账号发布了一条预告,称“星星几乎排列好了”(The stars are almost aligned)。Astra在拉丁语中意为星辰,OpenAI将其定义为“新一代智能”,并声称这是“当今世界智能水平最高、对齐表现最好的模型”。该模型初期仅向部分机构开放,包括参与Daybreak Access网络安全项目的组织。宕机平息几小时后,GPT-6 Astra按计划向首批机构开放,但“LLM史上最黑暗一天”的说法已在开发者社区中流传开来。
此次事件的核心问题并非某一家公司的修复速度,而是AI行业对底层基础设施的集体依赖。头部模型厂商将大量算力集中托管在少数云厂商的数据中心,可靠性的风险因此集中在上游供应链的单一节点上。OpenAI在过去一年中已多次出现服务中断,今年7月更曾连续多日未能保持稳定服务,基础设施承压并非偶发事件。Hugging Face联合创始人Thomas Wolf在宕机期间的一条推文也引发讨论,他先是转发汇总三家宕机消息的内容并提问“这种情况下你会用哪个AI”,几小时后更正说法,称宕机的是所有闭源AI服务。这一修正将讨论焦点从产品选择转向了集中性风险本身。
对企业客户而言,宕机窗口内的每一分钟都直接折算为停摆的生产流程。随着越来越多的工作流被迁移到AI产品上,一次集体失联足以打断整条业务链。宕机的直接损失可以量化,但信任的折损难以估量。头部AI服务共享同一片底层算力,模型能力的比拼之外,可靠性的竞争才刚刚开始。此次事件为整个行业提出了一个需要重新估值的风险项:用户敢把多少关键业务交给AI产品,而这些产品又是否会在某个早晨与竞争对手一同倒下。
该文观点仅代表作者本人,企服科学平台仅提供信息存储空间服务。