OpenAI、Anthropic、xAI同日发生服务中断,头部AI模型集体宕机暴露底层算力集中风险

头部AI公司共用同一批底层算力,模型层面的竞争再激烈,地基是共享的。

美东时间9月3日早晨,OpenAI旗下ChatGPT、Anthropic旗下Claude以及xAI旗下Grok三款主流大模型产品在92分钟内相继发生大规模服务中断,网页端、App与API全部无法访问。故障监测平台Downdetector数据显示,OpenAI收到的用户报告超过1.2万份,Claude约1200份,Grok约1000份,三家合计超过1.4万份。受影响的不止聊天界面,OpenAI的编程工具Codex、依赖Claude和ChatGPT的AI编程工具Cursor等服务也同步受损。

此次宕机始于美东时间9月3日上午9点半左右,Claude率先报告异常,随后Grok和ChatGPT相继出现连接失败、请求报错等问题。三家公司的状态页先后确认服务中断并启动修复,但均未在故障期间发布详细的正式通报。服务在持续近4小时后陆续恢复,截至北京时间9月4日凌晨1点10分前后,三家产品的状态页均已转绿。谷歌Gemini与微软Copilot的中断报告数量在同期有所上升,其中Gemini大体维持可用,成为少数未受明显影响的主流大模型服务。

关于故障原因,OpenAI与Anthropic尚未公布具体说明,仅在状态页标注问题已解决。行业内的推测指向底层云基础设施,有分析认为问题可能出在AWS或Azure等共享计算资源上,也有观点提出“多因素叠加”的可能性。唯一发布明确声明的是xAI。该公司在简短声明中表示:“对于今晨孟菲斯计算中心发生宕机、可能导致您在Grok上遇到的问题,我们深表歉意。”声明中提到的“计算合作伙伴”一词,侧面印证了头部AI公司共用底层算力的事实。

值得注意的是,宕机发生的当天,正是OpenAI原计划发布旗舰模型GPT-6 Astra的日子。在服务中断期间,ChatGPT官方账号发布了一条预告,称“星星几乎排列好了”(The stars are almost aligned)。Astra在拉丁语中意为星辰,OpenAI将其定义为“新一代智能”,并声称这是“当今世界智能水平最高、对齐表现最好的模型”。该模型初期仅向部分机构开放,包括参与Daybreak Access网络安全项目的组织。宕机平息几小时后,GPT-6 Astra按计划向首批机构开放,但“LLM史上最黑暗一天”的说法已在开发者社区中流传开来。

此次事件的核心问题并非某一家公司的修复速度,而是AI行业对底层基础设施的集体依赖。头部模型厂商将大量算力集中托管在少数云厂商的数据中心,可靠性的风险因此集中在上游供应链的单一节点上。OpenAI在过去一年中已多次出现服务中断,今年7月更曾连续多日未能保持稳定服务,基础设施承压并非偶发事件。Hugging Face联合创始人Thomas Wolf在宕机期间的一条推文也引发讨论,他先是转发汇总三家宕机消息的内容并提问“这种情况下你会用哪个AI”,几小时后更正说法,称宕机的是所有闭源AI服务。这一修正将讨论焦点从产品选择转向了集中性风险本身。

对企业客户而言,宕机窗口内的每一分钟都直接折算为停摆的生产流程。随着越来越多的工作流被迁移到AI产品上,一次集体失联足以打断整条业务链。宕机的直接损失可以量化,但信任的折损难以估量。头部AI服务共享同一片底层算力,模型能力的比拼之外,可靠性的竞争才刚刚开始。此次事件为整个行业提出了一个需要重新估值的风险项:用户敢把多少关键业务交给AI产品,而这些产品又是否会在某个早晨与竞争对手一同倒下。

该文观点仅代表作者本人,企服科学平台仅提供信息存储空间服务。

(0)
Meta调整工程师绩效考核标准 取消AI Token使用量指标
上一篇 3小时前
晶圆代工涨价潮蔓延:三星最高上调15%,台积电2027年先进制程涨幅最高25%
下一篇 2小时前

相关推荐

发表回复

登录后才能评论
分享本页
返回顶部