周四早晨,ChatGPT、Claude、Grok和Gemini四大AI服务几乎在同一时间段内遭遇严重故障。OpenAI和Anthropic均报告了高错误率,而Downdetector.com的监测数据显示Google的Gemini可能也发生了故障,尽管Google官方并未公开承认此事。
此次中断波及多个主流AI平台,但与之形成对比的是,包括亚马逊AWS、微软Azure和Cloudflare在内的主要互联网服务提供商均未报告任何重大基础设施故障。不过,DownDetector上的用户报告显示,这三家云服务商的故障数量在同期都出现了激增,暗示问题可能并非源于单一云平台。
目前各公司尚未公布具体的故障原因和恢复时间线。OpenAI和Anthropic的官方状态页面在故障期间均更新了事件说明,但未透露技术细节。Google方面则保持沉默,未对Gemini服务的异常状态做出正式回应。
此次事件引发了对AI服务供应链韧性的关注。四大前沿模型同时中断的情况在行业中极为少见,尽管各家模型在架构和训练数据上存在差异,但它们在推理阶段对底层算力资源的依赖具有高度相似性。分析人士指出,如果故障源头指向共同的上游供应商或网络交换节点,将促使AI公司重新审视其基础设施的冗余设计。
截至目前,各服务已陆续恢复正常运行,但用户对AI服务可用性的预期正在发生变化。随着企业客户将越来越多关键业务迁移至AI平台,单一模型或单一基础设施的脆弱性可能成为企业采用AI时的核心考量因素。未来,AI服务提供商或需在服务等级协议中纳入更明确的多云容灾和故障切换机制,以降低此类事件对业务连续性的影响。
该文观点仅代表作者本人,企服科学平台仅提供信息存储空间服务。