周四三大AI服务几乎同时出现的故障暴露出一个令人不安的现实:企业在自动化工作方面的步伐,已经超过了为AI故障做准备的速度。

在AI时代,企业正面临一个令人不安的新问题:当智能体助手突然失灵时会发生什么?

这一场景在周四变成了现实。OpenAI的ChatGPT、Anthropic的Claude以及SpaceXAI的Grok几乎在同一时间、且原因不明地出现了大规模、持续时间较长的服务中断。

从美国东部时间上午开始,多个ChatGPT模型在约两小时内出现故障,Claude模型的故障持续了四个小时,Grok模型则中断了近三个半小时。三家公司均承认服务出现了“异常升高”的问题,并已进行修复。

在用户于论坛中抱怨、IT团队紧急抢修恢复服务之际,这起事件也揭示出,部分企业在采用生成式AI工作流程时过于仓促,并未充分考虑大规模服务中断可能带来的、且不可避免的影响。

技术分析师兼记者卡尔米·列维(Carmi Levy)表示,随着AI智能体越来越多地接管自动化及更大规模的工作流程,一旦AI服务“踩刹车”,企业可能会发现自己处于“令人不安的暴露”状态。他认为,此次事件应当为那些在很大程度上忽视了这些日益关键的平台一旦突然瘫痪将带来何种代价的IT领导者敲响警钟。“这种风险已不再是假设性的。”

数小时的中断影响核心服务

ChatGPT出现故障当天,恰逢OpenAI备受期待的GPT-6 Astra发布——该公司称这一新前沿模型已接近通用人工智能(AGI)水平,更接近其打造出超越人类表现的自主系统这一目标。

OpenAI的故障发生在美国东部时间周四上午11点左右,影响了包括搜索、文件上传、智能体、GPTs、语音模式、图像生成、ChatGPT工作功能、合规API、深度研究、ChatGPT Atlas以及其他连接器和应用在内的一系列服务。在部分情况下,用户无法登录、对话记录无法加载,尝试发送消息时界面还会返回错误提示。OpenAI的Codex服务,包括网页版、API、命令行界面(CLI)以及VS Code扩展程序,也受到了影响。

OpenAI于美东时间下午12点55分修复了该问题,并建议Codex远程控制用户重新配对其移动设备。

Claude的服务大约在美东时间上午7点37分开始出现异常,Anthropic随后承认在接下来的几个小时里,其“详尽列出”的多个模型均出现了错误率升高的情况,涉及Mythos和Fable 5.1及5、Sonnet 5,以及Opus 5、4.8和4.6。

该问题于美东时间上午11点27分得到解决。而就在前一天,Claude也曾因Sonnet 5请求错误率升高,出现过约27分钟的中断。

与此同时,Grok大约在美东时间上午9点30分开始出现问题,其网页版、Build功能、API、办公/工作区插件、安卓应用及X平台均受到影响。相关服务于下午1点08分恢复至“健康”流量水平。

Info-Tech Research Group首席研究总监布莱恩·杰克逊(Brian Jackson)指出:“多个不同服务提供商在同一时间出现故障,这是一个颇为耐人寻味的情况。”他推测,这可能与共用的基础设施有关,比如内容分发网络(CDN)层、域名系统(DNS)或共享的云基础设施。

企业需要为服务中断做好规划

列维指出,就在几个月前,典型企业中AI的使用范围还仅限于员工用聊天机器人回答基础问题或起草简单邮件。当时即便出现大规模AI平台中断,对整体组织生产力的影响也相对有限。“但情况正在迅速改变,”他说。

列维表示,企业现在必须更好地理解智能体AI对日常工作流程的影响程度,以及在将主导权交给自动化、基于云端的工具之后,一旦发生故障,员工完成复杂任务的能力将受到多大程度的干扰。

在类似周四这样的事件中,员工可能会回退到传统的手动工作方式,比如手动更新电子表格或以老办法整理报告。但他们也可能意识到,在长期依赖AI智能体代劳大量工作之后,自己已经对自动化产生了过度依赖,“认知能力可能已不如从前那般敏锐”,列维说。

他表示,智能体AI日益普及应促使企业重新审视其灾难恢复和业务连续性计划,并评估潜在服务中断对生产力的影响。虽然像谷歌Workplace和微软365这样的云端生产力平台,利用本地存储数据提供了有限程度的“离线模式”功能,文档也可以同步至Dropbox或Google Docs桌面版对应的硬盘中,但智能体AI平台目前所能提供的离线应对方案还相当有限。

列维表示,企业应更详细地记录工作流程,并对一旦AI平台发生长时间中断,短期内的恢复方案进行情景规划。同时,企业还需要加强培训,确保员工能长期保持手动操作技能,并在服务中断发生时具备重新顶上的能力。他指出,企业越是依赖智能体完成关键任务,“为了提升生产力而将人类排除在流程之外”,员工在不可避免的服务中断发生时能够重新介入的能力就越弱。

“出于良好初衷的企业,完全有可能在不知不觉中变得过度依赖AI自动化,”列维说。“太多企业即将因为没有备份方案而吸取惨痛教训。”

Info-Tech的杰克逊还建议企业为大语言模型采用模块化架构;企业应将模型视为一种“可与替代方案热切换的商品”。这个替代方案可以是另一家云服务提供商(当然最好不要恰好也在同时经历故障),也可以是自托管的开放权重模型等选项。

杰克逊表示:“在这种首选服务商可能无法使用的情况下,企业若拥有备用方案,就能持续获得相同的智能能力支持,哪怕这只是一种权宜之计。”

Q&A

Q1:ChatGPT、Claude和Grok为什么会同时宕机?

A:三家公司均表示服务出现了“异常升高”的错误问题,具体原因尚不明确。专家推测可能与共用的基础设施有关,比如内容分发网络(CDN)层、域名系统(DNS)或共享的云基础设施。

Q2:这次AI服务中断持续了多长时间?

A:ChatGPT故障持续约两小时,Claude故障持续约四小时,Grok故障持续近三个半小时,三家公司均已完成修复。

Q3:企业该如何应对AI服务中断的风险?

A:专家建议企业重新审视灾难恢复和业务连续性计划,详细记录工作流程,加强员工手动技能培训,并考虑采用模块化架构,为大语言模型准备可热切换的备用方案,如其他云服务商或自托管的开放权重模型。

Computerworld