今年以来,主要AI实验室纷纷对外宣称自家模型存在重大安全风险,这一现象逐渐成为一种趋势。今年4月,Anthropic以网络安全为由,宣布对未发布模型Claude Mythos实施严格访问限制。6月,美国政府更进一步,发布国家安全指令,强制要求Anthropic对所有用户禁用Mythos及其姊妹模型Fable 5——此举遭到安全社区批评,政府数周后予以撤销。
OpenAI方面,也对自家未发布模型发出类似警告。8月初,该公司表示,其即将推出的Astra模型可能在网络安全风险方面已触及公司内部安全框架的"严重"级别,并将其转入隔离测试环境,实施更严格的网络与工具访问限制。而就在此前数周,一个OpenAI智能体曾突破测试环境、攻击Hugging Face系统。
本周,OpenAI宣布了应对安全问题的下一步举措。
在周二发布的一篇博客文章中,OpenAI表示将对模型实施更严格的隔离措施——将高风险代码与互联网及内部系统切断——并加强监控,力争在30分钟内发现潜在危险活动。值得关注的是,该公司表示,仅监控系统本身就可能为所涵盖的推理算力带来约20%的额外开销。
"随着模型能力不断增强,内部开发和测试所带来的风险也在同步增长,"OpenAI写道,"我们在监控、对齐和安全方面的标准,必须始终走在风险前面。为此,我们需要花时间达到这些标准,因此暂时放缓了扩展速度。"
具体而言,此次放缓"包括对计划部署的最新模型暂停两周强化学习训练"。公司还指出,其"规模最大的前沿强化学习计划仍处于暂停状态",目前正先行开展一系列规模更小、边界更清晰的训练与评估。
仔细推敲这些措辞,会发现若干关键疑点。首先,OpenAI以过去时描述这次为期两周的训练暂停,暗示其对应的正是8月初报道的Astra减速事件。而"规模最大的前沿强化学习计划"仍在暂停中,似乎指向时间节点更靠后的其他模型。
OpenAI首席执行官萨姆·奥特曼在X平台发文补充道,此次暂停是为了将安全与监控能力提升至当前模型能力所要求的水平。"模型进展现在极为迅速,我们一直说,一旦感到模型能力超过了安全与对齐的推进速度,就会采取行动。"
在后续发文中,奥特曼进一步说明了受影响的具体模型:"我们仍然预计很快会发布出色的新模型;此次影响的是更靠后的发布计划。"
然而,科技记者亚历克斯·希思在《时代》杂志的报道中指出,"大量Astra工作负载仍处于暂停状态",恢复工作正在逐步推进。这意味着,即便OpenAI最大的前沿强化学习计划处于搁置状态,Astra本身似乎也尚未完全走出减速阶段。
贯穿此次减速事件的一条核心线索,是"对齐"问题。在OpenAI的这篇博客文章中,"对齐"或其变体词(如"aligned""misaligned")共出现16次,而奥特曼本人在一篇118字的X帖子中,也三次提及"对齐"。
希思获得奥特曼的进一步置评。他报道称,此次减速并非由单一事件触发,而是源于"一系列研究观察结果,显示出不同程度的对齐偏差"——随着模型能力的提升速度超出研究人员的预期,对齐问题愈发凸显。
在这一语境中,"对齐"指的是模型能否按照开发者的意图行事、并保持对人类监督的响应。这与"能力"是截然不同的概念:一个模型可以非常擅长某项任务,但如果实现路径未经开发者认可,或超出其可观察范围,就仍属对齐失当。
这一区别正是周二公告的核心所在:OpenAI向外界宣告,其系统的发展速度已超出可靠管控的能力边界,在等待行业整体跟进的同时,公司选择主动放缓——尽管这意味着要承受竞争代价。
当然,与此前Anthropic的Mythos风波类似,OpenAI公开宣布减速,或许也有其他考量。
就在OpenAI发布减速声明的同一天,《华尔街日报》报道称,OpenAI第二季度运营亏损扩大了30亿美元,达到123亿美元——是同期新增营收(约10亿美元)的三倍,而营收同比增长18%至67亿美元。与此同时,Anthropic同季度营收翻超一倍,达到116亿美元,首次超越OpenAI。
周三,CNBC报道称,OpenAI首席财务官萨拉·弗里尔正在考虑于2027年(或在"业务持续好转"的情况下更早)推动公司上市。
这些报道并不足以直接证明财务压力是此次强化学习训练暂停的原因,但确实提供了一个合理的替代解释:OpenAI正在一个极度消耗资源的业务中大量烧钱,因此可能在寻求削减成本的方式。
网络社区中也有不少人质疑,OpenAI为何要主动宣布这次训练暂停。正如一位X用户所言:"仅仅暂停了两周?为什么要告诉任何人?谁会为一个大型项目两周的延期专门发公告?"
长期批评OpenAI的AI研究员加里·马库斯也发声,汇总了网络上多方评论,指出并非所有人都认同OpenAI暂停训练的理由。他写道:"我早在2024年1月(乃至更早)便已预警,OpenAI走向衰落的序幕已经拉开。首先,几乎没有人再信任他们,这对业务而言绝非好事。"
AI安全公司BlackFog的首席执行官兼创始人达伦·威廉姆斯则指出,发出警告的公司,往往也是那些试图主导规则制定的公司——尽管这未必是坏事,前提是最终能引入实验室以外的独立监督,并形成真正有约束力的规则。
"OpenAI和Anthropic对自家模型发出警告,背后确有合理的安全考量,"威廉姆斯告诉The New Stack,"但这些警告同时也在强化一种强势叙事:制造风险的公司,正在将自己塑造为如何治理这一风险的权威。这并不意味着他们的担忧是不真诚的。安全、竞争定位与监管影响力可以并行不悖。真正的检验标准在于:这些警告能否推动独立评估、切实管控,以及真正具有商业约束力的限制措施。"
Stability AI联合创始人埃马德·莫斯塔克则公开为萨姆·奥特曼和OpenAI点赞,表示倾向于"相信他们的说法"。"很显然,一些奇怪乃至危险的事情正在发生,我们的系统尚未做好准备,"莫斯塔克写道,"低于前沿水平的模型已经具备改变生活的能力,我们应在此基础上持续优化。"
IANS Research讲师、数据隐私咨询公司Red Clover Advisors创始人乔迪·丹尼尔斯则从更宏观的视角指出,Anthropic和OpenAI频繁公开谈及模型风险,背后的动因之一在于信任与责任——既能增强企业客户的部署信心,也能在日后出现问题时为自身提供一定的法律保障。
"在我看来,坦诚披露大语言模型的能力——包括正面与负面——能让客户在部署时更有信心,"丹尼尔斯告诉The New Stack,"同样可能的是,这两家公司都不希望成为那个引发灾难性事件、给企业或个人带来真实伤害的组织。"
当然,在这场喧嚣的背后,还有一个不可回避的现实:中国。或者更准确地说,是中国AI公司接连推出的一批强大开源模型。
周一,OpenAI总裁格雷格·布罗克曼列出了该公司在Hugging Face安全事件后拟实施的一系列安全措施,同时建议所有组织加强安全自动化。与此同时,他还专门对Z.ai的GLM-5.3模型发出警告——该中国公司发布的基准测试结果显示,GLM-5.3在部分编程和漏洞检测指标上超越了Anthropic的Fable 5和OpenAI自家的GPT-5.6 Sol。布罗克曼认为,一旦此类模型的权重公开发布,将"显著加剧威胁态势"。
就在数天前,Anthropic首席执行官达里奥·阿莫迪提出了相关论点:开源权重的发布并不能解决AI权力集中的根本问题,只是将这一问题转移到了那些掌握最多算力和芯片的人手中。
尽管两家公司均未明确呼吁禁止开源权重模型,但双方对此频繁发出警告,足以说明OpenAI和Anthropic将开源权重视为一种竞争威胁,与安全威胁同等重要。
这并不是说月之暗面、DeepSeek、Z.ai等公司应为OpenAI当前的困境负责。但它们已向世界证明:前沿能力,不再必然需要前沿级别的预算。
Q&A
Q1:OpenAI为什么要暂停强化学习训练?
A:OpenAI表示,暂停训练是因为模型能力的提升速度超出了安全与对齐机制的跟进能力。公司在博客中提到,随着模型越来越强大,内部开发和测试的风险也在增长,因此暂时放缓扩展节奏,用于完善监控、对齐和安全标准。其中,监控系统本身就可能带来约20%的推理算力额外开销。此外,有观点认为财务压力也可能是原因之一——OpenAI第二季度运营亏损高达123亿美元。
Q2:Astra模型目前处于什么状态?
A:Astra模型因触及OpenAI内部安全框架的"严重"网络安全风险级别,被转入隔离测试环境。此次训练暂停事件与Astra直接相关,且据报道,大量Astra工作负载仍处于暂停状态,恢复工作正在逐步推进,并未完全解除减速措施。
Q3:中国AI公司的开源模型对OpenAI有什么影响?
A:OpenAI总裁格雷格·布罗克曼专门对中国公司Z.ai的GLM-5.3模型发出警告,指出其在部分编程和漏洞检测指标上超越了OpenAI和Anthropic的旗舰模型,一旦权重公开将"显著加剧威胁态势"。这表明OpenAI将中国开源模型同时视为安全威胁与竞争威胁。月之暗面、DeepSeek等公司也已证明,前沿AI能力不再必然需要前沿级别的预算投入。
