随着AI行业的关注重心转向安全与对齐问题,微软发布了一份新的AI行为准则,旨在引导AI模型避免危险行为。
这份文件的层级比Anthropic首席执行官达里奥·阿莫代伊近期呼吁的"放缓前沿研发步伐"更为具体,聚焦于指导微软AI模型训练的价值观与红线。尽管如此,这份文件仍全面展示了微软在AI安全方面的整体思路,以及这些理念如何在实践中落地。
文件开篇预测,在未来十年内,超级智能AI系统将在大多数任务上超越人类表现。行为准则中写道:"遏制、控制并使这样一股强大力量与人类保持一致,是人类有史以来面临的最大挑战之一。因此,我们必须完全清楚为何要发明这些系统,以及我们打算如何控制它们。"
该行为准则还列出了微软AI模型应遵循的一般性原则——例如支持人类而非取代人类,推动人类福祉的提升——以及为落实这些原则而设定的具体安全约束条件。
按照微软的体系,每个模型都有一套凌驾于单个用户偏好或特定任务之上的总体行为准则。其中包括"绝对约束",禁止网络攻击、核武器或深度伪造内容的制作。这些约束还包括更广泛的条款,用以防止人类对AI系统整体失去控制。
文件写道:"微软AI模型不得使用自适应、欺骗性、自我强化、共谋或其他机制来规避或击败人类的监督,从而使自身无法再被授权人员或系统可靠地指挥、修改或关闭。"
此次发布正值AI安全议题受到前所未有的关注之际,一系列失控智能体事件以及一名Anthropic员工因担忧AI导致人类灭绝风险不断上升而突然辞职,都助推了这一趋势。
微软与Anthropic、OpenAI和xAI一样,基本上都认同"放缓前沿研发步伐"这一总体方针,并特别支持在AI实验室中设立嵌入式评估机制。
微软首席执行官萨提亚·纳德拉在网上写道:"我们欢迎为实现对齐这一设计目标所需的研究、专注与审慎的节奏把控。我们也欢迎'嵌入式评估者'等理念,以及更广泛地开发相关机制,让这一切不止停留在口头上。"
Q&A
Q1:微软的AI行为准则主要包含哪些内容?
A:该行为准则规定了微软AI模型应遵循的总体原则,如支持人类而非取代人类、推动人类福祉,同时设定了具体的安全约束,包括禁止网络攻击、核武器制造、深度伪造内容生产,以及防止AI规避人类监督等绝对限制。
Q2:微软为什么要在这个时候发布AI行为准则?
A:这份文件是在AI安全议题备受关注的背景下发布的,此前发生了一系列失控智能体事件,还有一名Anthropic员工因担忧AI风险不断上升而辞职,这些都促使微软等公司加强对AI安全与对齐问题的重视。
Q3:微软的AI行为准则和其他AI公司的安全方针有什么关系?
A:微软与Anthropic、OpenAI和xAI一样,普遍认同"放缓前沿研发步伐"的总体思路,并支持在AI实验室中引入嵌入式评估机制,微软首席执行官萨提亚·纳德拉也公开表示欢迎这类审慎推进对齐目标的研究和机制建设。
