近期,越来越多的AI研究人员对人工智能的危险性发出严峻警告,就连OpenAI CEO萨姆·奥特曼也表示,或许是时候"放缓"AI发展步伐了。但这具体应该如何实施?

在一篇新博客文章中,Anthropic CEO达里奥·阿莫代不仅呼应了"控制前沿发展速度"的呼吁,还提出了实现这一目标的三大策略。他表示,Anthropic将"单方面承诺"执行其中一项策略。

本周,关于AI安全与对齐问题的讨论愈发激烈。此前,研究员雅各布·科克森在辞去Anthropic职务时表示,他担心领先的AI公司正在"拿人类的生命做赌注",而那些构建这项技术的人"真心相信这项技术可能在这个十年结束前毁灭全人类",Anthropic的其他人也重复了这一说法。

阿莫代的文章并未明确提及科克森的辞职或其担忧,但他写道,有两件事让他确信现在是时候对AI发展采取更谨慎的方式:OpenAI-HuggingFace黑客事件,以及最近几个月"AI发展速度急剧加快"的事实,尤其是其"构建下一代AI的能力日益增强"。

阿莫代写道:"我们必须放慢提升AI模型能力的速度。进展看起来仍会很快,我们必须善用由此赢得的时间。"

他提出的第一步措施是引入来自METR等第三方组织的"嵌入式评估员"——这些评估员能够核实AI公司是否真正遵守其进度控制和安全承诺,同时确保安全事件得到如实报告。(此前OpenAI曾因未报告其AI智能体接管一个德语维基表单的事件而受到批评。)

阿莫代将这些评估员比作已被嵌入银行员工中的监管人员,并表示邀请他们加入是"Anthropic正在单方面承诺的事情(同时呼吁各国政府要求其他前沿公司效仿)"。这意味着要为评估员提供公司工牌、办公桌和笔记本电脑,并提供"与内部风险评估团队大致相当"的访问权限,除非法律或合同另有规定。

其次,阿莫代呼吁"民主国家内"的领先AI公司协调"共同的安全标准,以及对不受约束的AI进展速度的限制"。

这种协调看似不太可能实现,一方面是因为奥特曼和阿莫代之间显然存在分歧,另一方面据报道两家公司都担心协调一致的暂停可能招致反垄断审查。阿莫代在文章中提到了这一担忧,他写道:"出于反垄断方面的考虑,美国政府出面调解或至少促成这些讨论会有所帮助——他们不需要参与其中,但需要为某些类型的安全对话发放特定豁免。"

阿莫代还承认了中国AI主导地位的隐忧,这一点常被用作反对放缓发展的论据。但他表示,如果美国政府和科技公司采取措施,比如拒绝向中国公司出售先进芯片或半导体制造设备,同时打击模型蒸馏行为,就能"在未来3到5年内充分拖慢中国的进展步伐,从而显著拉大美国的领先优势"。

最后,阿莫代呼吁进行"全球协调",即美国及其盟友"在可能的范围内,尝试与专制政府进行协调"。阿莫代表示,这意味着要"与中国合作",他承认"能够实现的目标存在明显局限",但仍认为存在达成协议的可能性,即便只是"禁止某些明显危险的AI狭义用途,例如利用AI生产生物武器或允许用户这样做"。

由于阿莫代过去一直愿意承认AI的潜在危险,加上公司对某些形式监管持相对开放态度,一些AI支持者已经批评他是"末日论者",认为他的言论助长了当前的AI反对浪潮。对此,阿莫代表示他一直试图提供"平衡"的观点,并认为这种反对浪潮"从根本上说是一场信任危机",因为人们已经对科技公司、科技行业和政府产生了怀疑。

业内批评人士对这些世界末日式的AI警告也持怀疑态度,认为这些警告分散了人们对该技术已经造成的现实危害的关注。

例如,记者布莱恩·默钱特写道,他还没有看到"关于AI如何从自我递归改进走向杀死地球上每一个人的可信、逐步论证";他还认为,类似阿莫代提出的这些方案"很可能最终只会让Anthropic和OpenAI受益;这正是监管俘获在实际中的表现"。

在这篇新文章中,阿莫代写道,他仍然"相信AI能够极大地提升人类生活质量"。

他说:"我实现这些益处的愿望丝毫未减。但只有以正确的方式构建这项技术,这些益处才能真正实现——只要我们善用赢得的时间,就值得投入格外审慎的努力来把它做对。"

Q&A

Q1:Anthropic CEO达里奥·阿莫代提出的"控制前沿发展速度"具体包含哪些策略?

A:主要包含三项策略:一是引入第三方"嵌入式评估员"核实公司是否遵守安全承诺;二是呼吁民主国家内的领先AI公司协调共同安全标准并限制不受约束的进展速度;三是推动包括与中国在内的全球协调,探讨在特定危险用途上达成一致。

Q2:Anthropic为什么要单方面承诺引入第三方评估员?

A:阿莫代表示,这是为了核实AI公司是否真正遵守进度控制和安全承诺,并确保安全事件得到如实报告。他将这些评估员比作嵌入银行内部的监管人员,给予其工牌、办公桌等权限,以增加透明度和外部监督。

Q3:外界对阿莫代的AI安全言论有哪些批评?

A:一些AI支持者批评他是"末日论者",认为其言论助长了AI反对浪潮。也有记者认为,这类关于AI毁灭人类的警告缺乏可信的逐步论证,且类似方案可能只会让Anthropic和OpenAI这样的头部公司受益,本质上是一种监管俘获。

TechCrunch - AI