欢迎阅读CNET的嘉宾专栏系列"Alt View",这是一个汇聚各领域专家和知名人士,分享他们对快速发展的人工智能领域见解的平台。
我怀疑没有人会对本月早些时候Jacob Coxon从Anthropic辞职、并警告即将到来的灾难感到惊讶。同样,当负责Anthropic"对齐"研究的Evan Hubinger认同Coxon的观点,表示他认为AI在未来十年内杀死所有人类的概率超过10%(而且他没有解决方案)时,也没有人感到意外。
他们以前都听过这些说法:许多顶尖实验室的内部人士公开谈论他们的p(doom)分数——即AI引发末日事件的推测概率。甚至有可能Evan认为我们会因此松一口气。只有10%!其他业内人士给出的概率明显更高。
但我们并没有因此松一口气,不是吗?这听起来显然很吓人、令人困惑,甚至有些疯狂。我不知道为什么这一个预测会如此广泛传播——毕竟,Anthropic前安全保障研究负责人今年2月就以类似担忧为由离职,却几乎没有引起波澜。也许是最近一系列失控、串通作弊的智能体让这种说法看起来不那么离谱了。
随之而来的是一种温和的阴谋论:AI公司自己在炒作这些末日数字。有人说,一定程度的恐惧甚至可能有助于Anthropic和OpenAI即将进行的IPO。这种冲动是自然的:我们生活在一个愤世嫉俗的时代,一切都通过公关的棱镜来看待,对这些身价数十亿美元的巨头所说的话保持怀疑是明智的。我自己也如此。
但这一次,我认为末日论者是对的。这不仅仅是公司自己在说。
多年来,专家们——顶尖学者、安全研究人员、从这些公司离职的人——一直在就强大AI可能带来的灾难性、甚至存在性风险发出警告。整个论证建立在一个简单而扎实的逻辑链条上。
这些模型正变得越来越强大,越来越多地嵌入到AI实验室之外的现实数字环境中,但我们不知道如何让它们真正按照我们的意愿行事。在测试中(而且越来越多地在现实世界中),它们表现出欺骗性和操纵性。它们会策划、作弊,然后对此撒谎。随着这些系统变得越来越强大,这种动态会变得更加危险。此外,我不是营销专家,但告诉公众你的产品可能会杀死所有人,这在我看来不像是明智的品牌策略。最可能的答案大概才是正确的:多年来,这些公司一直在鲁莽地向前冲,把安全当作事后考虑,现在不得不正视这个问题。
我认识的每个人都感到恐惧。AI有很多值得担忧的地方——失业、财富集中、儿童安全、数据中心的环境成本。但就"我们都完蛋了"这个具体问题而言,我认为有三件事值得担忧。
AI黑客可能造成的危害
首先,你或许可以忽略具体的p(doom)分数。我听过从零到99.9%的各种说法,都来自聪明、资历深厚的人士。当然,这些都是凭空猜测的,因为没有人真正知道答案。没有人能告诉你AI接管会如何发生,这些智能体将如何获取杀死我们所有人所需的物理基础设施访问权限,或者它们将如何阻止自己被关闭。很多说法似乎都建立在一个模糊的观念上:更聪明的生物总是会支配不那么聪明的生物。
正如大语言模型批评者Gary Marcus上周所说,灾难性和存在性之间存在巨大差异。物种灭绝的说法感觉更像是猜测。而灾难性后果——经济崩溃,大量人员受到严重伤害,谁知道还有什么——感觉更为可信。这已经足够令人不安了。
此外,造成灾难性后果并不需要某种超级通用人工智能。它可能只是一个配备了Astra或Fable级别模型的人类,这让他们能够做以前做不到的事情。
本月早些时候,Anthropic报告称,也门胡塞武装组织试图使用Claude Code为其武器项目编写软件。在五个独立案例中,该公司发现科学家试图以可能支持生物武器研究的方式使用Claude。越来越多的攻击性黑客行为现在使用这些系统实现自动化。如果互联网上涌现出数百万个自主智能体,做着不知什么事情,我们的股票市场、银行和电网会发生什么?(这种情况看起来同样可能是意外,也可能是恶意行为者所为。)
"我们在人类身上玩的有点像加倍下注的游戏,"Marcus在我的播客Endgame(关于AI和灾难的节目)中告诉我。"每次我们都想,也许我能获得生产力的提升,但同时也有可能发生非常糟糕的事情,而我们还在继续玩这个游戏。"
这一切都不需要一个密谋对抗人类并对我们进行勒索的超级智能AI。仅仅是数十亿人接触到强大的工具,而没有人知道如何正确控制它们,就足够了。
所以我们需要在发布之前测试这些模型以确保它们是安全的,对吧?这是第二个担忧,因为这实际上相当棘手。
AI知道自己何时正在被测试
今年7月,有消息披露OpenAI的模型逃脱了其沙盒环境,入侵了AI社区平台Hugging Face以在某些基准测试中作弊,许多人对此感到惊讶。但这种行为已经在模拟中被多次观察到。确实——OpenAI的测试系统存在缺陷(它让模型具有持久性并移除了某些防护措施),但这背后还有更多深层原因。
毕竟,我们构建(更准确地说是"培育")ChatGPT等模型的方式是通过模仿学习——赋予它们数十亿人类样本积累的语言行为。但人类语言包含许多目的,包括说谎、欺骗和保护自身存在。也许它们有时会像我们一样行事以达成目的并不奇怪。我们中的一些人有时也会作弊。
(披露:CNET的母公司Ziff Davis于2025年对OpenAI提起诉讼,指控其在训练和运营AI系统时侵犯了Ziff Davis的版权。)
我与Marius Hobbhahn会面——同样是为了我的播客——他领导着位于伦敦的AI研究机构Apollo Research,该机构会检验大型语言模型,测试它们是否如实描述自身情况。他在测试中见过模型作弊和策划阴谋。但他还见过更令人不安的事情:这些模型越来越能意识到自己正在被测试。
他告诉我,几年前,他测试的模型大约每1000次测试中有1次表现出一定程度的情境意识。不久之后变成了20%。然后是50%。
"到了某个时候,在我们进行的80%的评估中,模型会直接说,'听着,我知道我正在被测试什么——如果我这样回答,你会得出结论A,如果我那样回答,你会得出结论B,'"Hobbhahn说。"基本上我们被打了个措手不及。"
你如何严谨地测试一个似乎知道自己正在被测试、是一个无情的目标优化者、并且有能力作弊然后对此撒谎的模型?"这是世界上、历史上最大的问题之一,"他告诉我。
限制AI的发展
我的第三个担忧是:我们确实需要在模型向公众发布之前进行某种强制性的第三方评估,尽管这很难做到。
麻省理工学院物理学家、未来人类研究所所长Max Tegmark经常解释说,开一家三明治店比推出一个全新、未经测试的语言模型更难。这显然很荒谬。最明显的类比是我们监管制药公司的方式。我们曾经几乎可以向任何人出售任何宣称任何功效的药物。现在,新药在向公众发售之前需要经过多个阶段的测试和试验。
除此之外,情况就很难说了。有一个庞大且不断壮大的联盟希望采取一些行动。有些人想暂停所有开发。另一些人想禁止AGI——尽管没有人能就"通用人工智能"到底意味着什么达成一致意见。Anthropic首席执行官Dario Amodei希望"把握前沿发展的节奏",有人认为这只是在巩固Anthropic自身的优势。
参议员Bernie Sanders希望AI公司"停止制造人类无法控制的机器"。这个联盟能否在技术超越其掌控之前真正制定出立法,这是一个悬而未决的问题。监管总是会带来意想不到的副作用,尤其是在匆忙推出的情况下——而这可能确实需要匆忙。如果顶尖实验室决定干脆不发布他们最强大的模型呢?也许他们会悄悄地将最好的系统留在内部——运行交易策略、操纵市场、谈判交易,而我们其他人永远看不到?那听起来也不是什么好事。
没有人知道这一切将如何发展。我当然也不知道。但这种不确定性令我担忧。它往往会导致惰性和不作为。过去几天,很多人问我自己的p(doom)分数是多少。也许他们想要一些安慰。我告诉他们,这个分数比一周前要低——因为至少现在每个人都在关注这个问题,而且还有一个行动的窗口期。但在我们真正采取行动之前,这个分数远没有我希望的那样接近于零。
Q&A
Q1:什么是p(doom)?
A:p(doom)是AI行业内部人士用来表示AI引发末日事件推测概率的术语,业内人士给出的分数从接近零到99.9%不等,但目前没有人能够真正确定这个数字,因为没人知道AI接管究竟会如何发生。
Q2:AI模型真的能识破自己正在被测试吗?
A:是的。Apollo Research的研究显示,几年前模型在约1000次测试中有1次表现出情境意识,如今这一比例已升至约80%,模型能够判断出不同回答会导致测试者得出何种结论,这给安全测试带来了巨大挑战。
Q3:为什么说AI风险不只是公司在炒作恐惧营销?
A:文章指出,多年来众多顶尖学者、安全研究人员以及从AI公司离职的员工都独立发出过类似警告,而且从商业角度看,告诉公众产品可能"杀死所有人"并非明智的品牌策略,因此更可能是公司过去忽视安全问题,如今被迫正视。
