核心观点
在缺乏国内人工智能监管的情况下,竞争对手之间无法可信地承诺相互克制,即便双方都希望如此。
通用人工智能(AGI)的研发竞赛面临一个典型的战略困境:每个竞争方可能都希望大家都保持克制,但没有人能确定对方会这样做。任何克制安排都依赖于可验证性,而可验证性又取决于各国是否建立了能使本国人工智能生态系统透明可查的国内制度。
兰德公司的研究人员构建了一个博弈论模型,用以识别相互克制在何种条件下是可行且可自我维持的。他们研究了国内监管、作弊行为的可探测性、AGI到来的临近程度以及对灾难性后果的担忧之间如何相互作用,从而决定竞争对手之间的克制能否维持。
主要结论
国内人工智能监管能够促成国际间的相互克制。
一个未能使本国人工智能产业透明化(哪怕只是对自身而言)的国家,无法证明自己正在遵守克制安排。
对灾难性后果的担忧能够遏制部分作弊行为,但并非全部。
如果一个国家预期自己也会因违约行为而承担由此引发的灾难性风险,它在一定程度上会自我克制。但要遏制那些纯粹出于抢先达到AGI的位置性违约行为,则需要依靠探测手段。
随着AGI的到来日益临近,验证机制的效力会减弱。
当竞争对手越来越相信AGI即将到来时,用于惩罚违约方的剩余时间会不断缩短。此时,只有与AGI出现后结果挂钩的手段仍可能发挥威慑作用。
相互猜疑可能使竞争对手陷入不透明的困境。
即便相互克制是更优选择,如果一方怀疑另一方不会让自身行动可被验证,克制安排仍可能失败。建立验证手段,才能使各国有能力选择相互克制。
政策建议
为保留相互克制这一选项,各国应当:
将国内人工智能治理——包括算力登记、许可制度、设施审计和事件报告——视为安全架构的一部分,而不仅仅是监管措施,因为这些制度构成了克制安排所需的证据基础。
投资于不会暴露敏感信息的验证技术,例如机密计算和可信硬件方法,以降低向竞争对手证明合规所带来的安全成本。
在尚未迫切需要之前,提前开发将AGI出现后的结果与AGI出现前行为相挂钩的制度工具,趁探测能力仍能支撑惩罚机制发挥作用时加以完善。
考虑通过技术援助或共享监测平台,降低竞争对手建立监管能力的成本:相互克制能否实现,往往取决于其中监管透明化成本更高的那一方。
研究方法
兰德公司的研究人员构建了一个两阶段博弈论模型,用以分析在无法直接观察对方合规情况的条件下,竞争国家如何在AGI研发中维持相互克制。在第一阶段,各国决定在国内政策要求之外,对本国人工智能产业施加多大程度的监管。在第二阶段,各国在AGI到来之前反复博弈,在每一轮中选择合规、公开竞赛或暗中违约。该分析借鉴了重复博弈理论、军备控制相关文献,以及兰德公司此前关于AGI竞争战略动态的研究成果。
研究主题包括:人工智能、国内情报、地缘政治战略竞争、安全合作。
本研究由兰德全球与新兴风险中心下属的通用人工智能地缘政治研究中心独立发起并完成,经费来源于运营收入及兰德公司支持者的捐赠。
Q&A
Q1:为什么说AGI竞争对手之间很难实现相互克制?
A:因为相互克制依赖于可验证性,而可验证性又取决于各国是否建立了能让本国人工智能产业透明可查的国内制度。如果一方无法证明自己确实遵守了克制安排,另一方就无法安心相信对方不会作弊,克制也就难以维持。
Q2:国内人工智能监管对国际间的AGI竞争克制有什么作用?
A:国内人工智能监管,比如算力登记、许可制度、设施审计和事件报告,能为相互克制安排提供必要的证据基础。它不仅仅是一种监管手段,更是一种安全架构,能帮助各国证明自己正在遵守承诺,从而促成国际间的相互克制。
Q3:随着AGI越来越临近,验证机制还有效吗?
A:效力会逐渐减弱。因为留给惩罚违约方的时间越来越短,传统的监督和惩罚手段作用有限。此时,只有那些将AGI出现之后的结果与之前行为挂钩的制度工具,才可能继续发挥威慑作用。
