2024年1月,专业服务公司奥雅纳(Arup)的一名员工参加了一场视频会议,视频另一端的人看起来包括公司的首席财务官。这场会议最终导致该员工向第三方账户发起了15笔电汇,总金额约2500万美元。

视频另一端的所有参与者,都是利用奥雅纳高管的公开露面视频和业绩说明会录像拼接而成的AI克隆体。

GrackerAI技术CEO迪帕克·古普塔在与ZDNET讨论奥雅纳事件时表示:"看到和听到某人,不再是证明其真实存在的依据。任何依赖'我认出了他们的脸和声音'的验证协议,现在都已失效。"

我们生活在一个后真相时代,员工每年经手着公司数以百万计的资金。即便攻击没有造成直接的资金损失,错误的代价依然高昂。随着时间推移,客户信任的损失以及违反法规所带来的罚款,足以让一家本来盈利的公司走向破产。

当网络欺诈不再留下任何可识别的痕迹,企业该如何保障自身安全?GrackerAI的古普塔和B2B网络安全公司S2i2首席技术官詹姆斯·斯科比认为,答案恰恰隐藏在那些曾经被认为过于简单、不适合大规模企业运营的低技术系统中。

纵观企业史,实时语音与视频通话始终是身份验证的黄金标准,是认证高价值交易、交换敏感医疗数据或讨论重要法律事务的核心手段。

然而过去五年间,这一标准正在被深度伪造技术悄然瓦解。深度伪造模拟人类行为的能力正以惊人的速度提升。过去,背景噪音、合成语音调制以及明显缺失的呼吸声,都曾是可供识别的破绽。但如今,深度伪造技术已将这些经验性判断远远甩在身后,真假难辨。

伦敦大学学院的一项研究发现,受试者准确识别深度伪造音频的概率仅约73%。即便经过专项培训、接触过深度伪造样本,准确率也仅提升了3.84%。而仅仅一年后,来自杜伊斯堡-埃森大学与印第安纳大学的研究人员汇总了56项类似研究的结果,发现人类的识别准确率实际上已接近随机猜测的水平。

S2i2的斯科比解释道:"这些破绽作为辅助信号仍有边际价值。"但将其作为有效防控手段已不再可行,因为这样做反而是在训练员工在遭受攻击时依赖感知判断,而感知恰恰是骗子所针对的弱点。

美国国家安全局(NSA)、联邦调查局(FBI)和网络安全与基础设施安全局(CISA)联合发布的信息简报,同样否定了传统的自动化检测方案——这类方案通过对语音或视频内容进行可视化分析来寻找篡改痕迹。这些方法预设了可被记录和统计的显著篡改特征,而在当前技术条件下,这一前提已不再成立。

更令人不安的是,随着技术日益成熟,社会工程学攻击不再局限于一次性的金融诈骗,而是逐步演变为对企业系统的长期渗透。

古普塔提到了2024年发生在安全培训公司KnowBe4身上的身份欺诈事件。该公司在面试和背景调查均未发现异常的情况下,雇用了一名攻击者,甚至为其配备了公司工作站,随后才意识到这名"员工"是一名朝鲜特工,正利用该设备向公司系统上传恶意软件。

"这几乎有些讽刺,"古普塔在回顾这一事件时说道,"这是一家安全培训公司,其整个业务的核心就是教人识别此类社会工程学骗局。"他还补充指出,朝鲜攻击者正在大规模运作此类行动,每年向美国和欧洲的企业派遣数千名冒牌"员工"。

2025年,美国司法部的一份公开通告同样显示,朝鲜攻击者在美国、中国、阿联酋和台湾的协作者配合下开展行动。谷歌威胁情报小组自2022年起持续调查类似事件,其中相当大比例的攻击目标已转向欧洲国家。

在高级检测模型和标准安全对策失效之际,依赖单一受控入口的模拟方案往往表现出更强的抗攻击能力。

"抵御最先进AI攻击的防御手段,往往是刻意采用低技术路线,"古普塔说道。深度伪造技术或许在复制公开可见的外貌与声音方面已大幅进步,但对于任何存在于可观测渠道之外、无法被远程监听的信息,却完全无从下手。

越来越多的反欺诈顾问目前已根据多个政府机构的指导意见,推荐将硬件安全密钥或口头密语作为安全措施。CISA目前推荐将FIDO2和PIV硬件凭证作为多因素认证(MFA)的新黄金标准。FBI也多次建议,在工作场所(或家庭)成员之间共享秘密口头密语。

口头密语是指通话参与者在视频或语音通话中共享的一个秘密词汇或短语。员工可以通过要求对方说出秘密密语来验证通话另一端人员的身份。然而,口头密语只有在整个组织内被所有人一致使用时才能发挥效果。古普塔表示,根据他的经验,当员工感到压力时,例如通话另一端的人自称是上级时,往往会跳过安全验证步骤。

斯科比指出,"让这一控制措施成为自动执行、无例外的规定"至关重要,因为攻击者常常制造紧迫感或社会压力,诱使员工绕过既定流程。他还建议将模拟深度伪造或语音钓鱼通话纳入员工安全培训,帮助员工练习如何拒绝表面上来自权威人士的不合规请求。

古普塔补充说,直接在公司系统层面强制要求口头密语作为身份验证条件或许更为有效,目前一些金融平台已经开始这样做。

除了实施无例外政策外,密语认证等低技术方案还需要针对大型组织进行规模化设计,以避免单点故障。斯科比建议将标准企业密码管理的最佳实践直接应用于口头密语的管理,例如:

斯科比推荐使用电子前哨基金会提供的词汇表,通过随机组合生成难以猜测但易于记忆的密语。使用随机密码生成器更为理想,因为人类的思维存在潜意识偏好,会使密语更容易被猜中。"强度来自选择的随机性,"斯科比补充道,"而非词语本身的含义。"

大型组织还应根据角色和业务关系设置差异化的密语,使其与特定的交易类型和员工职能相对应。例如,可以为财务部门设置专属密语,用于授权1000美元以下的交易,另设一个密语用于1000至20000美元的交易,以此类推。

这样一来,即便某个密语遭到泄露,也可以单独重置,而不影响其他密语的安全性。密语还应定期轮换,但不宜按照固定的日历周期进行。美国国家标准与技术研究院(NIST)的最新指南已建议废除90天强制更换密码的规则,认为这种做法过于可预测。密语应在出现泄露证据、人员角色变更或员工离职时及时更换。

最后,口头密语本身无法为大型企业的高价值交易提供充分的安全保障,必须与带外回拨、双重授权等机制结合使用。这意味着需要通过多个官方通信渠道对请求进行交叉验证,并要求第二名经授权的员工在处理请求之前完成确认。

古普塔发现,企业通常不愿在安全系统中引入过多环节。然而,目标并不是在所有地方增加阻力,而是将阻力精准集中在高风险业务流程上。

"当人们感受到安全措施是有针对性的而非一刀切的,他们就不会再试图绕过它,"他说。如果密语数量过多难以管理,斯科比建议使用经FedRAMP认证的密码管理器(如Keeper Security)来存储公司凭证。

Q&A

Q1:AI深度伪造视频通话诈骗是怎么实现的?为什么难以识别?

A:攻击者通过收集目标公司高管的公开视频、音频资料,利用AI技术克隆其外貌和声音,生成可实时参与视频通话的虚假形象。由于技术快速进步,过去可识别的破绽(如背景噪音、合成语音等)已难以察觉。伦敦大学学院研究显示,人类识别深度伪造的准确率约为73%,经训练后也仅提升约3.84%,实际上已接近随机猜测水平。

Q2:口头密语如何防范深度伪造欺诈?使用时有哪些注意事项?

A:口头密语是通话双方预先约定的秘密词句,通话时要求对方说出密语来验证身份。关键在于必须无例外地执行,不能因对方自称上级就跳过验证。密语应随机生成而非自主选择,并根据角色和交易金额分级设置。一旦发现泄露、人员变动或员工离职,应立即更换,不建议按固定周期轮换。

Q3:除了口头密语,还有哪些低技术手段可以防范AI欺诈攻击?

A:安全机构建议结合多种手段:一是使用FIDO2或PIV硬件安全密钥进行多因素认证,这是CISA推荐的新标准;二是采用带外回拨机制,通过多个官方渠道交叉验证请求;三是要求双重授权,即高价值交易须由第二名经授权员工确认后方可执行;四是定期开展模拟深度伪造通话的安全培训,帮助员工建立拒绝违规请求的习惯。

ZDNET