数据隐私法规已难应对AI时代挑战
欧盟《通用数据保护条例》(GDPR)和美国《健康保险流通与责任法案》(HIPAA)等数据隐私法规,在AI时代已愈发难以有效保护个人数据。
Gartner预测,到2029年,大多数隐私事件将源于AI对个人行为的推理分析,而非传统意义上姓名、地址、社会安全号码等可直接识别信息的泄露。
Gartner副总裁巴特·威廉姆森表示,AI强大的模式识别能力意味着,不法分子无需窃取或购买凭证,就能推断出关于特定个人的敏感信息。单纯对数据进行匿名化处理已无法提供足够的保护,因为AI算法可以从匿名数据集中重新识别个体身份,或推断出敏感属性。
"真正意义上的匿名化并不存在,除非彻底硬删除数据。推理攻击之所以如此强大,是因为它可以作用于一切数据,而不仅限于那些可直接识别身份的数据库,"威廉姆森说。
随着生成式AI和机器学习技术的持续进步,这些技术能够从匿名或聚合数据中推断出敏感的个人属性,例如健康状况或行为模式。
"现代模型可以通过挖掘行为模式、使用指标和聚合交易记录,对个人身份进行逆向工程。例如,AI可以从出行数据、社交媒体、X光片、心电图、核磁共振成像,乃至步态,或大约三笔交易记录的任意组合中识别出特定个体,"威廉姆森解释道。
他还指出,即便AI产生幻觉或生成了关于个人的虚假合成数据,这些不准确的信息同样可能造成严重的现实危害。AI偏见和幻觉已导致了错误定罪和法律研究中的重大失误等问题。
数据推理攻击威胁远超隐私泄露本身
网络安全公司Cobalt的首席信息安全官安德鲁·奥巴迪亚鲁认为,这一问题的影响已远远超出隐私违规本身的范畴。
"真正有价值的资产是洞察力本身,"奥巴迪亚鲁说,"AI可以在从未访问医疗记录或人力资源档案的情况下,推断出某人的健康状况、财务状况、在组织内部的影响力,乃至其对钓鱼邮件的响应概率。"
他表示,那些表面上看似不敏感的数据——例如员工通讯录、供应商关系、社交媒体活动或客户互动记录——一旦被AI关联整合,便可能产生极高的利用价值。AI可以通过这些数据推断出汇报关系、系统管理权限、高管之间的关系、审批权限,乃至哪位工程师负责关键的生产系统。攻击者随即可以利用这些信息,大幅提高攻击的精准度。
"最终的结果是:钓鱼攻击的可信度大幅提升,商业电子邮件诈骗的速度更快,勒索攻击更具针对性,入侵行动的效率也更高——因为攻击者在发出第一封邮件之前,就已经锁定了目标,"他解释道。
奥巴迪亚鲁补充说,企业不仅需要审视自身收集了哪些数据,更要思考"当这些数据被日益强大的AI系统进行组合、关联和解读时,究竟会揭示出什么"。
隐私法规亟需跟上AI发展步伐
威廉姆森指出,长期以来专注于直接可识别数据保护的隐私法规,随着AI技术的持续演进,也应将"间接可识别或可重新识别的内容"纳入监管范畴。
"今天的情况之所以与以往截然不同,在于以下几点的叠加:数据在任何地方都可被记录、可在全球范围内被访问(无论是意外泄露还是恶意入侵),加之现代分析型和生成式AI技术触手可及,任何人都可以借此访问数据。此外,企业几乎从未认真清理过那些已不再需要保留的数据,"威廉姆森说。
数据被重新识别的风险早于当前的AI热潮就已存在,但AI极大地加速了这一进程。威廉姆森引用了数据科学家吕克·罗歇、朱利安·M·亨德里克斯和伊夫-亚历山大·德·蒙茹瓦于2019年发表的一项研究——他们构建了一种生成式图形模型用于重新识别个体身份。研究结论显示:"利用该模型,仅需15个人口统计属性,就能在任意数据集中以99.98%的准确率重新识别美国人的身份。"
AI大幅提速身份重识别威胁
随着AI技术的持续演进,攻击者如今"在速度上占据了绝对优势",奥巴迪亚鲁对此表示认同,规模同样不可小觑。"五年前,为数千名潜在攻击目标构建详细画像在经济上并不可行。如今,这已成为现实。"
威廉姆森引用了西蒙·勒曼、丹尼尔·帕莱卡、约书亚·斯旺森、迈克尔·阿尔尼、尼古拉斯·卡利尼和弗洛里安·特拉梅尔等工程师于2026年发表的一项研究。研究发现,大语言模型"仅凭匿名在线个人资料和对话内容,就能重新识别出个体身份,其效率堪比一名专职人类调查员花费数小时所能完成的工作"。
值得关注的是,研究人员还指出,"在各类场景中,基于大语言模型的方法均大幅优于传统基线方法——在90%精确率条件下,其召回率高达68%,而最优的非大语言模型方法的召回率则接近于零。研究结果表明,保护匿名用户在线隐私的'实际模糊性'已不复存在,在线隐私的威胁模型亟需重新审视。"
"最高明的推理攻击,根本看不出攻击的痕迹,"奥巴迪亚鲁说,"攻击者可能从领英、公开文件、社交媒体、已泄露的凭证、GitHub活动记录和外泄的营销数据库入手。这些数据集单独来看并无太大价值,但AI会完成其中最关键的工作。"
企业应对AI推理威胁的实践路径
为降低基于推理的隐私风险,威廉姆森建议,首席信息安全官应首先做好全生命周期的数据管理,并在数据不再能为业务创造足以覆盖保护成本与风险的价值时,及时予以清除。
"数据有其生命周期,而我们都清楚,将'永久保存'作为生命周期策略是极不明智的。因此,请将数据的终止时间写入代码,"威廉姆森建议道。
在应对基于推理的风险方面,Gartner给出的建议以AI治理为起点。以下是威廉姆森针对企业防范AI推理威胁所提出的核心建议:
在使用任何类型的AI之前,务必充分评估不同类型AI所带来的风险,切勿低估。
Q&A
Q1:什么是AI推理攻击?它与传统数据泄露有何不同?
A:AI推理攻击是指利用AI技术,通过分析匿名数据、行为模式、聚合交易记录等间接信息,推断出个人的敏感属性,而无需直接窃取姓名、地址等可识别信息。与传统数据泄露不同,推理攻击不依赖直接访问敏感数据库,即便数据已经过匿名化处理,AI仍可将多个看似无关的数据片段关联整合,从而还原个人身份或推断敏感信息,防御难度更高。
Q2:Gartner对AI推理攻击的未来趋势有何预测?
A:Gartner预测,到2029年,大多数隐私事件将源于AI对个人行为的推理分析,而非传统的直接可识别信息泄露。随着生成式AI和机器学习持续演进,仅凭出行记录、社交媒体、医疗影像乃至步态等约三笔交易的组合数据,AI就能识别出特定个体身份,推理攻击的威胁将显著超越传统数据泄露风险。
Q3:企业应如何防范AI推理攻击带来的隐私风险?
A:Gartner副总裁威廉姆森建议,企业应从AI治理入手,做好数据全生命周期管理,及时清除不再具有业务价值的数据,避免"永久保存"的不当做法。同时,企业需重新审视数据组合后的潜在风险,评估数据被AI关联解读后可能揭示的信息。此外,不应低估不同类型AI所带来的风险,在部署和使用AI之前须进行充分的风险评估。
