生成式 AI 正加速渗透金融、医疗和欺诈防控等领域,围绕数据的争论已不再是"数据够不够",而是"数据对不对"。优质模型能帮助贷款机构评估无信用记录的申请人,帮助银行更早识别欺诈,帮助医疗机构更早发现风险。但模型的上限,由训练数据的质量决定。最有价值的数据,往往也是最敏感的数据。

数据价值在于关联,孤岛是最大障碍

有用的数据往往是碎片化的,分散在不同机构之间。银行掌握还款行为,零售商了解家庭消费,电信运营商掌握数字服务使用情况。每家机构只看到个人生活的一个切面。

AI 的价值,在于这些信号之间的关联。安全地将它们整合,才能更准确地揭示一个人的财务韧性、脆弱性、欺诈风险或潜在需求。此外,数据的时效性同样关键——行为模式、经济状况和欺诈手段不断变化,用过时数据训练的模型,做出的判断依据的是一个已经改变的世界。

敏感性是共享的根本障碍

金融数据涉及收入、负债与偿付能力;医疗数据涉及病史;零售和电信数据揭示日常行为与偏好。正是这种敏感性,决定了数据无法自由流通,即便共享目的是有价值的。

现有数据流通模式大多依赖跨第三方系统的复制与传输,存在数据泄露风险,也可能导致数据被用于超出原始授权的目的。核心问题在于:数据一旦共享,就难以"收回"。

监管层面,目的限制与数据最小化原则意味着,为某一目的收集的数据通常不能被挪作他用,无论其潜在价值多大。负责任的机构往往得出同样结论:移动敏感数据所带来的风险,超过了共享收益。

合成数据不是万能解

合成数据——即根据真实数据集的规律人工生成的数据——看起来像是一条出路:数据不是真实的,隐私问题似乎随之消失。但事实并非如此。

合成数据在系统测试、场景探索和极端案例压力测试方面确实有价值,但无法承载高风险 AI 决策的全部重量。合成数据只能复现已知的规律,可能遗漏真实数据中存在的新兴行为、意外关联或细微特征。真实数据中的空白和偏差,会被合成数据原样继承,且往往看不出来。

更重要的是,训练与决策是两回事。即便模型完全基于合成数据训练,在实际决策时面对的仍是真实的申请人、交易或患者。德国联邦财政部据报提议允许税务机关使用真实纳税人数据开发 AI 系统,理由正是虚构数据效果有限,但此举引发了隐私保护和功能蔓延方面的批评。

是否使用合成数据或真实数据,取决于具体应用场景。但对于最重要的决策而言,真实数据不可替代。

隐私增强技术:让真实数据可用而不必暴露

隐私增强技术(PETs)是一类无需交换或暴露敏感数据即可完成数据分析的技术体系。

具体而言,记录通过令牌化标识符进行匹配,两家机构可以确认共同客户,而无需知晓对方客户的身份。分析在中立环境中进行,原始记录对任何一方均不可见,离开该环境的只有结果——如聚合洞察、模型特征或单次决策评分。

PETs 并不取消对知情同意、问责机制和监管合规的要求,但它们解决了真实数据协同分析的核心障碍。

从南非实践看 PETs 的真实价值

目前,PETs 已在实际场景中被用于解决敏感数据分析难题。在南非,非洲最大连锁超市与多家领先银行联合测试:能否在不共享消费者数据的前提下,用超市购物行为预测信用状况?

经过匿名化和令牌化处理的数据集,在隐私保护环境中完成匹配,并基于融合数据训练模型。最终,800 万名此前无信用记录的人群获得了信用评分,其中 320 万人获得了原本会被拒绝的可负担信贷,而引入超市数据后,模型准确率提升了 41%。

这一结果之所以成为可能,是因为金融机构通过 PETs 访问了匿名化的超市数据。这些数据从未出现在任何银行的记录中,任何合成过程都无法产生它——因为这些行为从未被做出决策的机构所观察过。数据本来存在,只是因为合理的隐私顾虑而无法触及。

PETs 正在打开真实数据的边界

PETs 的普及曾受制于成本、复杂性和缺乏统一标准。随着技术的成熟和监管指引的明朗,这些障碍正在逐步降低。

PETs 的价值不止于让现有数据更安全地共享,更在于扩展了可用数据的范围——尤其是在模型最薄弱的领域:无信用记录的消费者、新兴欺诈模式、医疗服务不足的患者群体。

更好的 AI 不仅仅依赖更优的算法或更大的模型,更依赖于在不要求用户放弃隐私的前提下,获取真实、及时、有代表性的数据。隐私增强技术,正是让两者同时成为可能的关键。

Q&A

Q1:隐私增强技术(PETs)是什么?它如何解决数据共享的隐私问题?

A:隐私增强技术(PETs)是一类无需交换或暴露敏感数据即可完成数据分析的技术。它通过令牌化标识符匹配记录,让两家机构确认共同客户而不泄露身份信息,分析在中立的隐私保护环境中进行,原始数据对任何一方不可见,只有分析结果可以导出。PETs 不取消知情同意和监管要求,但解决了真实数据无法跨机构协同分析的核心障碍。

Q2:合成数据能替代真实数据训练 AI 模型吗?

A:不能完全替代。合成数据在系统测试和极端场景压力测试方面有价值,但它只能复现已知规律,无法捕捉真实数据中存在的新兴行为或意外关联。真实数据中的数据空白和偏差会被合成数据原样继承,且往往不易察觉。更关键的是,即便模型用合成数据训练,实际决策时面对的仍是真实的申请人或患者,因此对于高风险决策,真实数据不可替代。

Q3:南非超市与银行的 PETs 合作案例取得了哪些成果?

A:南非最大连锁超市与多家银行通过隐私增强技术,在不直接共享消费者数据的前提下,利用超市购物行为预测信用状况。最终为 800 万名无信用记录人群完成了信用评分,其中 320 万人获得了原本会被拒绝的可负担信贷,引入超市数据后模型准确率提升了 41%。这些数据从未出现在银行记录中,也无法通过合成数据生成,充分证明了 PETs 在扩展可用数据边界方面的独特价值。

World Economic Forum