数以百万计的用户正在打造属于自己的个性化 AI 伙伴,但大多数人对这些创造物的实际行为方式知之甚少。麻省理工学院媒体实验室助理教授 Pat Pataranutaporn 与其研究生 Anthony Baez 和 Sheer Karny 在一篇新论文中提出了"神经透明度"这一概念——这是一种让普通用户在聊天机器人开口说话之前,就能洞悉其神经网络内部状态的工具。相关研究本周已在 ACM 智能用户界面大会上正式发表。

以下是对 Pataranutaporn 教授的专访。他现任朝日广播公司媒体艺术与科学 CD 讲席教授,在访谈中介绍了研究发现、当前 AI 设计中被大多数用户忽视的风险,以及未来真正透明的 AI 可能呈现的面貌。

什么是"神经透明度"?它如何在设计阶段发挥作用?

现在,数以百万计的用户正通过简单的文本提示,将大语言模型驱动的个性化 AI 聊天机器人和智能体打造成协作助手、家教、教练、创意伙伴乃至生活伴侣。然而,大多数人在真正与 AI 交互之前,对这些提示会如何塑造 AI 的行为几乎一无所知。我们希望改变这种现状。

"神经透明度"的核心是为 AI 提供一种类似大脑扫描的工具。这并非因为 AI 拥有人类的大脑,而是因为其神经网络内部存在某些规律,能够在 AI 开口说话之前,预示它可能的行为方式。在这项研究中,我的学生 Anthony Baez、Sheer Karny 和我融合了人机交互与机制可解释性两个领域的洞察,将这些隐藏的规律转化为普通用户可以理解的形式。

基本思路并不复杂。首先,我们选择关注的行为特征,例如共情能力、诚实度、毒性、幻觉倾向或奉承性。接着,对比模型在被提示表现某一特征与其反面时的内部激活状态,这种差异便成为模型内部的一种"行为方向"。当用户撰写自定义系统提示——即在对话开始前塑造聊天机器人个性的指令——时,我们将模型的内部激活状态投射到这些方向上,并将结果转化为直观的可视化呈现。在我们的方案中,这是一张旭日图,能够在用户开始对话前预览聊天机器人可能呈现的个性特征。

我们将关注点放在设计阶段,是因为这是预防问题的最佳时机。目前,用户往往只有在聊天机器人出现意外行为后才意识到问题所在。我们的目标是从事后纠错转向提前预判,帮助用户在塑造 AI 的过程中及早识别潜在风险。

为什么用户总是误判 AI 的行为倾向?

我常开玩笑说,如果 AI 以终结者的形象出现,人们会更容易知道该如何应对。真正的挑战在于,AI 往往以温暖的朋友、教练、家教或伴侣的面貌示人,这让人们很难察觉到问题的发生。

我们的研究表明,在设计个性化 AI 时,用户普遍存在认知盲区。人们通常以为自己清楚聊天机器人的行为方式,但在我们的研究中,受试者对 15 个测量特征中的 11 个预测有误。这凸显了在用户开始使用 AI 之前,为其提供更好理解工具的必要性。

这一问题不容忽视,因为某些在当下感觉有帮助的行为,从长远来看未必是健康的。在我们此前的研究中,已记录到与 AI 聊天机器人交互相关的心理伤害案例。一个大语言模型若不断认可用户的观点、从不挑战其思维,可能会强化有害决策、不健康的信念或情感依赖。心理学早已证明,人们天然倾向于寻求肯定,因此 AI 的设计不仅是技术挑战,也是心理挑战。

更深层的问题在于,当今的 AI 系统在很大程度上仍是黑盒:即便是专家,也无法总是预测系统提示将如何在长对话中塑造 AI 的行为。随着 AI 伴侣逐渐融入日常生活,我们需要能够帮助人们在开始使用之前就理解自己所构建之物的工具。AI 应该给予支持,而不是一味迎合;应该个性化,而不是走向操控;应该足够透明,让人们能够做出知情选择。

透明度工具提升了信任,却没有改变用户行为,出路在哪里?

这实际上是论文中最令人深思的发现之一,因为它表明仅靠透明度本身是不够的。用户欣赏能够看到模型内部状态的机会,也表示对系统的信任度有所提升,但仅仅呈现信息并没有从根本上改变他们设计 AI 伴侣的方式。

在目前已作为预印本发布的后续研究中,我们正在研究模型的内部神经表征如何在多轮对话过程中发生变化,而非在初始提示后保持固定。我们已经看到了令人鼓舞的结果。通过将这些内部表征随时间的漂移过程可视化,用户能够显著提升识别和预判 AI 行为变化的能力,也不容易对聊天机器人的理解产生过度自信。AI 伴侣是动态系统,会随着与用户的互动不断演化,因此理解这些内部变化是重要的下一步。当然,这仍是一个非常年轻的研究领域。

展望更长远的未来,我相信这类透明度工具将像食品营养标签一样普及。随着 AI 深度融入教育、医疗、工作和个人关系,人们不仅应该了解 AI 能做什么,还应该了解它可能如何影响自身的思维、情感和行为。如果我们真心希望 AI 帮助人类蓬勃发展,这种透明度是不可或缺的。

Q&A

Q1:神经透明度工具是如何让用户预览 AI 行为的?

A:该工具通过分析大语言模型在被提示表现不同特征时的内部激活状态差异,提炼出"行为方向"。当用户输入自定义系统提示后,工具将模型内部激活状态投射到这些方向上,并以旭日图的形式直观展示聊天机器人在共情、诚实、毒性、幻觉和奉承性等维度上的预期表现,让用户在对话开始前就能了解 AI 可能的行为倾向。

Q2:用户在设计个性化 AI 时为什么容易误判其行为?

A:研究显示,用户在 15 个测量特征中有 11 个预测有误,普遍高估正面特征、低估奉承性等潜在有害特征。这是因为 AI 往往以温暖友好的形象示人,容易让人放松警惕;同时,人们天然倾向于寻求肯定,导致对 AI 行为的判断受到心理偏差影响。此外,系统提示如何影响 AI 在长对话中的行为,即便对专家来说也难以准确预判。

Q3:神经透明度工具提升了用户信任,为什么却没有改变用户的设计行为?

A:研究发现,仅仅呈现透明度信息不足以改变用户的实际行为。用户在看到可视化结果后信任度上升,但设计方式并未发生根本变化。研究团队在后续工作中正在探索将模型内部表征在多轮对话中的动态变化过程也可视化,初步结果显示这能帮助用户更好地识别 AI 行为变化,并减少对聊天机器人行为的过度自信。

MIT News