一项新研究发现,AI推荐工具对人类评估者的影响力之强,足以让他们推翻独立人类专家的判断——不仅放弃了有潜力的创新项目,还接受了专家认为不达标的方案。更值得关注的是,当大语言模型附上解释说明时,评估者反而更容易盲从错误决策。叙述性解释非但没有提升人类判断力,反而削弱了它。

每家企业在推进项目前都会进行筛选,但这一过程始终存在不确定性,以及误判的风险——既可能错误推进最终失败的项目(假阳性),也可能错误淘汰本可成功的想法(假阴性)。谷歌眼镜和亚马逊Fire Phone是前者的典型案例;施乐公司早期终止以太网和PostScript项目则是后者的例子。

由于决策者时间有限、信息不足,越来越多的人开始借助大语言模型生成基于上下文的推荐意见和决策依据。

研究团队——来自哈佛商学院、麻省理工学院和华盛顿大学——专门研究了AI在"早期创新筛选"中的作用,考察人类评估者在有无大语言模型解释的情况下,决策质量有何差异。

实验邀请228名有经验的评估者,对麻省理工学院一项挑战赛的近50份提案进行评估,设置了三种场景:纯人工评估(无AI辅助)、附带书面理由的大语言模型评估、以及仅给出通过/拒绝结论的黑箱AI推荐。

评估者的决策随后与四位人类专家的判断进行比对,后者被视为"正确"基准。研究者考察评估者是直接服从大语言模型建议、推翻建议,还是"有效推翻"——即在独立核实后再做决定。

总体而言,评估者有67%的情况接受了大语言模型的建议。他们对黑箱推荐和附带叙述的推荐的认同率均约为75%,而对人类决策的认同率仅为54%。

看似反直觉的是,黑箱推荐实际上提升了决策质量(使其更接近人类专家判断),而附带叙述的推荐则没有。当大语言模型建议拒绝某提案并附上理由时,评估者的认同比例明显偏高,这虽然减少了假阳性,却"大幅"增加了假阴性。

研究者认为,这是因为叙述性解释"抑制"了有效推翻行为:大语言模型提供了一个令人信服、易于接受的论据,实际上阻碍了人类的独立核实。这与"大语言模型解释能增强人类决策"的普遍假设相悖。

研究者还指出,人类在认知上天然倾向于对负面信息赋予更高权重,这一现象被称为"负面偏见"。"拒绝是一种主动的排除性决定,感觉比保留选项更具后果性和责任感,"他们写道。拒绝还能维持现状、规避风险,且无需投入资源。

大语言模型的解释为顺从拒绝决策提供了"现成的理由",人类实际上将思考外包给了AI。评估者往往依赖表面线索,如语言流畅度、连贯性和表面可信度。大语言模型尤其擅长利用这一点,因为它们语言流畅、表现得像专家,制造出一种"解释深度的幻觉",让人高估自己对决策的理解程度。

研究者指出,这些发现对企业设计AI辅助评估系统具有"明确的启示"。

在高风险决策中,企业应谨慎对待大语言模型的解释,不应轻信AI推荐,而应在部署前进行测试,以提高准确性并帮助人类审查者发现模型错误。

在质量控制、合规筛查或欺诈检测等场景中,大语言模型的解释可以支持保守的人类决策;但在早期筛选等任务中,叙述性解释可能因"抑制独立判断、压制有效的人工推翻"而损害决策质量。在这类场景下,更简洁或更不透明的推荐反而有助于保留人类的自主判断空间。

研究者建议,未来的解释系统设计应综合考虑任务性质和AI错误的潜在代价。企业可以尝试让模型同时提供支持和反对某想法的理由,或基于固定阈值披露不确定性,而非仅给出二元判断;系统也可以设计成主动邀请人类提出异议的形式。

研究者最终强调:"组织应将AI解释视为一种行为干预手段,而非普遍有益的透明工具——其效果取决于评估者在不确定条件下如何处理信息。"

Q&A

Q1:大语言模型附带解释为什么反而会降低人类决策质量?

A:研究发现,大语言模型的叙述性解释会为评估者提供"现成的理由",让他们更容易直接接受AI的拒绝建议,而不去独立核实。这种现象与人类的"负面偏见"相结合——人们天然更重视负面信息——导致假阴性大幅增加,即错误淘汰了本应推进的好项目。大语言模型流畅、专业的语言还会制造"解释深度的幻觉",让人高估自己对决策的理解程度。

Q2:黑箱AI推荐和附带解释的AI推荐,哪种对决策更有帮助?

A:实验结果显示,黑箱推荐(仅给出通过/拒绝结论,不附理由)反而更有助于提升决策质量,使评估者的判断更接近人类专家的基准。附带叙述性解释的推荐虽然认同率同样约为75%,但会显著增加假阴性错误,整体决策质量反而更差。

Q3:企业在使用AI辅助评估系统时应该注意什么?

A:研究者建议,在高风险决策场景中应谨慎使用大语言模型解释,不能轻信AI推荐,需在部署前充分测试。对于早期创新筛选类任务,可考虑使用更简洁或不透明的推荐形式,以保留人类的独立判断空间。此外,可以尝试让模型同时呈现支持与反对的理由,或设计鼓励人类提出异议的系统结构。

Computerworld