在设计辅助疾病诊断的人工智能系统时,"一刀切"的方案很可能并非最佳策略。

麻省理工学院(MIT)等机构的研究人员开展的一项新研究发现,尽管AI辅助整体上提升了非专业人士和临床医生在皮肤病诊断中的准确率,但AI可解释性方法对不同知识水平用户的影响却大相径庭。

可解释AI方法通过描述或验证模型的决策过程,帮助用户判断何时应信任模型的预测。例如,模型可能通过热力图标注图像中对诊断最为关键的区域,或借助大语言模型以通俗语言解释预测结果。

在这项研究中,研究人员分别测试了非专业人士和初级保健医生在不同可解释AI系统辅助下进行皮肤病诊断的表现。

研究发现,非专业人士的诊断准确率有所提升,但这主要源于对AI系统的过度依赖。非专业人士对基于大语言模型的解释几乎无条件信任,无论其对错;而当解释措辞模糊或流于泛泛时,反而觉得更具说服力。

相比之下,临床医生不会被错误的AI辅助所误导,且在仅获得模型预测结果、不附加任何解释的情况下表现最佳。

MIT电气工程与计算机科学系副教授、医学工程与科学研究所成员、信息与决策系统实验室及贾米尔健康机器学习诊所首席研究员Marzyeh Ghassemi表示:"良好的AI系统能在某些医疗场景中提升诊断表现,但这必须与可能引发更多错误的算法依赖倾向审慎地加以平衡。我们知道,AI和可解释性方法都可能在人类决策中引发自动化偏差,这种锚定效应在设计AI系统时必须加以重视。"

斯坦福大学生物医学数据科学与皮肤病学助理教授、本文共同作者Roxana Daneshjou表示:"随着患者越来越多地借助AI获得医疗建议,这些发现尤为重要。研究表明,医学知识越匮乏的人,越容易在可解释AI模型给出错误输出时被带偏。"

研究人员指出,上述结果强调了在设计AI系统时以用户为中心的重要性,同时也凸显了开发鼓励批判性思维而非过度依赖模型的可解释性方法的必要性。

哥伦比亚大学生物医学信息学系助理教授、论文第一作者Orson Xu说:"我们越来越清楚地认识到,不能简单地假设一个好的AI就能解决所有问题。我们需要认真关注AI系统的实际使用者,因为同样的解释可能帮助专家、却误导新手。往往那些最能从AI中受益的人,也最容易被AI带入歧途,所以如何呈现一个建议,和建议本身是否正确同样重要。"

论文合著者还包括MIT研究生张浩然、本科生Reina Wang、Jameel诊所研究员Luis Soenksen博士,以及多位临床医生和研究人员。相关研究成果已发表于《自然·医学》期刊。

探索可解释性方法的影响

目前,多款经FDA批准的AI接口已被应用于帮助临床医生识别医学图像中的皮肤状况,以优化早期诊断流程。这些工具除提供图像中是否存在病变的预测外,通常还采用多种方法对模型的决策过程进行解释。

与此同时,非专业人士也可借助AI搜索引擎自行进行数字化诊断,这类系统常通过大语言模型以更简明的语言解释预测结果。

研究人员评估了这些可解释AI工具在皮肤病检测中对初级保健医生和非专业人士的实际影响。测试方式是向用户展示医学图像及AI对皮肤病的预测结果,同时采用不同的可解释AI方案。

这些方案包括:仅提供AI预测及置信度(不附加解释)、提供相似图像以佐证预测、基于热力图标注关键图像区域,以及使用大语言模型以通俗语言解释模型推理过程。

非专业人士的任务是判断皮肤痣的图像是否为恶性,分别在有无可解释AI辅助的条件下进行测试;临床医生则接受更具挑战性的皮肤病鉴别诊断任务。

研究发现,所有可解释AI方案均提升了非专业人士的诊断准确率,主要原因是这些工具帮助用户更准确地排除了非癌症痣。

此外,当研究人员引入一个专为消除深肤色偏差而设计的公平约束模型时,该系统显著提升了诊断准确率,并有效降低了基于肤色的诊断差异。

Ghassemi表示:"但非专业用户表现更好的原因,正是因为他们更加依赖模型。模型出错时对表现的损害,大于模型正确时带来的提升。我们只是在这一场景中训练出了非常出色的AI模型。"

这种依赖效应在使用大语言模型解释时最为突出,用户在大语言模型辅助下给出错误答案时,反而表现出更高的自信度。

而临床医生则对错误的AI解释具有较强的抵御能力,在所有可解释性方法中,大语言模型对其诊断准确率的提升幅度最小。

Xu表示:"这归根结底在于两类用户使用解释的方式不同。临床医生在参考AI前,脑海中已有了初步诊断,会将AI结果与自身的专业训练相对照,因此错误的解释会被识别出来。而非专业人士则可能依赖相同的解释来形成最初判断,一个听起来言之凿凿的理由,就可能将他们引向错误答案。同样的工具,对一类用户来说是助力,对另一类用户来说却可能是风险。"

克服依赖效应

研究人员进一步深入分析后发现,对AI辅助依赖程度最高的用户,恰恰是在无AI辅助情况下表现最差的群体。

他们还发现,向用户呈现AI解释的时机对其行为具有显著影响。如果在用户尚未独立完成诊断之前便提供解释,他们往往会对模型表现出更强的依赖性。

此外,当疾病表现较为隐匿时,AI系统的诊断表现优于人类;但当图像中出现非典型症状或无关特征时,人类的诊断则明显更具优势。

综合来看,上述结果表明,可解释AI可能导致用户对模型产生过度依赖,使其在AI给出错误建议时也盲目跟从。

研究人员指出,与其借助大语言模型生成更详尽的解释,不如要求用户先独立给出诊断假设,再呈现AI建议以提示其他可能的病情供用户参考,这或许更为有效。

Ghassemi表示:"我们真正希望AI能够激发创造性思维,帮助用户提升能力,或补足其在识别细微病症方面的不足。否则,我们将面临自动化偏差的风险——一旦模型出错,用户将无力纠正。"

本研究部分受美国国家科学基金会、施密特科学基金、美国全国经济研究局及哥伦比亚大学资助。

Q&A

Q1:这项研究的核心发现是什么,AI对不同用户的诊断帮助有何差异?

A:研究发现,AI辅助整体提升了非专业人士和临床医生的皮肤病诊断准确率,但影响机制截然不同。非专业人士准确率的提升主要源于对AI的盲目依赖,而非真正理解诊断逻辑,大语言模型的解释甚至会增强他们对错误答案的自信心。临床医生则不易被错误的AI解释误导,在仅获得模型预测、不附加解释的情况下表现最佳。

Q2:可解释AI方法为什么会让非专业人士反而做出更多错误判断?

A:非专业人士缺乏独立的医学知识体系,倾向于将AI解释作为形成判断的主要依据,而非用来验证自己的想法。当大语言模型给出语气自信、听起来合理的解释时,即便内容有误,用户也容易被说服。此外,如果在用户未独立诊断前便率先呈现AI解释,还会进一步强化这种依赖倾向,从而增加出错概率。

Q3:研究人员建议如何改进医疗AI系统的设计以减少过度依赖?

A:研究人员建议,应优先要求用户在接触AI建议之前先独立给出诊断假设,再向其呈现AI预测结果作为参考,以引导批判性思考而非被动接受。此外,应避免使用可能诱导盲目服从的详尽解释,转而设计能激发用户主动思考的交互方式,从而让AI真正发挥补充和提升人类判断的作用,而非替代判断。

MIT News