[论文解读] Evaluating Explainable AI on a Multi-Modal Medical Imaging Task: Can Existing Algorithms Fulfill Clinical Requirements?
本文提出了一种模态特定特征重要性(MSFI)度量方法,用于评估多模态医学影像中的可解释人工智能(XAI)方法,以满足临床对模态感知和局部化解释的需求。在对脑肿瘤MRI分类任务中系统评估16种XAI算法后,作者发现现有方法未能满足临床对忠实性和合理性的要求,凸显了在多模态环境下设计基于临床实际的XAI方法的必要性。
Being able to explain the prediction to clinical end-users is a necessity to leverage the power of artificial intelligence (AI) models for clinical decision support. For medical images, a feature attribution map, or heatmap, is the most common form of explanation that highlights important features for AI models' prediction. However, it is unknown how well heatmaps perform on explaining decisions on multi-modal medical images, where each image modality or channel visualizes distinct clinical information of the same underlying biomedical phenomenon. Understanding such modality-dependent features is essential for clinical users' interpretation of AI decisions. To tackle this clinically important but technically ignored problem, we propose the modality-specific feature importance (MSFI) metric. It encodes clinical image and explanation interpretation patterns of modality prioritization and modality-specific feature localization. We conduct a clinical requirement-grounded, systematic evaluation using computational methods and a clinician user study. Results show that the examined 16 heatmap algorithms failed to fulfill clinical requirements to correctly indicate AI model decision process or decision quality. The evaluation and MSFI metric can guide the design and selection of XAI algorithms to meet clinical requirements on multi-modal explanation.
研究动机与目标
- 识别并形式化多模态医学影像中解释AI决策的临床相关需求,尤其关注模态优先级和模态特定特征定位。
- 弥补当前XAI评估在多模态医学影像中的空白,因为现有方法主要针对单模态自然图像设计,且未经过临床终端用户的验证。
- 开发一种计算度量方法——模态特定特征重要性(MSFI),以捕捉图像解释中的临床解读模式。
- 在真实世界的脑肿瘤分类任务中,对16种XAI方法进行计算评估与临床医生参与的双重评估,使用多模态MRI数据。
- 通过展示现有方法未能满足多模态医学影像解释的关键临床需求,为未来XAI算法设计提供指导。
提出的方法
- 提出模态特定特征重要性(MSFI)度量方法,以量化XAI热图在多模态医学影像中反映临床模式(即模态优先级和模态特定特征定位)的程度。
- 在多模态MRI脑肿瘤分类任务中,对16种XAI方法(涵盖激活法、梯度法和扰动法)进行系统性评估。
- 通过临床医生用户研究评估解释的合理性,由放射科医生根据临床相关性和与诊断推理的一致性对热图进行评分。
- 对热图进行后处理:截取顶部1%的值,将负值设为零,归一化至[0,1]区间,并应用高斯平滑以提升视觉清晰度。
- 实施模态特异性遮挡、特征掩蔽和特征重排,以生成模态特定的热图,确保方法论与临床影像解读保持一致。
- 使用在多模态MRI(T1、T2、FLAIR、T1ce)上训练的基线模型生成预测结果,并将XAI解释与模型行为及临床期望进行对比评估。
实验结果
研究问题
- RQ1现有XAI方法在多模态医学影像中生成的热图,在多大程度上正确反映了AI模型的决策过程?
- RQ2XAI生成的热图在多大程度上与临床解读模式一致,特别是是否能突出关键模态并实现模态特定的特征定位?
- RQ3临床医生对XAI解释合理性的判断,能否预测AI模型实际预测质量?
- RQ4当前XAI算法是否因设计用于单模态自然图像而非多模态临床数据,而导致无法满足临床需求?
- RQ5所提出的MSFI度量方法是否能有效量化并区分多模态医学影像中XAI方法的临床实用性?
主要发现
- 经计算度量和临床医生评估双重验证,16种评估的XAI方法均未能满足多模态医学影像决策解释的临床要求。
- 无一种XAI方法能始终如一地将正确的模态识别为模型预测中最重要的模态,表明其在模态优先级忠实度方面表现不佳。
- 大多数方法生成的热图不具备模态特异性,常在所有图像通道中重复相同的解释,违反了临床预期。
- 临床医生对所有方法的解释合理性评分均较低,且解释合理性与模型预测质量之间无显著相关性。
- 所提出的MSFI度量方法成功捕捉了临床解读模式,并揭示了现有XAI方法在多模态数据上的系统性缺陷。
- 本研究表明,若不针对模态特异性信息和临床推理工作流程进行重新设计,当前XAI算法在多模态影像中不适用于临床决策支持。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。