[论文解读] Explainable Deep Learning Methods in Medical Image Classification: A Survey
本综述全面回顾了医学图像分类中可解释深度学习方法,重点聚焦于视觉、文本、基于样本和基于概念的解释技术。它评估了现有数据集、基准指标及报告生成模型的性能,同时识别出在放射学中临床部署可解释人工智能的关键挑战与未来研究方向。
The remarkable success of deep learning has prompted interest in its application to medical imaging diagnosis. Even though state-of-the-art deep learning models have achieved human-level accuracy on the classification of different types of medical data, these models are hardly adopted in clinical workflows, mainly due to their lack of interpretability. The black-box-ness of deep learning models has raised the need for devising strategies to explain the decision process of these models, leading to the creation of the topic of eXplainable Artificial Intelligence (XAI). In this context, we provide a thorough survey of XAI applied to medical imaging diagnosis, including visual, textual, example-based and concept-based explanation methods. Moreover, this work reviews the existing medical imaging datasets and the existing metrics for evaluating the quality of the explanations. In addition, we include a performance comparison among a set of report generation-based methods. Finally, the major challenges in applying XAI to medical imaging and the future research directions on the topic are also discussed.
研究动机与目标
- 为解决临床对黑箱深度学习模型的信任缺失问题,回顾专用于医学影像的可解释人工智能(XAI)技术。
- 对医学图像分类中的事后解释与内在可解释模型进行系统性比较。
- 评估并基准化医学影像中视觉与文本解释的解释质量指标。
- 利用自然语言处理指标与临床相关性,分析基于报告生成的XAI方法性能。
- 识别可解释AI在真实临床工作流中部署的开放性挑战与未来研究方向。
提出的方法
- 将XAI方法系统性地划分为四种模态:特征归因、文本解释、基于样本的解释与基于概念的解释。
- 回顾并比较事后方法(如显著性图、遮挡法、扰动法)与内在可解释模型(如注意力机制、稀疏网络)。
- 使用Grad-CAM、积分梯度与人工标注的相关性图等指标评估视觉解释质量。
- 采用标准自然语言处理指标(如BLEU、ROUGE、CIDEr)评估文本解释,重点关注放射科报告生成。
- 分析基于Transformer与基础模型的自由文本报告生成方法的性能。
- 提出一种评估解释保真度与临床合理性的框架,强调客观、自动化指标的必要性。
实验结果
研究问题
- RQ1在医学图像分类中,哪些事后与内在可解释XAI方法最为有效?
- RQ2在临床可解释性与可靠性方面,不同解释模态(视觉、文本、基于样本、基于概念)如何比较?
- RQ3现有XAI在医学影像中评估指标的当前局限性是什么?如何改进?
- RQ4现代报告生成模型(如Transformer)在生成临床相关且连贯的放射科报告方面表现如何?
- RQ5在临床实践中部署XAI的主要障碍是什么?未来需要哪些研究以克服这些障碍?
主要发现
- 事后XAI方法(如Grad-CAM与积分梯度)虽广泛应用,但存在不稳定与鲁棒性不足的问题,引发对解释可靠性的担忧。
- 由于其内在透明性与对事后分析的依赖减少,内在可解释模型正日益受到关注,能提供更可信的解释。
- 基于Transformer的文本解释方法在生成连贯且语境准确的放射科报告方面,优于传统RNN模型。
- 现有文本解释评估指标(如BLEU、ROUGE)与人类判断存在中等相关性,但仅靠这些指标不足以评估临床相关性。
- 迫切需要客观、自动化的指标来评估解释质量,因为当前方法仍严重依赖主观的人工标注。
- 监管合规性、数据隐私与临床验证仍是XAI在真实医疗环境中部署的主要障碍。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。