[论文解读] Guidelines and Evaluation of Clinical Explainable AI in Medical Image Analysis
本文提出了临床XAI指南,这是一个用于评估医学影像分析中可解释人工智能的五项标准框架——可理解性、临床相关性、真实性、信息性合理性以及计算效率。作者使用新型度量方法评估了16种热力图XAI方法,发现其在真实性和合理性方面表现不佳,证明了该框架在识别临床可行解释方面的有效性。
Explainable artificial intelligence (XAI) is essential for enabling clinical users to get informed decision support from AI and comply with evidence-based medical practice. Applying XAI in clinical settings requires proper evaluation criteria to ensure the explanation technique is both technically sound and clinically useful, but specific support is lacking to achieve this goal. To bridge the research gap, we propose the Clinical XAI Guidelines that consist of five criteria a clinical XAI needs to be optimized for. The guidelines recommend choosing an explanation form based on Guideline 1 (G1) Understandability and G2 Clinical relevance. For the chosen explanation form, its specific XAI technique should be optimized for G3 Truthfulness, G4 Informative plausibility, and G5 Computational efficiency. Following the guidelines, we conducted a systematic evaluation on a novel problem of multi-modal medical image explanation with two clinical tasks, and proposed new evaluation metrics accordingly. Sixteen commonly-used heatmap XAI techniques were evaluated and found to be insufficient for clinical use due to their failure in G3 and G4. Our evaluation demonstrated the use of Clinical XAI Guidelines to support the design and evaluation of clinically viable XAI.
研究动机与目标
- 解决医学影像分析中临床XAI缺乏标准化评估标准的问题。
- 通过定义与实际医疗决策一致的标准,弥合技术XAI评估与临床可用性之间的差距。
- 确保XAI技术不仅技术上可靠,而且具有临床意义且可操作可行。
- 开发新的评估度量方法,以评估多模态医学影像任务中解释的真实性与信息性合理性。
- 通过评估16种常见的XAI方法并识别其临床缺陷,展示该框架的实用性。
提出的方法
- 提出临床XAI的五个核心标准:可理解性、临床相关性、真实性、信息性合理性以及计算效率。
- 基于G1(可理解性)和G2(临床相关性)定义解释形式,然后优化G3(真实性)、G4(信息性合理性)和G5(计算效率)。
- 引入MSFI度量方法,通过测量多模态图像中重要特征和模态的定位情况,量化合理性。
- 通过MSFI得分与医生评估之间的相关性分析,验证合理性度量的有效性。
- 通过测量解释质量与模型性能、预测正确性及不确定性之间的相关性,评估真实性。
- 通过测量运行时间和资源使用情况评估计算效率,重点关注对时间敏感临床工作流程的影响。
实验结果
研究问题
- RQ1如何评估XAI技术,以确保其在医学影像分析中既技术上可靠又具有临床实用性?
- RQ2哪些XAI评估标准对临床部署最为关键,应如何优先排序?
- RQ3现有基于热力图的XAI方法在临床环境中在真实性与信息性合理性方面满足要求的程度如何?
- RQ4量化合理性度量能否可靠替代人类评估,以评估XAI的临床实用性?
- RQ5XAI在时间敏感的临床决策支持中具备可行性的计算效率阈值是什么?
主要发现
- 16种常用热力图XAI技术未能满足真实性(G3)和信息性合理性(G4)标准,限制了其临床实用性。
- MSFI度量方法旨在量化合理性,其与医生评估结果显著相关,验证了其作为临床合理性代理指标的有效性。
- 解释合理性的度量与模型性能及预测正确性相关,表明其在检测AI错误和偏见方面具有实用价值。
- 计算效率差异显著:基于梯度的方法生成解释时间少于10秒,而Shapley Value Sampling方法耗时长达30分钟,后者在实时应用中不切实际。
- 临床XAI指南提供了一个结构化框架,可指导XAI的设计与评估,有助于选择既准确又具临床可操作性的方法。
- 通过MSFI等度量方法量化合理性,可实现可重复、自动化且标准化的XAI实用性验证,而无需完全依赖主观的人工评分。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。