Skip to main content
QUICK REVIEW

[论文解读] Interpreting and Correcting Medical Image Classification with PIP-Net

Meike Nauta, Johannes H. Hegeman|arXiv (Cornell University)|Jul 19, 2023
Explainable Artificial Intelligence (XAI)被引用 4
一句话总结

该论文提出 PIP-Net,一种基于原型的可解释深度学习模型,可在医学图像分类中实现人类可理解的推理并直接修正模型。通过仅从图像级别标签中学习语义上有意义的图像局部区域(原型),PIP-Net 揭示了模型的捷径学习现象(例如,依赖X光投照体位类型进行骨折检测),并允许临床医生通过禁用有问题的原型来修正模型,从而提升临床AI系统的可信度与鲁棒性。

ABSTRACT

Part-prototype models are explainable-by-design image classifiers, and a promising alternative to black box AI. This paper explores the applicability and potential of interpretable machine learning, in particular PIP-Net, for automated diagnosis support on real-world medical imaging data. PIP-Net learns human-understandable prototypical image parts and we evaluate its accuracy and interpretability for fracture detection and skin cancer diagnosis. We find that PIP-Net's decision making process is in line with medical classification standards, while only provided with image-level class labels. Because of PIP-Net's unsupervised pretraining of prototypes, data quality problems such as undesired text in an X-ray or labelling errors can be easily identified. Additionally, we are the first to show that humans can manually correct the reasoning of PIP-Net by directly disabling undesired prototypes. We conclude that part-prototype models are promising for medical applications due to their interpretability and potential for advanced model debugging.

研究动机与目标

  • 评估 PIP-Net 在真实世界医学图像分类任务(如骨折检测和皮肤癌诊断)中的适用性。
  • 探究 PIP-Net 是否能在无需局部标注的情况下,通过原型分析揭示数据质量问题,如虚假标注、X光片中的文字或标注错误。
  • 评估 PIP-Net 的推理是否与医学影像领域的临床标准和领域知识保持一致。
  • 探索临床医生是否可通过禁用不希望的原型来手动修正模型行为,实现在无需重训练情况下的直接模型调试。
  • 通过原型操作实现人机协同的模型修正,展示医学AI中混合智能的可行性。

提出的方法

  • PIP-Net 使用基于原型的卷积神经网络架构,仅通过图像级别标签学习稀疏且语义上有意义的图像局部区域(原型)。
  • 原型通过无监督预训练初始化,使模型能够在无需局部标注的情况下发现相关图像块。
  • 模型通过计算输入图像块与学习到的原型之间的相似度来生成注意力分数,形成用于分类的稀疏评分表。
  • 通过可视化每个输入所激活的原型,实现模型可解释性,使临床医生能够检查并验证模型的推理过程。
  • 通过手动禁用与虚假相关性相关的原型(例如,与髋部骨折病例中患者活动能力相关的特定X光投照体位)来纠正捷径学习。
  • 当无有效原型被激活时,模型会放弃预测,从而提升对分布外输入的可靠性。

实验结果

研究问题

  • RQ1PIP-Net 是否能仅使用图像级别标签,在医学图像中学习到可解释且语义上有意义的原型性局部区域?
  • RQ2PIP-Net 的推理在多大程度上与既定的医学分类标准和临床知识保持一致?
  • RQ3PIP-Net 是否能通过原型分析检测到数据质量问题,如无关标注(例如X光片中的文字)或标注错误?
  • RQ4临床医生是否能通过禁用特定原型有效修正模型行为,从而消除捷径学习?
  • RQ5禁用有问题的原型是否能提升模型的可靠性并减少对混淆因素的依赖?

主要发现

  • PIP-Net 在髋部骨折和皮肤癌数据集中成功学习到可解释且语义上有意义的原型性局部区域,可视化图像块与临床上相关的解剖区域相对应。
  • 模型发现,部分原型仅在急诊室拍摄的、患者无法活动的X光片上被激活,表明模型存在基于患者活动能力而非骨折本身的捷径学习。
  • 在禁用这些与投照体位相关的原型后,PIP-Net 对骨折类别的输出分数在约一半受影响图像上降为零,证实模型曾依赖这种虚假相关性。
  • 临床医生可通过禁用不希望的原型手动修正模型推理,展示了无需重训练的直接模型调试能力。
  • 当无有效原型被激活时,模型放弃预测的能力提升了其在临床部署中的安全性和可靠性。
  • 结果表明,PIP-Net 支持混合智能,通过实现临床专家与AI之间的双向反馈回路,使专家能够建议或抑制原型以优化模型行为。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。