[论文解读] ProtoMIL: Multiple Instance Learning with Prototypical Parts for Whole-Slide Image Classification
ProtoMIL 通过利用可学习的原型化局部区域,提出了一种用于全切片图像(WSI)分类的自解释型多实例学习框架,从而在不损失准确率的前提下提升了可解释性。该方法通过注意力机制聚合图像块与原型之间的相似度,实现对预测结果的细粒度视觉解释,同时在五个 WSI 数据集上实现了最先进(SOTA)的性能表现。
Multiple Instance Learning (MIL) gains popularity in many real-life machine learning applications due to its weakly supervised nature. However, the corresponding effort on explaining MIL lags behind, and it is usually limited to presenting instances of a bag that are crucial for a particular prediction. In this paper, we fill this gap by introducing ProtoMIL, a novel self-explainable MIL method inspired by the case-based reasoning process that operates on visual prototypes. Thanks to incorporating prototypical features into objects description, ProtoMIL unprecedentedly joins the model accuracy and fine-grained interpretability, which we present with the experiments on five recognized MIL datasets.
研究动机与目标
- 解决现有用于全切片图像(WSI)分类的多实例学习(MIL)模型缺乏可解释性的问题。
- 开发一种方法,通过从训练数据中学习原型化局部区域,提供细粒度的、基于病例的解释。
- 在实现基于原型的推理以支持局部和全局可解释性的同时,保持高分类准确率。
- 通过将解释建立在可学习的、类别特定的视觉原型之上,减少对黑箱注意力机制的依赖。
- 通过鼓励从袋(bag)中代表性不足的阳性实例中学习原型,提升模型的鲁棒性。
提出的方法
- 将全切片图像(WSIs)划分为图像块,并计算其与一组可学习的、类别特定的原型化局部区域之间的相似度。
- 应用注意力池化机制,聚合图像块与原型之间的相似度,生成袋级别的表示。
- 引入一种新型正则化技术,鼓励原型从对阳性袋标签有贡献的实例中学习,即使这些实例在袋中代表性不足。
- 采用原型剪枝策略,以紧凑方式表示数据类别,去除非类别特定的局部区域,从而提升可解释性。
- 使用双分支网络联合学习图像块嵌入与原型特征,支持端到端训练。
- 通过突出显示注意力加权的图像块并将其与对应的原型化局部区域关联,实现对预测结果的人工可解释性可视化。
实验结果
研究问题
- RQ1MIL 模型是否能在全切片图像分类中同时实现高准确率与细粒度可解释性?
- RQ2如何有效学习并利用原型化局部区域,以实现自监督的、基于病例的推理式解释?
- RQ3鼓励从代表性不足的阳性实例中学习原型,是否能提升模型性能与可解释性?
- RQ4原型剪枝在多大程度上能降低模型复杂度而不损害性能?
- RQ5所提出的方法是否能以临床上有意义的方式,同时提供局部(实例级)和全局(类别级)解释?
主要发现
- ProtoMIL 在五个基准 WSI 数据集上实现了最先进性能,准确率与当前 SOTA 模型相比仅低 1-2%。
- 在 Camelyon16 数据集上,ProtoMIL 达到 87.3% ± 1.2% 的准确率和 0.935 ± 0.007 的 AUC,与 SOTA 方法相当。
- 在 TCGA-RCC 数据集上,ProtoMIL 实现 94.66% ± 1.0% 的准确率和 0.988 ± 0.009 的 AUC,展现出在肾癌分类任务中的强劲性能。
- 原型剪枝平均将原型数量减少约 30%,性能下降可忽略不计,仅在结肠癌数据集中出现轻微 AUC 下降。
- 该模型同时提供局部(注意力加权图像块)和全局(基于原型)解释,显著优于标准 MIL 方法的可解释性。
- 实验表明,ProtoMIL 的可解释性优于如 TransMIL 和 CLAM 等基于注意力的模型,后者需要复杂分析才能实现解释。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。