Skip to main content
QUICK REVIEW

[论文解读] Dual-stream Maximum Self-attention Multi-instance Learning

Bin Li, Kevin W. Eliceiri|arXiv (Cornell University)|Jun 9, 2020
Image Retrieval and Classification Techniques参考文献 22被引用 4
一句话总结

该论文提出了一种基于神经网络的新型多实例学习(MIL)模型——双流最大自注意力多实例学习(DSMIL),该模型采用双流架构,联合学习实例分类器和包分类器。第一流通过最大池化操作识别出激活程度最高的实例,该实例随后作为查询,在第二流中计算所有实例之间的自注意力分数,从而将计算复杂度从 O(n²) 降低至 O(n),同时提升性能,在基准 MIL 数据集上取得了最先进结果。

ABSTRACT

Multi-instance learning (MIL) is a form of weakly supervised learning where a single class label is assigned to a bag of instances while the instance-level labels are not available. Training classifiers to accurately determine the bag label and instance labels is a challenging but critical task in many practical scenarios, such as computational histopathology. Recently, MIL models fully parameterized by neural networks have become popular due to the high flexibility and superior performance. Most of these models rely on attention mechanisms that assign attention scores across the instance embeddings in a bag and produce the bag embedding using an aggregation operator. In this paper, we proposed a dual-stream maximum self-attention MIL model (DSMIL) parameterized by neural networks. The first stream deploys a simple MIL max-pooling while the top-activated instance embedding is determined and used to obtain self-attention scores across instance embeddings in the second stream. Different from most of the previous methods, the proposed model jointly learns an instance classifier and a bag classifier based on the same instance embeddings. The experiments results show that our method achieves superior performance compared to the best MIL methods and demonstrates state-of-the-art performance on benchmark MIL datasets.

研究动机与目标

  • 解决多实例学习(MIL)中缺乏实例级别标签的弱监督学习挑战。
  • 降低 MIL 模型中全连接自注意力机制的计算复杂度,该复杂度随包大小呈二次方增长。
  • 通过聚焦于最相关实例(即激活程度最高的实例)进行依赖建模,提升分类性能。
  • 通过共享实例嵌入,实现实例分类器和包分类器的联合训练,增强特征学习能力。
  • 通过在两流之间交替优化,支持大规模包(如包含数万个切片的全切片图像)的训练。

提出的方法

  • 该模型采用双流架构:第一流执行标准的最大池化操作,以识别出激活程度最高的实例嵌入。
  • 第二流通过将激活程度最高的实例与包中所有其他实例进行相关性计算,形成查询-键机制,从而计算自注意力分数。
  • 该基于最高激活实例的自注意力机制将计算复杂度从 O(n²) 降低至 O(n),使其可扩展至大规模包。
  • 注意力分数用于将实例嵌入聚合为包嵌入,进而用于包级别的分类。
  • 模型联合训练来自最大池化流的实例分类器和来自注意力流的包分类器,两者共享相同的实例嵌入。
  • 训练过程在两流之间交替进行,即使在极大规模的包上,也能实现对深层特征提取器的有效反向传播。

实验结果

研究问题

  • RQ1仅聚焦于激活程度最高的实例进行自注意力计算,是否能在 MIL 模型中提升性能并降低计算成本?
  • RQ2一种联合学习实例分类器和包分类器的双流架构,是否能比单流方法提供更优的特征表示?
  • RQ3所提出的方法是否可扩展至大规模包,例如包含数万个切片的全切片图像分析任务?
  • RQ4DSMIL 中的实例分类器性能与标准 MIL 最大池化模型相比如何?
  • RQ5在实例流与包流之间交替训练对模型收敛性和性能有何影响?

主要发现

  • DSMIL 在 MIL 基准数据集上取得了最先进性能,优于现有方法,包括 AbMILP、IQSA-AbMILP 和 LSA-AbMILP。
  • 在结肠癌数据集上,DSMIL 达到 91.1% 的准确率(±0.012)、93.2% 的精确率(±0.013)和 91.2% 的 F1 分数(±0.009),全面超越所有基线模型。
  • 在乳腺癌数据集上,DSMIL 达到 93.7% 的准确率(±0.000)、92.5% 的精确率(±0.091)和 97.4% 的 F1 分数(±0.050),表现出高度的稳定性和优异性能。
  • 通过仅将自注意力限制在激活程度最高的实例上,模型将计算复杂度从 O(n²) 降低至 O(n),实现了对大规模包的可扩展性。
  • 训练完成后,实例分类器流可独立使用,无需依赖完整的包注意力机制,即可提供可靠的实例级别预测。
  • 交替训练策略使模型能够有效优化深层特征提取器和聚合算子,适用于全切片图像分类等极大规模包的场景。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。