Skip to main content
QUICK REVIEW

[論文レビュー] Attention-Challenging Multiple Instance Learning for Whole Slide Image Classification

Yunlong Zhang, Honglin Li|arXiv (Cornell University)|Nov 13, 2023
Advanced Image and Video Retrieval Techniques被引用数 4
ひとこと要約

本論文は、注意メカニズムがより困難なインスタンスに注目するように強制することで過学習を是正する、全スライド画像(WSI)分類のための新規MILフレームワーク、Attention-Challenging Multiple Instance Learning(ACMIL)を提案する。ACMILは、多様な判別的パターンを捉えるためにMultiple Branch Attention(MBA)を統合し、顕著なインスタンスを抑制するためにStochastic Top-K Instance Masking(STKIM)を採用し、Camelyon16、BRACS、LBCの3つのWSIデータセットで最先端の性能を達成し、一般化性能とロバスト性が向上している。

ABSTRACT

In the application of Multiple Instance Learning (MIL) methods for Whole Slide Image (WSI) classification, attention mechanisms often focus on a subset of discriminative instances, which are closely linked to overfitting. To mitigate overfitting, we present Attention-Challenging MIL (ACMIL). ACMIL combines two techniques based on separate analyses for attention value concentration. Firstly, UMAP of instance features reveals various patterns among discriminative instances, with existing attention mechanisms capturing only some of them. To remedy this, we introduce Multiple Branch Attention (MBA) to capture more discriminative instances using multiple attention branches. Secondly, the examination of the cumulative value of Top-K attention scores indicates that a tiny number of instances dominate the majority of attention. In response, we present Stochastic Top-K Instance Masking (STKIM), which masks out a portion of instances with Top-K attention values and allocates their attention values to the remaining instances. The extensive experimental results on three WSI datasets with two pre-trained backbones reveal that our ACMIL outperforms state-of-the-art methods. Additionally, through heatmap visualization and UMAP visualization, this paper extensively illustrates ACMIL's effectiveness in suppressing attention value concentration and overcoming the overfitting challenge. The source code is available at \url{https://github.com/dazhangyu123/ACMIL}.

研究の動機と目的

  • 限られたデータ、高解像度、クラス不均衡の影響により、全スライド画像(WSI)分類における多次元インスタンス学習(MIL)で継続的に発生する過学習の課題に対処する。
  • ヒートマップ可視化によって明らかになったように、既存のMILモデルにおける過学習の根本的原因、すなわち少数の判別的インスタンスに注目が集中することを解明する。
  • 顕著なパッチに依存するのではなく、より多様で困難なインスタンスに注目するように注意メカニズムを促す手法を開発する。
  • 注目度の多様性を明示的に促進し、上位の注目インスタンスに過剰に依存するのを抑制することで、WSI解析におけるモデルの一般化性能とロバスト性を向上させる。

提案手法

  • 異なるパターンを持つ判別的インスタンスを捉えるために、複数の並列された注目ブランチを用いるMultiple Branch Attention(MBA)を導入し、特徴の多様性を向上させる。
  • 上位-K個の注目重み付きインスタンスをランダムにマスクし、その注目スコアを残りのインスタンスに再配分することで、注目度の集中を防ぐ、データ拡張に類似した手法であるStochastic Top-K Instance Masking(STKIM)を提案する。
  • MBAとSTKIMを統合したACMILフレームワークを構築し、注目メカニズムがより困難で目立たないインスタンスに注目するように強制することで、一般化性能を向上させる。
  • 冗長性を防ぐために、各注目ブランチが異なる判別的知識を学習するよう促進するため、MBAに多様性損失 $\mathcal{L}_d$ を組み込む。
  • UMAP可視化とヒートマップ分析を用いて、モデルの改善された注目分布と特徴クラスタリング行動を検証する。
  • ImageNetおよびSSLの事前学習を用いた2つのバックボーン(ResNet18とViT-S/16)を用いて、3つのWSIデータセット(Camelyon16、BRACS、LBC)でACMILを訓練および評価する。

実験結果

リサーチクエスチョン

  • RQ1既存のMILモデルにおけるWSI分類の過学習に、少数の判別的インスタンスへの注目過集中がどの程度寄与しているか。
  • RQ2顕著でない、より困難なインスタンスに注目を向けるようにすることで、WSIデータセットにおけるモデルの一般化性能と性能が向上するか。
  • RQ3Stochastic Top-K Instance Masking(STKIM)は、注目度の優位性を遮断し、注目度の多様性を促進するのにどの程度有効か。
  • RQ4多様性損失 $\mathcal{L}_d$ を用いたMultiple Branch Attention(MBA)は、単一ブランチの注目と比較して、より強固で一般化された特徴学習を実現するか。
  • RQ5ヒートマップおよびUMAP可視化により、ACMILが先行するSOTA手法と比較して、より判別力があり、より良好に分離された特徴を学習していることが確認できるか。

主な発見

  • ACMILは、3つのWSIデータセットで最先端のMIL手法を顕著に上回り、ResNet18とImageNet事前学習を用いたLBCデータセットではF1スコアで5.9%の向上を達成した。
  • MBAに多様性損失 $\mathcal{L}_d$ を組み込むことで、データセット全体で5.3–8.0%の性能向上が得られ、注目度の多様性を促進する上でその重要性が確認された。
  • テスト時におけるSTKIMはわずかに性能を低下させるため、推論時には不要であり、cutoutと同様に訓練時正則化として機能することが示された。
  • UMAP可視化により、ACMILはより判別力があり、より良好に分離された特徴を学習していることが示され、LBCデータセットではV-measureが0.316(ABMILは0.224)を記録した。
  • ヒートマップ可視化により、ACMILは少数のインスタンスへの注目集中を軽減し、パッチ全体にわたって注目をより広く分散させていることが確認され、過学習の低減と関連している。
  • ACMILは、Camelyon16、BRACS、LBCの全指標(F1スコア、AUC)で最先端の性能を達成し、ABMILおよび他のSOTAベースラインと比較して一貫した改善を示した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。