[論文レビュー] Exploring Visual Prompts for Whole Slide Image Classification with Multiple Instance Learning
本稿では、自然画像とヒストパスロジー画像の間のドメインシフトを軽減し、複数インスタンス学習(MIL)を用いた全スライド画像(WSI)分類のためのImageNet事前学習モデルの適応に視覚的プロンプトを導入する。バックボーンを固定し、代表的なパッチ上で軽量なプロンプト部のみを微調整することで、Camelyon16およびTCGA-NSCLCデータセットにおいて、複数のMILモデルとバックボーンで一貫した性能向上を達成する。
Multiple instance learning (MIL) has emerged as a popular method for classifying histopathology whole slide images (WSIs). However, existing approaches typically rely on pre-trained models from large natural image datasets, such as ImageNet, to generate instance features, which can be sub-optimal due to the significant differences between natural images and histopathology images that lead to a domain shift. In this paper, we present a novel, simple yet effective method for learning domain-specific knowledge transformation from pre-trained models to histopathology images. Our approach entails using a prompt component to assist the pre-trained model in discerning differences between the pre-trained dataset and the target histopathology dataset, resulting in improved performance of MIL models. We validate our method on two publicly available datasets, Camelyon16 and TCGA-NSCLC. Extensive experimental results demonstrate the significant performance improvement of our method for different MIL models and backbones. Upon publication of this paper, we will release the source code for our method.
研究の動機と目的
- ImageNet事前学習モデルとヒストパスロジーWSIの間のドメインシフトを解消することにより、MILベースのWSI分類における特徴量の質を制限する要因を軽減すること。
- 限られたパッチレベルのラベルに対して、特徴抽出器全体を微調整する方法の限界を克服すること。これには過学習のリスクと事前学習された表現の劣化が伴う。
- 視覚分野におけるプロンプト学習、特にヒストパスロジー分野への応用を検討し、事前学習済み特徴量を病理的データに適応させる視覚的プロンプトを導入すること。
- バックボーンを固定し、プロンプト部のみを更新する軽量で効率的な学習スキームを構築することにより、計算コストを低減すること。
- 公開WSIデータセット(Camelyon16, TCGA-NSCLC)において、異なるバックボーン(ResNet-18/50)とMILモデル(DTFD, ABMIL)を用いて、視覚的プロンプトの有効性を検証すること。
提案手法
- 固定されたImageNet事前学習バックボーンに学習可能なプロンプト部を追加する、新しい視覚的プロンプト学習フレームワークを提案する。これにより、特徴量がヒストパスロジー画像に適応される。
- プロンプト学習に使用するパッチ数を削減し、効率性を高めるとともに過学習のリスクを軽減するため、代表的パッチ選択(RPS)戦略を採用する。
- バックボーンの重みを固定したまま、プロンプトブロックと軽量なMIL分類器のみを学習することで、効率的なドメイン適応が可能になる。
- 2段階のプロセスを採用する:まず、特徴の多様性に基づいてWSIから代表的パッチを選択し、次に、これらのパッチを用いてプロンプト部のみを微調整する。
- プロンプトモジュールを特徴抽出ヘッドに統合し、バックボーンを固定したまま、プロンプトとMIL分類器のエンドツーエンド学習を可能にする。
- アテンションベースのMILモデル(例:DTFD, ABMIL)を用い、プロンプト適応後のパッチレベル特徴量をWSIレベルの予測に集約する。

実験結果
リサーチクエスチョン
- RQ1MILベースの分類において、ImageNetとヒストパスロジーWSIの間のドメインシフトを視覚的プロンプトが効果的に軽減できるか?
- RQ2パッチレベルのラベルが入手不可能な状況下で、プロンプト学習が特徴抽出器全体を微調整する手法を上回る性能を示せるか?
- RQ3プロンプトブロックの数がWSI分類におけるモデルの性能と耐性に与える影響は何か?
- RQ4過学習を避ける観点から、効果的なプロンプト学習を実現するための最適な代表的パッチ数は何か?
- RQ5提案手法が異なるバックボーンとMILアーキテクチャに一般化可能か?
主な発見
- ResNet-18を用いた場合、Camelyon16データセットでベースライン比3.83%のAUC向上を達成し、TCGA-NSCLCでは1.28%の向上を示した。
- ResNet-50を用いた場合、固定ベースラインおよび全微調整アプローチ(RPS-FT)を常に上回り、優れた一般化性能と耐性を示した。
- 1つ以上のプロンプトブロックを追加することで、ベースライン比AUCが約1%向上し、プロンプト部の有効性と安定性が裏付けられた。
- DTFDおよびABMILという異なるMILモデル、ResNet-18およびResNet-50という異なるバックボーンにおいても、一貫した性能向上を示し、広範な適用可能性を示した。
- 代表的パッチ数Kのすべての値において、RPS-FTを上回る性能を達成し、GPUリソースの50%未満で実行された。これにより、効率性が証明された。
- アブレーションスタディの結果、バックボーン全体を微調整すると過学習が生じ、性能が劣化する一方、プロンプトベースの適応ではこの問題を回避できた。

より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。