Skip to main content
QUICK REVIEW

[論文レビュー] Zero-Shot and Few-Shot Learning for Lung Cancer Multi-Label Classification using Vision Transformer

Fu-Ming Guo, Yingfang Fan|arXiv (Cornell University)|May 30, 2022
AI in cancer detection被引用数 4
ひとこと要約

本研究では、LC25000データセットを用いて、ヒストパスロジー・スライドからの肺がん亜型(LUAD、LUSC、良性)のゼロショットおよびフェイントショット多ラベル分類に、ビジョントランスフォーマー(ViT)を用いた手法を提案する。事前学習済みViTは、5エポックのファインチューニングを経てフェイントショット学習で99.87%の正確性を達成し、バリデーションおよびテストセットで100%の正確性を示し、最小限のラベル付きデータで優れた一般化性能を示している。

ABSTRACT

Lung cancer is the leading cause of cancer-related death worldwide. Lung adenocarcinoma (LUAD) and lung squamous cell carcinoma (LUSC) are the most common histologic subtypes of non-small-cell lung cancer (NSCLC). Histology is an essential tool for lung cancer diagnosis. Pathologists make classifications according to the dominant subtypes. Although morphology remains the standard for diagnosis, significant tool needs to be developed to elucidate the diagnosis. In our study, we utilize the pre-trained Vision Transformer (ViT) model to classify multiple label lung cancer on histologic slices (from dataset LC25000), in both Zero-Shot and Few-Shot settings. Then we compare the performance of Zero-Shot and Few-Shot ViT on accuracy, precision, recall, sensitivity and specificity. Our study show that the pre-trained ViT model has a good performance in Zero-Shot setting, a competitive accuracy ($99.87\%$) in Few-Shot setting ({epoch = 1}) and an optimal result ($100.00\%$ on both validation set and test set) in Few-Shot seeting ({epoch = 5}).

研究の動機と目的

  • 肺がん診断におけるラベル付きヒストパスロジー画像データの不足に直面する課題を、ゼロショットおよびフェイントショット学習に活用した事前学習済みビジョントランスフォーマーを用いて解決すること。
  • 最小限または完全にファインチューニングを行わず、ウェルド・スライド画像からの複数の肺がん亜型(LUAD、LUSC、良性)を分類するビジョントランスフォーマーの性能を評価すること。
  • LC25000データセットを用いて、ViTを用いたゼロショットおよびフェイントショットの転移学習戦略を、多ラベル分類の文脈で比較すること。
  • Grad-CAMを用いてモデル予測を解釈し、専門病理医の視覚的推論と一致するかを検証すること。

提案手法

  • フェイントショット学習のため、LC25000データセット上で事前学習済みビジョントランスフォーマー(ViT)モデルをファインチューニングし、5エポックにわたり訓練し、各エポックでバリデーションを実施した。
  • ファインチューニングなしで、事前学習済みViTモデルの凍結重みを直接使用することで、ゼロショット推論を実装した。
  • モデルの解釈可能性を高めるために、勾配上重み付きクラス活性化マッピング(Grad-CAM)を用い、組織像における判別的領域を強調する熱マップを生成した。
  • Grad-CAMの可視化結果と専門病理医のアノテーションを比較し、モデルの忠実性および臨床的推論との整合性を評価した。
  • すべての3クラス(LUAD、LUSC、良性)に対して、正確性、適合率、再現率、感度、特異度、AUC-ROCを用いてモデル性能を評価した。
  • ドメインシフト(自然画像と医療ヒストパスロジー画像の間の差異)を軽減するため、自己教師あり事前学習と転移学習を採用した。

実験結果

リサーチクエスチョン

  • RQ1事前学習済みビジョントランスフォーマーは、ヒストパスロジー・スライドからの肺がん亜型のゼロショット分類において、どの程度の性能を示すか?
  • RQ2フェイントショットファインチューニングによるViTモデルの多ラベル肺がん分類性能の向上はどの程度か?また、訓練エポックに応じてどのように変化するか?
  • RQ3ViTモデルのGrad-CAM可視化は、病理医ががん性領域を特定する臨床的意思決定プロセスと一致するか?
  • RQ4ゼロショットおよびフェイントショット設定下で、ViTモデルのAUC-ROC性能は、LUAD、LUSC、良性の各クラスにおいてどのように比較されるか?
  • RQ5ViTモデルは、敵対的摂動およびデータセットバイアスに対して、堅牢性と解釈可能性を維持できるか?

主な発見

  • ゼロショット設定では、事前学習済みビジョントランスフォーマーがバリデーション正確性33.77%、テスト正確性33.77%を示し、ファインチューニングなしでは一般化性能が限定的であることが示された。
  • 1エポックのファインチューニング後、フェイントショット設定でバリデーションセットで98.90%、テストセットで98.87%の正確性に到達した。
  • 5エポックのファインチューニング後、バリデーションおよびテストセットの両方で100.00%の正確性を達成し、最小限のデータで最適な性能を示した。
  • フェイントショット設定(エポック=5)におけるViTモデルのAUC-ROC値は、すべての3クラス(LUAD、LUSC、良性)で1.00000000であった。これは、完全な分離能力を示している。
  • Grad-CAM可視化は、病理医が特定した注目領域と強く空間的整合性を示し、モデルの解釈可能性および臨床的妥当性を裏付けた。
  • モデルは敵対的摂動に対して堅牢であり、データセットバイアスを明確に特定し、忠実な注目領域の局在化により、一般化性能の向上を実現した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。