Skip to main content
QUICK REVIEW

[論文レビュー] Pretrained ViTs Yield Versatile Representations For Medical Images

C. Matsoukas, Johan Fredin Haslum|arXiv (Cornell University)|Mar 13, 2023
AI in cancer detection被引用数 7
ひとこと要約

この論文は、ImageNetで事前学習されたビジョントランスフォーマー(ViTs)が、複数の2次元医療画像分類ベンチマークで畳み込みニューラルネットワーク(CNNs)と同等の性能を達成することを示している。医療データセットで微調整された際、オフザシェルのViTsはCNNsと同等またはわずかに上回り、特に自己教師あり事前学習を組み合わせると顕著な性能向上を示す。また、アテンションマップによる解釈可能性の向上と、インダクティブバイアスへの依存の低減も実現している。

ABSTRACT

Convolutional Neural Networks (CNNs) have reigned for a decade as the de facto approach to automated medical image diagnosis, pushing the state-of-the-art in classification, detection and segmentation tasks. Over the last years, vision transformers (ViTs) have appeared as a competitive alternative to CNNs, yielding impressive levels of performance in the natural image domain, while possessing several interesting properties that could prove beneficial for medical imaging tasks. In this work, we explore the benefits and drawbacks of transformer-based models for medical image classification. We conduct a series of experiments on several standard 2D medical image benchmark datasets and tasks. Our findings show that, while CNNs perform better if trained from scratch, off-the-shelf vision transformers can perform on par with CNNs when pretrained on ImageNet, both in a supervised and self-supervised setting, rendering them as a viable alternative to CNNs.

研究の動機と目的

  • ビジョントランスフォーマー(ViTs)が、医療画像分類においてCNNsの代替として実用的であるかどうかを評価すること。
  • ImageNetでの事前学習および自己教師あり事前学習が、多様な医療画像処理タスクにおけるViTの性能に与える影響を評価すること。
  • 医療文脈において、ViTsがCNNsと比較して解釈性および特徴学習の面で優位性を示すかどうかを調査すること。
  • 医療画像処理の文脈において、モデル容量およびデータ量の増加に伴うViTsのスケーラビリティを評価すること。
  • 特に病変の局在化において、ViTsとCNNsのアテンションパターンを比較すること。

提案手法

  • DeiT-SmallおよびDeiT-BaseのViTアーキテクチャを、ISIC 2019、APTOS 2019、PatchCamelyon、CheXpert、CBIS-DDSM、その他の6つの公開2次元医療画像ベンチマークで微調整した。
  • 同じトレーニングプロトコル(教師ありおよび自己教師あり事前学習設定を含む)に従い、ViTの性能をResNet-50と比較した。
  • 医療画像データを用いてMoCo v2およびBYOLを用いた自己教師あり事前学習を実施し、ドメイン固有の表現学習の効果を評価した。
  • Grad-CAMおよびクラストークンのアテンションマップを用いて、ViTsとCNNsの間でのモデルの解釈性を可視化・比較した。
  • パッチサイズ、モデル容量、アテンションパターンのアブレーションスタディを実施し、アーキテクチャ的要因が性能に与える影響を分析した。
  • データ量の異なる設定(少データ学習および完全な教師あり学習)を想定し、ViTのデータ効率を評価した。

実験結果

リサーチクエスチョン

  • RQ1ImageNetで事前学習されたビジョントランスフォーマー(ViTs)は、2次元医療画像分類においてCNNsと同等の性能を達成できるか?
  • RQ2医療データを用いた自己教師あり事前学習は、ImageNetでの事前学習を上回る性能向上をViTsにもたらすか?
  • RQ3ViTsのアテンションマップは、医療画像における病変の局在化において、CNNの活性化マップと比較してどのように異なるか?
  • RQ4ViTsは、学習から初期化する場合と比較して、トランスファー学習の恩恵をどれほど受けるか。また、CNNsと比較してその恩恵はどの程度か?
  • RQ5ViTsは、モデルサイズおよびデータ量の増加に伴い、CNNsよりも優れたスケーラビリティを示すか?

主な発見

  • ImageNetで事前学習されたViTsは、ISIC 2019、APTOS 2019、PatchCamelyon、CheXpert、CBIS-DDSMを含む、全評価対象の医療画像分類ベンチマークでResNet-50と同等の性能を達成した。
  • 学習から初期化した場合、CNNsはViTsを上回るが、ViTsはImageNetでの事前学習により、CNNsよりも顕著な性能向上を示した。
  • 医療データを用いた自己教師あり事前学習は、特にImageNetでの事前学習と組み合わせた場合、ViTsに小さなが一貫した性能向上をもたらし、CNNsを上回った。
  • ViTsは、皮膚腫瘍、出血、レントゲン画像における不透明部など、病変に明確に焦点を合わせた、より局在的で解釈可能なアテンションマップを生成した。
  • ViTsは初期層からグローバルおよびローカルな画像領域に注目しており、長距離依存性が初期段階で捉えられているのに対し、CNNsはグローバルな文脈を獲得するのに深層部に依存している。
  • モデル容量の増加およびパッチサイズの小型化に伴い、ViTsの性能はCNNsと同程度にスケーリングし、インダクティブバイアスの低減にもかかわらず、強力な性能を維持した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。