Skip to main content
QUICK REVIEW

[論文レビュー] Is it Time to Replace CNNs with Transformers for Medical Images?

Christos Matsoukas, Johan Fredin Haslum|arXiv (Cornell University)|Aug 20, 2021
AI in cancer detection参考文献 23被引用数 105
ひとこと要約

本論文は Vanilla CNN と Vision Transformer (ViT) を医用画像診断で比較し、ViT は事前学習済み(ImageNet あるいは自己教師付き学習)で CNN の性能を再現・上回る可能性があること、Attention マップによる解釈性が追加される点を示す。

ABSTRACT

Convolutional Neural Networks (CNNs) have reigned for a decade as the de facto approach to automated medical image diagnosis. Recently, vision transformers (ViTs) have appeared as a competitive alternative to CNNs, yielding similar levels of performance while possessing several interesting properties that could prove beneficial for medical imaging tasks. In this work, we explore whether it is time to move to transformer-based models or if we should keep working with CNNs - can we trivially switch to transformers? If so, what are the advantages and drawbacks of switching to ViTs for medical image diagnosis? We consider these questions in a series of experiments on three mainstream medical image datasets. Our findings show that, while CNNs perform better when trained from scratch, off-the-shelf vision transformers using default hyperparameters are on par with CNNs when pretrained on ImageNet, and outperform their CNN counterparts when pretrained using self-supervision.

研究の動機と目的

  • オフ・ザ・シェルの ViTs が大幅な再設計なしに医用画像診断の置換可能な選択肢になり得るかを評価する。
  • CNN と ViT の異なる初期化戦略(ランダム、ImageNet プリトレーニング、自己監督プリトレーニング)下での性能を評価する。
  • 自然画像で見られる転移学習と自己教師付き学習の利点が医用画像にも拡張されるかを検証する。
  • ViT の attention マップを通じた解釈可能性の利点を分析する。

提案手法

  • ResNet50(CNN)と DeiT-S(ViT)を 16×16 トークンで三つの初期化戦略のもと標準化比較する。
  • 三つの医用データセット:APTOS2019(糖尿病性網膜症)、ISIC2019(皮膚病変)、CBIS-DDSM(マンモグラフィー)。
  • 学習設定:Adam 最適化、基本学習率 1e-4、ウォームアップ、学習率減衰、入力 256×256、共通データ拡張。
  • 設定ごとに五回の繰り返しを実施し、検証チェックポイントの中から最良を選択。
  • ImageNet 初期化の後にターゲットデータで自己教師付きプリトレーニングを行い、その後監視付き微調整を行う。

実験結果

リサーチクエスチョン

  • RQ1Vanilla ViTs は modest なデータレジームで医用画像解析のプラグアンドプレイな置換として機能するか。
  • RQ2ImageNet のプリトレーニングと自己教師付きプリトレーニングは ViTs の医用タスクで CNN レベルの性能達成に役立つか。
  • RQ3自己教師付きプリトレーニングは ViTs に対して CNN より大きな利点を医用画像で提供するか。
  • RQ4医用画像における ViT と CNN の解釈性の利点は何か。

主な発見

  • ImageNet で事前学習した ViTs はデータが限られている場合に CNN と同等の性能を発揮する。
  • ImageNet 初期化を用いた転移学習は ViTs が医用タスクで CNN の性能に匹敵させるのに役立つ。
  • 自己教師付きプリトレーニングと監督付き微調整の組み合わせが最も高い性能を達成し、この設定では ViTs が CNN をわずかに上回る。
  • ランダム初期化の場合は全データセットで CNN が ViT より優れる。
  • ViT は attention マップを通じた解釈性を改善し、Grad-CAM のみよりもより細かなサリエンシーを提供する。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。