Skip to main content
QUICK REVIEW

[論文レビュー] Are Natural Domain Foundation Models Useful for Medical Image Classification?

Joana Palés Huix, Ganeshan, Adithya Raju|arXiv (Cornell University)|Oct 30, 2023
COVID-19 diagnosis using AI被引用数 4
ひとこと要約

本研究では、ISIC、ChestX-ray14、NIH、Chexpertの4つのベンチマークデータセットを対象に、DINOv2、CLIP、BLIP、SAM、SEE-MSの5つの最先端の基礎モデルの医用画像分類性能を評価した。DINOv2はImageNet-1kの教師あり事前学習を常に上回ったが、他のモデルはこのベースラインを上回らなかった。これは、自然ドメインで優れた性能を示すものの、医用画像分類への一般化が必ずしも成功しないことを示している。

ABSTRACT

The deep learning field is converging towards the use of general foundation models that can be easily adapted for diverse tasks. While this paradigm shift has become common practice within the field of natural language processing, progress has been slower in computer vision. In this paper we attempt to address this issue by investigating the transferability of various state-of-the-art foundation models to medical image classification tasks. Specifically, we evaluate the performance of five foundation models, namely SAM, SEEM, DINOv2, BLIP, and OpenCLIP across four well-established medical imaging datasets. We explore different training settings to fully harness the potential of these models. Our study shows mixed results. DINOv2 consistently outperforms the standard practice of ImageNet pretraining. However, other foundation models failed to consistently beat this established baseline indicating limitations in their transferability to medical image classification tasks.

研究の動機と目的

  • 自然ドメインで学習された基礎モデルの医用画像分類タスクへの転移可能性を評価すること。
  • 自己教師ありおよび対照的事前学習モデル(例:DINOv2、CLIP、BLIP)の性能を、標準的なImageNet-1k教師ありベースラインと比較すること。
  • 微調整またはバックボーンの凍結が、医用データセットにおける性能に与える影響を調査すること。
  • 医用微調整の過程で、基礎モデルの各層における特徴の再利用と適応を分析すること。
  • アーキテクチャ設計や事前学習目的が、医用画像分類における転移成功に与える影響を特定すること。

提案手法

  • ISIC、ChestX-ray14、NIH、Chexpertの4つの医用画像データセットに対して、DINOv2、CLIP(OpenCLIP)、BLIP、SAM、SEE-MSの5つの基礎モデルを評価した。
  • 適応戦略の違いを評価するために、線形ヘッドとViTベースの分類ヘッドの両方を用いた。
  • 全微調整と部分的微調整(特定の層の凍結または解放)を実施し、特徴の適応を分析した。
  • タスク固有の適応なしで特徴の質と転移可能性を評価するためにk-NN評価を適用した。
  • 活性マップを用いた類似度分析により、モデル間およびデータセット間での表現を比較した。
  • データサイズや解像度の変化に応じた感受性を評価するため、高解像度入力とさまざまなデータセットサイズを用いてモデルを訓練した。

実験結果

リサーチクエスチョン

  • RQ1自然画像データで事前学習された基礎モデルは、医用画像分類において標準的なImageNet-1k教師あり事前学習を上回ることができるか?
  • RQ2バックボーンの微調整と凍結の違いが、異なる基礎モデルの性能に与える影響は何か?
  • RQ3基礎モデルの初期層と後期層のどちらが、医用タスクに適した転送可能な特徴を示すか?
  • RQ4なぜ一部の基礎モデル(例:SAM、BLIP)は自然視覚タスクでは優れたゼロショット性能を示すものの、医用画像分類では性能が低いのか?
  • RQ5事前学習目的(自己教師あり対照的でテキストを伴うもの)が、医用画像分類への転移可能性に与える影響は何か?

主な発見

  • DINOv2は、4つの医用データセットすべてでImageNet-1k教師あり事前学習を常に上回り、優れた転送可能性を示した。
  • SAM、BLIP、OpenCLIPはほとんどの設定でImageNet-1kベースラインを上回れず、医用画像分類への一般化が限定的であることが示された。
  • 基礎モデルを凍結すると性能が低下し、特に後段の層で顕著だった。これは、高レベル特徴が医用タスクに直接転送可能でないことを示唆している。
  • DINOv2の微調整は、他のモデルと比較して収束が早く、性能も高かった。これは、適応が必要な層が少ないためだと考えられる。
  • 特徴類似度分析の結果、初期層ではモデル間で特徴の再利用が見られたが、後段の層では微調整時に顕著な適応が見られた。これは、タスク固有の適応が不可欠であることを示している。
  • DeiT分類器を追加してもわずかな向上しか得られず、基礎モデルの高レベル特徴が、下流の医用分類器にとって最適な入力ではないことを示唆している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。