Skip to main content
QUICK REVIEW

[論文レビュー] MedFMC: A Real-world Dataset and Benchmark For Foundation Model Adaptation in Medical Image Classification

Dequan Wang, Xiaosong Wang|arXiv (Cornell University)|Jun 16, 2023
COVID-19 diagnosis using AIMedicine被引用数 3
ひとこと要約

本稿では、5つの多様な臨床的タスク—胸部レントゲン、病理学、内 endoscopy、新生児黄疸、糖尿病網膜症—をカバーする22,349枚の実世界の医療画像を含む、MedFMCを紹介する。このベンチマークは、プロンプトベースのチューニングとファインチューニングを用いた基礎モデルの少サンプル適応を評価しており、特にVPTを含む少サンプル手法が、希少疾患クラスにおいて優れた性能と高い安定性を示し、10ショット実験においても変動が小さいことが明らかになった。

ABSTRACT

Foundation models, often pre-trained with large-scale data, have achieved paramount success in jump-starting various vision and language applications. Recent advances further enable adapting foundation models in downstream tasks efficiently using only a few training samples, e.g., in-context learning. Yet, the application of such learning paradigms in medical image analysis remains scarce due to the shortage of publicly accessible data and benchmarks. In this paper, we aim at approaches adapting the foundation models for medical image classification and present a novel dataset and benchmark for the evaluation, i.e., examining the overall performance of accommodating the large-scale foundation models downstream on a set of diverse real-world clinical tasks. We collect five sets of medical imaging data from multiple institutes targeting a variety of real-world clinical tasks (22,349 images in total), i.e., thoracic diseases screening in X-rays, pathological lesion tissue screening, lesion detection in endoscopy images, neonatal jaundice evaluation, and diabetic retinopathy grading. Results of multiple baseline methods are demonstrated using the proposed dataset from both accuracy and cost-effective perspectives.

研究の動機と目的

  • 医療画像分類における基礎モデルの適応評価のための、公開可能で多様かつ実世界のデータセットが不足している現状に対処する。
  • 複数の医療画像モodalitiesおよび臨床的タスクをカバーする少サンプル学習手法のベンチマークを可能にする。
  • 限られたデータで実際の臨床状況を模倣するコスト効率の良い適応技術—特にプロンプトベース学習—を評価する。
  • データが極めて限られた状況下で、少サンプル手法がファインチューニングを上回ることを示す。特に希少疾患クラスにおいて顕著である。
  • 研究の加速を図るため、標準化された公開データセットとコードベースを提供する。

提案手法

  • X線、病理学、内 endoscopy、デジタル写真、網膜写真の多様なモダリティをカバーする5か所の臨床機関から、22,349枚の実世界の2次元医療画像を収集した。
  • 5つの異なる分類タスクを構築した:多ラベル胸部異常分類(ChestDR)、二値胃腸疾患病変検出(ColonPath)、多ラベル大腸疾患病変検出(Endo)、二値新生児黄疸評価(NeoJaundice)、多クラス糖尿病網膜症グレーディング(Retino)。
  • ImageNet事前学習済みバックボーン(例:Swin-T、ResNeXt)を用いて、メタベースライン、VPT(視覚的プロンプトチューニング)、標準的ファインチューニングを含む、多数の少サンプル学習ベースラインを評価した。
  • 学習可能な視覚的トークンを用いたプロンプトベースチューニング(VPT)を実施し、データの10–20%のみを用いて基礎モデルを適応させ、パラメータ更新を最小限に抑えた。
  • 標準的な評価指標(正確度、AUC、mAP、平均平均精度)を用い、10回の繰り返し実験により、少サンプル設定におけるばらつきを評価した。
  • 20%の少サンプルプールを用いた完全なファインチューニングと比較し、データ拡張が性能に与える影響を評価した。
(a) ChestDR
(a) ChestDR

実験結果

リサーチクエスチョン

  • RQ1限られたデータで、多様かつ実世界の医療画像分類タスクに少サンプル適応手法が効果的に一般化できるか?
  • RQ2プロンプトベース手法(例:VPT)は、正確度、安定性、データ効率の観点から、標準的ファインチューニングに比べてどのように異なるか?
  • RQ3少サンプル手法は、一般的な疾患クラスと比較して、希少疾患クラスの分類性能をどの程度向上させるか?
  • RQ4繰り返し実行された少サンプル実験における性能のばらつきはどの程度で、異なるデータ分割において結果はどの程度安定しているか?
  • RQ5少数のサンプルしかない状況で、データ拡張はファインチューニング性能を顕著に向上させるか?

主な発見

  • VPTは、すべての5つの医療画像分類タスクにおいて、少サンプルベースラインの中で最も優れた全体的な性能を示した。
  • 10枚のサンプルしかない状況でも、特にVPTを含む少サンプル手法がファインチューニングを上回り、20%のデータで完全なファインチューニングを実施した場合と比較して、性能低下が最小限に抑えられた。
  • 10回の繰り返し10ショット実験における正確度およびAUCのばらつきは、常に5%未満であり、少サンプル学習の結果の高い安定性を示した。
  • 胸部X線分類における希少疾患クラス(テールクラス)は、少サンプル手法を用いることで、高いか同等のAUC値を達成しており、低頻度疾患に対する耐性の向上が示唆された。
  • 1〜5枚のサンプルでのファインチューニングは、過学習やアンダーフィットのため、しばしば不安定であった。これは、極めて少ないデータ環境下における従来のファインチューニングの重大な限界を示している。
  • データ拡張は、ファインチューニング性能にほとんど影響を与えず、極めて少ないショット設定下では、データ効率は主にモデル適応戦略に依存していることが示唆された。
(b) ColonPath
(b) ColonPath

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。