Skip to main content
QUICK REVIEW

[論文レビュー] Towards Foundation Models and Few-Shot Parameter-Efficient Fine-Tuning for Volumetric Organ Segmentation

Julio Silva-Rodríguez, José Dolz|arXiv (Cornell University)|Mar 29, 2023
Radiomics and Machine Learning in Medical ImagingMedicine被引用数 3
ひとこと要約

本論文は、基礎モデルを用いたボリュメトリック臓器セグメンテーションのための、新しい少サンプル効率的微調整(FSEFT)フレームワークを提案する。空間アダプタモジュールと制約付き帰納的推論を導入することで、最小限のラベル付きデータでパラメータ効率的な適応を実現する。本手法は、完全な教師あり微調整に近い性能を達成するとともに、パラメータ更新を削減し、低データの臨床的状況におけるロバスト性を向上させる。

ABSTRACT

The recent popularity of foundation models and the pre-train-and-adapt paradigm, where a large-scale model is transferred to downstream tasks, is gaining attention for volumetric medical image segmentation. However, current transfer learning strategies devoted to full fine-tuning for transfer learning may require significant resources and yield sub-optimal results when the labeled data of the target task is scarce. This makes its applicability in real clinical settings challenging since these institutions are usually constrained on data and computational resources to develop proprietary solutions. To address this challenge, we formalize Few-Shot Efficient Fine-Tuning (FSEFT), a novel and realistic scenario for adapting medical image segmentation foundation models. This setting considers the key role of both data- and parameter-efficiency during adaptation. Building on a foundation model pre-trained on open-access CT organ segmentation sources, we propose leveraging Parameter-Efficient Fine-Tuning and black-box Adapters to address such challenges. Furthermore, novel efficient adaptation methodologies are introduced in this work, which include Spatial black-box Adapters that are more appropriate for dense prediction tasks and constrained transductive inference, leveraging task-specific prior knowledge. Our comprehensive transfer learning experiments confirm the suitability of foundation models in medical image segmentation and unveil the limitations of popular fine-tuning strategies in few-shot scenarios.

研究の動機と目的

  • 臨床的制約によりラベル付きデータが限られる状況を想定し、医療画像セグメンテーションの現実的で少サンプルの微調整設定を形式化すること。
  • 低データ環境下での標準的微調整の限界(過学習や計算コストの高さ)を解消すること。
  • 3次元ボリュメトリックセグメンテーションに特化した、パラメータ効率的な微調整戦略の開発を目的とし、空間アダプタとタスク固有のインダクティブバイアスを活用すること。
  • 少サンプル条件下で、多様な公的CTデータセットに対して提案手法の有効性を評価すること。

提案手法

  • 事前学習済みの3次元セグメンテーションバックボーンの層間へ、密度予測タスク(例:臓器セグメンテーション)に特化した空間アダプタモジュールを挿入する。
  • 解剖学的事前知識(例:臓器の体積比制約)を組み込んだ制約付き帰納的推論機構を採用し、少数のサンプルで一般化性能を向上させる。
  • BTCVデータセットで事前学習された基礎モデルを用い、アダプタパラメータのみで微調整する「事前学習+適応」パラダイムを採用する。
  • アダプタを少数のラベル付きサンプルで学習し、臓器の形態に関する事前知識を用いて推論段階を正則化するハイブリッドなトレーニング・インフェンス戦略を適用する。
  • 主なバックボーン重みを凍結したまま、アダプタパラメータのみを最適化することで、メモリおよび計算リソースの大幅な削減を実現する。
  • ゼロショットおよび少サンプルの転移性能を評価するため、複数の公的CTデータセットを対象とした多データセット評価プロトコルを採用する。

実験結果

リサーチクエスチョン

  • RQ1新しい臓器セグメンテーションタスクにおいて、1〜5例程度のラベル付きサンプルしか利用できない場合、標準的微調整手法は効果的に一般化できるか?
  • RQ23次元医療画像セグメンテーションにおいて、低データ環境下でパラメータ効率的微調整戦略は、完全微調整と比較してどの程度優れているか?
  • RQ3標準的なアダプタモジュールと比較して、空間アダプタは密度予測タスクでどの程度性能を向上させるか?
  • RQ4制約付き帰納的推論による解剖学的事前知識の統合は、少サンプル環境下でセグメンテーション精度を向上させるか?
  • RQ5多様なデータセットで事前学習された基礎モデルは、最小限のラベル付きデータで、新たな臨床的タスクに効果的に適応可能か?

主な発見

  • 標準的微調整手法は、少数サンプル(1〜5例)での使用時、性能が著しく低下し、一部のケースでDiceスコアが0.5未満にまで低下する。
  • 提案された空間アダプタモジュールは、標準アダプタと比較して平均Diceスコアを最大0.012向上させ、特に肝臓や膵臓のような複雑な形状の臓器で効果を発揮する。
  • 制約付き帰納的推論によりさらに性能向上が達成され、5ショット設定でDiceスコアが最大0.016向上し、特に小規模または不規則な形状の臓器で顕著に効果を示す。
  • アダプタと帰納的推論を組み合わせた完全なフレームワークは、10ショット設定で平均Diceスコア0.783を達成し、完全微調整(0.787)に非常に近い性能を発揮する一方、パラメータ更新率はわずか0.04%にまで低減される。
  • 線形プローブと標準アダプタは低データ環境下で性能を発揮せず、10ショットで平均Diceスコアは0.771にとどまる。これは、より表現力の高い適応機構の必要性を示唆する。
  • 本手法は多様なCTデータセットにわたって良好な一般化性能を示し、新しい臓器や画像プロトコルに適応しても、強力なベースラインを常に上回る一貫した性能向上を達成する。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。