Skip to main content
QUICK REVIEW

[論文レビュー] Leveraging Foundation Models for Content-Based Image Retrieval in Radiology

Stefan Denner, David Zimmerer|arXiv (Cornell University)|Mar 11, 2024
Radiomics and Machine Learning in Medical Imaging被引用数 4
ひとこと要約

本論文では、特に弱教師ありモデルであるBiomedCLIPを、放射線科におけるコンテンツベース医療画像検索(CBIR)のためのオフザシェル特徴抽出器として使用することを提案する。185の病態をカバーする4つのモダリティにわたる160万枚の画像データセットを用いたベンチマークにおいて、BiomedCLIPは微調整なしでP@1が0.594を達成し、特化型モデルを上回る性能を示し、多様な病態にわたる優れた一般化性能を示した。

ABSTRACT

Content-based image retrieval (CBIR) has the potential to significantly improve diagnostic aid and medical research in radiology. However, current CBIR systems face limitations due to their specialization to certain pathologies, limiting their utility. On the other hand, several vision foundation models have been shown to produce general-purpose visual features. Therefore, in this work, we propose using vision foundation models as powerful and versatile off-the-shelf feature extractors for content-based image retrieval. Our contributions include: (1) benchmarking a diverse set of vision foundation models on an extensive dataset comprising 1.6 million 2D radiological images across four modalities and 161 pathologies; (2) identifying weakly-supervised models, particularly BiomedCLIP, as highly effective, achieving a achieving a P@1 of up to 0.594 (P@3: 0.590, P@5: 0.588, P@10: 0.583), comparable to specialized CBIR systems but without additional training; (3) conducting an in-depth analysis of the impact of index size on retrieval performance; (4) evaluating the quality of embedding spaces generated by different models; and (5) investigating specific challenges associated with retrieving anatomical versus pathological structures. Despite these challenges, our research underscores the vast potential of foundation models for CBIR in radiology, proposing a shift towards versatile, general-purpose medical image retrieval systems that do not require specific tuning. Our code, dataset splits and embeddings are publicly available under https://github.com/MIC-DKFZ/foundation-models-for-cbmir.

研究の動機と目的

  • 現在のCBIRシステムの一般化性能が限られていること、特に特定の病態の狭い範囲でのみ学習されていることに対処する。
  • 基礎モデルがタスク固有の微調整なしに、多様な用途に適した汎用的特徴抽出器として機能できるかどうかを調査する。
  • 大規模かつマルチモダリティ、マルチパスロジーの放射線科データセット上で、監視付き、自己教師あり、弱教師ありの多様な基礎モデルの性能を評価する。
  • 病理的構造と解剖的構造の検索における課題を分析し、インデックスサイズが検索性能に与える影響を評価する。
  • 今後の研究のための包括的ベンチマークを提供するため、コード、データセット、埋め込み表現を公開する。

提案手法

  • RadImageNet、NIH14、MIMIC、CheXpertの4つの公開データセットを統合し、CT、MR、X線、超音波の4つのモダリティにわたる2D放射線画像として合計160万枚の画像を含む一貫したデータセットを構築した。
  • 微調整なしで特徴抽出に使用するため、ResNet、ViT、SAM、MedSAM、CLIP、MedCLIP、BiomedCLIP、MAE、DINOv2を含む12種類のビジョン基礎モデルを用いた。
  • 効率的な類似度検索のため、FAISSを用いて画像埋め込みをインデックス化し、P@1および平均平均精度(mAP)を用いて検索性能を評価した。
  • クラスあたりのインデックス化サンプル数(5〜3000)を変化させることで、性能の飽和状態とクラスタリング挙動を評価するアブレーションスタディを実施した。
  • kNN分類と線形プローブによるF1スコアおよびAUPRCを用いて、埋め込み空間の質を評価し、クラスタリングの良さと特徴の関連性を分析した。

実験結果

リサーチクエスチョン

  • RQ1ビジョン基礎モデルは、医療画像検索のための特徴抽出器としてどの程度の性能を示すか?
  • RQ2ビジョン基礎モデルの性能は、特化型の病態固有のCBIRシステムと比べてどうか?
  • RQ3インデックスサイズが医療CBIRシステムの検索性能に与える影響は何か?
  • RQ4ビジョン基礎モデルの埋め込み空間は、病理的構造と解剖的構造の両方をどの程度適切に捉えているか?

主な発見

  • BiomedCLIPは、全データセットで最高のP@1(0.594)を達成し、微調整なしで特化型モデルでさえも上回った。
  • 弱教師ありモデル(BiomedCLIPやCLIP)は優れた一般化性能を示し、特にBiomedCLIPは埋め込み空間でのクラスタリングが最も優れていた(kNN F1スコア:0.667マクロ)。
  • インデックス内での1クラスあたりのサンプル数が約1000に達すると検索性能が飽和し、それ以上の増加は限界効果を示した。
  • 解剖的クラスの検索精度が病理的クラスよりも高かったため、埋め込み空間内では病理的特徴が識別しにくいことが示唆された。
  • CLIPは線形分類性能が最高(AUPRC:0.743マイクロ)を記録し、医療特化型でないにもかかわらず、病理学的特徴の質が非常に高いことを示した。
  • 自己教師ありモデル(DINOv2やViT)も線形プローブ性能が高く、医療データでの微調整によりCBIRへの応用可能性が非常に高いことが示唆された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。