Skip to main content
QUICK REVIEW

[論文レビュー] UniMed-CLIP: Towards a Unified Image-Text Pretraining Paradigm for Diverse Medical Imaging Modalities

Muhammad Uzair Khattak, Shahina Kunhimon|arXiv (Cornell University)|Dec 13, 2024
Radiomics and Machine Learning in Medical ImagingMedicine被引用数 3
ひとこと要約

この論文では、6つの医療画像モダリティにわたる530万枚の画像-テキストペアから構成される大規模でオープンソースのデータセットを用いて事前学習された統合的ビジョン・ランゲージモデル、UniMed-CLIPを紹介する。ラベルのみのデータセットから大規模言語モデル(LLM)を活用して高品質なキャプションを合成することで、UniMed-CLIPは、特許権のあるデータで学習された既存のモデルですら、最大+12.61ポイントの精度向上を達成し、訓練データの3分の1でさえも、最先端のゼロショット性能を実現した。

ABSTRACT

Vision-Language Models (VLMs) trained via contrastive learning have achieved notable success in natural image tasks. However, their application in the medical domain remains limited due to the scarcity of openly accessible, large-scale medical image-text datasets. Existing medical VLMs either train on closed-source proprietary or relatively small open-source datasets that do not generalize well. Similarly, most models remain specific to a single or limited number of medical imaging domains, again restricting their applicability to other modalities. To address this gap, we introduce UniMed, a large-scale, open-source multi-modal medical dataset comprising over 5.3 million image-text pairs across six diverse imaging modalities: X-ray, CT, MRI, Ultrasound, Pathology, and Fundus. UniMed is developed using a data-collection framework that leverages Large Language Models (LLMs) to transform modality-specific classification datasets into image-text formats while incorporating existing image-text data from the medical domain, facilitating scalable VLM pretraining. Using UniMed, we trained UniMed-CLIP, a unified VLM for six modalities that significantly outperforms existing generalist VLMs and matches modality-specific medical VLMs, achieving notable gains in zero-shot evaluations. For instance, UniMed-CLIP improves over BiomedCLIP (trained on proprietary data) by an absolute gain of +12.61, averaged over 21 datasets, while using 3x less training data. To facilitate future research, we release UniMed dataset, training codes, and models at https://github.com/mbzuai-oryx/UniMed-CLIP.

研究の動機と目的

  • ビジョン・ランゲージの事前学習に適した大規模でオープンアクセス可能な医療画像-テキストデータセットの不足を解決すること。
  • モダリティ特化型モデルの限界を克服し、統合的でマルチモーダルなビジョン・ランゲージ基盤モデルを開発すること。
  • LLMを用いてラベルのみの医療データセットを高品質な画像-テキストペアに変換することで、スケーラブルでデータ中心の事前学習を可能にすること。
  • 公開研究を促進するため、完全にオープンソースのデータセット、トレーニングコード、およびモデルをリリースすること。

提案手法

  • 医療スタイルのテンプレートを用いて、モダリティ固有の画像-ラベルデータセットを標準化された画像-テキストペアに変換するためのデータ収集フレームワークを開発した。
  • X線、CT、MRI、エコー、病理、Fundus画像の6つの医療画像モダリティをカバーする、合計530万件の画像-テキストデータセット「UniMed」を構築した。
  • MetaCLIPのViT-B/16ビジョンエンコーダーとBioMed-BERTテキストエンコーダーをベースにしたビジョン・ランゲージモデルを、コントラスト学習の目的関数を用いて微調整した。
  • 16台のA100 40GB GPUを用いたマルチノード環境でUniMed-CLIPを学習し、GPUあたりバッチサイズ128、初期学習率5e-5、2000ステップのウォームアップを採用した。
  • GPT-4oを用いたプロンプト工学により、疾患ラベルから一貫性があり臨床的に適切なキャプションを生成し、高品質なキャプションを確保した。
  • 合成された画像-テキストペアと既存のオープンな医療VLMデータを統合し、多様性と表現品質を向上させた。

実験結果

リサーチクエスチョン

  • RQ1オープンソースデータのみを用いて、多様な医療画像モダリティにわたる強力なゼロショット一般化を達成できる統合的ビジョン・ランゲージモデルは構築可能か?
  • RQ2LLMによって生成された合成画像-テキストペアで学習したモデルの性能は、特許権のあるデータや小規模データセットで学習したモデルと比べてどの程度優れているか?
  • RQ3LLMは、事前学習のための高品質で臨床的に関連性のある画像-テキストペアに、ラベルのみの医療データセットをどれだけ効果的に変換できるか?
  • RQ4複数のモダリティにわたるデータで学習した統合モデルは、ゼロショットおよび線形プローブ評価において、モダリティ特化型モデルを上回る性能を示すか?
  • RQ5LLMを活用したデータ拡張を用いたデータ中心のアプローチは、顕著に少ないデータ要件で最先端の性能を達成できるか?

主な発見

  • UniMed-CLIPは、訓練データの3分の1しか使用しなかったにもかかわらず、閉鎖型データで学習されたBiomedCLIPよりも、21種類の多様な医療データセットの平均で+12.61ポイントの精度向上を達成した。
  • PCamヒストパスロジー・データセットでは、100%線形プローブで85.97%の精度を達成し、BiomedCLIP(83.40%)とPMC-CLIP(81.03%)を上回った。
  • ACL MRIデータセットでは、100%線形プローブで97.28%の精度を達成し、BiomedCLIP(83.84%)とCLIP(81.09%)を上回った。
  • ODIR-2x300 Fundus画像データセットでは、100%線形プローブで95.00%の精度を達成し、BiomedCLIP(94.17%)とCLIP(91.73%)を上回った。
  • CT、MRI、網膜Fundus画像の各分野において、クラス不均衡なデータセットでも強力な性能を維持し、歪んだデータ分布下でも優れた一般化能力を示した。
  • 全6モダリティで最先端のゼロショット性能を達成し、MediMeTA(CT) や FIVES(Fundus)といった難易度の高いデータセットにおいても、前例となるモデルを大きく上回る改善を示した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。