Skip to main content
QUICK REVIEW

[論文レビュー] VIS-MAE: An Efficient Self-supervised Learning Approach on Medical Image Segmentation and Classification

Zelong Liu, Andrew Tieu|arXiv (Cornell University)|Feb 1, 2024
Brain Tumor Detection and ClassificationNeuroscience被引用数 3
ひとこと要約

VIS-MAE は、CT、MR、PET、X線、超音波モダリティを含む 250 万枚のラベルなし医療画像で事前学習された自己教師ありビジョントランスフォーマーベースの基盤モデルです。ラベル効率が高く、医療画像分類およびセグメンテーションにおいて最先端の性能を達成しており、ラベル付きデータの 50–80% のみで微調整された場合でもベンチマークを上回ります。

ABSTRACT

Artificial Intelligence (AI) has the potential to revolutionize diagnosis and segmentation in medical imaging. However, development and clinical implementation face multiple challenges including limited data availability, lack of generalizability, and the necessity to incorporate multi-modal data effectively. A foundation model, which is a large-scale pre-trained AI model, offers a versatile base that can be adapted to a variety of specific tasks and contexts. Here, we present VIsualization and Segmentation Masked AutoEncoder (VIS-MAE), novel model weights specifically designed for medical imaging. Specifically, VIS-MAE is trained on a dataset of 2.5 million unlabeled images from various modalities (CT, MR, PET,X-rays, and ultrasound), using self-supervised learning techniques. It is then adapted to classification and segmentation tasks using explicit labels. VIS-MAE has high label efficiency, outperforming several benchmark models in both in-domain and out-of-domain applications. In addition, VIS-MAE has improved label efficiency as it can achieve similar performance to other models with a reduced amount of labeled training data (50% or 80%) compared to other pre-trained weights. VIS-MAE represents a significant advancement in medical imaging AI, offering a generalizable and robust solution for improving segmentation and classification tasks while reducing the data annotation workload. The source code of this work is available at https://github.com/lzl199704/VIS-MAE.

研究の動機と目的

  • ラベル付き医療画像データの限界を克服するため、汎用的な基盤モデルの開発を目的とする。
  • CT、MR、PET、X線、超音波など多様な医療画像モダリティにわたるモデルの汎化性能を向上させることを目的とする。
  • 下流の分類およびセグメンテーションタスクにおけるラベル効率を高めることを目的とする。
  • 事前学習段階で手動アノテーションを必要とせずに、効果的なマルチモodal表現学習を可能とすることを目的とする。
  • 臨床現場での医療画像分野への導入に耐えうる、強固で転送可能なAI基盤を提供することを目的とする。

提案手法

  • VIS-MAE はマスクドオートエンコーダ(MAE)フレームワークを採用しており、入力医療画像のランダムなパッチをマスクし、可視パッチからそれらを再構築する。
  • モデルは、多様な画像モダリティからなる大規模な 250 万枚のラベルなし医療画像データセットで事前学習される。
  • ビジョントランスフォーマーベースを用いて、医療画像内の長距離依存関係および空間階層を捉える。
  • 微調整段階では、ラベル付きデータのわずかな割合を用いて分類およびセグメンテーションタスクに適応させる。
  • 画像タイプに応じたモダリティ固有の正規化およびデータ拡張戦略をアーキテクチャに組み込むことで、さまざまな画像タイプにわたる耐性を向上させる。
  • 自己教師あり事前学習により、下流タスクの微調整の前に汎用的な特徴を学習可能となる。

実験結果

リサーチクエスチョン

  • RQ1多様でラベルなしの医療画像で事前学習された自己教師あり基盤モデルは、下流のセグメンテーションおよび分類性能を向上させることができるか?
  • RQ2限られたラベル付きデータで微調整された場合、VIS-MAE の性能は既存の事前学習済みモデルと比べてどの程度優れているか?
  • RQ3VIS-MAE は、異なる画像モダリティおよび臨床的タスクにどの程度汎化可能か?
  • RQ4医療画像にマスクドオートエンコーディングを適用することで、より強固で転送可能な表現が得られるか?
  • RQ5VIS-MAE は、正確性を損なわせることなく、医療画像AIにおけるアノテーション負荷を軽減できるか?

主な発見

  • VIS-MAE は、ドメイン内およびドメイン外の両設定において、複数の医療画像セグメンテーションおよび分類ベンチマークで最先端の性能を達成しており、既存のモデルを上回っている。
  • モデルは、ラベル付きデータの 50% のみで微調整されても高い性能を維持しており、優れたラベル効率を示している。
  • VIS-MAE は、CT、MR、PET、X線、超音波を含む多様な画像モダリティにわたって強力な汎化性能を示している。
  • 250 万枚のラベルなし画像を用いた自己教師あり事前学習は、限られたデータでの教師あり事前学習よりも、下流タスクの精度を顕著に向上させている。
  • 分類およびインスタンスセグメンテーションの両タスクで競争力のある結果を達成しており、広範な適用可能性を示している。
  • ソースコードは公開されており、再現性および医療AI分野におけるさらなる研究を支援している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。