Skip to main content
QUICK REVIEW

[論文レビュー] M3AE: Multimodal Representation Learning for Brain Tumor Segmentation with Missing Modalities

Hong Liu, Wei Dong|arXiv (Cornell University)|Mar 9, 2023
Brain Tumor Detection and ClassificationNeuroscience被引用数 3
ひとこと要約

本論文は、M3AEと呼ばれる、脳腫瘍セグメンテーションのための新しい自己教師ありマルチモーダルマスクドオートエンコーダー枠組みを提案する。このフレームワークは、事前学習中にランダムにマスクされたモダリティと画像パッチを同時に処理することで、臨床的・技術的制約によりMRIモダリティが欠損している状況に対処する。モデル逆転を用いて欠損モダリティの代替として代表的なフルモダリティ画像を生成し、メモリ効率の良い自己蒸留を用いて異種の欠損モダリティ状況間で知識を統合することで、単一のコンactなモデルでBraTS 2018および2020で最先端の性能を達成する。

ABSTRACT

Multimodal magnetic resonance imaging (MRI) provides complementary information for sub-region analysis of brain tumors. Plenty of methods have been proposed for automatic brain tumor segmentation using four common MRI modalities and achieved remarkable performance. In practice, however, it is common to have one or more modalities missing due to image corruption, artifacts, acquisition protocols, allergy to contrast agents, or simply cost. In this work, we propose a novel two-stage framework for brain tumor segmentation with missing modalities. In the first stage, a multimodal masked autoencoder (M3AE) is proposed, where both random modalities (i.e., modality dropout) and random patches of the remaining modalities are masked for a reconstruction task, for self-supervised learning of robust multimodal representations against missing modalities. To this end, we name our framework M3AE. Meanwhile, we employ model inversion to optimize a representative full-modal image at marginal extra cost, which will be used to substitute for the missing modalities and boost performance during inference. Then in the second stage, a memory-efficient self distillation is proposed to distill knowledge between heterogenous missing-modal situations while fine-tuning the model for supervised segmentation. Our M3AE belongs to the 'catch-all' genre where a single model can be applied to all possible subsets of modalities, thus is economic for both training and deployment. Extensive experiments on BraTS 2018 and 2020 datasets demonstrate its superior performance to existing state-of-the-art methods with missing modalities, as well as the efficacy of its components. Our code is available at: https://github.com/ccarliu/m3ae.

研究の動機と目的

  • 臨床的・技術的制約によりT1、T1c、T2、FLAIRの1つ以上のMRIモダリティが欠損している状況における脳腫瘍セグメンテーションの課題に対処すること。
  • 再トレーニングを必要とせず、すべての可能な欠損モダリティのサブセットに一般化可能な「万能」フレームワークを構築すること。
  • 欠損データ下でのモダリティ内およびモダリティ間の依存関係を捉える自己教師あり事前学習を通じて、頑健なマルチモーダル表現を学習すること。
  • モデル逆転を用いて、推論時に欠損モダリティの高品質で最適化された代替画像を生成することで、推論性能を向上させること。
  • 二重ネットワーク共同学習に比べて過剰なメモリやパラメータのオーバーヘッドを回避しながら、異種の欠損モダリティ構成間で効率的に意味的知識を蒸留すること。

提案手法

  • 事前学習中に、ランダムなMRIモダリティのサブセットと、残りのモダリティからのランダムな空間的パッチを同時にマスクするマルチモーダルマスクドオートエンコーダー(M3AE)を提案する。
  • M3AEの再構成損失を自己教師あり信号として用い、欠損データに対して耐性のある頑健なマルチモーダル表現を学習する。
  • M3AE損失を逆伝播することで最適化された代表的フルモダリティ画像を生成するモデル逆転を適用し、推論時に欠損モダリティの高品質な代替として使用可能にする。
  • 異なる欠損モダリティ構成間で知識を転送するための、メモリ効率の良い自己蒸留戦略を導入し、二重ネットワーク共同学習に比べてパラメータのオーバーヘッドを低減する。
  • 共有重みを持つ単一のエンコーダ-デコーダアーキテクチャを採用し、モデルの再トレーニングなしにすべての可能なモダリティ組み合わせへの展開を可能にする。
  • エンドツーエンドで学習する:まずフルモダリティデータ上でM3AEの事前学習を行い、次に異種の欠損モダリティ状況で自己蒸留によるファインチューニングを行う。

実験結果

リサーチクエスチョン

  • RQ1自己教師ありマルチモーダルマスクドオートエンコーダーは、欠損モダリティ下でも一般化可能な頑健な表現を効果的に学習できるか?
  • RQ2モデル逆転に基づくモダリティ補完は、モダリティが欠損している状況でセグメンテーション性能を向上させるか?
  • RQ3メモリ効率の良い自己蒸留は、多様な欠損モダリティ構成間で意味的知識を効果的に転送できるか?
  • RQ4提案されたM3AEフレームワークは、すべての欠損モダリティ状況で、既存の最先端手法を上回るセグメンテーション精度を達成するか?
  • RQ5単一モデル・万能設計を踏まえ、実世界への展開において効率的で実用的か?

主な発見

  • M3AEは、BraTS 2018のテストスプリットにおいて、すべての欠損モダリティ状況で最高の平均Dice係数(DSC)を達成し、4つの最先端手法を上回った。
  • アブレーションスタディの結果、M3AEの事前学習やパッチマスクを省いた場合に顕著な性能低下が生じ、これらが頑健な表現学習に不可欠であることを裏付けた。
  • モデル逆転に基づく代替法は、ゼロフィルイングや訓練データの平均画像を用いる場合よりも顕著にDSCを向上させ、平均画像法は性能を低下させることも確認した。
  • 提案された自己蒸留戦略は、ベースライン蒸留法を上回る性能を発揮し、二重ネットワーク共同学習に比べて約470万のパラメータを削減した。
  • フルモダリティの検証セットにおいて、M3AEはBraTS 2018で最先端の性能を達成し、チャレンジ外の最先端手法を上回り、チャレンジ優勝モデルに対しても競争力を持つ結果となった。
  • 腫瘍領域(浮腫、強化腫瘍、壊死巣)すべてにおいて、さまざまな欠損モダリティ条件下でも強力な性能を維持し、一般化性と頑健性を示した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。