[論文レビュー] Unsupervised Domain Adaptation via Disentangled Representations: Application to Cross-Modality Liver Segmentation
本稿では、医療画像分類における教師なしクロスモダリティドメイン適応のための分離表現フレームワークを提案する。画像をドメイン不変のコンテンツとモダリティ固有のスタイルに分解することで、多対多マッピングを可能にする。CTのみの訓練を用いて、MRI肝臓分類で0.81のDice類似係数を達成し、CycleGAN(0.72)を上回り、マルチフェーズMRIやジョイントドメイン学習においても頑健性を示す。
A deep learning model trained on some labeled data from a certain source domain generally performs poorly on data from different target domains due to domain shifts. Unsupervised domain adaptation methods address this problem by alleviating the domain shift between the labeled source data and the unlabeled target data. In this work, we achieve cross-modality domain adaptation, i.e. between CT and MRI images, via disentangled representations. Compared to learning a one-to-one mapping as the state-of-art CycleGAN, our model recovers a many-to-many mapping between domains to capture the complex cross-domain relations. It preserves semantic feature-level information by finding a shared content space instead of a direct pixelwise style transfer. Domain adaptation is achieved in two steps. First, images from each domain are embedded into two spaces, a shared domain-invariant content space and a domain-specific style space. Next, the representation in the content space is extracted to perform a task. We validated our method on a cross-modality liver segmentation task, to train a liver segmentation model on CT images that also performs well on MRI. Our method achieved Dice Similarity Coefficient (DSC) of 0.81, outperforming a CycleGAN-based method of 0.72. Moreover, our model achieved good generalization to joint-domain learning, in which unpaired data from different modalities are jointly learned to improve the segmentation performance on each individual modality. Lastly, under a multi-modal target domain with significant diversity, our approach exhibited the potential for diverse image generation and remained effective with DSC of 0.74 on multi-phasic MRI while the CycleGAN-based method performed poorly with a DSC of only 0.52.
研究の動機と目的
- ペairedデータが存在しない状況下で、CTとMRI間のドメインシフトを解消すること。
- CycleGANにおける1対1マッピングの制限を克服すること。1対1マッピングは多様性に欠け、意味特徴の保存性が低下する可能性がある。
- モダリティに依存しない共有コンテンツ空間を学習することで、効果的な教師なしドメイン適応を実現すること。
- ジョイントドメイン学習に一般化できること。つまり、未ペアのCTおよびMRIデータを用いて1つのモデルを訓練し、両モダリティで性能を向上させること。
- 多様性が著しく高いマルチモダリティターゲットドメイン(例:マルチフェーズMRI)においても頑健性を維持し、多様な画像生成を可能にすること。
提案手法
- モデルは画像表現を、共通のコンテンツ空間(解剖学的意味を保持)とドメイン固有のスタイル空間(モダリティ特徴をエンコード)に分離する。
- デュアルエンコーダアーキテクチャを採用:各モダリティに対してコンテンツエンコーダとスタイルエンコーダを別々に設け、画像をそれぞれのコンテンツコードおよびスタイルコードにマップする。
- コンテンツコードはドメイン間で共有され、ドメイン不変特徴の学習を可能にする。一方、スタイルコードはモダリティ固有であり、多様なスタイル転送が可能になる。
- 再構成損失により、コンテンツコードとスタイルコードが元の画像を再構成できることを保証し、画像の忠実性を維持する。
- サイクル一貫性損失の代わりに、多対多マッピングをサポートする分離に基づく目的関数を採用し、表現の多様性を向上させる。
- セグメンテーションネットワークは、ソースドメイン(CT)からのコンテンツオンative表現のみで訓練され、推論はターゲットドメイン(MRI)からのコンテンツコードに適用される。
実験結果
リサーチクエスチョン
- RQ1分離表現は、医療画像分類における1対1マッピングに比べ、より効果的なクロスモダリティドメイン適応を可能にするか?
- RQ2ターゲットドメインに高い多様性(例:マルチフェーズMRI)が存在する場合、未ペアのCTおよびMRIデータに対して、本手法はどの程度の性能を示すか?
- RQ3分離表現フレームワークは、複数のモダリティからの未ペアデータを用いて1つのモデルを訓練するジョイントドメイン学習をサポートできるか?
- RQ4特に複雑で多様なマルチモダリティターゲットドメインにおいて、本モデルはCycleGANよりも意味的コンテンツをよりよく保持するか?
- RQ5スタイルコードを操作することで、同一のコンテンツコードから複数の現実的で多様なスタイル転送(例:非対照的MRI、動脈期、門脈静脈期)を生成できるか?
主な発見
- 提案手法DADRは、CTのみの訓練データを用いて、非対照的MRI分類で0.81のDice類似係数(DSC)を達成し、CycleGANベース手法(0.72)を顕著に上回った。
- 3つの対照相を持つマルチフェーズMRIにおいて、DADRモデルはDSCが0.74を維持した一方、CycleGANベース手法は急激に低下し0.52まで下がった。
- ジョイントドメイン学習への一般化性が強く示され、未ペアデータを用いて両モダリティで共同訓練した場合、CTでは0.912、MRIでは0.891のDSCを達成し、個別に訓練したモデルを上回った。
- 分離表現により、スタイルコードを変更することで多様なスタイル転送が可能となり、1つのコンテンツコードから非対照的、動脈期、門脈静脈期の複数の現実的MRI画像を生成できた。
- 共有コンテンツ空間はドメイン間で意味的解剖学的情報を効果的に保持しており、大きなドメインシフトやターゲットドメインの多様性が著しい状況下でも、頑健な適応が可能であった。
- 特にピクセル単位のスタイル転送に依存するのではなく、特徴レベルの意味的保存性に優れるため、CycleGANに比べて優れた頑健性と表現品質を示した。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。