Skip to main content
QUICK REVIEW

[論文レビュー] Multi-modal AsynDGAN: Learn From Distributed Medical Image Data without Sharing Private Information

Qi Chang, Zhennan Yan|arXiv (Cornell University)|Dec 15, 2020
AI in cancer detection参考文献 48被引用数 8
ひとこと要約

本論文では、患者の生データを共有せずに複数の医療機関間で協調的に学習できるプライバシー保護型分散GANフレームワーク、Multi-modal AsynDGANを提案する。中央集権的な生成器と分散型の識別器を用いることで、複数の施設における統合的データ分布を学習し、高精細な合成医療画像を生成する。また、脳腫瘍セグメンテーションなどの下流タスクにおいて、訓練時のモダリティ欠落があっても、実データ学習と同等の性能を達成する。

ABSTRACT

As deep learning technologies advance, increasingly more data is necessary to generate general and robust models for various tasks. In the medical domain, however, large-scale and multi-parties data training and analyses are infeasible due to the privacy and data security concerns. In this paper, we propose an extendable and elastic learning framework to preserve privacy and security while enabling collaborative learning with efficient communication. The proposed framework is named distributed Asynchronized Discriminator Generative Adversarial Networks (AsynDGAN), which consists of a centralized generator and multiple distributed discriminators. The advantages of our proposed framework are five-fold: 1) the central generator could learn the real data distribution from multiple datasets implicitly without sharing the image data; 2) the framework is applicable for single-modality or multi-modality data; 3) the learned generator can be used to synthesize samples for down-stream learning tasks to achieve close-to-real performance as using actual samples collected from multiple data centers; 4) the synthetic samples can also be used to augment data or complete missing modalities for one single data center; 5) the learning process is more efficient and requires lower bandwidth than other distributed deep learning methods.

研究の動機と目的

  • ヒーパイやGDPRなどの厳格なプライバシー保護規制のため、医療機関間での共同医療画像解析が困難であるという課題に対処すること。
  • 生画像データを共有せず、患者のプライバシーを損なわず、分散型で多モダリティ医療画像データセットからの学習を可能にすること。
  • 単一および多モダリティデータの両方の生成と欠落モダリティ補完をサポートするスケーラブルで効率的なフレームワークの開発。
  • 元の機微なデータセットへのアクセスを必要とせず、セグメンテーションなどの下流タスクを支援する合成データ生成パイプラインの提供。
  • 従来のフェデレーテッドラーニング手法と比較して、通信オーバーヘッドを低減し、効率性を向上させること。

提案手法

  • フレームワークは中央集権的な生成器と、複数の分散型識別器を採用しており、それぞれ局所的な実データと生成されたデータから学習される。
  • 生成器は、局所的な実データと生成サンプルの間の敵対的損失を最小化することで、複数の機関における統合的データ分布を学習する。
  • 生データのプライバシーを保つために、通信されるのは合成画像、アノテーション(例:セグメンテーションマスク)、および損失勾配のみである。
  • 各施設の利用可能なモダリティを条件として生成器に与えることで、多モダリティ学習を可能にし、一部のモダリティが欠落している場合でも学習が可能である。
  • フレームワークは、さまざまなGAN損失関数(例:ワッサーシュタイン距離)やネットワークアーキテクチャと互換性があり、拡張可能である。
  • 欠落モダリティ補完は、訓練済みの生成器を用いて欠落しているモダリティの合成画像を生成し、それを下流タスクでの実データの拡張に用いることで達成される。

実験結果

リサーチクエスチョン

  • RQ1生データを共有せずに、複数の機関の多モダリティ医療画像の統合的データ分布を分散型GANフレームワークが学習できるか?
  • RQ2分散型で不完全なデータセットから学習した生成器が、下流の医療画像解析タスクを支援できるような合成画像をどれほど正確に生成できるか?
  • RQ3本フレームワークが生成する合成データは、ローカルまたは不完全な実データで学習する場合と比較して、セグメンテーション性能をどの程度向上できるか?
  • RQ4本フレームワークは、利用可能なデータと訓練済みの生成器のみを用いて、医療画像データセットの欠落モダリティを効果的に補完できるか?
  • RQ5本フレームワークの通信効率および学習速度は、医療画像分野における既存のフェデレーテッドラーニングやGANベースの手法と比較してどの程度優れているか?

主な発見

  • AsynDGANから得た合成データのみで学習したセグメンテーションモデルは、Diceスコア80.9±14.1を達成し、'Other'施設の実データで学習したモデル(Real-Other(n/a:T1c))と同等の性能を示した。
  • CBICAデータセットにおいて、合成T1c画像を用いて欠落モダリティを補完したところ、セグメンテーションDiceスコアは78.0±23.4から83.0±14.6に向上した。
  • TCIAデータセットでは、合成Flair画像の生成により、Diceスコアが76.7±15.3から85.5±10.4に向上し、欠落モダリティ補完において顕著な性能向上を示した。
  • 一部のデータセンターが特定のモダリティ(例:T2やFlair)を欠落している場合でも、多モダリティの合成画像を正常に生成できたことから、データの非均質性に対する耐性が確認された。
  • 合成データで学習したモデルの性能は、実データで学習したモデルと同等であったため、生成されたサンプルの忠実性と実用性が裏付けられた。
  • 生画像を送信しない代わりに勾配と合成データのみを送信するため、従来のフェデレーテッドラーニングと比較して通信オーバーヘッドが削減された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。