Skip to main content
QUICK REVIEW

[論文レビュー] Synthetic Learning: Learn From Distributed Asynchronized Discriminator GAN Without Sharing Medical Image Data

Qi Chang, Hui Qu|arXiv (Cornell University)|May 29, 2020
AI in cancer detection被引用数 9
ひとこと要約

本論文では、複数の病院の生体画像に直接アクセスせずに、中央に配置された生成器が複数の病院から得たデータ分布を学習するプライバシー保護型分散GANフレームワーク、AsynDGANを提案する。各施設に配置された非同期な識別器を用い、下流のセグメンテーションタスク用に合成データを生成することで、AsynDGANは、すべての実データで訓練されたモデルと同等の性能を達成しながら、データのプライバシーを確保し、通信負荷を低減する。

ABSTRACT

In this paper, we propose a data privacy-preserving and communication efficient distributed GAN learning framework named Distributed Asynchronized Discriminator GAN (AsynDGAN). Our proposed framework aims to train a central generator learns from distributed discriminator, and use the generated synthetic image solely to train the segmentation model.We validate the proposed framework on the application of health entities learning problem which is known to be privacy sensitive. Our experiments show that our approach: 1) could learn the real image's distribution from multiple datasets without sharing the patient's raw data. 2) is more efficient and requires lower bandwidth than other distributed deep learning methods. 3) achieves higher performance compared to the model trained by one real dataset, and almost the same performance compared to the model trained by all real datasets. 4) has provable guarantees that the generator could learn the distributed distribution in an all important fashion thus is unbiased.

研究の動機と目的

  • ヒーパー(HIPAA)などの規制が、患者スキャンの機関間共有を制限する医療AIにおけるデータプライバシーの重大な課題に対処する。
  • 規制的・機関的障壁のため、大規模で中央集権的な医療画像データセットの入手が制限される問題を克服する。
  • 生データを共有せずに、通信効率的でプライバシー保護型のフレームワークを提供し、複数の医療機関間での共同学習を可能にする。
  • 分散的・プライベートなデータセットから生成された合成データのみを用いて、高精度な下流の医療画像セグメンテーションを実現する。
  • 生成器が複数の機関にまたがる全体のデータ分布を偏りのない忠実な表現として学習することを保証する。

提案手法

  • 中央に配置された生成器と、各医療機関に分散配置された複数の識別器を備えた分散非同期識別器GAN(AsynDGAN)フレームワークを提案する。
  • 各識別器は、自らのプライベートなデータセット上でローカルに動作し、生画像を送信せずに勾配フィードバックを中央の生成器に提供する。
  • 非同期学習を用いることで、通信遅延を低減し、分散された拠点間でのスケーラビリティを向上させる。
  • ローカルの識別器からの勾配信号のみを用いて、すべての機関の実データ分布を模倣する合成画像を生成器が生成するように訓練する。
  • 訓練された生成器を用いて、セグメンテーションネットワークのようなタスク固有のモデルのファインチューニングに無制限の合成画像を生成する。
  • 中央の生成器が生患者画像を一切アクセスまたは保存しないようにし、ローカルの識別器からの勾配更新にのみ依存することで、プライバシーを確保する。

実験結果

リサーチクエスチョン

  • RQ1中央の生成器は、生画像への直接アクセスがなくても、複数のプライベートな医療画像データセットから真のデータ分布を学習できるか?
  • RQ2AsynDGANが生成する合成画像は、すべての実データで訓練されたモデルと同等のセグメンテーション性能を達成できるか?
  • RQ3AsynDGANは、単一機関のデータセットで訓練されたモデルを上回る性能を示すか?
  • RQ4AsynDGANは、医療画像分野における他の分散学習手法と比較して、通信効率と学習速度の点で優れているか?
  • RQ5生成器が、生画像への直接アクセスがなくても、複数の機関にまたがる全データ分布を偏りのない形で学習できる、保証可能なプロバイルが可能か?

主な発見

  • AsynDGANは、核細胞セグメンテーションでDiceスコア0.7930を達成し、任意の1つの医療機関のデータで訓練されたモデル(例:前立腺:0.7704)を上回り、すべての実データで訓練されたモデル(Dice:0.7833)と同等の性能を示した。
  • AsynDGANから生成された合成画像で訓練されたモデルは、Diceスコア0.7930、AJI 0.5608を達成し、Real-Allベースライン(Dice:0.7833、AJI:0.5608)と同等の性能を示し、Syn-All(Dice:0.7856)を上回った。
  • AsynDGANは、単一機関のデータセットで訓練されたモデル、例えばReal-Subset-breast(Dice:0.7340)やReal-Subset-liver(Dice:0.7639)を顕著に上回った。
  • 本フレームワークは通信効率が高く、生画像の送信ではなく勾配の送信のみであるため、他の分散ディープラーニング手法よりも帯域幅が低い。
  • 高品質な合成画像と下流タスクでの競争力のある性能から、生成器が複数の機関にまたがる全体のデータ分布を忠実で偏りのない表現として学習していることが裏付けられた。
  • 本手法は、生画像への直接アクセスがなくても、生成器が分散データ分布を偏りのない形で学習できるという、保証可能なプロバイルを提供する。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。