Skip to main content
QUICK REVIEW

[论文解读] Multi-modal AsynDGAN: Learn From Distributed Medical Image Data without Sharing Private Information

Qi Chang, Zhennan Yan|arXiv (Cornell University)|Dec 15, 2020
AI in cancer detection参考文献 48被引用 8
一句话总结

该论文提出了一种名为Multi-modal AsynDGAN的隐私保护分布式生成对抗网络框架,可在不共享原始患者数据的情况下,实现医疗机构间的协作训练。通过采用集中式生成器和分布式判别器,该模型学习多个机构之间的联合数据分布,生成高保真度的合成医学图像,并在下游任务(如脑肿瘤分割)中实现与真实数据训练相当的性能,即使在训练机构缺少某些模态的情况下亦是如此。

ABSTRACT

As deep learning technologies advance, increasingly more data is necessary to generate general and robust models for various tasks. In the medical domain, however, large-scale and multi-parties data training and analyses are infeasible due to the privacy and data security concerns. In this paper, we propose an extendable and elastic learning framework to preserve privacy and security while enabling collaborative learning with efficient communication. The proposed framework is named distributed Asynchronized Discriminator Generative Adversarial Networks (AsynDGAN), which consists of a centralized generator and multiple distributed discriminators. The advantages of our proposed framework are five-fold: 1) the central generator could learn the real data distribution from multiple datasets implicitly without sharing the image data; 2) the framework is applicable for single-modality or multi-modality data; 3) the learned generator can be used to synthesize samples for down-stream learning tasks to achieve close-to-real performance as using actual samples collected from multiple data centers; 4) the synthetic samples can also be used to augment data or complete missing modalities for one single data center; 5) the learning process is more efficient and requires lower bandwidth than other distributed deep learning methods.

研究动机与目标

  • 为解决由于严格的隐私和数据保护法规(如HIPAA和GDPR)导致的跨机构医学图像协作分析挑战。
  • 实现在不共享原始图像数据或损害患者隐私的前提下,从分布式的多模态医学图像数据集中进行学习。
  • 开发一种可扩展且高效的框架,支持单模态和多模态数据生成以及缺失模态补全。
  • 提供一种合成数据生成流程,支持下游任务(如分割)而无需访问原始私有数据集。
  • 相比现有的联邦学习方法,在医学影像领域中降低通信开销并提高效率。

提出的方法

  • 该框架采用集中式生成器和多个分布式判别器,每个判别器在本地真实数据和生成器生成的合成数据上进行训练。
  • 生成器通过最小化本地真实数据与生成样本之间的对抗损失,学习多个机构之间的联合数据分布。
  • 仅在节点之间传输合成图像、标注(例如分割掩码)和损失梯度,从而保护原始数据隐私。
  • 通过在每个站点可用模态的条件下对生成器进行条件控制,支持多模态学习,即使某些模态缺失亦可实现。
  • 该框架具有可扩展性,兼容多种生成对抗网络损失函数(例如Wasserstein距离)和网络架构。
  • 通过使用训练好的生成器为缺失模态生成合成图像,实现缺失模态补全,这些合成图像随后用于在下游任务中增强真实数据。

实验结果

研究问题

  • RQ1是否能够通过分布式生成对抗网络框架,在不共享原始数据的情况下,从多个机构的多模态医学图像中学习到联合数据分布?
  • RQ2在分布式且不完整的数据集上训练的生成器,其生成的合成图像在多大程度上能支持下游医学图像分析任务?
  • RQ3与在本地或不完整的真实数据上训练相比,该框架生成的合成数据在多大程度上能提升分割性能?
  • RQ4该框架是否能仅利用可用数据和训练好的生成器,有效补全医学影像数据集中的缺失模态?
  • RQ5与现有的联邦学习或基于生成对抗网络的医学影像方法相比,该框架在通信效率和训练速度方面表现如何?

主要发现

  • 仅使用AsynDGAN生成的合成数据进行训练的分割模型,Dice分数达到80.9±14.1,与在'Other'机构真实数据上训练的模型性能相当(Real-Other(n/a:T1c))。
  • 当使用合成T1c图像补全'CBICA'数据集中的缺失模态时,分割Dice分数从78.0±23.4提升至83.0±14.6。
  • 对于'TCIA'数据集,合成Flair图像的生成使Dice分数从76.7±15.3提升至85.5±10.4,表明在缺失模态补全方面实现了显著的性能提升。
  • 即使某些数据中心缺乏特定模态(如T2或Flair),该框架仍能成功生成多模态合成图像,显示出对数据异质性的强鲁棒性。
  • 在合成数据上训练的模型性能与在真实数据上训练的模型相当,表明生成样本具有高度保真度和实用性。
  • 与传统联邦学习相比,该方法降低了通信开销,因为仅传输梯度和合成数据,而非原始图像。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。