[论文解读] Synthetic Learning: Learn From Distributed Asynchronized Discriminator GAN Without Sharing Medical Image Data
该论文提出 AsynDGAN,一种保护隐私的分布式 GAN 框架,可在不访问原始医学影像的情况下,让中心生成器从多个医院学习数据分布。通过在各机构使用异步判别器并生成用于下游分割任务的合成数据,AsynDGAN 实现了与使用全部真实数据训练的模型相当的性能,同时确保了数据隐私并减少了通信开销。
In this paper, we propose a data privacy-preserving and communication efficient distributed GAN learning framework named Distributed Asynchronized Discriminator GAN (AsynDGAN). Our proposed framework aims to train a central generator learns from distributed discriminator, and use the generated synthetic image solely to train the segmentation model.We validate the proposed framework on the application of health entities learning problem which is known to be privacy sensitive. Our experiments show that our approach: 1) could learn the real image's distribution from multiple datasets without sharing the patient's raw data. 2) is more efficient and requires lower bandwidth than other distributed deep learning methods. 3) achieves higher performance compared to the model trained by one real dataset, and almost the same performance compared to the model trained by all real datasets. 4) has provable guarantees that the generator could learn the distributed distribution in an all important fashion thus is unbiased.
研究动机与目标
- 解决医疗人工智能中数据隐私的关键挑战,其中 HIPAA 等法规限制了患者扫描数据在机构间的共享。
- 克服由于监管和机构壁垒导致的大规模集中式医学影像数据集难以获取的问题。
- 开发一种通信高效、保护隐私的框架,实现在不共享原始数据的情况下,跨多个医疗机构协同训练。
- 仅使用从分布式私有数据集生成的合成数据,实现高性能的下游医学图像分割。
- 确保生成器能够学习到多个机构间整体数据分布的无偏、忠实表示。
提出的方法
- 提出一种具有中心生成器和多个分布在各医疗机构的判别器的分布式异步判别器 GAN(AsynDGAN)框架。
- 每个判别器在其私有数据集上本地运行,并仅通过梯度反馈更新中心生成器,而不传输原始图像。
- 使用异步训练以减少通信延迟,并提升在分布式站点中的可扩展性。
- 仅利用本地判别器的梯度信号,训练生成器以生成模仿所有机构真实数据分布的合成图像。
- 将训练好的生成器用于生成无限量的合成图像,以微调特定任务的模型(如分割网络)。
- 通过确保中心生成器从不访问或存储原始患者图像,仅依赖本地判别器的梯度更新,来保障隐私。
实验结果
研究问题
- RQ1中心生成器能否在不直接访问原始图像的情况下,从未公开的多个医学数据集中学习到真实的数据分布?
- RQ2AsynDGAN 生成的合成图像能否实现与使用全部真实数据训练的模型相当的分割性能?
- RQ3AsynDGAN 是否优于在单一机构子集数据上训练的模型?
- RQ4与医学影像中的其他分布式学习方法相比,AsynDGAN 在通信效率和训练速度方面表现如何?
- RQ5AsynDGAN 是否能提供可证明的保证,即生成器能够以无偏方式学习到各机构间整体数据分布?
主要发现
- 在细胞核分割任务中,AsynDGAN 达到了 0.7930 的 Dice 评分,优于在任一单一医疗机构数据上训练的模型(如前列腺数据集为 0.7704),并与使用全部真实数据训练的模型(Dice: 0.7833)性能相当。
- 在 AsynDGAN 生成的合成图像上训练的模型,达到了 0.7930 的 Dice 评分和 0.5608 的 AJI 评分,与 Real-All 基线模型(Dice: 0.7833,AJI: 0.5608)性能匹配,并优于 Syn-All 模型(Dice: 0.7856)。
- AsynDGAN 显著优于在单一机构数据集上训练的模型,如 Real-Subset-breast(Dice: 0.7340)和 Real-Subset-liver(Dice: 0.7639)。
- 该框架通信效率高,由于仅传输梯度而非原始数据,其带宽需求低于其他分布式深度学习方法。
- 生成器学习到了多个机构间整体数据分布的忠实、无偏表示,这由高质量的合成图像和具有竞争力的下游性能所证实。
- 该方法提供了可证明的保证:即使未直接访问原始图像,生成器也能以无偏方式学习到分布式数据分布。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。