Skip to main content
QUICK REVIEW

[论文解读] A Deep Learning Approach to Private Data Sharing of Medical Images Using Conditional GANs

Hanxi Sun, Jason Plawinski|arXiv (Cornell University)|Jun 24, 2021
AI in cancer detection参考文献 35被引用 4
一句话总结

本文提出了一种基于条件生成对抗网络(conditional GAN)的方法,用于生成保留隐私且具有临床相关性的椎体单元合成磁共振成像(MRI)图像。通过将生成器条件化于解剖位置(颈椎、胸椎、腰椎),该方法生成了高保真度、多样化且保护隐私的合成数据,支持下游任务(如模型训练),其性能与真实数据相当。

ABSTRACT

Sharing data from clinical studies can facilitate innovative data-driven research and ultimately lead to better public health. However, sharing biomedical data can put sensitive personal information at risk. This is usually solved by anonymization, which is a slow and expensive process. An alternative to anonymization is sharing a synthetic dataset that bears a behaviour similar to the real data but preserves privacy. As part of the collaboration between Novartis and the Oxford Big Data Institute, we generate a synthetic dataset based on COSENTYX (secukinumab) Ankylosing Spondylitis clinical study. We apply an Auxiliary Classifier GAN to generate synthetic MRIs of vertebral units. The images are conditioned on the VU location (cervical, thoracic and lumbar). In this paper, we present a method for generating a synthetic dataset and conduct an in-depth analysis on its properties along three key metrics: image fidelity, sample diversity and dataset privacy.

研究动机与目标

  • 为解决临床研究中因隐私顾虑导致敏感医学影像数据难以共享的问题。
  • 开发一种既能保留临床相关性又确保患者隐私的合成数据生成方法。
  • 在三个核心指标上评估合成数据:图像保真度、样本多样性与数据集隐私性。
  • 证明合成数据可有效替代真实数据用于医学影像深度学习模型的训练与验证。
  • 提供一个可复现、开源的框架,用于生成与共享合成医学影像。

提出的方法

  • 在真实椎体单元MRI图像上训练一个辅助分类器生成对抗网络(AC-GAN),并以解剖位置(颈椎、胸椎、腰椎)作为条件。
  • 生成器接收一个噪声向量 z ∈ ℝ¹⁰⁰ 和一个独热编码的条件向量 cₖ ∈ ℝ³,以生成合成图像。
  • 通过条件向量之间的线性插值实现图像形变,从而在解剖区域之间实现平滑过渡。
  • 在像素空间和嵌入空间(通过UMAP-64)中,使用成对攻击和基于分布的重识别攻击评估隐私性。
  • 生成一个包含10,000张图像的合成数据集,其类别分布与真实数据一致(25% 颈椎,55% 胸椎,20% 腰椎)。
  • 在真实数据(F2305)和合成数据上分别训练一个ResNet-18分类器,并在独立测试集(A2209)上比较其性能。

实验结果

研究问题

  • RQ1条件生成对抗网络能否生成在视觉和统计上与真实图像相似的椎体单元合成MRI图像?
  • RQ2该合成数据集是否保留了原始数据中观察到的解剖变异多样性?
  • RQ3通过成对攻击或基于分布的攻击,合成数据在多大程度上能防止原始患者的重识别?
  • RQ4在合成数据上训练的深度学习模型能否实现与在真实数据上训练的模型相当的性能?
  • RQ5该合成数据集是否可在下游临床影像分析任务中作为真实数据的有效替代?

主要发现

  • 合成图像表现出高视觉保真度,经由人工与模型评估,其感知质量与真实图像无显著差异。
  • 合成数据集完整捕捉了颈椎、胸椎与腰椎区域之间的全部解剖变异,展现出强大的样本多样性。
  • 在成对攻击中,未成功重识别出任何原始图像,像素空间与嵌入空间中的最小距离均超过重识别阈值。
  • 基于分布的攻击结果显示,没有任何合成样本位于任何真实样本的第1百分位(像素空间)或第0.1百分位(嵌入空间)以内,表明隐私保护效果显著。
  • 在合成数据上训练的ResNet-18分类器在独立测试集上AUC达到0.89,与在真实数据上训练的模型AUC(0.90)非常接近。
  • 代码与合成数据集已公开发布于 https://github.com/tcoroller/pGAN,支持可复现性与进一步研究。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。