Skip to main content
QUICK REVIEW

[论文解读] Medical Image Synthesis for Data Augmentation and Anonymization using Generative Adversarial Networks

Hoo-Chang Shin, Neil Tenenholtz|arXiv (Cornell University)|Jul 26, 2018
Generative Adversarial Networks and Image Synthesis参考文献 6被引用 14
一句话总结

本文提出一种基于条件生成对抗网络(conditional GAN)的方法,通过分割掩码生成多参数磁共振成像(MRI)扫描,用于脑部肿瘤的图像合成,实现数据增强与数据匿名化。当使用合成数据补充真实数据时,该方法可提升肿瘤分割性能;在仅使用合成数据并配合微调的情况下,其性能可与真实数据训练相当,为医学影像中的数据稀缺与隐私保护问题提供了有效解决方案。

ABSTRACT

Data diversity is critical to success when training deep learning models. Medical imaging data sets are often imbalanced as pathologic findings are generally rare, which introduces significant challenges when training deep learning models. In this work, we propose a method to generate synthetic abnormal MRI images with brain tumors by training a generative adversarial network using two publicly available data sets of brain MRI. We demonstrate two unique benefits that the synthetic images provide. First, we illustrate improved performance on tumor segmentation by leveraging the synthetic images as a form of data augmentation. Second, we demonstrate the value of generative models as an anonymization tool, achieving comparable tumor segmentation results when trained on the synthetic data versus when trained on real subject data. Together, these results offer a potential solution to two of the largest challenges facing machine learning in medical imaging, namely the small incidence of pathological findings, and the restrictions around sharing of patient data.

研究动机与目标

  • 解决由于罕见病理表现导致的标注医学影像数据有限的问题。
  • 克服深度学习模型在脑肿瘤分割训练中面临的数据稀缺与类别不平衡问题。
  • 开发一种生成多样化、逼真合成MRI图像的方法,同时保留解剖结构与病理学变异。
  • 通过使用合成的、匿名化的图像,实现在不暴露真实患者数据的前提下实现数据共享与模型训练。
  • 证明仅使用合成数据训练的模型可达到与使用真实数据训练的模型相当的性能。

提出的方法

  • 在两个公开的MRI数据集(ADNI 和 BRATS)上训练条件图像到图像翻译生成对抗网络,以分割掩码作为输入。
  • 以四维多参数MRI(T1、T2、T1c、Flair)作为输入和输出,保持空间关系与对比度一致性。
  • 通过在脑部解剖与肿瘤的分割图上条件化生成对抗网络,生成合成MRI图像,从而实现对肿瘤大小、位置与外观的控制。
  • 在训练过程中应用标准数据增强技术(裁剪、旋转、平移、弹性形变),以对比有无合成数据时的性能差异。
  • 分别在仅真实数据、真实+合成数据、仅合成数据上训练分割模型,并对后者使用10%的真实数据进行微调。
  • 使用BRATS'15数据集的保留测试集上的Dice分数评估性能。

实验结果

研究问题

  • RQ1由生成对抗网络生成的合成MRI图像是否能提升深度学习模型在脑肿瘤分割中的性能?
  • RQ2仅使用合成数据训练的模型在多大程度上能达到与使用真实患者数据训练的模型相当的性能?
  • RQ3使用合成数据是否能减少对真实患者数据的依赖,同时保持模型的泛化能力与诊断准确性?
  • RQ4与传统数据增强技术相比,引入合成数据在提升分割性能方面有何优势?
  • RQ5生成模型能否在不损害模型实用性的前提下,有效实现医学影像数据的匿名化?

主要发现

  • 在真实数据中加入合成数据进行训练时,基于生成对抗网络的模型Dice分数达到0.80/0.07,而仅使用真实数据训练时为0.64/0.14,表明性能有显著提升。
  • 当仅使用合成数据训练并在10%真实数据上微调后,模型Dice分数达到0.80/0.18,接近真实数据训练模型的性能。
  • 当仅使用合成数据且数据量超过真实数据五倍时,模型Dice分数达到0.81/0.09,表明合成数据可作为有效的预训练数据。
  • 即使不使用标准数据增强,合成数据仍能带来性能提升,表明生成对抗网络生成的图像提供了独特且非冗余的数据多样性。
  • 表现最佳的模型(Wang et al. [20])在真实+合成数据上达到0.86/0.09的Dice分数,而本研究的生成对抗网络模型达到0.82/0.08,尽管分辨率较低,仍表现出具有竞争力的性能。
  • 结果表明,合成数据生成可有效应对数据稀缺问题,并实现医学影像中的隐私保护型数据共享。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。