[论文解读] Towards Realistic Ultrasound Fetal Brain Imaging Synthesis
本文提出一种基于生成对抗网络(GAN)的方法,利用扩散-超分辨率-GAN(DSR-GAN)和基于Transformer的-GAN(TB-GAN),在数据稀缺的产前超声成像背景下,合成高分辨率(256×256)胎儿经小脑后窝脑部超声图像。DSR-GAN在FID分数上显著优于TB-GAN(平均7.04,最佳5.09),而TB-GAN的平均FID为36.02,最佳为28.93,表明在数据有限的情况下,DSR-GAN具有更优的真实感和训练稳定性。
Prenatal ultrasound imaging is the first-choice modality to assess fetal health. Medical image datasets for AI and ML methods must be diverse (i.e. diagnoses, diseases, pathologies, scanners, demographics, etc), however there are few public ultrasound fetal imaging datasets due to insufficient amounts of clinical data, patient privacy, rare occurrence of abnormalities in general practice, and limited experts for data collection and validation. To address such data scarcity, we proposed generative adversarial networks (GAN)-based models, diffusion-super-resolution-GAN and transformer-based-GAN, to synthesise images of fetal ultrasound brain planes from one public dataset. We reported that GAN-based methods can generate 256x256 pixel size of fetal ultrasound trans-cerebellum brain image plane with stable training losses, resulting in lower FID values for diffusion-super-resolution-GAN (average 7.04 and lower FID 5.09 at epoch 10) than the FID values of transformer-based-GAN (average 36.02 and lower 28.93 at epoch 60). The results of this work illustrate the potential of GAN-based methods to synthesise realistic high-resolution ultrasound images, leading to future work with other fetal brain planes, anatomies, devices and the need of a pool of experts to evaluate synthesised images. Code, data and other resources to reproduce this work are available at \url{https://github.com/budai4medtech/midl2023}.
研究动机与目标
- 解决因数据稀缺、隐私顾虑及专家资源有限导致的公开胎儿超声数据集不足这一关键挑战。
- 开发一种基于深度生成模型的数据增强策略,以合成逼真、高分辨率的胎儿脑部超声图像,提升人工智能/机器学习模型的训练效果。
- 评估两种GAN架构——扩散-超分辨率-GAN与基于Transformer的-GAN——在小规模公开数据集上生成经小脑后窝切面图像的性能。
- 证明即使在真实数据有限的情况下,基于GAN的图像合成仍能生成逼真图像,且训练稳定,FID分数较低。
- 为未来利用合成数据实现其他胎儿脑部切面、解剖结构及成像设备的图像合成奠定基础。
提出的方法
- 采用两阶段生成框架:首先,使用微调后的去噪扩散概率模型(DDPM)生成128×128像素图像,随后通过超分辨率生成对抗网络(SRGAN)上采样至256×256像素。
- 在真实图像与合成图像之间应用直方图匹配,以对齐色彩分布,提升视觉真实感。
- 对于基于Transformer的-GAN,采用包含Swin Transformer模块的StyleSwin架构,以捕捉高频细节,同时降低内存占用。
- 应用可微分数据增强(DiffAug)与自适应伪增强(APA),以防止因训练数据量小而导致判别器过拟合。
- 使用带有两时间尺度更新规则的Adam优化器进行模型训练,并通过在经丘脑平面数据上预训练,再在经小脑后窝图像上微调的方式实现迁移学习。
- 图像质量通过Fréchet Inception Distance(FID)进行评估,该指标衡量真实图像与生成图像之间的分布相似性。

实验结果
研究问题
- RQ1基于GAN的方法能否有效从一个小规模公开数据集合成逼真的256×256胎儿经小脑后窝脑部超声图像?
- RQ2在训练稳定性和图像质量方面,扩散-超分辨率-GAN与基于Transformer的-GAN有何差异?
- RQ3数据增强与迁移学习在有限胎儿超声数据上训练GAN时,能在多大程度上提升其性能?
- RQ4在本研究背景下,FID分数能否可靠地反映合成胎儿超声图像的真实感?
- RQ5此类合成数据在支持未来胎儿脑部超声成像中人工智能/机器学习应用方面具有多大潜力?
主要发现
- 扩散-超分辨率-GAN(DSR-GAN)在第10轮训练时达到平均FID分数7.04,最佳FID为5.09,表明其具有高度真实感和稳定训练表现。
- 基于Transformer的-GAN(TB-GAN)的FID分数显著更高,平均为36.02,最佳为28.93(第60轮),表明其生成图像真实感较低。
- DSR-GAN相比TB-GAN展现出更快收敛速度与更稳定的训练损失,而TB-GAN需训练60轮才达到最佳FID性能。
- 采用直方图匹配后,真实图像与合成图像之间的色彩一致性得到改善,显著提升了视觉合理性。
- 从更大的经丘脑平面数据集迁移学习,显著提升了TB-GAN在较小经小脑后窝数据集上的微调性能。
- 结果表明,即使在临床数据有限的情况下,基于GAN的图像合成仍是一种可行方案,可生成逼真胎儿超声图像,支持未来数据高效的人工智能发展。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。