[论文解读] A Two Stage GAN for High Resolution Retinal Image Generation and Segmentation
本文提出了一种两阶段 GAN 框架,仅使用少量真实训练样本即可生成高分辨率视网膜图像及其对应的语义血管标记图。首先,渐进式生长 GAN (Progressively Growing GAN) 生成逼真的血管结构掩码;随后,图像到图像翻译模型将这些掩码转换为逼真的视网膜图像。所生成的数据在预训练后微调真实数据的设置下,使视网膜血管分割性能达到最先进水平,在 DRIVE 和 CHASE_DB1 基准测试中均优于现有方法。
In recent years, the use of deep learning is becoming increasingly popular in computer vision. However, the effective training of deep architectures usually relies on huge sets of annotated data. This is critical in the medical field where it is difficult and expensive to obtain annotated images. In this paper, we use Generative Adversarial Networks (GANs) for synthesizing high quality retinal images, along with the corresponding semantic label-maps, to be used instead of real images during the training process. Differently from other previous proposals, we suggest a two step approach: first, a progressively growing GAN is trained to generate the semantic label-maps, which describe the blood vessel structure (i.e. vasculature); second, an image-to-image translation approach is used to obtain realistic retinal images from the generated vasculature. By using only a handful of training samples, our approach generates realistic high resolution images, that can be effectively used to enlarge small available datasets. Comparable results have been obtained employing the generated images in place of real data during training. The practical viability of the proposed approach has been demonstrated by applying it on two well established benchmark sets for retinal vessel segmentation, both containing a very small number of training samples. Our method obtained better performances with respect to state-of-the-art techniques.
研究动机与目标
- 解决医学深度学习中视网膜图像标注数据集有限的关键挑战。
- 克服生成具有准确语义标注的高分辨率、逼真医学图像的困难。
- 开发一种数据高效的方法,以合成多样化、高质量的视网膜图像及其对应的血管分割掩码。
- 证明合成数据可有效预训练深度分割网络,从而在小样本真实数据集上提升性能。
- 通过利用合成数据增强,在仅使用极少数真实图像的情况下实现最先进的血管分割结果。
提出的方法
- 在少量真实视网膜标记图上训练渐进式生长 GAN (PGGAN),以生成高分辨率的语义血管掩码。
- 将生成的标记图作为输入,送入条件图像到图像翻译网络(如 Pix2Pix 或类似模型),以合成逼真的视网膜图像。
- 两阶段设计将语义结构生成与视觉真实感分离,降低 GPU 显存需求并提升训练稳定性。
- 该框架为每个数据集(DRIVE 和 CHASE_DB1)生成 10,000 对合成图像-标记图对,用于数据增强。
- 采用三种训练协议训练分割多尺度注意力网络(SMANet):仅使用合成数据、仅使用真实数据,以及先在合成数据上预训练再在真实数据上微调。
- 该方法实现了有效的迁移学习,即在合成数据上预训练可提升模型泛化能力,再在真实数据上微调。
实验结果
研究问题
- RQ1两阶段 GAN 流程能否仅从少量真实训练样本中生成高分辨率、逼真的视网膜图像及准确的语义血管标记图?
- RQ2通过该方法生成的合成数据能否有效提升基于深度学习的视网膜血管分割性能?
- RQ3在低数据场景下,先在合成数据上预训练再在真实数据上微调,是否优于仅在真实数据上训练?
- RQ4所提方法在基准视网膜血管分割数据集上的性能与最先进技术相比如何?
- RQ5将语义结构与视觉外观生成相分离,在多大程度上提升了图像质量与训练效率?
主要发现
- 在 DRIVE 数据集上,使用该方法生成的合成数据训练 SMANet,AUC 达到 98.65%,准确率达到 96.90%,与仅使用真实数据训练的性能相当。
- 在 CHASE_DB1 数据集上,该方法的 AUC 达到 99.16%,准确率达到 97.72%,超越了该基准上所有先前报告的结果。
- 与仅使用真实数据训练相比,先在合成数据上预训练再在真实数据上微调,使 DRIVE 数据集的 AUC 提升 0.17,CHASE_DB1 数据集的 AUC 提升 0.34。
- 仅使用合成数据训练的 SMANet 达到了与真实数据训练相当的性能,表明合成图像有效捕捉了数据的潜在分布。
- 两阶段方法相比端到端 GAN 训练显著降低了 GPU 显存需求,使在资源有限条件下实现高分辨率图像生成成为可能。
- 该框架具有良好的泛化能力,不限于视网膜成像,提示其在其他医学影像领域亦具潜在应用价值。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。