[论文解读] Semantic Segmentation with Generative Models: Semi-Supervised Learning and Strong Out-of-Domain Generalization
本文提出了一种基于生成对抗网络(GAN)的语义分割框架,联合建模图像与标签分布,实现仅用极少标注数据的半监督学习。通过在测试时优化潜在码,并从推理得到的嵌入生成分割掩码,该方法在域内性能达到最先进水平,并实现了前所未有的域外泛化能力——在医学影像中实现从CT到MRI的迁移,在真实人脸与绘画、雕塑及动物面部之间实现跨域泛化。
Training deep networks with limited labeled data while achieving a strong generalization ability is key in the quest to reduce human annotation efforts. This is the goal of semi-supervised learning, which exploits more widely available unlabeled data to complement small labeled data sets. In this paper, we propose a novel framework for discriminative pixel-level tasks using a generative model of both images and labels. Concretely, we learn a generative adversarial network that captures the joint image-label distribution and is trained efficiently using a large set of unlabeled images supplemented with only few labeled ones. We build our architecture on top of StyleGAN2, augmented with a label synthesis branch. Image labeling at test time is achieved by first embedding the target image into the joint latent space via an encoder network and test-time optimization, and then generating the label from the inferred embedding. We evaluate our approach in two important domains: medical image segmentation and part-based face segmentation. We demonstrate strong in-domain performance compared to several baselines, and are the first to showcase extreme out-of-domain generalization, such as transferring from CT to MRI in medical imaging, and photographs of real faces to paintings, sculptures, and even cartoons and animal faces. Project Page: \url{https://nv-tlabs.github.io/semanticGAN/}
研究动机与目标
- 解决语义分割等密集像素级任务中高标注成本的挑战,特别是在医学影像等专家标注昂贵的领域。
- 克服判别式模型在泛化到分布外数据(如不同成像模态或艺术表现形式)时的局限性。
- 通过结合大规模未标注数据与少量标注样本,实现高效的半监督学习。
- 开发统一的生成式框架,建模图像与语义标签的联合分布,支持对新域的零样本与少样本适应。
提出的方法
- 将StyleGAN2改造为条件生成器,以建模图像与分割掩码的联合分布,并引入专用的标签生成分支。
- 使用对抗性目标训练生成器与判别器,其中图像判别器与掩码判别器分别确保生成图像与标签的真实性。
- 使用独立的编码器网络,通过图像与掩码上的监督重建损失,将输入图像映射至潜在码。
- 在测试时对潜在码进行优化,以重建输入图像,随后从优化后的嵌入生成标签。
- 利用训练好的生成模型合成大规模、全标注的合成数据,用于训练判别式分割网络。
- 采用截断与多样性导向的采样策略,生成高质量的合成数据,用于数据增强与迁移学习。

实验结果
研究问题
- RQ1一个仅学习图像-标签联合分布的纯生成式模型,能否在仅使用极少标注数据的情况下实现具有竞争力的语义分割性能?
- RQ2该生成式模型在泛化到域外输入(如不同成像模态,例如从CT到MRI;或艺术表现形式,例如绘画、卡通)方面的能力有多强?
- RQ3在域内与极端域外设置下,该生成式模型的性能与判别式基线相比如何?
- RQ4在该半监督生成式框架中,标注数据与未标注数据的相对价值如何?数据量的变化对分割mIoU有何影响?
- RQ5该生成式模型能否用于合成高质量、多样化且对下游判别式分割模型有用的训练数据?
主要发现
- 所提方法在CelebA-Mask上达到0.7600的mIoU,在MetFaces-40上达到0.6336,优于强基线模型,在域内与域外设置下均表现优异。
- 仅使用150张标注图像与3,000张未标注图像,模型即达到0.7046的mIoU,与使用1,500张标注图像与28,000张未标注图像(mIoU为0.7566)的性能相当,展现出极高的数据效率。
- 通过模型生成的合成数据可提升下游分割性能:使用20,000张合成样本并结合混合策略,MetFaces上的mIoU达到0.7192,超越仅使用真实数据的基线模型。
- 该模型对极端域外输入表现出惊人泛化能力,即使仅在真实人脸数据上进行训练,也能为动物面部、雕塑与卡通图像生成合理分割结果。
- 对潜在码进行测试时优化显著优于直接使用编码器推理,凸显潜在空间精细化的重要性。
- 该生成式方法在少样本与零样本分割任务中均优于基于合成数据训练的判别式模型与真实数据基线,确立了新的SOTA性能。

更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。