Skip to main content
QUICK REVIEW

[论文解读] Learning Foreground-Background Segmentation from Improved Layered GANs

Yang Yu, Hakan Bilen|arXiv (Cornell University)|Apr 1, 2021
Video Surveillance and Tracking Methods被引用 4
一句话总结

该论文提出了一种改进的分层生成对抗网络(GAN),通过最大化潜在码与生成图像/掩码之间的互信息,实现前景与背景的解耦,从而实现成对图像和分割掩码的高质量合成。该方法通过交替训练 GAN 和分割网络,采用分析-合成框架,在 CUB、Cars、Dogs 和 APC 数据集上实现了无监督前景-背景分割的最先进性能。

ABSTRACT

Deep learning approaches heavily rely on high-quality human supervision which is nonetheless expensive, time-consuming, and error-prone, especially for image segmentation task. In this paper, we propose a method to automatically synthesize paired photo-realistic images and segmentation masks for the use of training a foreground-background segmentation network. In particular, we learn a generative adversarial network that decomposes an image into foreground and background layers, and avoid trivial decompositions by maximizing mutual information between generated images and latent variables. The improved layered GANs can synthesize higher quality datasets from which segmentation networks of higher performance can be learned. Moreover, the segmentation networks are employed to stabilize the training of layered GANs in return, which are further alternately trained with Layered GANs. Experiments on a variety of single-object datasets show that our method achieves competitive generation quality and segmentation performance compared to related methods.

研究动机与目标

  • 通过自动合成成对图像和掩码,减少对昂贵人工标注分割掩码的依赖。
  • 解决无监督条件下分层 GAN 中出现的平凡分解(例如全部为前景或全部为背景)问题。
  • 通过潜在码与生成内容之间互信息的最大化,提升前景与背景的解耦程度。
  • 利用 GAN 生成的合成数据实现分割网络的端到端训练。
  • 通过分割网络的反馈稳定 GAN 训练,形成相互促进的循环。

提出的方法

  • 分层 GAN 架构从两个独立的潜在码生成背景和前景:一个共享的‘公共’码和一个用于前景的私有‘私有’码。
  • 通过最大化合成图像与私有潜在码之间的互信息,鼓励生成多样化且有意义的前景。
  • 同时最大化前景掩码与私有码之间的互信息,以确保语义一致性。
  • 在图像合成过程中引入扰动,以惩罚平凡的全前景分解,提升模型鲁棒性。
  • 分割网络在合成数据上进行训练,并在交替训练过程中用于正则化 GAN。
  • 该框架采用分析-合成方法,其中分割性能提升 GAN 的解耦能力,反之亦然。

实验结果

研究问题

  • RQ1潜在码与生成图像之间的互信息最大化,能否提升分层 GAN 中前景-背景的解耦性能?
  • RQ2此类 GAN 生成的合成图像-掩码对是否能在无人工标注的情况下实现具有竞争力的分割性能?
  • RQ3分割网络的反馈能否提升分层 GAN 训练的稳定性和生成质量?
  • RQ4与基于 VAE 和先前基于 GAN 的无监督分割方法相比,该方法在真实世界数据集上的表现如何?
  • RQ5该方法是否能泛化到单目标基准之外的多类别数据集?

主要发现

  • 在 CUB 数据集上,该方法达到 81.7% 的 mIoU,显著优于 PerturbGAN(38.0% mIoU),并较 Melas-Kyriazi 等人(66.4% IoU)高出 3.3 个百分点。
  • 在 CUB 数据集上,该方法实现 94.3% 的准确率和 69.7% 的 IoU,表现出与最先进无监督方法相当的性能。
  • 在 APC 数据集上,FID 得分为 103.9,显著低于 GENESIS-V2 的 245.6,表明图像生成质量更优。
  • 定性结果表明,与 GENESIS-V2 相比,该方法生成的分割掩码更精细、更准确,尤其在复杂真实图像上表现更优。
  • 该方法可泛化至多类别数据集,在 APC 数据集中成功生成并分割多类别图像。
  • 消融实验表明,互信息最大化是缓解全背景和平凡分解问题的关键。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。