Skip to main content
QUICK REVIEW

[论文解读] Finding an Unsupervised Image Segmenter in Each of Your Deep Generative Models

Luke Melas-Kyriazi, Christian Rupprecht|arXiv (Cornell University)|May 17, 2021
Generative Adversarial Networks and Image Synthesis参考文献 59被引用 20
一句话总结

本文提出一种无监督方法,可自动发现预训练深度生成模型(如 GAN)潜在空间中的前景-背景分割方向,无需人工监督。通过学习一个能改变图像亮度和一致性的通用潜在方向,该方法生成合成分割掩码以训练分割网络,在 CUB200 和牛津花卉等多样化数据集上实现了最先进的无监督性能。

ABSTRACT

Recent research has shown that numerous human-interpretable directions exist in the latent space of GANs. In this paper, we develop an automatic procedure for finding directions that lead to foreground-background image separation, and we use these directions to train an image segmentation model without human supervision. Our method is generator-agnostic, producing strong segmentation results with a wide range of different GAN architectures. Furthermore, by leveraging GANs pretrained on large datasets such as ImageNet, we are able to segment images from a range of domains without further training or finetuning. Evaluating our method on image segmentation benchmarks, we compare favorably to prior work while using neither human supervision nor access to the training data. Broadly, our results demonstrate that automatically extracting foreground-background structure from pretrained deep generative models can serve as a remarkably effective substitute for human supervision.

研究动机与目标

  • 开发一种无监督、与生成器无关的方法,用于发现 GAN 中能实现前景-背景图像分离的有意义潜在方向。
  • 仅使用 GAN 生成的合成掩码训练分割模型,而无需真实训练数据或人工标注。
  • 证明即使训练和测试数据分布显著不同,也可通过单一预训练生成器在多种图像领域实现高质量分割。
  • 表明分割性能与 GAN 质量相关,提示前景/背景结构在图像生成过程中被隐式学习。
  • 建立一种新范式:可从生成模型中自动提取显著性、对象分离等概念,以替代视觉任务中的人工监督。

提出的方法

  • 该方法采用探测方案,学习一个固定的、全局的潜在偏移量,以诱导图像外观变化,特别针对亮度和一致性,以分离前景和背景区域。
  • 其优化目标平衡图像亮度变化与结构一致性,使用超参数 λ 控制这两个因素之间的权衡。
  • 该方法识别出两个互补的潜在方向:一个使前景变亮(vl),另一个使前景变暗(vb),两者均来自同一优化过程。
  • 利用 GAN 和发现的潜在方向,生成大规模图像-掩码对合成数据集,随后以完全监督的方式训练标准分割网络。
  • 该方法完全自动化,无需人工标注或模型特定调参,适用于广泛 GAN 架构。
  • 最终分割模型在真实世界基准上进行评估,无需进一步微调,证明其在不同领域间的泛化能力。

实验结果

研究问题

  • RQ1能否自动发现 GAN 潜在空间中的通用潜在方向,以实现无需人工监督的前景-背景图像分离?
  • RQ2在仅使用预训练 GAN 生成的合成数据训练的分割模型,能在多大程度上泛化到真实世界、多样化的图像数据集?
  • RQ3所得到的分割模型性能是否与底层 GAN 的质量相关,提示前景/背景结构在训练过程中被隐式编码?
  • RQ4该方法能否在不使用任何真实训练标签或数据的情况下,超越现有无监督或手工设计的显著性检测方法?
  • RQ5同一潜在方向能否在多种 GAN 架构(包括在不同数据集和分辨率上训练的模型)上使用,以实现一致的分割性能?

主要发现

  • 该方法在 CUB200 和牛津花卉等基准上实现了最先进的无监督图像分割性能,优于以往无监督方法且无需人工监督。
  • 所有 12 个评估的 GAN(包括在 TinyImageNet 上训练的模型)均产生合理的分割结果,证明该方法在多种生成器架构中的广泛适用性。
  • 表现最佳的 GAN(BigBiGAN)达到最高分割准确率,且 FID 分数(衡量 GAN 质量的指标)与分割性能之间存在强正相关。
  • 同时使用前景变亮(vl)和前景变暗(vb)潜在方向,性能可媲美集成两个独立模型,但计算成本几乎可忽略。
  • 该方法在显著性检测基准上也取得具有竞争力的结果,通常匹配或超过监督方法和手工设计方法,尽管未使用任何真实训练数据或标签。
  • 消融实验确认 λ = 0.2 时亮度变化与一致性的权衡达到最优,且两个方向并非精确反向,这是由于生成器函数的非线性所致。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。