Skip to main content
QUICK REVIEW

[论文解读] SeGAN: Segmenting and Generating the Invisible

Kiana Ehsani, Roozbeh Mottaghi|arXiv (Cornell University)|Mar 29, 2017
Advanced Neural Network Applications参考文献 49被引用 4
一句话总结

SeGAN 提出了一种基于 GAN 的模型,利用合成的、逼真的训练数据,联合实现对遮挡物体不可见部分的分割与生成。该方法在分割不可见区域、生成逼真外观以及从遮挡关系中推断深度分层方面均优于当前最先进方法,在无需微调的情况下也能有效泛化至自然图像。

ABSTRACT

Objects often occlude each other in scenes; Inferring their appearance beyond their visible parts plays an important role in scene understanding, depth estimation, object interaction and manipulation. In this paper, we study the challenging problem of completing the appearance of occluded objects. Doing so requires knowing which pixels to paint (segmenting the invisible parts of objects) and what color to paint them (generating the invisible parts). Our proposed novel solution, SeGAN, jointly optimizes for both segmentation and generation of the invisible parts of objects. Our experimental results show that: (a) SeGAN can learn to generate the appearance of the occluded parts of objects; (b) SeGAN outperforms state-of-the-art segmentation baselines for the invisible parts of objects; (c) trained on synthetic photo realistic images, SeGAN can reliably segment natural images; (d) by reasoning about occluder occludee relations, our method can infer depth layering.

研究动机与目标

  • 解决在物体部分被遮挡的场景中,推断其外观与分割不可见部分的挑战。
  • 联合优化不可见区域的分割与其实现逼真外观的生成,克服单独使用分割或生成方法的局限性。
  • 利用大规模、高精度的合成数据进行学习,其遮挡边界精确,避免了人工标注不可见区域数据时存在的主观性与噪声。
  • 实现从合成训练数据到真实世界自然图像的零样本泛化,适用于未见过的物体实例。
  • 通过建模遮挡物-被遮挡物关系来推断深度分层,实现相对深度排序,而无需显式的深度监督。

提出的方法

  • SeGAN 采用条件生成对抗网络框架,其中生成器根据输入图像和可见区域掩码,联合预测不可见物体部分的分割掩码与外观。
  • 模型采用双流生成器结构:一个分支预测不可见区域的分割掩码(SI),另一分支生成这些区域的像素级外观。
  • 判别器经过训练,能够区分真实与生成的图像-掩码对,从而在外观真实性和空间一致性方面施加约束。
  • 训练仅在具有真实遮挡边界的合成逼真场景上进行,为不可见区域提供精确监督。
  • 该架构与类别无关,无需语义类别标签,而是依赖于空间关系与遮挡推理。
  • 通过检查潜在遮挡物的可见掩码与被遮挡物预测的不可见掩码之间的交并比(IoU),推断深度分层,设定 5% 的阈值。

实验结果

研究问题

  • RQ1深度学习模型能否联合学习在遮挡场景中对不可见物体部分进行分割与外观生成?
  • RQ2联合优化分割与生成是否优于单独或顺序处理的方法?
  • RQ3在合成数据上训练的模型能否在不进行微调的情况下泛化至真实世界自然图像?
  • RQ4模型能否在无显式深度监督的情况下,从遮挡模式中推断出深度分层?
  • RQ5与当前最先进基线方法相比,该模型在分割、生成与深度排序方面的性能如何?

主要发现

  • SeGAN 在预测不可见区域方面优于当前最先进分割基线,在合成数据上达到 58.9% 的 SI IoU。
  • 在自然图像上,SeGAN 表现出良好的泛化能力,尽管仅在合成数据上进行训练,仍达到 50.7% 的 SI IoU。
  • 该模型能生成逼真的不可见部分外观,其外观生成质量优于基于 GAN 的基线方法。
  • 在合成数据上,SeGAN 在深度分层推断方面达到 84.04% 的准确率,显著优于单图像深度基线(60.18%)。
  • 在训练中同时使用合成与自然数据会降低性能,表明存在领域偏移问题。
  • 模型通过分析掩码交并比,成功推断出遮挡物-被遮挡物关系,仅凭遮挡线索即可实现相对深度排序。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。