Skip to main content
QUICK REVIEW

[论文解读] Weakly Supervised Object Discovery by Generative Adversarial & Ranking Networks

Ali Diba, Vivek Sharma|arXiv (Cornell University)|Nov 22, 2017
Generative Adversarial Networks and Image Synthesis参考文献 52被引用 5
一句话总结

本文提出了一种新颖的弱监督目标检测框架,结合生成对抗网络(GANs)与排序损失,从杂乱场景中合成逼真的目标实例。通过使用相似性排序目标训练条件GAN,模型能够在无需边界框标注的情况下学习生成特定目标模板,从而实现弱监督目标检测,并在MS-COCO和PASCAL VOC数据集上提升了定位性能。

ABSTRACT

The deep generative adversarial networks (GAN) recently have been shown to be promising for different computer vision applications, like image edit- ing, synthesizing high resolution images, generating videos, etc. These networks and the corresponding learning scheme can handle various visual space map- pings. We approach GANs with a novel training method and learning objective, to discover multiple object instances for three cases: 1) synthesizing a picture of a specific object within a cluttered scene; 2) localizing different categories in images for weakly supervised object detection; and 3) improving object discov- ery in object detection pipelines. A crucial advantage of our method is that it learns a new deep similarity metric, to distinguish multiple objects in one im- age. We demonstrate that the network can act as an encoder-decoder generating parts of an image which contain an object, or as a modified deep CNN to rep- resent images for object detection in supervised and weakly supervised scheme. Our ranking GAN offers a novel way to search through images for object specific patterns. We have conducted experiments for different scenarios and demonstrate the method performance for object synthesizing and weakly supervised object detection and classification using the MS-COCO and PASCAL VOC datasets.

研究动机与目标

  • 通过利用生成模型解决无真实边界框标注的弱监督目标检测挑战。
  • 仅使用图像级别标签,在杂乱场景中发现并合成逼真的目标实例。
  • 通过排序目标学习一种深度相似性度量,以区分单张图像中的多个目标。
  • 通过生成伪真实模板来提升目标检测性能。
  • 利用幻觉生成的、GAN生成的目标样本作为监督信号,实现弱监督目标检测。

提出的方法

  • 提出一种条件GAN架构,其中生成器利用类别标签和空间条件从场景中合成特定目标实例。
  • 引入一种新颖的排序损失,通过比较真实与生成目标的特征嵌入,促使生成器产生更逼真且更具区分度的样本。
  • 使用CNN编码器提取图像特征,随后由生成器利用这些特征生成特定目标的图像块。
  • 判别器用于区分真实图像与生成图像,而排序网络则确保同一类别的生成样本彼此更相似,而非同类样本则差异更大。
  • 通过多种损失组件(对抗损失、重建损失及所提出的排序损失)端到端训练整个模型管道。
  • 将训练好的模型用于生成合成数据以进行数据增强,从而提升弱监督设置下的检测性能。

实验结果

研究问题

  • RQ1带有排序目标的生成对抗网络能否有效在杂乱场景中发现并合成单个目标实例?
  • RQ2在无边界框标注的情况下,所提方法在弱监督目标检测中的表现如何?
  • RQ3与标准GAN或基线方法相比,所学习的相似性度量是否能提升目标定位与分类性能?
  • RQ4所生成的目标模板能否作为弱监督设置下训练目标检测器的有效伪真实标签?
  • RQ5该方法在MS-COCO和PASCAL VOC等数据集上的泛化能力如何?

主要发现

  • 在使用VGG-16和合成数据的情况下,该方法在MS-COCO测试集上达到46.4%的mAP,优于先前的弱监督方法。
  • 在PASCAL VOC 2007上,使用VGG-16时mAP达到55.8%,使用数据增强后提升至58.6%,超过当前最先进基线方法。
  • 在PASCAL VOC 2007上,'aero'类别的正确定位率达到85.5%,表明其具备强大的定位能力。
  • 排序损失显著提升了特征的区分能力,从而带来更好的泛化性能与更逼真的目标生成效果。
  • 该方法实现了有效的弱监督检测,在PASCAL VOC上相较无排序基线方法,mAP最高提升达6.5%。
  • 利用GAN生成额外训练数据可显著提升检测性能,表明该方法在大规模数据集扩展方面具有巨大潜力。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。