Skip to main content
QUICK REVIEW

[论文解读] Rethinking Diversified and Discriminative Proposal Generation for Visual Grounding

Yu Zhou, Jun Yu|arXiv (Cornell University)|May 9, 2018
Multimodal Machine Learning Applications被引用 3
一句话总结

本文提出了一种新型方法——多样化与判别性提议网络(DDPN),通过联合优化目标提议生成中的多样性与判别性,实现视觉定位任务的性能提升。通过生成高质量提议并结合KLD损失与回归损失训练强基准模型,DDPN在多个基准上达到最先进性能,包括在ReferItGame上实现18.8%的性能提升,以及在Flickr30k Entities上实现8.2%的性能提升。

ABSTRACT

Visual grounding aims to localize an object in an image referred to by a textual query phrase. Various visual grounding approaches have been proposed, and the problem can be modularized into a general framework: proposal generation, multi-modal feature representation, and proposal ranking. Of these three modules, most existing approaches focus on the latter two, with the importance of proposal generation generally neglected. In this paper, we rethink the problem of what properties make a good proposal generator. We introduce the diversity and discrimination simultaneously when generating proposals, and in doing so propose Diversified and Discriminative Proposal Networks model (DDPN). Based on the proposals generated by DDPN, we propose a high performance baseline model for visual grounding and evaluate it on four benchmark datasets. Experimental results demonstrate that our model delivers significant improvements on all the tested data-sets (e.g., 18.8\% improvement on ReferItGame and 8.2\% improvement on Flickr30k Entities over the existing state-of-the-arts respectively)

研究动机与目标

  • 为解决视觉定位中提议生成这一常被视为固定模块的未被充分探索的作用。
  • 探究何种特性使提议生成器在视觉定位任务中表现优异,重点关注多样性与判别性。
  • 设计一个统一框架,同时提升提议的多样性与判别能力。
  • 基于DDPN生成的提议与新型训练损失,建立视觉定位的强基准模型。
  • 通过广泛的消融实验与对比分析,在多个基准数据集上验证DDPN的有效性。

提出的方法

  • 提出多样化与判别性提议网络(DDPN),一种双流网络结构,联合优化提议的多样性与判别质量。
  • 基于特征聚类设计多样性损失,以促使提议覆盖不同的物体区域。
  • 采用对比学习方法设计判别损失,以增强提议之间以及与背景之间的可分性。
  • 将DDPN与简单的特征拼接模块结合,实现视觉与文本特征之间的多模态融合。
  • 使用两种新型损失联合训练完整模型:基于软标签的Kullback-Leibler(KLD)散度损失,用于建模提议上下文;以及平滑L1回归损失,用于边界框精细化。
  • 采用VGG-16与ResNet-101作为主干网络,评估特征表示能力对性能的影响。

实验结果

研究问题

  • RQ1何种特性使提议生成器在视觉定位任务中表现有效?多样性与判别性如何实现联合优化?
  • RQ2与标准RPN或选择性搜索相比,统一的提议生成框架是否能显著提升视觉定位性能?
  • RQ3KLD损失(使用软标签)与回归损失在提升定位精度方面分别起到何种作用?
  • RQ4主干网络的选择(如VGG-16与ResNet-101)在多大程度上影响基于DDPN的系统性能?
  • RQ5所提出的基于DDPN的基准模型在多个基准上与最先进方法相比表现如何?

主要发现

  • 基于DDPN的模型在ReferItGame上实现18.8%的绝对性能提升(63.0% vs. 44.2%的先前SOTA),在Flickr30k Entities上实现8.2%的性能提升(73.3% vs. 65.1%)。
  • 使用ResNet-101作为主干网络相比VGG-16带来3–4个百分点的性能增益,证明了特征表示能力的重要性。
  • 消融实验表明,DDPN中的多样性与判别性组件均不可或缺,任一组件的移除均导致性能显著下降。
  • 使用软标签的KLD损失有助于提升提议的上下文建模能力,从而改善排序性能。
  • 平滑L1回归损失能有效优化边界框预测,减少定位误差并提升IoU得分。
  • 所提出的基准模型在全部四个基准数据集(RefCOCO、RefCOCO+、Flickr30k Entities与ReferItGame)上均优于所有先前的SOTA方法。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。