Skip to main content
QUICK REVIEW

[论文解读] Object Recognition with and without Objects

Zhuotun Zhu, Lingxi Xie|arXiv (Cornell University)|Nov 20, 2016
Advanced Image and Video Retrieval Techniques参考文献 25被引用 6
一句话总结

本文提出分别在图像的前景(物体)和背景(上下文)区域上独立训练深度神经网络,表明仅在背景上训练的模型即可实现强大的识别性能(top-1准确率为14.4%),在仅使用上下文的图像上超越人类表现。研究显示,将此类网络结合可使识别准确率超越基线模型,揭示了人类与深度网络在视觉推理机制上的显著差异。

ABSTRACT

While recent deep neural networks have achieved a promising performance on object recognition, they rely implicitly on the visual contents of the whole image. In this paper, we train deep neural net- works on the foreground (object) and background (context) regions of images respectively. Consider- ing human recognition in the same situations, net- works trained on the pure background without ob- jects achieves highly reasonable recognition performance that beats humans by a large margin if only given context. However, humans still outperform networks with pure object available, which indicates networks and human beings have different mechanisms in understanding an image. Furthermore, we straightforwardly combine multiple trained networks to explore different visual cues learned by different networks. Experiments show that useful visual hints can be explicitly learned separately and then combined to achieve higher performance, which verifies the advantages of the proposed framework.

研究动机与目标

  • 探究深度神经网络是否能仅从背景(上下文)区域中学习到有意义的视觉表征,而无需物体信息。
  • 比较人类与神经网络在仅使用前景或仅使用背景区域进行训练或测试时的物体识别表现。
  • 评估结合在不同视觉线索(前景、背景、混合)上训练的网络是否能提升整体识别性能。
  • 探索显式学习并融合来自图像不同区域的视觉模式在物体识别中的可行性与优势。

提出的方法

  • 从ImageNet ILSVRC2012中构建专用数据集,利用真实边界框将图像分离为前景(FGSet)、背景(BGSet)和混合(HybridSet)数据集。
  • 使用标准ImageNet训练协议,分别在FGSet、BGSet及组合数据集上训练独立的深度卷积神经网络(FGNet、BGNet、HybridNet、OrigNet)。
  • 在测试图像上应用训练好的网络,无论是否使用真实边界框,采用引导式(使用边界框)和非引导式(基于物体提议)推理设置。
  • 通过早期或晚期融合方式结合多个网络的预测结果,特别测试FGNet、BGNet和HybridNet的线性组合以实现性能提升。
  • 可视化BGNet的特征图,识别FGNet未学习到的上下文特异性模式,验证了视觉表征的差异性。
  • 通过OrigNet在100个密集采样补丁上进行消融实验,以隔离网络组合带来的性能提升,而非数据增强的影响。

实验结果

研究问题

  • RQ1当仅在背景(上下文)区域上训练而完全不包含物体信息时,深度神经网络能否实现合理的物体识别性能?
  • RQ2人类在仅可见前景(物体)时的识别表现,与在相同数据上训练的深度神经网络相比如何?
  • RQ3结合在不同视觉线索(前景、背景、混合)上训练的网络,是否能相比单网络基线提升识别准确率?
  • RQ4网络组合带来的性能增益在多大程度上源于特征融合,而非数据增强或集成效应?

主要发现

  • 仅在背景区域上训练的深度神经网络在背景验证集上达到了14.4%的top-1准确率和接近30%的top-5准确率,表明仅靠上下文就蕴含对识别极为有用的视觉信息。
  • 当仅可见前景(物体)时,人类在物体识别上的表现显著优于深度网络,表明网络依赖的线索与人类不同。
  • 深度网络在纯背景识别任务上优于非专家人类,其top-1准确率为14.4%,而人类在相同任务上的表现约为10%。
  • 将HybridNet与BGNet结合,使top-1准确率提升2.50%,top-5准确率提升2.47%,相比仅使用HybridNet,表明互补的视觉线索可增强性能。
  • HybridNet与OrigNet100(100张裁剪图像推理)的结合实现了60.80%的top-1准确率,显著高于OrigNet100的58.08%,证明性能增益并非源于数据增强。
  • 即使在非引导设置下缺乏准确的物体标注,网络组合带来的性能增益依然显著,表明网络能够从上下文中隐式推断出物体位置。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。