Skip to main content
QUICK REVIEW

[论文解读] Ego-Object Discovery

Marc Bolaños, Petia Radeva|arXiv (Cornell University)|Apr 7, 2015
Video Surveillance and Tracking Methods参考文献 21被引用 9
一句话总结

本文提出了一种基于预训练卷积神经网络(CNN)特征、新颖的物体补全策略以及SVM过滤的半监督第一人称相机数据自举物体发现方法,显著优于以往方法,在PASCAL VOC 2012、MSRC和一个新的第一人称数据集(EDUB)上实现了最先进性能,尤其在真实生活记录场景中检测罕见和低可见度物体方面表现突出。

ABSTRACT

Lifelogging devices are spreading faster everyday. This growth can represent great benefits to develop methods for extraction of meaningful information about the user wearing the device and his/her environment. In this paper, we propose a semi-supervised strategy for easily discovering objects relevant to the person wearing a first-person camera. Given an egocentric video/images sequence acquired by the camera, our algorithm uses both the appearance extracted by means of a convolutional neural network and an object refill methodology that allows to discover objects even in case of small amount of object appearance in the collection of images. An SVM filtering strategy is applied to deal with the great part of the False Positive object candidates found by most of the state of the art object detectors. We validate our method on a new egocentric dataset of 4912 daily images acquired by 4 persons as well as on both PASCAL 2012 and MSRC datasets. We obtain for all of them results that largely outperform the state of the art approach. We make public both the EDUB dataset and the algorithm code.

研究动机与目标

  • 解决在第一人称生活记录数据中发现频繁出现但视觉差异大且部分遮挡的物体的挑战。
  • 克服传统物体存在检测器在非有意、低分辨率的第一人称图像中产生高误报率('无物体'候选)的局限性。
  • 通过深度特征和基于补全机制的迭代优化,提升对罕见或低可见度物体类别的检测能力。
  • 开发一种鲁棒的半监督框架,仅需极少人工标注即可在多样化的第一人称环境中实现良好泛化。
  • 实现在真实世界、噪声大且模糊的第一人称图像序列中发现有意义且与用户相关的物体。

提出的方法

  • 利用预训练的深度CNN特征(来自类似VGG的架构)提取物体候选的丰富高层外观表征。
  • 应用一种新颖的“补全”策略,通过重用先前发现类别的特征,恢复并重新评估低可见度或部分遮挡的物体实例。
  • 采用一类SVM分类器过滤由物体存在检测器生成的虚假‘无物体’候选,降低候选池中的噪声。
  • 实施迭代发现流程:(1) 提取物体存在提议,(2) 通过SVM过滤,(3) 对最佳候选聚类,(4) 将最佳聚类标记为新物体,(5) 通过补全特征发现更难的实例。
  • 采用半监督方法,初始物体发现由易检测实例引导,随后逐步优化更难、更不常见的类别。
  • 仅将低层次图像特征(如颜色、纹理)作为基线比较;核心方法依赖深度CNN特征以获得更优表征。

实验结果

研究问题

  • RQ1与传统低层次特征相比,深度CNN特征是否能显著提升第一人称生活记录数据中的物体发现性能?
  • RQ2所提出的补全策略在非有意、模糊且遮挡严重的第一人称图像中,对提升罕见或低可见度物体实例检测的改善程度如何?
  • RQ3在具有挑战性第一人称设置下,SVM过滤在减少物体存在检测器产生的虚假‘无物体’候选方面有多有效?
  • RQ4CNN特征、补全策略与SVM过滤的组合是否在包括第一人称、PASCAL VOC 2012和MSRC在内的多样化数据集上,优于最先进方法,实现更高的F1值和发现覆盖率?
  • RQ5在图像退化严重的现实场景下,该方法对具有高类内差异的物体(如手、人)的检测表现如何,尤其是在图像模糊、噪声大时?

主要发现

  • 与基线方法相比,使用Grauman特征时,该方法将‘无物体’候选减少了92.75%,SVM过滤后‘无物体’标签的聚类比例从96%降至49%。
  • 在EDUB数据集(4912张来自4名用户的的第一人称图像)上,该方法发现了16%的真值唯一物体实例,优于基线方法(S1)仅发现6–7%。
  • 在PASCAL VOC 2012、MSRC和新EDUB数据集上,该方法实现了最先进F1值,显著优于以往方法,包括Lee等人(2011)和Kading等人(2015)的方法。
  • CNN特征与补全策略的结合使系统能够检测到传统方法常遗漏的稀有且视觉多变的类别(如手、人)。
  • 即使在极模糊和噪声大的第一人称图像上,该方法仍保持高性能,表明其对生活记录数据中常见的图像退化具有强鲁棒性。
  • 迭代发现过程成功按难度递增顺序识别物体类别,早期迭代检测高频物体,后期迭代发现稀有或部分可见的实例。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。