Skip to main content
QUICK REVIEW

[论文解读] Exploiting Egocentric Object Prior for 3D Saliency Detection

Gedas Bertasius, Hyun Soo Park|arXiv (Cornell University)|Nov 9, 2015
Visual Attention and Saliency Detection参考文献 24被引用 5
一句话总结

本文提出EgoObject表征,通过从第一视角RGBD图像中编码形状、位置、大小和深度特征,为3D显著性检测建模一个固定大小的先验。基于人类视觉感知的心理学发现,该方法在3D显著性检测中实现了30%的相对性能提升,并在新发布的第一视角RGBD显著性数据集上实现了准确的未来显著性预测和交互分类。

ABSTRACT

On a minute-to-minute basis people undergo numerous fluid interactions with objects that barely register on a conscious level. Recent neuroscientific research demonstrates that humans have a fixed size prior for salient objects. This suggests that a salient object in 3D undergoes a consistent transformation such that people's visual system perceives it with an approximately fixed size. This finding indicates that there exists a consistent egocentric object prior that can be characterized by shape, size, depth, and location in the first person view. In this paper, we develop an EgoObject Representation, which encodes these characteristics by incorporating shape, location, size and depth features from an egocentric RGBD image. We empirically show that this representation can accurately characterize the egocentric object prior by testing it on an egocentric RGBD dataset for three tasks: the 3D saliency detection, future saliency prediction, and interaction classification. This representation is evaluated on our new Egocentric RGBD Saliency dataset that includes various activities such as cooking, dining, and shopping. By using our EgoObject representation, we outperform previously proposed models for saliency detection (relative 30% improvement for 3D saliency detection task) on our dataset. Additionally, we demonstrate that this representation allows us to predict future salient objects based on the gaze cue and classify people's interactions with objects.

研究动机与目标

  • 基于神经科学研究中关于显著物体存在固定大小先验的发现,探究第一人称视觉感知中是否存在一致的、第一视角的物体先验。
  • 开发一种表征方法,以捕捉显著物体的特征(形状、位置、大小和深度),而无需依赖物体类别模板或人工检测。
  • 在真实世界的第一视角场景中,评估该表征在3D显著性检测、未来显著性预测和交互分类任务中的表现。
  • 创建并发布一个新的人类第一视角RGBD显著性数据集,支持多任务标注,为显著性模型的稳健评估提供支持。

提出的方法

  • 提出EgoObject表征,从第一视角RGBD图像帧中编码形状、位置、大小和深度特征,以建模一致的第一视角物体先验。
  • 使用随机森林分类器,通过训练从RGBD图像中提取的区域级特征,学习显著性图。
  • 利用第一视角双目相机的深度信息估计物体距离,该信息是显著性和交互预测的关键线索。
  • 在捕捉日常活动(如烹饪、进餐和购物)的第一视角RGBD显著性数据集上训练并评估模型。
  • 通过将时间帧作为输入,利用EgoObject表征预测未来显著性,建模注视和接近度线索。
  • 通过学习基于深度的阈值,并利用EgoObject特征区分交互类型,将交互分类为“视觉”或“触觉”。

实验结果

研究问题

  • RQ1在第一人称视觉感知中,是否存在一个一致的第一视角物体先验,其特征为显著3D物体的可预测形状、大小、位置和深度模式?
  • RQ2与先前方法相比,一种编码形状、位置、大小和深度特征的第一视角RGBD表征是否能提升3D显著性检测性能?
  • RQ3基于当前注视和接近度线索,EgoObject表征能否在第一视角视频中预测未来显著物体?
  • RQ4在多大程度上,EgoObject表征能利用深度和空间特征将人-物体交互分类为“视觉”或“触觉”?
  • RQ5各个特征(形状、位置、大小、深度、上下文)对显著性检测的贡献如何?其中哪些特征最具信息量?

主要发现

  • 在所提出的数据集上,与先前模型相比,EgoObject表征在3D显著性检测性能上实现了30%的相对提升。
  • 形状特征对显著性检测贡献最大,其次是位置、大小和深度,而上下文特征信息量最少。
  • 未来显著性检测器(FSD)在平均2秒预测中比基线显著性检测器(SD)高出8.7 F-score点,2秒、4秒和6秒预测的最高F-score分别提升了26.1、24.5和22.1。
  • 基于EgoObject的交互分类器在八个交互类别上的平均准确率比基于深度阈值的基线高出9.7%。
  • 可视化结果表明,即使在超市等复杂环境中,模型也能生成有意义的未来显著性预测。
  • 特征重要性分析证实,深度和大小特征极具信息量,验证了心理学直觉:物体接近度和感知大小是第一视角显著性中的关键线索。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。