Skip to main content
QUICK REVIEW

[论文解读] First Person Action-Object Detection with EgoNet

Gedas Bertasius, Hyun Soo Park|arXiv (Cornell University)|Mar 15, 2016
Human Pose and Action Recognition参考文献 58被引用 16
一句话总结

该论文提出 EgoNet,一种双流深度学习模型,通过融合视觉外观与3D空间线索(结合第一人称坐标嵌入),从第一人称 RGBD 视频中检测动作-物体(即引发有意识视觉或触觉交互的物体)。EgoNet 在多种第一人称数据集上实现了最先进性能,并展现出强大的零样本泛化能力,在平均 F1 和平均精确率上均优于先前方法。

ABSTRACT

Unlike traditional third-person cameras mounted on robots, a first-person camera, captures a person's visual sensorimotor object interactions from up close. In this paper, we study the tight interplay between our momentary visual attention and motor action with objects from a first-person camera. We propose a concept of action-objects---the objects that capture person's conscious visual (watching a TV) or tactile (taking a cup) interactions. Action-objects may be task-dependent but since many tasks share common person-object spatial configurations, action-objects exhibit a characteristic 3D spatial distance and orientation with respect to the person. We design a predictive model that detects action-objects using EgoNet, a joint two-stream network that holistically integrates visual appearance (RGB) and 3D spatial layout (depth and height) cues to predict per-pixel likelihood of action-objects. Our network also incorporates a first-person coordinate embedding, which is designed to learn a spatial distribution of the action-objects in the first-person data. We demonstrate EgoNet's predictive power, by showing that it consistently outperforms previous baseline approaches. Furthermore, EgoNet also exhibits a strong generalization ability, i.e., it predicts semantically meaningful objects in novel first-person datasets. Our method's ability to effectively detect action-objects could be used to improve robots' understanding of human-object interactions.

研究动机与目标

  • 解决仅使用第一人称视频数据检测动作-物体(即引发有意识视觉或触觉交互的物体)的挑战。
  • 通过仅利用第一人称视觉信号,克服第三人称摄像头和可穿戴传感器的局限性。
  • 在无需任务特定微调的情况下,建模人与动作-物体之间特有的3D空间关系(距离与方向)。
  • 开发一种可泛化的模型,以检测多样化的、未见过的活动与物体类别中的动作-物体。
  • 提供一个新的标注第一人称 RGBD 数据集,包含逐像素的动作-物体掩码,用于基准测试。

提出的方法

  • 设计一种联合双流网络架构,平行处理 RGB(视觉外观)和深度/高度(3D 空间布局)输入。
  • 集成第一人称坐标嵌入层,编码动作-物体相对于观察者视角的空间分布。
  • 使用摄像机佩戴者在真实任务中标注的逐像素动作-物体二值掩码,端到端训练网络。
  • 通过共享融合路径结合双流特征,并预测逐像素的动作-物体概率。
  • 使用预训练的单目深度估计模型,将仅含 RGB 的数据集(如 GTEA Gaze+、Social Children Interaction)增强为包含深度预测的版本。
  • 采用交叉熵损失函数,输出为 softmax,优化像素级分类任务。

实验结果

研究问题

  • RQ1仅依靠第一人称视频是否足以实现动作-物体的准确检测,而无需依赖注视追踪或可穿戴传感器?
  • RQ2视觉外观与3D空间线索的融合在第一人称视频中检测动作-物体方面有多高效?
  • RQ3与标准空间编码相比,第一人称坐标嵌入在多大程度上提升了检测性能?
  • RQ4在一组第一人称活动中训练的模型,能否泛化到新型、未见过的活动与物体类别?
  • RQ5在多种第一人称数据集上,EgoNet 与现有方法相比,在准确率和鲁棒性方面表现如何?

主要发现

  • 在所提出的 First-Person Action-Object RGBD 数据集上,EgoNet 实现了 0.396 的平均 F1 和 0.313 的平均精确率,优于基线方法。
  • 若移除第一人称坐标嵌入,平均 F1 降至 0.313,平均精确率降至 0.202,表明其在性能中起着关键作用。
  • 在 GTEA Gaze+ 数据集(仅含 RGB,无深度)上,EgoNet 实现 0.513 的平均 F1 和 0.443 的平均精确率,较第二好的方法在平均 F1 上高出 6.5%。
  • 在 Social Children Interaction 数据集上,EgoNet 实现 0.285 的平均 F1 和 0.185 的平均精确率,显著优于第二好的方法(0.254 的平均 F1,0.106 的平均精确率)。
  • 定性结果表明,EgoNet 在多个数据集上产生的动作-物体预测比 DeepLab-FCN 基线更准确且定位更优。
  • 检测到的动作-物体的3D可视化结果表明,该模型恢复的空间配置与人类交互模式一致,为潜在的机器人操作应用提供了支持。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。