[论文解读] First Person Action-Object Detection with EgoNet
该论文提出 EgoNet,一种双流深度学习模型,通过融合视觉外观与3D空间线索(结合第一人称坐标嵌入),从第一人称 RGBD 视频中检测动作-物体(即引发有意识视觉或触觉交互的物体)。EgoNet 在多种第一人称数据集上实现了最先进性能,并展现出强大的零样本泛化能力,在平均 F1 和平均精确率上均优于先前方法。
Unlike traditional third-person cameras mounted on robots, a first-person camera, captures a person's visual sensorimotor object interactions from up close. In this paper, we study the tight interplay between our momentary visual attention and motor action with objects from a first-person camera. We propose a concept of action-objects---the objects that capture person's conscious visual (watching a TV) or tactile (taking a cup) interactions. Action-objects may be task-dependent but since many tasks share common person-object spatial configurations, action-objects exhibit a characteristic 3D spatial distance and orientation with respect to the person. We design a predictive model that detects action-objects using EgoNet, a joint two-stream network that holistically integrates visual appearance (RGB) and 3D spatial layout (depth and height) cues to predict per-pixel likelihood of action-objects. Our network also incorporates a first-person coordinate embedding, which is designed to learn a spatial distribution of the action-objects in the first-person data. We demonstrate EgoNet's predictive power, by showing that it consistently outperforms previous baseline approaches. Furthermore, EgoNet also exhibits a strong generalization ability, i.e., it predicts semantically meaningful objects in novel first-person datasets. Our method's ability to effectively detect action-objects could be used to improve robots' understanding of human-object interactions.
研究动机与目标
- 解决仅使用第一人称视频数据检测动作-物体(即引发有意识视觉或触觉交互的物体)的挑战。
- 通过仅利用第一人称视觉信号,克服第三人称摄像头和可穿戴传感器的局限性。
- 在无需任务特定微调的情况下,建模人与动作-物体之间特有的3D空间关系(距离与方向)。
- 开发一种可泛化的模型,以检测多样化的、未见过的活动与物体类别中的动作-物体。
- 提供一个新的标注第一人称 RGBD 数据集,包含逐像素的动作-物体掩码,用于基准测试。
提出的方法
- 设计一种联合双流网络架构,平行处理 RGB(视觉外观)和深度/高度(3D 空间布局)输入。
- 集成第一人称坐标嵌入层,编码动作-物体相对于观察者视角的空间分布。
- 使用摄像机佩戴者在真实任务中标注的逐像素动作-物体二值掩码,端到端训练网络。
- 通过共享融合路径结合双流特征,并预测逐像素的动作-物体概率。
- 使用预训练的单目深度估计模型,将仅含 RGB 的数据集(如 GTEA Gaze+、Social Children Interaction)增强为包含深度预测的版本。
- 采用交叉熵损失函数,输出为 softmax,优化像素级分类任务。
实验结果
研究问题
- RQ1仅依靠第一人称视频是否足以实现动作-物体的准确检测,而无需依赖注视追踪或可穿戴传感器?
- RQ2视觉外观与3D空间线索的融合在第一人称视频中检测动作-物体方面有多高效?
- RQ3与标准空间编码相比,第一人称坐标嵌入在多大程度上提升了检测性能?
- RQ4在一组第一人称活动中训练的模型,能否泛化到新型、未见过的活动与物体类别?
- RQ5在多种第一人称数据集上,EgoNet 与现有方法相比,在准确率和鲁棒性方面表现如何?
主要发现
- 在所提出的 First-Person Action-Object RGBD 数据集上,EgoNet 实现了 0.396 的平均 F1 和 0.313 的平均精确率,优于基线方法。
- 若移除第一人称坐标嵌入,平均 F1 降至 0.313,平均精确率降至 0.202,表明其在性能中起着关键作用。
- 在 GTEA Gaze+ 数据集(仅含 RGB,无深度)上,EgoNet 实现 0.513 的平均 F1 和 0.443 的平均精确率,较第二好的方法在平均 F1 上高出 6.5%。
- 在 Social Children Interaction 数据集上,EgoNet 实现 0.285 的平均 F1 和 0.185 的平均精确率,显著优于第二好的方法(0.254 的平均 F1,0.106 的平均精确率)。
- 定性结果表明,EgoNet 在多个数据集上产生的动作-物体预测比 DeepLab-FCN 基线更准确且定位更优。
- 检测到的动作-物体的3D可视化结果表明,该模型恢复的空间配置与人类交互模式一致,为潜在的机器人操作应用提供了支持。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。