Skip to main content
QUICK REVIEW

[论文解读] Mutual Context Network for Jointly Estimating Egocentric Gaze and Actions

Yifei Huang, Zhenqiang Li|arXiv (Cornell University)|Jan 7, 2019
Human Pose and Action Recognition参考文献 79被引用 11
一句话总结

本文提出了一种互惠上下文网络(MCN),通过利用双向上下文——动作预测引导注视估计,注视位置提升动作识别——联合估计第一人称视角下的注视与动作识别。该方法通过可学习卷积核整合动作依赖的注视预测与注视引导的特征聚合,并结合视觉显著性进行晚期融合,在公开的第一人称视频数据集上实现了最先进性能。

ABSTRACT

In this work, we address two coupled tasks of gaze prediction and action recognition in egocentric videos by exploring their mutual context. Our assumption is that in the procedure of performing a manipulation task, what a person is doing determines where the person is looking at, and the gaze point reveals gaze and non-gaze regions which contain important and complementary information about the undergoing action. We propose a novel mutual context network (MCN) that jointly learns action-dependent gaze prediction and gaze-guided action recognition in an end-to-end manner. Experiments on public egocentric video datasets demonstrate that our MCN achieves state-of-the-art performance of both gaze prediction and action recognition.

研究动机与目标

  • 解决现有方法将注视预测与动作识别视为独立任务的局限性,尽管二者在第一人称视频中存在强烈相互依赖关系。
  • 通过引入动作上下文提升注视预测准确性,特别是在仅靠显著性不足以判断的杂乱场景中。
  • 通过利用注视引导的空间特征聚合,增强动作识别性能,聚焦于相关且互补的区域。
  • 建模注视与动作之间的双向上下文,实现端到端的联合学习,同步提升两项任务性能。
  • 分析失败案例并识别局限性,特别是动作边界处注意力转换的问题。

提出的方法

  • MCN框架使用主干网络从第一人称视频帧中提取特征。
  • 基于动作的注视预测模块从预测的动作可能性生成卷积核,以在特征图中空间关注与动作相关的区域。
  • 注视引导的动作识别模块利用预测的注视位置,选择性地聚合注视区域与非注视区域的特征,以提升动作分类性能。
  • 视觉显著性图与动作上下文化的注视预测在后期进行融合,以提升鲁棒性与准确性。
  • 通过注视与动作任务的联合监督,端到端训练网络,共享特征表示。
  • 该方法采用晚期融合策略,结合低层次显著性与高层动作上下文,实现最终的注视预测。

实验结果

研究问题

  • RQ1动作上下文能否提升第一人称视频中的注视预测性能,特别是在杂乱或模糊的场景中?
  • RQ2注视引导的特征聚合能否通过聚焦于相关且互补的视觉区域,提升动作识别性能?
  • RQ3通过互惠上下文联合建模注视与动作,是否能优于独立或单向建模的性能?
  • RQ4动作识别失败如何影响注视预测?模型能否缓解此类错误传播?
  • RQ5模型能否捕捉连续动作之间的注意力转换,特别是当注视提前转向未来目标时?

主要发现

  • MCN在多个公开的第一人称视频数据集上,于注视预测与动作识别两项任务中均实现了最先进性能。
  • 在EGTEA数据集上,当动作识别正确时,模型的AAE为5.68;当动作识别失败时,AAE为6.01,表明从动作到注视的错误传播有限。
  • 注视引导的动作识别模块通过选择性地聚合注视区域与非注视区域的特征,提升了动作识别的判别能力。
  • 基于动作的注视预测模块成功学习了与动作相关的注视模式,例如在‘put pan’动作中聚焦于锅,或在‘take bread’动作中聚焦于面包。
  • 失败案例显示,模型在动作之间的注视转换上表现不佳,特别是在动作完成前注视已转向未来目标时。
  • 与先前在未修剪视频上训练的方法相比,尽管该方法在AAE上优于MCN(4.83 vs. 5.74),但MCN在修剪数据上表现更优,凸显了在受控序列中动作上下文的优势。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。