Skip to main content
QUICK REVIEW

[论文解读] Predicting Gaze in Egocentric Video by Learning Task-dependent Attention Transition

Yifei Huang, Minjie Cai|arXiv (Cornell University)|Mar 24, 2018
Visual Attention and Saliency Detection参考文献 38被引用 9
一句话总结

该论文提出了一种用于第一人称视角注视预测的混合深度学习模型,通过循环神经网络学习任务相关的注意力转移,将自底向上的显著性与任务依赖的注意力转移相结合。通过基于任务上下文建模注视固定点的时间转移,该模型在公开的第一人称视角数据集上实现了最先进性能,显著优于仅基于显著性的基线模型,并展示了有意义的任务感知注意力转移学习能力。

ABSTRACT

We present a new computational model for gaze prediction in egocentric videos by exploring patterns in temporal shift of gaze fixations (attention transition) that are dependent on egocentric manipulation tasks. Our assumption is that the high-level context of how a task is completed in a certain way has a strong influence on attention transition and should be modeled for gaze prediction in natural dynamic scenes. Specifically, we propose a hybrid model based on deep neural networks which integrates task-dependent attention transition with bottom-up saliency prediction. In particular, the task-dependent attention transition is learned with a recurrent neural network to exploit the temporal context of gaze fixations, e.g. looking at a cup after moving gaze away from a grasped bottle. Experiments on public egocentric activity datasets show that our model significantly outperforms state-of-the-art gaze prediction methods and is able to learn meaningful transition of human attention.

研究动机与目标

  • 通过建模注意力转移中的任务相关模式,提升动态第一人称视频中的注视预测性能。
  • 解决基于显著性的模型在复杂、任务驱动场景中的局限性,其中高层上下文会影响注视行为。
  • 利用循环网络学习注视固定点之间的时序依赖关系,捕捉注意力区域之间的转移。
  • 融合自底向上的显著性与学习到的任务特定注意力动态,以提高预测准确性。
  • 验证注意力转移模块在厨房环境中不同操作任务间的泛化能力。

提出的方法

  • 双流卷积神经网络从第一人称视频帧中生成自底向上的显著性图。
  • 循环神经网络利用先前注视区域和头部运动作为输入,建模任务相关的注意力转移。
  • 注视状态预测器基于先前注意力和运动线索,估计在特定区域发生注视的可能性。
  • 全卷积网络融合显著性图与注意力图,生成最终的注视预测热力图。
  • 注意力转移模块使用卷积神经网络中间层(如 conv5_3)的特征表示,从当前注视特征预测下一个注视区域。
  • 显著性与注意力模块的后期融合结合了二者的优势,从而提升性能。

实验结果

研究问题

  • RQ1与仅基于显著性的模型相比,建模任务相关的注意力转移是否能提升第一人称视频中的注视预测准确性?
  • RQ2该注意力转移模块在相同环境中的不同第一人称操作任务间是否具有良好的泛化能力?
  • RQ3该模型在多大程度上能从时序注视序列中学习到有意义的任务特定注视转移模式?
  • RQ4将自底向上的显著性与自顶向下的注意力转移相结合,是否能优于单独使用任一组件?
  • RQ5即使在多样化任务上进行训练,注意力转移模块是否仍能高精度预测下一个注视区域?

主要发现

  • 所提出的模型在 GTEA Gaze Plus 和 EGTEA Gaze+ 数据集上均实现了最先进性能,显著优于现有的基于显著性和基于注意力的方法。
  • 仅使用 conv5_3 层特征时,注意力转移(AT)模块在预测下一个注视区域方面达到 86.8% 的准确率,远高于随机基线(10.7%)。
  • 显著性预测(SP)与任务依赖注意力转移(AT_d)的后期融合优于仅使用 SP,即使 AT_d 在不同任务上进行训练也成立。
  • AT_s 变体(在相同任务上进行训练和测试)优于 SP,表明任务特定的转移模式具有高度预测性。
  • 模型的注意力转移模块在定性示例中成功预测了下一个注视区域,显示出连贯且与上下文相关的注意力转移。
  • 跨任务验证表明,AT_d 具有合理的泛化能力,SP+AT_d 的性能优于 SP 和 AT_s,证实了两个组件的互补性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。