[论文解读] In the Eye of the Beholder: Gaze and Actions in First Person Video
该论文提出了一种深度学习模型,通过使用随机单元对注视点建模为概率分布,联合估计第一人称视频中的注视方向并进行动作识别。该方法从采样的注视分布中生成注意力图,以指导特征聚合,在EGTEA Gaze+和EPIC-Kitchens数据集上均取得了最先进性能,即使在推理阶段不使用注视数据也能实现优异表现。
We address the task of jointly determining what a person is doing and where they are looking based on the analysis of video captured by a headworn camera. To facilitate our research, we first introduce the EGTEA Gaze+ dataset. Our dataset comes with videos, gaze tracking data, hand masks and action annotations, thereby providing the most comprehensive benchmark for First Person Vision (FPV). Moving beyond the dataset, we propose a novel deep model for joint gaze estimation and action recognition in FPV. Our method describes the participant's gaze as a probabilistic variable and models its distribution using stochastic units in a deep network. We further sample from these stochastic units, generating an attention map to guide the aggregation of visual features for action recognition. Our method is evaluated on our EGTEA Gaze+ dataset and achieves a performance level that exceeds the state-of-the-art by a significant margin. More importantly, we demonstrate that our model can be applied to larger scale FPV dataset---EPIC-Kitchens even without using gaze, offering new state-of-the-art results on FPV action recognition.
研究动机与目标
- 解决在第一人称视频中联合估计注视与动作的挑战,其中注视提供关键的注意力线索以提升动作识别性能。
- 通过将注视建模为潜在的概率分布,缓解因跳跃眼动、噪声和无关注视点带来的注视测量不确定性。
- 构建一个统一的深度学习框架,将注视建模与动作识别相结合,以提升在自指视频任务中的性能。
- 构建一个全面的基准数据集EGTEA Gaze+,包含同步的视频、注视追踪、手部掩码和动作标注,以支持第一人称视觉研究。
- 证明所提出模型在大规模数据集EPIC-Kitchens上的泛化能力,即使在推理阶段不使用注视数据,仍能取得最先进结果。
提出的方法
- 在深度神经网络中使用随机单元将注视建模为潜在的概率分布,实现对不确定性的感知注意力建模。
- 从随机注视单元中采样,生成时空注意力图,以突出视频中与动作相关的关键区域。
- 利用生成的注意力图在动作识别分支中执行空间与时间维度的特征聚合,聚焦于相关视觉线索。
- 使用EGTEA Gaze+数据集,通过联合目标函数端到端训练模型,同时优化注视估计与动作识别。
- 通过将注视监督替换为均匀先验,并使用在IG-65M上预训练的更强CSN152主干网络,将模型适配至EPIC-Kitchens数据集。
- 采用早停和衰减学习率策略以防止过拟合,尤其针对大尺寸主干网络和有限的批量大小。
实验结果
研究问题
- RQ1如何有效建模第一人称注视数据中的不确定性,以提升动作识别性能?
- RQ2一个同时学习注视与动作的联合模型是否能优于独立训练的模型?
- RQ3将注视作为概率注意力先验,能在多大程度上提升在大规模数据集上的动作识别性能?
- RQ4在训练阶段使用注视监督的模型是否能泛化到无注视标注的数据集(如EPIC-Kitchens)?
- RQ5主干网络的选择与训练策略对联合注视与动作识别性能有何影响?
主要发现
- 所提模型在EGTEA Gaze+数据集上达到最先进性能,显著优于先前方法在注视估计与动作识别两个任务上的表现。
- 在EPIC-Kitchens数据集中,模型在可见集上的Top-1准确率为60.05%,Top-5准确率为81.97%;在未见集上分别为38.14%和63.81%,超越所有先前单模型方法。
- 相较于强基线模型CSN152,该模型在可见集上Top-1和Top-5准确率分别提升+0.3%和+1.0%,在未见集上分别提升+0.5%和+0.8%。
- 即使使用均匀注视先验(无真实注视数据),模型仍取得具有竞争力的结果,表明其具备强大的泛化能力。
- 消融实验证实,性能提升主要源于强大的主干网络(CSN152)与预训练,而所提出的注意力机制进一步带来了稳定且一致的性能增益。
- 在2020年EPIC-Kitchens挑战中,该模型在未见测试集上排名第二,在可见测试集上排名第四,优于使用光流、音频或目标检测器的方法。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。