[论文解读] Following Gaze Across Views
本文提出了一种端到端深度学习模型,用于在多个视角的同一场景中跟踪人类视线,利用显著性、视线姿态以及视角之间的几何关系。仅使用视线标注进行训练,该模型能够预测当人视线超出画面时在第二个视角中的视线位置,在新提出的 VideoGaze 数据集上实现了最先进性能,全测试集的平均精度为 0.255。
Following the gaze of people inside videos is an important signal for understanding people and their actions. In this paper, we present an approach for following gaze across views by predicting where a particular person is looking throughout a scene. We collect VideoGaze, a new dataset which we use as a benchmark to both train and evaluate models. Given one view with a person in it and a second view of the scene, our model estimates a density for gaze location in the second view. A key aspect of our approach is an end-to-end model that solves the following sub-problems: saliency, gaze pose, and geometric relationships between views. Although our model is supervised only with gaze, we show that the model learns to solve these subproblems automatically without supervision. Experiments suggest that our approach follows gaze better than standard baselines and produces plausible results for everyday situations.
研究动机与目标
- 解决在非受限场景中,当视线延伸至源视角之外时,跨多个摄像头视角跟踪人类视线的挑战。
- 开发一种仅使用视线标注即可预测目标视角中视线位置的方法,无需姿态或几何关系的显式监督。
- 创建一个大规模多视角视线跟踪基准数据集,以支持此类模型的训练与评估。
- 证明模型通过端到端训练隐式学习到子问题的解决方案,如显著性估计与几何变换。
提出的方法
- 该模型采用多路径架构,分别设置独立分支用于显著性预测、视线方向估计以及视角间的几何变换。
- 通过仅使用视线标注联合优化视线预测,使网络能够自监督地学习显著性与姿态估计。
- 几何路径估计摄像头视角之间的变换(旋转与平移),实现从源视角到目标视角的视线投影。
- 该模型在包含 47,456 个视频帧中头部、眼睛与视线标注的 VideoGaze 数据集上进行端到端训练。
- 通过添加场景变化检测头,将模型的一个变体扩展为检测场景变化,该头在来自不同场景的帧上进行训练。
- 使用平均精度(mAP)评估性能,并通过消融研究评估各路径的贡献。
实验结果
研究问题
- RQ1是否能够仅使用视线标注,而无需姿态或几何关系的显式监督,让深度学习模型预测第二个视角中的视线位置?
- RQ2通过端到端训练,模型在多大程度上能隐式学习到显著性、视线方向以及视角间的几何关系?
- RQ3该模型在时间上相距较远或几何上差异较大的视角上泛化能力如何?
- RQ4该模型能否检测到视线目标已离开场景,从而指示场景变化?
主要发现
- 所提出的模型在 VideoGaze 数据集全测试集上达到 0.255 的平均精度,显著优于所有基线模型。
- 在与源帧时间间隔为 1 秒或以上的缩减测试集上,该模型的 mAP 为 0.255,而静态基线模型下降至 0.187。
- 在视角差异更大的情况下,模型表现更优,因为此时显著性路径的作用更加关键。
- 消融研究显示,仅保留垂直轴方向的旋转与平移时性能最佳,这与典型摄像头运动一致。
- 用于场景变化检测的扩展模型达到 0.877 的平均精度,远高于随机猜测的 0.5。
- 内部路径的可视化结果证实,该模型在无显式监督的情况下,成功学习到了几何关系、视线方向与显著区域的估计。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。