Skip to main content
QUICK REVIEW

[论文解读] Social Behavior Prediction from First Person Videos

Shan Su, Jung Pyo Hong|arXiv (Cornell University)|Nov 29, 2016
Human Pose and Action Recognition参考文献 41被引用 8
一句话总结

该论文提出一种基于第一人称视频的方法,通过3D重建实现社会配置的自动标注,以预测篮球运动员未来的轨迹和视线方向。该方法利用孪生网络学习第一人称视觉语义,检索合理的轨迹,并通过社会兼容性选择群体轨迹——最大化通过共同注意实现的视线对齐,5秒后在5米位置误差和30度视线误差下优于第三人称基线方法。

ABSTRACT

This paper presents a method to predict the future movements (location and gaze direction) of basketball players as a whole from their first person videos. The predicted behaviors reflect an individual physical space that affords to take the next actions while conforming to social behaviors by engaging to joint attention. Our key innovation is to use the 3D reconstruction of multiple first person cameras to automatically annotate each other's the visual semantics of social configurations. We leverage two learning signals uniquely embedded in first person videos. Individually, a first person video records the visual semantics of a spatial and social layout around a person that allows associating with past similar situations. Collectively, first person videos follow joint attention that can link the individuals to a group. We learn the egocentric visual semantics of group movements using a Siamese neural network to retrieve future trajectories. We consolidate the retrieved trajectories from all players by maximizing a measure of social compatibility---the gaze alignment towards joint attention predicted by their social formation, where the dynamics of joint attention is learned by a long-term recurrent convolutional network. This allows us to characterize which social configuration is more plausible and predict future group trajectories.

研究动机与目标

  • 从第一人称视频片段中预测篮球运动员的长期社会行为,特别是未来的位置和视线方向。
  • 解决第三人称计算机视觉系统难以捕捉的微妙、情境依赖的社会线索的挑战。
  • 利用第一人称视频中的独特视觉信号:个体第一人称上下文和集体共同注意动态。
  • 开发一种可扩展的大规模学习框架,利用3D重建的第一人称数据对视觉社会信号进行建模。
  • 通过计算上合理的社会行为建模,推动体育分析、社交机器人以及虚拟/增强现实应用的发展。

提出的方法

  • 利用多段第一人称视频的3D重建,自动标注社会配置的视觉语义,包括其他球员的位置、朝向和速度,精度达亚像素级(重投影误差 < 0.5像素)。
  • 采用孪生神经网络学习编码社会与空间配置的第一人称视觉表征,支持基于过去相似情境的轨迹检索。
  • 应用广义Dijkstra算法,通过最大化基于视线对齐的社交兼容性得分,选择最合理的群体轨迹集合。
  • 利用长时程循环卷积网络(LRCN)建模共同注意的动力学,使用社会构型特征(球员位置与速度)。
  • 通过圆柱投影稳定第一人称视频输入,减少抖动与模糊,提升原始第一人称视角的视觉特征学习效果。
  • 通过3D配准整合多玩家的第一人称视角,扩展可见空间,提升个体视角之外的上下文丰富度。

实验结果

研究问题

  • RQ1第一人称视频数据能否有效用于预测复杂社会互动中长期群体行为,如未来轨迹和视线方向?
  • RQ2如何学习第一人称视觉语义,以识别相似的社会与空间配置,用于行为预测?
  • RQ3共同注意在建模球员间社会兼容性方面发挥什么作用?如何定量测量以选择合理的群体轨迹?
  • RQ4第一人称摄像头的视觉信号在预测社会一致行为方面,相较于第三人称视角有多大优势?
  • RQ5由共同注意驱动的视线方向预测,能否提升未来行为与场景幻觉的真实感与准确性?

主要发现

  • 所提方法在5秒后实现5米的位置预测误差和30度的视线方向误差,显著优于第三人称基线方法。
  • 由于整合了社会兼容性与共同注意建模,该方法在视线方向预测方面优于Vanilla LSTM与Social LSTM。
  • 球员位置影响预测准确率:得分后卫比中锋更难预测,因其在场上的互动更复杂、更多样。
  • 仅依赖视觉特征(无运动学数据)表现较差,表明社会与空间上下文对鲁棒预测至关重要。
  • 基于社会配置检索相似过去序列,支持可解释的预测推理,如定性对比所示。
  • 使用K个最佳轨迹解进行未来图像幻觉生成,可产生对齐的背景结构和合理的社会配置,且随时间逐渐退化。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。