[论文解读] Learning Person Trajectory Representations for Team Activity Analysis
本文提出了一种端到端的深度学习框架,从团队运动中球员的移动轨迹中学习时空轨迹表征,以分析个体动作与集体群体动态。通过在轨迹序列上使用堆叠的一维卷积神经网络,该模型在识别特定球队行为和事件方面实现了高准确率,优于手工设计的特征,并在NHL和NBA数据集上的球队识别与事件分类任务中表现出色。
Activity analysis in which multiple people interact across a large space is challenging due to the interplay of individual actions and collective group dynamics. We propose an end-to-end approach for learning person trajectory representations for group activity analysis. The learned representations encode rich spatio-temporal dependencies and capture useful motion patterns for recognizing individual events, as well as characteristic group dynamics that can be used to identify groups from their trajectories alone. We develop our deep learning approach in the context of team sports, which provide well-defined sets of events (e.g. pass, shot) and groups of people (teams). Analysis of events and team formations using NHL hockey and NBA basketball datasets demonstrate the generality of our approach.
研究动机与目标
- 开发一种端到端的深度学习方法,用于学习编码多人活动中个体动作与群体动态的轨迹表征。
- 解决在视觉特征因运动模糊和快速球员移动而不足以充分描述复杂团队运动的挑战。
- 从世界坐标系中的原始球员轨迹中学习丰富的时空依赖关系,以识别个体事件与集体团队行为。
- 证明该方法在不同团队运动(包括曲棍球和篮球)中的通用性与鲁棒性。
- 表明基于轨迹的表征可有效捕捉独特的群体动态,实现球队识别,而无需依赖视觉外观。
提出的方法
- 将一维卷积神经网络(CNN)应用于随时间变化的球员二维轨迹数据(x, y坐标)序列,以学习时空特征。
- 模型采用堆叠架构,各层滤波器大小递增、滤波器数量递增,层间使用ReLU激活函数与最大池化。
- 输入的轨迹序列通过多层卷积层处理,随后经过全局平均池化和全连接层进行分类。
- 网络端到端训练,以从轨迹序列中预测球队身份与事件类型,使用交叉熵损失函数。
- 可视化第一卷积层的滤波器,以解释所学习到的时序模式,如代表特定运动动态的“Z”、“S”、“M”或“W”形状。
- 在包含事件(如传球、投篮)和球队阵型标注的NHL与NBA数据集上评估该方法。
实验结果
研究问题
- RQ1对原始球员轨迹序列进行深度学习,能否有效捕捉团队运动中的个体事件模式与集体群体动态?
- RQ2仅依靠基于轨迹的表征,在不依赖视觉外观或物体级特征的情况下,能在多大程度上识别球队?
- RQ3不同网络架构选择(如层数、滤波器大小、滤波器数量)对球队与事件识别性能有何影响?
- RQ4第一卷积层中学习到的滤波器是否对应于能区分球队或事件的有意义时序运动模式?
- RQ5与手工设计的轨迹特征(如IDT)相比,该方法在捕捉群体层面动态方面表现如何?
主要发现
- 5conv模型在球队身份分类中达到24.78%的准确率,在比赛层面达到95.91%的准确率,显著优于IDT基线模型(分别为5.74%和9.10%)。
- 增加卷积层数量可提升性能,其中5conv模型在所有深度变体中表现最佳。
- 使用较小的滤波器尺寸(如3x3)性能更优;当滤波器尺寸增至9x9时,准确率急剧下降至14.13%。
- 模型在比赛层面达到95.91%的准确率,表明其在整场比赛中具有强大的泛化能力与一致性,实现可靠的球队识别。
- 第一层滤波器的可视化揭示了类似“Z”、“S”、“M”和“W”形状的时序模式,表明模型捕捉到了有意义的运动动态。
- 模型在65%的进攻回合中正确识别了波士顿凯尔特人队,且在诸如“挡拆后外弹”等典型战术动作上预测置信度高,表明其对球队特定策略具有学习敏感性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。