Skip to main content
QUICK REVIEW

[论文解读] Learning to score the figure skating sports videos

Chengming Xu, Yanwei Fu|arXiv (Cornell University)|Feb 8, 2018
Human Pose and Action Recognition参考文献 64被引用 7
一句话总结

本文提出了一种结合自注意力LSTM(S-LSTM)与多尺度卷积跳跃LSTM(M-LSTM)的深度学习框架,用于从完整时长的花样滑冰视频中预测得分。该模型有效捕捉了局部与全局的序列模式,在MIT-skate数据集和新提出的Fis-V数据集上均实现了最先进(SOTA)的性能,显著提升了回归准确率与斯皮尔曼等级相关系数。

ABSTRACT

This paper targets at learning to score the figure skating sports videos. To address this task, we propose a deep architecture that includes two complementary components, i.e., Self-Attentive LSTM and Multi-scale Convolutional Skip LSTM. These two components can efficiently learn the local and global sequential information in each video. Furthermore, we present a large-scale figure skating sports video dataset -- FisV dataset. This dataset includes 500 figure skating videos with the average length of 2 minutes and 50 seconds. Each video is annotated by two scores of nine different referees, i.e., Total Element Score(TES) and Total Program Component Score (PCS). Our proposed model is validated on FisV and MIT-skate datasets. The experimental results show the effectiveness of our models in learning to score the figure skating videos.

研究动机与目标

  • 为解决专业花样滑冰视频评分的挑战,该任务需要理解长时长、复杂的表演,并具备专家级评分能力。
  • 开发一种能够捕捉完整滑冰表演中局部技术动作(TES)与全局艺术表现(PCS)的模型。
  • 构建一个大规模、高质量的视频数据集,包含专家标注的TES与PCS得分,以支持体育视频分析研究。
  • 在现有及新收集的数据集上评估所提模型的有效性,证明其在基线方法上的优越性能。

提出的方法

  • 自注意力LSTM(S-LSTM)利用自注意力机制识别并加权关键的片段级特征用于回归,聚焦于局部序列模式。
  • 多尺度卷积跳跃LSTM(M-LSTM)通过改进的跳跃LSTM架构,在多个时间尺度上建模局部与全局时间依赖性,同时降低计算成本。
  • 两个子网络可独立使用,也可组合为端到端框架,联合回归TES与PCS得分。
  • 模型以C3D特征作为输入,通过最大池化或平均池化,并结合线性SVR进行回归,实现端到端训练。
  • 使用均方误差(MSE)与斯皮尔曼等级相关系数评估框架性能,并对注意力机制与特征类型进行消融研究。
  • Fis-V数据集由专业比赛视频构建,包含500个高质量片段,平均时长2分50秒,每个片段由九名国际裁判标注。

实验结果

研究问题

  • RQ1深度学习模型能否有效从完整时长的视频表演中学习预测专家评分?
  • RQ2自注意力机制与多尺度建模在捕捉滑冰得分中技术与艺术成分方面分别起到何种作用?
  • RQ3在该回归任务中,不同特征提取方法(如C3D与SENet)的相对性能如何?
  • RQ4结合S-LSTM与M-LSTM是否能提升性能?若能,对哪种得分类型(TES或PCS)提升更显著?
  • RQ5模型的注意力机制是否与人类专家对关键表现时刻的评估一致?

主要发现

  • 所提出的M-LSTM与S-LSTM模型在MIT-skate与Fis-V数据集上,无论在斯皮尔曼等级相关系数还是MSE方面,均显著优于所有基线模型。
  • 在Fis-V数据集上,M-LSTM单独使用时表现最佳,PCS的斯皮尔曼相关系数达0.853,TES为0.781。
  • S-LSTM与M-LSTM的结合进一步提升了PCS的性能(斯皮尔曼相关系数0.853),但在TES上未见显著增益,表明技术得分的特征学习存在冗余。
  • 在Fis-V数据集上,平均池化优于最大池化;而在MIT-skate上,最大池化表现更优,表明池化策略对数据集具有敏感性。
  • C3D特征(基于片段、具备运动感知能力)优于静态帧-based的SENet特征,凸显了在花样滑冰视频分析中时间建模的重要性。
  • 自注意力机制成功通过赋予高影响力技术动作(如复杂跳跃)更高的注意力权重,识别出关键表现时刻,经定性可视化验证有效。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。