Skip to main content
QUICK REVIEW

[论文解读] Fine-Grained Action Detection with RGB and Pose Information using Two Stream Convolutional Networks

Leonard Hacker, Finn Bartels|arXiv (Cornell University)|Feb 6, 2023
Stroke Rehabilitation and RecoveryMedicine被引用 3
一句话总结

本文提出一种双流3D卷积神经网络框架,通过MMPose从RGB视频帧中提取人体姿态信息,实现细粒度乒乓球击球动作检测。通过将原始RGB流与姿态增强RGB流(PRGB)进行晚期特征融合,模型在分类任务中达到87.3%的准确率,较基线模型略有提升;然而检测性能仍有限,IoU为0.349,mAP为0.110。

ABSTRACT

As participants of the MediaEval 2022 Sport Task, we propose a two-stream network approach for the classification and detection of table tennis strokes. Each stream is a succession of 3D Convolutional Neural Network (CNN) blocks using attention mechanisms. Each stream processes different 4D inputs. Our method utilizes raw RGB data and pose information computed from MMPose toolbox. The pose information is treated as an image by applying the pose either on a black background or on the original RGB frame it has been computed from. Best performance is obtained by feeding raw RGB data to one stream, Pose + RGB (PRGB) information to the other stream and applying late fusion on the features. The approaches were evaluated on the provided TTStroke-21 data sets. We can report an improvement in stroke classification, reaching 87.3% of accuracy, while the detection does not outperform the baseline but still reaches an IoU of 0.349 and mAP of 0.110.

研究动机与目标

  • 通过结合视觉信息与人体姿态信息,提升体育视频中细粒度动作检测的性能。
  • 探究姿态表征是否能在传统基于RGB的模型之外,提升动作识别与检测性能。
  • 评估在双流3D CNN架构中不同姿态融合策略(如PRGB与纯姿态)的有效性。
  • 确定姿态数据是否能补偿乒乓球击球等动作中类间差异小的问题。
  • 在TTStroke-21数据集上,针对分类与检测任务,与MediaEval 2022基线模型进行性能对比。

提出的方法

  • 采用双流3D CNN架构,其中一路处理原始RGB视频片段,另一路处理姿态增强的帧。
  • 姿态信息通过MMPose工具箱提取,对每帧中检测到的人体进行自顶向下的关节点估计。
  • 评估了两种基于姿态的输入:黑色背景上的人体姿态(Pose)与叠加在原始RGB帧上的姿态(PRGB)。
  • 在最终分类层之前应用晚期特征融合,其中特征相加融合策略表现最佳。
  • 模型采用带有注意力机制的3D卷积神经网络(3D-CNN)模块,以捕捉时空特征。
  • 在Tesla V100 GPU上训练2000个周期,学习率为0.0001,动量为0.5。
(a) RGB
(a) RGB

实验结果

研究问题

  • RQ1与单流RGB模型相比,结合RGB与姿态信息是否能提升乒乓球视频中细粒度动作分类的性能?
  • RQ2姿态信息是否能增强对低差异性动作(如乒乓球击球)的检测性能?
  • RQ3在双流3D CNN中,早期、晚期或中间融合策略中,哪种能获得最佳性能?
  • RQ4姿态估计质量如何影响模型对相似乒乓球击球动作的区分能力?
  • RQ5在检测任务中,姿态数据是否能补偿缺乏物体级线索(如球拍、球)的问题?

主要发现

  • 双流模型在击球分类任务中达到87.3%的测试准确率,较基线模型提升0.9%。
  • 最佳检测性能由RGB与PRGB双流配置实现,IoU为0.349,mAP为0.110。
  • 仅使用姿态流的检测性能显著下降,mAP降至0.046,表明仅靠姿态数据缺乏判别性线索。
  • 晚期融合中采用特征相加策略优于加权融合与拼接融合,表明在最终层进行融合为最佳时机。
  • 尽管分类性能有所提升,但检测性能未超越基线,可能因姿态数据中缺少球与球拍等关键线索。
  • 模型表现出较强的泛化能力,RGB与PRGB流的验证准确率最高达0.848,表明在TTStroke-21数据集上学习效果稳健。
(b) Pose
(b) Pose

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。