[论文解读] ReHAR: Robust and Efficient Human Activity Recognition
ReHAR 是一种鲁棒且高效的人体动作识别框架,通过单帧表示模型结合视频帧与光流图像,并利用LSTM实现端到端学习。它在单人和群体动作数据集上均达到最先进(SOTA)的准确率,同时运行速度比以往方法快一个数量级。
Designing a scheme that can achieve a good performance in predicting single person activities and group activities is a challenging task. In this paper, we propose a novel robust and efficient human activity recognition scheme called ReHAR, which can be used to handle single person activities and group activities prediction. First, we generate an optical flow image for each video frame. Then, both video frames and their corresponding optical flow images are fed into a Single Frame Representation Model to generate representations. Finally, an LSTM is used to pre- dict the final activities based on the generated representations. The whole model is trained end-to-end to allow meaningful representations to be generated for the final activity recognition. We evaluate ReHAR using two well-known datasets: the NCAA Basketball Dataset and the UCFSports Action Dataset. The experimental results show that the pro- posed ReHAR achieves a higher activity recognition accuracy with an order of magnitude shorter computation time compared to the state-of-the-art methods.
研究动机与目标
- 设计一种能够处理复杂动作(包括体育视频中的群体活动)的人体动作识别系统。
- 在显著降低计算时间的同时,提升识别准确率,相较现有深度学习方法。
- 通过端到端训练实现对视频与运动表征中意义特征的联合学习。
- 通过突出输入帧与光流图像中的关键区域,提供视觉可解释性。
提出的方法
- 为每个视频帧生成光流图像,以捕捉运动动态。
- 将原始视频帧与对应的光流图像输入单帧表示模型,以提取时空特征。
- 使用长短期记忆(LSTM)网络处理生成的表征,建模时间依赖性并预测最终的动作标签。
- 整个模型通过端到端方式训练,以优化动作识别的特征表征。
- 通过消融研究证实,全局平均池化层可降低维度并提升泛化能力。
- 采用基于梯度的可视化方法生成类别特定显著图,以解释模型注意力机制,并突出输入数据中的关键区域。
实验结果
研究问题
- RQ1统一的深度学习框架能否有效识别视频中的人体单人与群体动作?
- RQ2与仅使用帧图像相比,光流与视频帧的融合在多大程度上提升了识别准确率?
- RQ3端到端训练在多大程度上提升了复杂动作识别的特征表征质量?
- RQ4与现有的分层或非端到端方法相比,该模型能否在显著降低推理时间的同时实现高准确率?
- RQ5模型在预测时关注哪些视觉线索?这些线索与人类对关键动作的感知是否一致?
主要发现
- 在NCAA篮球和UCF Sports Action数据集上,ReHAR在动作识别准确率上均优于现有最先进方法。
- 该模型的运行速度比现有方案快约一个数量级,适用于实时应用。
- 消融研究显示,若将全局池化层替换为展平层,mAP从0.928降至0.889,证实了全局池化对性能的关键作用。
- 可视化结果表明,ReHAR关注的关键区域为关键人物与运动模式(如球员、球或篮筐),而非无关背景元素。
- 在误分类案例中(如将“行走”预测为“高尔夫”),模型会突出显示人物及上下文相关特征(如球杆),表明其高置信度错误具有合理依据。
- 该可视化方法成功追踪了通过两个LSTM和全连接层的类别特定重要性,实现了模型决策的可解释性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。