Skip to main content
QUICK REVIEW

[论文解读] Multi-Level Recurrent Residual Networks for Action Recognition

Zhenxing Zheng, Gaoyun An|arXiv (Cornell University)|Nov 22, 2017
Human Pose and Action Recognition参考文献 31被引用 6
一句话总结

该论文提出了一种新型架构——多级循环残差网络(MRRN),通过三条并行的残差网络-循环神经网络(ResNet-RNN)流,融合低、中、高层时空表征,每条流均采用恒等快捷连接。通过利用堆叠的简单循环单元(SRUs)和软最大分数的加权融合,MRRN在不使用外部数据的情况下,实现了51.3%的HMDB-51准确率和81.9%的UCF-101准确率,性能达到当前最先进水平,同时计算复杂度低于先前模型。

ABSTRACT

Most existing Convolutional Neural Networks(CNNs) used for action recognition are either difficult to optimize or underuse crucial temporal information. Inspired by the fact that the recurrent model consistently makes breakthroughs in the task related to sequence, we propose a novel Multi-Level Recurrent Residual Networks(MRRN) which incorporates three recognition streams. Each stream consists of a Residual Networks(ResNets) and a recurrent model. The proposed model captures spatiotemporal information by employing both alternative ResNets to learn spatial representations from static frames and stacked Simple Recurrent Units(SRUs) to model temporal dynamics. Three distinct-level streams learned low-, mid-, high-level representations independently are fused by computing a weighted average of their softmax scores to obtain the complementary representations of the video. Unlike previous models which boost performance at the cost of time complexity and space complexity, our models have a lower complexity by employing shortcut connection and are trained end-to-end with greater efficiency. MRRN displays significant performance improvements compared to CNN-RNN framework baselines and obtains comparable performance with the state-of-the-art, achieving 51.3% on HMDB-51 dataset and 81.9% on UCF-101 dataset although no additional data.

研究动机与目标

  • 解决现有CNN-RNN模型在优化深层网络方面的局限性,并在视频动作识别中未能充分利用时间信息的问题。
  • 在保持或提升性能的同时,降低时空建模中的计算复杂度。
  • 探索低、中、高层表征之间的互补性,以增强视频理解能力。
  • 设计一种端到端可训练的架构,高效捕捉视频序列中的空间与时间动态。

提出的方法

  • 该模型采用三条并行流——低、中、高层循环残差网络(RRNs),每条流均结合ResNet进行空间特征提取,以及堆叠的简单循环单元(SRUs)进行时间建模。
  • 每条流均使用恒等快捷连接,以降低训练难度,并减少时间和空间复杂度。
  • 通过先使用ResNets从视频帧中提取固定长度的特征向量,再通过SRUs进行序列建模,学习时空表征。
  • 通过计算三条流的软最大分数的加权平均,生成最终预测结果,以融合互补的表征。
  • 在最终分类层之前,对RNN输出的整个序列应用时间序列池化。
  • 使用标准交叉熵损失和随机梯度下降进行端到端训练,无需额外的数据增强或预训练。

实验结果

研究问题

  • RQ1单一网络架构中,低、中、高层表征的多级表示是否可通过互补融合提升动作识别性能?
  • RQ2在循环残差架构中使用恒等快捷连接,与标准RNN或残差网络相比,对训练效率和模型复杂度有何影响?
  • RQ3轻量级循环残差网络在不使用外部数据的情况下,能否在标准基准上优于或匹配3D-CNN或cLSTM等更复杂模型的性能?
  • RQ4不同的时间池化策略在多大程度上影响不同网络深度的特征对最终动作识别准确率的贡献?

主要发现

  • MRRN在HMDB-51数据集上达到51.3%的top-1准确率,在UCF-101上达到81.9%的准确率,性能与当前最先进模型相当或更优,且未使用额外数据。
  • 与Spatial ConvNet相比,MRRN在HMDB-51上提升10.8%,在UCF-101上提升8.9%,表明通过循环单元建模运动动态具有显著优势。
  • 在HMDB-51上,MRRN相比cLSTM提升7.2%(从44.1%提升至51.3%),在UCF-101上提升6.1%(从75.8%提升至81.9%),表明其具备更强的时空表征学习能力。
  • 三流架构结合软最大分数的加权融合,性能优于单一流,证实了多级特征的互补性。
  • 复杂度分析表明,由于高效的恒等快捷连接和参数量减少,MRRN的时间和空间复杂度低于C3D、scLSTM和cLSTM。
  • UCF-101上的混淆矩阵显示对角线主导性显著,表明在大多数动作类别上预测准确率较高,第一折测试的总体准确率达到81.9%。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。