Skip to main content
QUICK REVIEW

[论文解读] Rethinking Motion Representation: Residual Frames with 3D ConvNets for Better Action Recognition

Tao Li, Xueting Wang|arXiv (Cornell University)|Jan 16, 2020
Human Pose and Action Recognition参考文献 32被引用 19
一句话总结

本文提出将残差帧——即背景静态且物体被移除的帧——作为3D ConvNets的输入,以改进动作识别中的运动特征提取。通过用残差帧替代标准RGB帧,该方法在从零开始训练时,在UCF101和HMDB51上分别实现了20.5%和12.5%的top-1准确率提升;同时,结合残差运动特征与2D卷积外观特征的双路网络,优于基于光流的模型,且无需昂贵的光流计算。

ABSTRACT

Recently, 3D convolutional networks yield good performance in action recognition. However, optical flow stream is still needed to ensure better performance, the cost of which is very high. In this paper, we propose a fast but effective way to extract motion features from videos utilizing residual frames as the input data in 3D ConvNets. By replacing traditional stacked RGB frames with residual ones, 20.5% and 12.5% points improvements over top-1 accuracy can be achieved on the UCF101 and HMDB51 datasets when trained from scratch. Because residual frames contain little information of object appearance, we further use a 2D convolutional network to extract appearance features and combine them with the results from residual frames to form a two-path solution. In three benchmark datasets, our two-path solution achieved better or comparable performances than those using additional optical flow methods, especially outperformed the state-of-the-art models on Mini-kinetics dataset. Further analysis indicates that better motion features can be extracted using residual frames with 3D ConvNets, and our residual-frame-input path is a good supplement for existing RGB-frame-input models.

研究动机与目标

  • 在不依赖昂贵光流计算的前提下,改进3D ConvNets在动作识别中的运动表征能力。
  • 探究残差帧(仅包含运动变化)是否能比标准堆叠RGB帧更好地捕捉时序动态。
  • 构建一个双路网络,结合来自残差帧的运动特征与来自单个RGB帧的外观特征,以提升识别性能。
  • 证明在从零开始训练时,残差帧输入相较于仅使用RGB的3D ConvNets可实现显著的准确率提升。
  • 提供一种计算效率更高的两流模型替代方案,其性能与现有光流两流模型相当或更优。

提出的方法

  • 通过减去连续的RGB帧生成残差帧,以隔离运动变化并抑制静态背景和物体外观。
  • 将堆叠的残差帧作为3D ConvNet的输入以提取运动特征,替代标准的RGB帧堆叠。
  • 在单个RGB帧上训练一个独立的2D ConvNet以提取外观特征,形成互补路径。
  • 通过晚期融合将3D残差路径和2D外观路径的特征进行融合,以提升识别准确率。
  • 在3D运动路径中使用ResNet-18作为主干网络,在外观路径中使用标准2D ConvNet,以确保计算效率。
  • 端到端训练双路模型,采用交叉熵损失函数,优化在基准数据集上的top-1和top-5准确率。

实验结果

研究问题

  • RQ1残差帧能否作为3D ConvNets在动作识别中的输入,比堆叠RGB帧更有效?
  • RQ2用残差帧替代光流是否能在显著降低计算成本的前提下实现相当或更优的性能?
  • RQ3结合残差运动特征与RGB外观特征的双路网络能否超越现有的两流模型?
  • RQ4残差帧方法在不同复杂度的数据集(如UCF101、HMDB51和Mini-kinetics)上的性能表现如何?
  • RQ5残差帧方法对全局运动及涉及细微物体交互的复杂动作是否具有鲁棒性?

主要发现

  • 将残差帧作为3D ConvNets的输入,在从零开始训练时,使UCF101的top-1准确率提升20.5%,HMDB51提升12.5%。
  • 双路模型在UCF101上达到90.6%的top-1准确率,在Mini-kinetics上达到73.9%,优于MARS和TBN等SOTA模型,且无需使用光流。
  • 在HMDB51上,双路模型达到55.4%的top-1准确率,与最佳性能的两流模型相当,但无需光流计算。
  • 仅使用运动路径的模型在UCF101上达到87.0%的top-1准确率,优于仅使用RGB输入的TSN和I3D-RGB。
  • 双路模型在UCF101上达到98.6%的top-5准确率,优于原始使用光流的两流模型。
  • 尽管使用了更浅的3D主干网络(ResNet-18),而非更深层的ResNeXt-101-3D,双路方法在结合RGB和光流流时仍优于MARS。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。