Skip to main content
QUICK REVIEW

[论文解读] Motion Feature Network: Fixed Motion Filter for Action Recognition

Myunggi Lee, Seungeui Lee|arXiv (Cornell University)|Jul 26, 2018
Human Pose and Action Recognition参考文献 24被引用 4
一句话总结

该论文提出MFNet,一种统一的2D CNN架构,其可学习的运动模块通过固定方向滤波器直接从RGB帧中编码时空特征,无需光流或3D卷积。该方法在Jester(96.22% top-1准确率)和Something-Something(37.48% top-1准确率)数据集上实现了最先进性能,且在从零开始训练时无需预训练或多流融合。

ABSTRACT

Spatio-temporal representations in frame sequences play an important role in the task of action recognition. Previously, a method of using optical flow as a temporal information in combination with a set of RGB images that contain spatial information has shown great performance enhancement in the action recognition tasks. However, it has an expensive computational cost and requires two-stream (RGB and optical flow) framework. In this paper, we propose MFNet (Motion Feature Network) containing motion blocks which make it possible to encode spatio-temporal information between adjacent frames in a unified network that can be trained end-to-end. The motion block can be attached to any existing CNN-based action recognition frameworks with only a small additional cost. We evaluated our network on two of the action recognition datasets (Jester and Something-Something) and achieved competitive performances for both datasets by training the networks from scratch.

研究动机与目标

  • 解决两流方法和3D CNN在动作识别中计算成本高、结构复杂的问题。
  • 实现仅使用RGB输入的端到端时空特征学习,避免使用预计算的光流。
  • 设计一种轻量级、模块化的运动模块,可无缝集成到现有2D CNN框架中,仅带来极少的计算开销。
  • 在仅靠空间线索不足以区分的细粒度、时间对称动作数据集上提升性能。
  • 验证运动模块在无需额外模态监督的情况下,有效捕捉运动方向和时间动态的能力。

提出的方法

  • 引入运动模块,对连续RGB帧的特征图应用固定方向滤波器(如水平、垂直、对角线方向)。
  • 通过将移位后的特征图减去原始特征图来计算运动特征,模拟光流但不学习参数。
  • 将运动模块作为即插即用模块集成到2D CNN主干网络(如ResNet)中,支持端到端训练。
  • 采用类似两流的推理策略,通过分段特征聚合实现,但仅使用RGB输入。
  • 对空间特征使用共享特征提取器,对时间建模使用独立的运动模块,两者联合训练。
  • 对分段进行时间平均池化以聚合特征,从而在最小化架构改动的前提下实现分类。

实验结果

研究问题

  • RQ1固定且非学习的运动滤波器能否有效捕捉视频动作识别中的时空动态?
  • RQ2在仅使用RGB输入从零开始训练时,统一的2D CNN结合运动模块是否优于两流或3D CNN基线方法?
  • RQ3所提出的运动模块在时间对称动作对(如“向左滑动”与“向右滑动”)的数据集上,如何提升分类准确率?
  • RQ4推理时最优的分段数是多少?其与训练时使用的分段数有何关系?
  • RQ5运动模块能否在未在大规模数据集上预训练的情况下,有效迁移到不同动作识别数据集中?

主要发现

  • MFNet在Jester测试集上达到96.22%的top-1准确率,优于此前方法,且未使用光流或ImageNet预训练权重。
  • 在Something-Something数据集上,MFNet在官方排行榜上达到37.48%的top-1准确率,展现出在细粒度动作识别任务中的强大性能。
  • 模型显著降低了对时间对称动作对的误分类率——例如,“向前滚动手掌”预测被误分类为“向后滚动手掌”的比例仅为4.2%,而基线方法为35.7%。
  • 性能随验证分段数增加而提升,峰值出现在K=7,尽管最优分段数略高于训练时的K值,表明更精细的时间采样具有优势。
  • 消融实验确认,运动模块对性能有显著贡献,尤其在区分运动方向方面,即使在无任何预训练或多尺度融合的情况下亦然。
  • 由于基于2D CNN架构和固定滤波器,MFNet在参数量更少、计算成本更低的前提下,实现了与3D ConvNets和两流模型相当甚至更优的性能。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。