Skip to main content
QUICK REVIEW

[论文解读] Generalized Rank Pooling for Activity Recognition

Anoop Cherian, Basura Fernando|arXiv (Cornell University)|Apr 7, 2017
Human Pose and Action Recognition参考文献 43被引用 18
一句话总结

本文提出广义秩池化(GRP),一种基于黎曼优化的新方法,从视频片段的CNN特征中学习低秩子空间表示,保留时序顺序以提升动作识别性能。通过将视频序列建模为格拉斯曼流形上的子空间,并使用共轭梯度下降法,GRP在多个基准测试中达到最先进性能,相较于平均池化和秩池化,在某些数据集上性能提升高达20%。

ABSTRACT

Most popular deep models for action recognition split video sequences into short sub-sequences consisting of a few frames; frame-based features are then pooled for recognizing the activity. Usually, this pooling step discards the temporal order of the frames, which could otherwise be used for better recognition. Towards this end, we propose a novel pooling method, generalized rank pooling (GRP), that takes as input, features from the intermediate layers of a CNN that is trained on tiny sub-sequences, and produces as output the parameters of a subspace which (i) provides a low-rank approximation to the features and (ii) preserves their temporal order. We propose to use these parameters as a compact representation for the video sequence, which is then used in a classification setup. We formulate an objective for computing this subspace as a Riemannian optimization problem on the Grassmann manifold, and propose an efficient conjugate gradient scheme for solving it. Experiments on several activity recognition datasets show that our scheme leads to state-of-the-art performance.

研究动机与目标

  • 解决传统池化方法在视频特征中丢弃时序顺序的局限性。
  • 通过低秩子空间表示保留深度CNN特征中的时序动态,以提升动作识别性能。
  • 通过推广至多个正交超平面,克服先前秩池化方法对单一直线和线性排序的依赖,突破其局限性。
  • 开发一种高效优化框架,用于在正交性约束下学习此类子空间。
  • 证明基于子空间的视频表示相较于现有池化与识别方法的优越性。

提出的方法

  • GRP将池化问题表述为在格拉斯曼流形上的黎曼优化任务,其中子空间代表紧凑的视频表示。
  • 该方法联合最小化低秩逼近误差与二次排序损失,以在投影特征中保留时序顺序。
  • 通过黎曼优化方法,特别是共轭梯度下降算法,强制实施子空间基的正交性约束。
  • 子空间参数从短视频片段的中间CNN特征端到端学习,使用RGB和光流输入。
  • 该方法应用于双流网络结构,特征提取自VGG-16和ResNet-152模型。
  • 分类通过在嵌入于格拉斯曼流形的子空间参数上训练的非线性分类器完成。

实验结果

研究问题

  • RQ1低秩子空间表示是否比平均池化或最大池化更有效地保留视频特征中的时序顺序?
  • RQ2将秩池化从单一直线推广至多维子空间,是否能提升动作识别的准确性?
  • RQ3在格拉斯曼流形上使用黎曼优化,能否高效求解视频表示学习中的非凸、正交性约束优化问题?
  • RQ4在多样化的动作识别基准测试中,GRP与最先进方法相比性能如何?
  • RQ5使用更深的CNN(如ResNet-152)在多大程度上提升了GRP框架的性能?

主要发现

  • GRP在HMDB-51和UCF101数据集上达到最先进性能,使用ResNet-152特征时平均准确率达到93.5%。
  • 在JHMDB数据集上,GRP使用IDT-FV特征达到73.7%的准确率,较之前最先进方法高出1.5个百分点。
  • 在MPII和JHMDB数据集上,GRP相较秩池化提升10%至20%,证明使用子空间优于使用直线的优越性。
  • 无排序约束的变体性能显著低于GRP,证实保留时序顺序的重要性。
  • 使用ResNet-152特征相比VGG-16特征带来7%的性能增益,表明GRP可有效扩展至更深网络。
  • 在JHMDB数据集中13种动作上,GRP优于近期的P-CNN方法;在19种动作上,GRP表现优于或匹配无约束变体。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。