Skip to main content
QUICK REVIEW

[論文レビュー] Generalized Rank Pooling for Activity Recognition

Anoop Cherian, Basura Fernando|arXiv (Cornell University)|Apr 7, 2017
Human Pose and Action Recognition参考文献 43被引用数 18
ひとこと要約

本稿では、動画クリップのCNN特徴量から、時間的順序を保持する低ランク部分空間表現を学習する、リーマン最適化に基づく新規な方法である一般化ランクプーリング(GRP)を提案する。動画シーケンスをグラスマン多様体上の部分空間としてモデル化し、共役勾配降下法を用いることで、複数のベンチマークで最先端性能を達成し、平均プーリングやランクプーリングを最大20%上回る性能を発揮する。

ABSTRACT

Most popular deep models for action recognition split video sequences into short sub-sequences consisting of a few frames; frame-based features are then pooled for recognizing the activity. Usually, this pooling step discards the temporal order of the frames, which could otherwise be used for better recognition. Towards this end, we propose a novel pooling method, generalized rank pooling (GRP), that takes as input, features from the intermediate layers of a CNN that is trained on tiny sub-sequences, and produces as output the parameters of a subspace which (i) provides a low-rank approximation to the features and (ii) preserves their temporal order. We propose to use these parameters as a compact representation for the video sequence, which is then used in a classification setup. We formulate an objective for computing this subspace as a Riemannian optimization problem on the Grassmann manifold, and propose an efficient conjugate gradient scheme for solving it. Experiments on several activity recognition datasets show that our scheme leads to state-of-the-art performance.

研究の動機と目的

  • 従来のプーリング手法が動画特徴量における時間的順序を無視するという制限を是正すること。
  • 低ランク部分空間表現を用いて、深層CNN特徴量の時間的ダイナミクスを保持することで、行動認識を向上させること。
  • 単一の直線や線形ランクに依存する既存のランクプーリングの制限を克服し、複数の正規直交ハイパーハイパープランに一般化すること。
  • 直交制約下でのこのような部分空間の学習に適した効率的な最適化フレームワークを開発すること。
  • 既存のプーリングおよび認識手法と比較して、部分空間に基づく動画表現の優位性を実証すること。

提案手法

  • GRPは、部分空間をコンactな動画表現として表すことで、プーリング問題をグラスマン多様体上のリーマン最適化タスクとして定式化する。
  • 特徴量の射影において時間的順序を保持するために、低ランク近似誤差と二次的ランク損失を同時に最小化する。
  • 部分空間基底の直交制約は、リーマン最適化を用いて強制され、具体的には共役勾配降下法が使用される。
  • 短い動画クリップの途中のCNN特徴量から、RGBおよびオプティカルフロー入力を用いて、部分空間パラメータをエンドツーエンドで学習する。
  • 本手法は、VGG-16およびResNet-152モデルから特徴量を抽出する二重ストリームネットワークアーキテクチャに適用される。
  • 分類は、グラスマン多様体に埋め込まれた部分空間パラメータ上で学習された非線形分類器を用いて実行される。

実験結果

リサーチクエスチョン

  • RQ1低ランク部分空間表現は、平均プーリングや最大プーリングと比較して、動画特徴量の時間的順序をより効果的に保持できるか?
  • RQ2単一の直線から多様体的部分空間へのランクプーリングの一般化は、行動認識の正確性を向上させるか?
  • RQ3グラスマン多様体上のリーマン最適化は、非凸かつ直交制約付きの最適化問題を、動画表現学習において効率的に解けるか?
  • RQ4多様な行動認識ベンチマークにおいて、GRPは最先端手法と比較してどの程度優れた性能を示すか?
  • RQ5より深いCNN(例:ResNet-152)を用いることで、GRPフレームワークの性能はどの程度向上するか?

主な発見

  • HMDB-51およびUCF101データセットにおいて、GRPはResNet-152特徴量を用いて平均93.5%の精度を達成し、最先端性能を記録した。
  • JHMDBデータセットでは、IDT-FV特徴量を用いて73.7%の精度を達成し、前回の最先端手法を1.5ポイント上回った。
  • MPIIおよびJHMDBにおいて、GRPはランクプーリングを10~20%上回り、直線ではなく部分空間を用いる利点を示した。
  • ランク制約なしのバージョンはGRPに比べて著しく性能が劣っており、時間的順序の保持が重要であることを確認した。
  • VGG-16特徴量と比較して、ResNet-152特徴量を用いることで7%の性能向上が得られ、GRPがより深いネットワークにスケーラブルであることを示した。
  • JHMDBの21の行動のうち13個において、GRPは最近のP-CNN手法を上回り、19の行動では同手法または制約なしのバージョンと同等以上またはそれを上回った。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。