Skip to main content
QUICK REVIEW

[論文レビュー] Multi-Level Recurrent Residual Networks for Action Recognition

Zhenxing Zheng, Gaoyun An|arXiv (Cornell University)|Nov 22, 2017
Human Pose and Action Recognition参考文献 31被引用数 6
ひとこと要約

本稿では、アイデンティティショートカット接続を備えた3つの並列なResNet-RNNストリームを用いて、低レベル、中レベル、高レベルの時空間的表現を統合する、新しいアーキテクチャであるマルチレベル再帰的残差ネットワーク(MRRN)を提案する。スタックドシンプルリカレントユニット(SRU)とソフトマックススコアの重み付き統合を活用することで、外部データを用いずにHMDB-51で51.3%、UCF-101で81.9%の最先端性能を達成した一方で、先行モデルよりも低い計算複雑性を維持している。

ABSTRACT

Most existing Convolutional Neural Networks(CNNs) used for action recognition are either difficult to optimize or underuse crucial temporal information. Inspired by the fact that the recurrent model consistently makes breakthroughs in the task related to sequence, we propose a novel Multi-Level Recurrent Residual Networks(MRRN) which incorporates three recognition streams. Each stream consists of a Residual Networks(ResNets) and a recurrent model. The proposed model captures spatiotemporal information by employing both alternative ResNets to learn spatial representations from static frames and stacked Simple Recurrent Units(SRUs) to model temporal dynamics. Three distinct-level streams learned low-, mid-, high-level representations independently are fused by computing a weighted average of their softmax scores to obtain the complementary representations of the video. Unlike previous models which boost performance at the cost of time complexity and space complexity, our models have a lower complexity by employing shortcut connection and are trained end-to-end with greater efficiency. MRRN displays significant performance improvements compared to CNN-RNN framework baselines and obtains comparable performance with the state-of-the-art, achieving 51.3% on HMDB-51 dataset and 81.9% on UCF-101 dataset although no additional data.

研究の動機と目的

  • 従来のCNN-RNNモデルが深層ネットワークの最適化に課題を抱え、動画行動認識において時間情報を十分に活用していない点を是正すること。
  • 性能を維持または向上させつつ、時空間モデリングにおける計算複雑性を低減すること。
  • 低レベル、中レベル、高レベルの多様な表現の相補性を活用して、動画理解を向上させること。
  • 空間的および時間的ダイナミクスを効率的に捉えることができる、エンドツーエンドで学習可能なアーキテクチャを設計すること。

提案手法

  • モデルは、低レベル、中レベル、高レベルの再帰的残差ネットワーク(RRN)の3つの並列ストリームを採用しており、それぞれが空間的特徴抽出にResNet、時間的モデリングにスタックドシンプルリカレントユニット(SRU)を組み合わせている。
  • 各ストリームにアイデンティティショートカット接続を適用することで、学習の難易度を軽減し、時間的・空間的複雑性を低減している。
  • 時空間的表現は、まず動画フレームから固定長の特徴ベクトルをResNetで抽出し、その後SRUによる逐次モデリングで学習される。
  • 最終的な予測は、3つのストリームのソフトマックススコアの重み付き平均を計算することで、相補的な表現を統合する。
  • 最終分類層の前に、RNN出力の全系列に時間系列プーリングを適用する。
  • 追加のデータオーグメンテーションや事前学習を用いずに、標準的な交差エントロピー損失と確率的勾配降下法を用いてエンドツーエンドで学習される。

実験結果

リサーチクエスチョン

  • RQ1単一のネットワークアーキテクチャから得られる多様なレベル(低、中、高)の表現が、相補的な統合によって行動認識性能を向上させることができるか?
  • RQ2再帰的残差アーキテクチャにおけるアイデンティティショートカットの使用は、標準的なRNNや残差ネットワークと比較して、学習効率やモデル複雑性にどのような影響を与えるか?
  • RQ3外部データを一切使用せずに、軽量な再帰的残差ネットワークが、3D-CNN や cLSTM などのより複雑なモデルを凌駆するか、同等の性能を達成できるか?
  • RQ4異なる時間的プーリング戦略は、異なるネットワーク深さからの特徴の貢献度にどのように影響を与えるか?

主な発見

  • MRRNはHMDB-51データセットで51.3%のトップ1精度、UCF-101で81.9%を達成し、追加データを一切使用せず、最先端のモデルと同等またはそれを上回る性能を示した。
  • Spatial ConvNet よりもHMDB-51で10.8%、UCF-101で8.9%高い性能を示し、リカレントユニットによる運動ダイナミクスのモデリングの有効性を裏付けた。
  • cLSTM よりもHMDB-51で7.2%(44.1%から51.3%に)向上、UCF-101で6.1%(75.8%から81.9%に)向上し、より強力な時空間的表現学習を示した。
  • ソフトマックススコアの重み付き統合を施した3ストリームアーキテクチャは、個別のストリームよりも優れた性能を示し、多様なレベルの特徴の相補性を確認した。
  • 複雑性解析の結果、アイデンティティショートカットの効率的利用とパラメータ数の削減により、C3D、scLSTM、cLSTM よりも時間的・空間的複雑性が低いことが判明した。
  • UCF-101の混同行列は強い対角優位性を示しており、大多数の行動クラスで高い予測精度を達成しており、第1スプリットで全体で81.9%の精度を記録した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。