Skip to main content
QUICK REVIEW

[論文レビュー] Relational Long Short-Term Memory for Video Action Recognition

Zexi Chen, Bharathkumar Ramachandra|arXiv (Cornell University)|Nov 16, 2018
Human Pose and Action Recognition参考文献 54被引用数 7
ひとこと要約

本論文では、動画内のオブジェクト間の長距離および短距離の時空間的関係をモデル化するために、LSTMアーキテクチャに非局所演算を統合した関係的LSTM(Relational LSTM)ネットワークを提案する。局所的な時空間的プーリングブランチと組み合わせることで、LSTMベースのモデルにおいて最先端の性能を達成し、大規模なCharadesデータセットにおいて前人最高の手法よりも3.2%の向上を示し、オブジェクト同士の相互作用や長期的軌道のモデル化が優れていることを示している。

ABSTRACT

Spatial and temporal relationships, both short-range and long-range, between objects in videos, are key cues for recognizing actions. It is a challenging problem to model them jointly. In this paper, we first present a new variant of Long Short-Term Memory, namely Relational LSTM, to address the challenge of relation reasoning across space and time between objects. In our Relational LSTM module, we utilize a non-local operation similar in spirit to the recently proposed non-local network to substitute the fully connected operation in the vanilla LSTM. By doing this, our Relational LSTM is capable of capturing long and short-range spatio-temporal relations between objects in videos in a principled way. Then, we propose a two-branch neural architecture consisting of the Relational LSTM module as the non-local branch and a spatio-temporal pooling based local branch. The local branch is utilized for capturing local spatial appearance and/or short-term motion features. The two branches are concatenated to learn video-level features from snippet-level ones which are then used for classification. Experimental results on UCF-101 and HMDB-51 datasets show that our model achieves state-of-the-art results among LSTM-based methods, while obtaining comparable performance with other state-of-the-art methods (which use not directly comparable schema). Further, on the more complex large-scale Charades dataset, we obtain a large 3.2% gain over state-of-the-art methods, verifying the effectiveness of our method in complex understanding.

研究の動機と目的

  • 動画内のオブジェクト同士の短距離および長距離の空間的・時間的関係を同時にモデル化する課題に対処すること。
  • 空間的・時間的全域にわたる関係的依存性を捉えるために、非局所演算を組み込んだLSTMベースの動画行動認識を改善すること。
  • グローバルな関係的推論(非局所LSTMを用いて)と局所的特徴学習を組み合わせた2ブランチアーキテクチャを構築し、強力な動画レベル表現を実現すること。
  • LSTMベースの手法において最先端の性能を達成するとともに、ベンチマークデータセットで非LSTM最先端手法と同等の結果を得ること。
  • 細分化された時間的・空間的推論を要する複雑な大規模データセットにおいて、提案手法の有効性を検証すること。

提案手法

  • 関係的LSTMは、通常のLSTMにおける全結合演算を、非局所ネットワークにインspiredされた非局所演算に置き換える。これにより、空間的・時間的全域の特徴マップに対して注目メカニズムに類似した計算が可能になる。
  • 非局所演算は、類似度関数を用いて、すべての位置における特徴の重み付き和を計算することで、局所性を仮定せずに長距離依存性を捉える。
  • 2ブランチのニューラルアーキテクチャを提案:1ブランチは関係的LSTMを用いてグローバルな関係的推論を実行し、もう1ブランチは時空間的プーリングを用いて局所的な外観および運動特徴を抽出する。
  • 両ブランチの出力を連結して統一的な動画レベル表現を形成し、最終的な分類器ヘッドを用いて分類に用いる。
  • クロスエントロピー損失を用いてエンド・ツー・エンドで学習し、UCF-101およびHMDB-51では空間的・時間的ストリームのラテントフェージョンを適用し、CharadesではRGB入力のみを用いる。
  • UCF-101、HMDB-51、Charadesで評価し、トップ-1精度およびmAPを含む標準的なプロトコルと指標を用いる。

実験結果

リサーチクエスチョン

  • RQ1改良されたLSTMアーキテクチャは、動画行動におけるオブジェクト間の短距離および長距離の時空間的関係を効果的にモデル化できるか?
  • RQ2LSTMに非局所演算を統合することで、標準的なLSTMや2次元・3次元CNNと比較して、行動認識における関係的推論がどのように向上するか?
  • RQ3関係的推論と局所的特徴学習を組み合わせた2ブランチアーキテクチャは、単独のLSTMやCNNベースのモデルと比較して、より優れた性能を発揮するか?
  • RQ4関係的LSTMは、複雑な動画行動における長期的軌道およびオブジェクト相互作用の特徴をどの程度効果的に捉えることができるか?
  • RQ5非LSTM最先端手法と同等の性能を達成できるか、特にCharadesのような大規模データセットにおいて。

主な発見

  • UCF-101データセットでは、本手法が94.8%のトップ-1精度を達成し、すべての先行LSTMベースの手法を上回り、最良の非LSTMモデルと同等の性能を示した。
  • HMDB-51データセットでは、71.4%のトップ-1精度を達成し、より困難で多様性のある行動認識ベンチマークでも強力な性能を示した。
  • 大規模なCharadesデータセットでは、mAPが28.8%に達し、前人最高の手法よりも3.2%の絶対的向上を示した。これは、複数オブジェクトが関与する長時間の動画行動理解において、本手法の有効性を示している。
  • アブレーションスタディにより、関係的LSTMモジュールが、特に長距離依存性やオブジェクト相互作用のモデル化において顕著な寄与をしていることが確認された。
  • LSTMベースの手法において最先端の結果を達成し、CharadesではRGB入力のみで非LSTM最先端手法と同等の性能を示した。
  • 本手法は訓練が単純で、一般化性能が高く、複数のデータセットおよび評価プロトコルにおいて一貫した性能向上を示した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。