Skip to main content
QUICK REVIEW

[論文レビュー] Residual Frames with Efficient Pseudo-3D CNN for Human Action Recognition

Jiawei Chen, Jenson Hsiao|arXiv (Cornell University)|Aug 3, 2020
Human Pose and Action Recognition参考文献 12被引用数 4
ひとこと要約

本稿では、隣接するRGBフレーム間の差分である残差フレームを用いて、計算コストを最小限に抑えながら顕著な運動特徴を捉える運動表現として活用することで、軽量で効率的な人体行動認識フレームワークを提案する。新たに導入された擬似3次元畳み込みモジュールは、3次元畳み込みを2次元空間的および1次元時間的畳み込みに分解し、特徴空間の残差と自己注意機構を組み込むことで、163Gから30GにFLOPsを削減しながらUCF101で83%のトップ1精度を達成する最先端の性能を実現した。

ABSTRACT

Human action recognition is regarded as a key cornerstone in domains such as surveillance or video understanding. Despite recent progress in the development of end-to-end solutions for video-based action recognition, achieving state-of-the-art performance still requires using auxiliary hand-crafted motion representations, e.g., optical flow, which are usually computationally demanding. In this work, we propose to use residual frames (i.e., differences between adjacent RGB frames) as an alternative "lightweight" motion representation, which carries salient motion information and is computationally efficient. In addition, we develop a new pseudo-3D convolution module which decouples 3D convolution into 2D and 1D convolution. The proposed module exploits residual information in the feature space to better structure motions, and is equipped with a self-attention mechanism that assists to recalibrate the appearance and motion features. Empirical results confirm the efficiency and effectiveness of residual frames as well as the proposed pseudo-3D convolution module.

研究の動機と目的

  • 光流に代わる計算コストが低く効率的な運動表現を用いて、人体行動認識の性能を向上させること。
  • 高価な手作業で作成された運動特徴に依存せずに、動画データの時間的ダイナミクスをモデル化する課題に取り組むこと。
  • 運動および外観特徴の学習を強化する、軽量でパラメータ効率の良い3次元畳み込みモジュールを開発すること。
  • 残差フレームがRGB入力との補完的モダリティとして、行動認識に有効であることを検証すること。
  • 特徴空間の残差と自己注意機構が、認識性能を顕著に向上させることを示すこと。

提案手法

  • 背景や外観ノイズを最小限に抑えるために、隣接するRGBフレーム間の絶対差分として残差フレームを計算し、運動固有の特徴を抽出する。具体的には、$ x^{res}_{(t_1,s)} = |x_{t_1+s} - x_{t_1}| $ と定義される。
  • 標準的な3次元畳み込みを並列な2次元空間的および1次元時間的畳み込みに分解することで、計算コストとモデルサイズを削減する新しい擬似3次元畳み込みモジュールを提案する。
  • 時間的に隣接する特徴マップからの残差を特徴空間に組み込むことで、運動表現の学習を強化する。
  • 認識タスクに対する関連性に基づいて、外観特徴と運動特徴の重要度を再キャリブレーションするための自己注意機構を導入する。
  • アブレーションスタディを実施し、各構成要素の貢献度を検証する。
  • エンドツーエンドでRGBと残差フレームの両方の入力を用いてモデルを学習し、トップ1およびトップ5精度、FLOPs、アブレーション解析を用いてモダリティ統合と構成要素の有効性を評価する。

実験結果

リサーチクエスチョン

  • RQ1フレーム差分として計算される残差フレームは、人体行動認識において光流の効率的で効果的な代替手段として機能するか?
  • RQ2残差フレーム計算における異なるステップサイズは、行動認識性能にどのように影響するか?
  • RQ3提案された擬似3次元畳み込みモジュールは、計算コストを削減しつつ、認識精度をどの程度向上させるか?
  • RQ4自己注意機構と特徴空間の残差が、提案されたモジュールにおいてそれぞれどの程度の貢献をしているか?
  • RQ5RGBと残差フレームの入力融合は、単独で使用するモダリティよりも優れた性能を達成するか?

主な発見

  • ステップサイズ $ s=1 $ のみで残差フレームを使用した場合、UCF101でトップ1精度83.0%を達成し、RGBのみのモデルよりも2.6ポイント高い性能を示した。
  • RGBと残差フレーム($ s=1 $)を融合した場合、トップ1精度は85.6%に上昇し、両モダリティ間の補完的特徴が有効であることを示した。
  • 提案された擬似3次元モジュールにより、FLOPsは標準的な3次元畳み込みの163Gから30Gに削減され、性能向上が確認された。
  • アブレーションスタディの結果、自己注意機構を削除するとトップ1精度が1.8%低下(83.8%に)、特徴空間の残差を削除すると2.1%低下(83.5%に)した。
  • ステップサイズが大きくなると性能が低下し、トップ1精度は $ s=1 $ の83.0%から $ s=4 $ の80.2%に低下した。これは、小さな時間的ステップが運動の忠実性をよりよく保持していることを示している。
  • 自己注意機構と特徴空間の残差の両方を有効にした完全なモデルは、トップ1精度85.6%を達成し、両要素の相乗効果を確認した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。