Skip to main content
QUICK REVIEW

[論文レビュー] Deep Multimodal Feature Analysis for Action Recognition in RGB+D Videos

Amir Shahroudy, Tian-Tsong Ng|arXiv (Cornell University)|Mar 23, 2016
Human Pose and Action Recognition参考文献 78被引用数 17
ひとこと要約

本稿では、スタックドオートエンコーダーに基づくネットワークを用いて、RGB+D動画特徴を階層的に共有(共通)成分とモodal特異的成分に分解する、深層マルチモーダル特徴解析フレームワークDSSCAを提案する。さらに、混合ノルム正則化を用いた構造的スパarsity学習マシン(SSLM)を導入し、分類性能を向上させるために情報量の多い成分を選択する。5つのRGB+Dアクション認識ベンチマークで最先端の精度を達成し、オンラインRGBDデータセットでは99.0%の精度を記録した。

ABSTRACT

Single modality action recognition on RGB or depth sequences has been extensively explored recently. It is generally accepted that each of these two modalities has different strengths and limitations for the task of action recognition. Therefore, analysis of the RGB+D videos can help us to better study the complementary properties of these two types of modalities and achieve higher levels of performance. In this paper, we propose a new deep autoencoder based shared-specific feature factorization network to separate input multimodal signals into a hierarchy of components. Further, based on the structure of the features, a structured sparsity learning machine is proposed which utilizes mixed norms to apply regularization within components and group selection between them for better classification performance. Our experimental results show the effectiveness of our cross-modality feature analysis framework by achieving state-of-the-art accuracy for action classification on five challenging benchmark datasets.

研究の動機と目的

  • RGBと深度モダリティの補完的情報を活用することで、単一モダリティのアクション認識の限界を克服すること。
  • マルチモーダル特徴を共有(共通)成分とモダリティ特異的成分に階層的に分解する深層ニューラルネットワークを構築し、より高いロバスト性と識別能を実現すること。
  • 構造的スパarsityに基づく学習マシンを設計し、情報量の多いコンポーネントおよび層の選択を可能にすることで、分類性能を向上させること。
  • 複数の挑戦的なRGB+Dアクション認識データセットにおいて、提案フレームワークが従来手法を上回ることを実証すること。

提案手法

  • 各層が入力のRGBおよび深度特徴を共有成分とモダリティ特異的成分に分解する、深層オートエンコーダーに基づく共有特異的特徴因子分解ネットワークを提案する。
  • エンドツーエンド学習により、階層的かつ非線形なマルチモーダル信号の表現を学習可能なスタックド構造の深層アーキテクチャを採用する。
  • 混合ノルム(例:ℓ2,1)を用いて、コンポーネント内およびコンポーネント・レイヤー間のグループ選択に正則化を適用する、構造的スパarsity学習マシン(SSLM)を導入する。
  • SSLM分類器は、より識別的なコンポーネント(例:共有特徴、深層でのモダリティ特異的特徴)に高い重みを割り当てるように学習する。
  • バックプロパゲーションを用いたエンドツーエンド学習により、因子分解と分類の目的関数を同時に最適化する。
  • 局所的および包括的特徴(例:HOG、HOF、HON4D)をRGBおよび深度ストリームから事前に抽出し、ネットワークへの入力として用いる。

実験結果

リサーチクエスチョン

  • RQ1深層ニューラルネットワークは、階層的かつ非線形な表現を保持しつつ、マルチモーダルRGB+D特徴を共有成分とモダリティ特異的成分に効果的に因子分解できるか?
  • RQ2共有成分とモダリティ特異的成分の両方を組み込むことで、単一の共有成分や単一モダリティ特徴のみを用いる場合よりも優れたアクション認識性能が得られるか?
  • RQ3混合ノルム正則化を用いた構造的スパarsity学習は、レイヤー間で情報量の多いコンポーネントの選択的統合を可能にし、分類性能の向上に寄与するか?
  • RQ4提案フレームワークは、標準的なRGB+Dアクション認識ベンチマークにおいて、最先端の手法と比較して優れた性能を示すか?

主な発見

  • 提案されたDSSCAフレームワークは、オンラインRGBDデータセットで99.0%という最先端の精度を達成し、従来手法を顕著に上回った。
  • MSRデイリーアクティビティ3Dデータセットでは96.3%の精度を達成し、単一モダリティベースライン(RGB:89.4%、深度:92.5%)および他のマルチモーダル手法を上回った。
  • 構造的スパarsity学習マシン(SSLM)は、共有成分(例:Y³でℓ2ノルムが0.20–0.42)およびモダリティ特異的成分(Zr³、Zd³)に高い重みを割り当てており、それらの識別的価値を裏付けた。
  • 寄与度分析の結果、一部のコンポーネントはほぼゼロの重み(例:オンラインS3のZd¹で0.00)を示しており、それらはデータに存在してもアクション分類にあまり寄与しなかった。
  • フレームワークの性能向上は、特に深層ネットワークで顕著に現れ、階層的特徴因子分解の利点を示した。
  • オンラインRGBDデータセットでは、原子的局所レベル分析と比較して誤差率の低減が50%以上であったことから、スタックドで深い因子分解の優位性が確認された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。