Skip to main content
QUICK REVIEW

[論文レビュー] RGB-D Based Action Recognition with Light-weight 3D Convolutional Networks

Haokui Zhang, Ying Li|arXiv (Cornell University)|Nov 24, 2018
Human Pose and Action Recognition参考文献 57被引用数 5
ひとこと要約

本稿では、RGB-Dに基づく行動認識のための軽量3次元畳み込みネットワーク(IST、SST、GSST)を提案する。3次元畳み込みを空間的および時間的成分に分解し、チャネルシャッフル、グループ畳み込み、およびtanhベースの統合戦略を用いる。これらのモデルは、NTU(97.6%クロスビュー)およびN-UCLA(95.5%)で最先端の精度を達成し、パラメータ数と推論時間の両方を顕著に削減した。I3Dと比較して効率性に優れながらも、競争力ある性能を維持している。

ABSTRACT

Different from RGB videos, depth data in RGB-D videos provide key complementary information for tristimulus visual data which potentially could achieve accuracy improvement for action recognition. However, most of the existing action recognition models solely using RGB videos limit the performance capacity. Additionally, the state-of-the-art action recognition models, namely 3D convolutional neural networks (3D-CNNs) contain tremendous parameters suffering from computational inefficiency. In this paper, we propose a series of 3D light-weight architectures for action recognition based on RGB-D data. Compared with conventional 3D-CNN models, the proposed light-weight 3D-CNNs have considerably less parameters involving lower computation cost, while it results in favorable recognition performance. Experimental results on two public benchmark datasets show that our models can approximate or outperform the state-of-the-art approaches. Specifically, on the RGB+D-NTU (NTU) dataset, we achieve 93.2% and 97.6% for cross-subject and cross-view measurement, and on the Northwestern-UCLA Multiview Action 3D (N-UCLA) dataset, we achieve 95.5% accuracy of cross-view.

研究の動機と目的

  • 行動認識における最先端の3次元-CNNの高い計算コストと大きなパラメータ数の問題に対処すること。
  • RGBと深度モダリティの補完的情報を活用して、RGB-D動画における行動認識の精度を向上させること。
  • 計算オーバーヘッドを最小限に抑える高効率な3次元-CNNアーキテクチャを設計すること。
  • 公開のRGB-Dベンチマーク(NTUおよびN-UCLAデータセットを含む)における軽量3次元-CNNの有効性を検証すること。

提案手法

  • 3次元畳み込みを空間的および時間的2次元畳み込みに分離することで、パラメータ数と計算量を削減する。
  • 残差ブロックにおける特徴表現の向上とパラメータ効率の向上のため、チャネルシャッフルと分割を適用する。
  • ネットワーク全体のパラメータ数と計算コストをさらに削減するため、グループ畳み込みを用いる。
  • RGBと深度特徴を効果的に統合するため、双曲正弦関数ベースの統合戦略を導入する。
  • 3つの軽量バージョンを設計:IST(空間的・時間的分離型)、SST(グループ畳み込みを備えた空間的・時間的型)、GSST(追加のチャネル分割とグループ畳み込みを備えた型)。
  • 初期特徴抽出能力を維持するため、最初の畳み込み層を圧縮しないで保持し、効率化の恩恵を深い層に集中させる。

実験結果

リサーチクエスチョン

  • RQ13次元畳み込みを空間的および時間的成分に分離することで、パラメータ数とFLOPsを顕著に削減できるか、精度を損なわずに行えるか?
  • RQ2RGBのみのモデルと比較して、深度データの統合が行動認識性能にどのように寄与するか?
  • RQ3軽量3次元-CNNは、I3Dのような重い最先端モデルと同等またはそれ以上の性能を達成できるか、どの程度まで達成できるか?
  • RQ4グループ畳み込みやチャネルシャッフルなどのアーキテクチャ的要素が、精度、パラメータ数、推論速度のトレードオフにどのように影響するか?

主な発見

  • NTUデータセットでは、提案されたGSSTモデルがクロスビュー評価で97.6%の精度を達成し、I3Dと比較して効率性に優れた性能を示した。
  • N-UCLAデータセットでは、クロスビュー評価で95.5%の精度を達成し、多視点データに対する優れた一般化能力を示した。
  • GeForce GTX TITANでは推論時間を約45%、Tesla K40cでは約48%短縮し、I3Dと比較して1イテレーションあたり0.214秒および0.296秒の実行時間となった。
  • 最初の畳み込み層は、全FLOPsの23.8%から61.8%を占めていたが、全パラメータの0.5%から2.1%にしか寄与していなかった。これは、初期層の最適化が効率性にとって極めて重要であることを示している。
  • GSSTにおけるグループ畳み込みの使用は、SSTと比較して精度の著しい低下を引き起こした。これは、圧縮と表現能力の間の妥当なトレードオフが存在することを示唆している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。