Skip to main content
QUICK REVIEW

[論文レビュー] Real-World Graph Convolution Networks (RW-GCNs) for Action Recognition in Smart Video Surveillance

Justin Sanchez, Christopher Neff|arXiv (Cornell University)|Jan 15, 2022
Human Pose and Action Recognition被引用数 9
ひとこと要約

本稿では、エッジベースの行動認識における現実世界のノイズおよび遅延制約に強く対応する、注意メカニズムを統合したST-GCNアーキテクチャ、Real-World Graph Convolution Networks (RW-GCNs) を提案する。神経科学および情報理論にインspiredされた意味的および制御フィードバックメカニズムを統合することで、NTU-RGB-D-120で94.1%の精度を達成し、ST-GCNと比較して3.02倍低い遅延を実現。また、空間キーポイントノイズがある状況下でも、Northwestern-UCLAで90.4%の精度を維持し、ST-GCNと比較して32.5倍低い遅延を達成する。

ABSTRACT

Action recognition is a key algorithmic part of emerging on-the-edge smart video surveillance and security systems. Skeleton-based action recognition is an attractive approach which, instead of using RGB pixel data, relies on human pose information to classify appropriate actions. However, existing algorithms often assume ideal conditions that are not representative of real-world limitations, such as noisy input, latency requirements, and edge resource constraints. To address the limitations of existing approaches, this paper presents Real-World Graph Convolution Networks (RW-GCNs), an architecture-level solution for meeting the domain constraints of Real World Skeleton-based Action Recognition. Inspired by the presence of feedback connections in the human visual cortex, RW-GCNs leverage attentive feedback augmentation on existing near state-of-the-art (SotA) Spatial-Temporal Graph Convolution Networks (ST-GCNs). The ST-GCNs' design choices are derived from information theory-centric principles to address both the spatial and temporal noise typically encountered in end-to-end real-time and on-the-edge smart video systems. Our results demonstrate RW-GCNs' ability to serve these applications by achieving a new SotA accuracy on the NTU-RGB-D-120 dataset at 94.1%, and achieving 32X less latency than baseline ST-GCN applications while still achieving 90.4% accuracy on the Northwestern UCLA dataset in the presence of spatial keypoint noise. RW-GCNs further show system scalability by running on the 10X cost effective NVIDIA Jetson Nano (as opposed to NVIDIA Xavier NX), while still maintaining a respectful range of throughput (15.6 to 5.5 Actions per Second) on the resource constrained device. The code is available here: https://github.com/TeCSAR-UNCC/RW-GCN.

研究の動機と目的

  • 理想のポーズデータと低遅延という仮定が成立しない現実世界のエッジデプロイメントにおけるスケルトンベース行動認識のギャップを埋める。
  • リアルタイム制約が厳しいエッジシステムに典型的なノイズの大きいキーポイント入力と厳しい遅延制約の下でも高い精度を維持できるモデルを開発する。
  • NVIDIA Jetson Nanoなどの低コスト・リソース制約のあるエッジデバイスにスケーラブルかつプライバシーを守る形で展開可能なモデルを実現する。
  • 神経科学的フィードバックメカニズムと情報理論の原則を統合することで、現実世界のスケルトン行動認識の新しいサブドメインを形式化する。
  • フィードバック拡張GCNが、精度を犠牲にすることなくノイズ耐性を向上させるとともに推論遅延を低減できることを示す。

提案手法

  • RW-GCNsは、人間の視覚皮質のフィードバックループにインspiredされた注意フィードバックメカニズムを、既存のST-GCNに追加する。
  • 2種類のフィードバックを導入:意味的フィードバック(過去の特徴を再処理して識別能を向上)、制御フィードバック(時間的サンプリングと特徴再利用を管理)。
  • アーキテクチャは情報ボトルネック理論に基づき、エンドツーエンドシステム全体で空間的および時間的ノイズ耐性を最適化する。
  • フィードバックモジュールは軽量であり、32チャネルでのみ動作するため、計算オーバーヘッドを最小限に抑え、エッジデバイスでの効率性を維持する。
  • 実際のノイズ(時間的Re-IDエラー、リアルタイムシステムによる不完全なポーズ推定)を含むエンドツーエンド評価を実施。
  • スケーラビリティはNVIDIA Jetson Nanoでテストされ、シーンの複雑さに応じて15.6~5.5 Actions per Second (ApS)のスループットを達成した。

実験結果

リサーチクエスチョン

  • RQ1注意フィードバックメカニズムは、空間キーポイントエラーおよび時間的不整合といった現実世界のノイズ条件下で、行動認識の精度を向上させることができるか?
  • RQ2フィードバック拡張GCNは、標準のST-GCNと比較して、精度を維持または向上させつつ推論遅延を低減できるか?
  • RQ3RW-GCNsは、性能を犠牲にすることなく、Jetson Nanoのような低コスト・リソース制約のあるエッジデバイスに効率的に展開可能か?
  • RQ4神経科学的フィードバックの統合は、不完全な入力データを持つエンドツーエンドエッジシステムにおける耐性をどのように向上させるか?
  • RQ5提案されたアーキテクチャは、NTU-RGB-D-120およびNorthwestern-UCLAのようなベンチマークデータセットにおいて、現実的なシステム制約下で最先端の性能を達成できるか?

主な発見

  • RW-GCNsは、NTU-RGB-D-120データセットで94.1%という新たな最先端の精度を達成し、以前のST-GCNベースラインを上回った。
  • NTU-RGB-D-120において、ST-GCNベースラインと比較して3.02倍の遅延低減を達成。精度を3.8%放棄することで10倍の遅延低減も達成。
  • Northwestern-UCLAデータセットでは、空間キーポイントノイズがある状況下でも90.4%の精度を維持し、ST-GCNベースラインと比較して32.5倍低い遅延を達成。
  • Northwestern-UCLAデータセットでは、時間的Re-IDエラーを含む完全なエンドツーエンドシステムのノイズ下でも71.8%の精度を達成し、遅延を32.5倍低減。
  • NVIDIA Jetson Nano上で効率的に動作し、15.6~5.5 Actions per Second (ApS)のスループットを達成。ノードあたりのコストを10倍低減しながらも、実用的なスループットを維持。
  • 意味的フィードバック機構は最小限のオーバーヘッドで、ApSはわずか1.6倍増加、パラメータ数も無視できる程度に増加し、その効率性が裏付けられた。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。