Skip to main content
QUICK REVIEW

[論文レビュー] Temporal Graph Modeling for Skeleton-based Action Recognition

Jianan Li, Xuemei Xie|arXiv (Cornell University)|Dec 16, 2020
Human Pose and Action Recognition参考文献 34被引用数 15
ひとこと要約

本稿では、時間的関係グラフを構築することで隣接および非隣接の時間的依存関係を明示的に捉えることにより、骨格ベースの行動認識をモデル化するTemporal Enhanced Graph Convolutional Network (TE-GCN)を提案する。可 learnableエッジ接続を通じて、多ヘッドメカニズムが多様な時間的関係を強化し、NTU-60およびNTU-120 RGB+Dデータセットにおいて、それぞれCSおよびC-setupプロトコルで90.8%および85.9%の正確性を達成し、最先端の性能を実現した。

ABSTRACT

Graph Convolutional Networks (GCNs), which model skeleton data as graphs, have obtained remarkable performance for skeleton-based action recognition. Particularly, the temporal dynamic of skeleton sequence conveys significant information in the recognition task. For temporal dynamic modeling, GCN-based methods only stack multi-layer 1D local convolutions to extract temporal relations between adjacent time steps. With the repeat of a lot of local convolutions, the key temporal information with non-adjacent temporal distance may be ignored due to the information dilution. Therefore, these methods still remain unclear how to fully explore temporal dynamic of skeleton sequence. In this paper, we propose a Temporal Enhanced Graph Convolutional Network (TE-GCN) to tackle this limitation. The proposed TE-GCN constructs temporal relation graph to capture complex temporal dynamic. Specifically, the constructed temporal relation graph explicitly builds connections between semantically related temporal features to model temporal relations between both adjacent and non-adjacent time steps. Meanwhile, to further explore the sufficient temporal dynamic, multi-head mechanism is designed to investigate multi-kinds of temporal relations. Extensive experiments are performed on two widely used large-scale datasets, NTU-60 RGB+D and NTU-120 RGB+D. And experimental results show that the proposed model achieves the state-of-the-art performance by making contribution to temporal modeling for action recognition.

研究の動機と目的

  • 1D局所畳み込みの積み重ねに依存するため、従来のGCNベース手法が長距離時間的依存関係をモデル化する点で限界を示していることに対処する。
  • 意味的に関連する非隣接時間ステップを接続する時間的関係グラフを構築することで、骨格系列内の複雑な時間的ダイナミクスを明示的にモデル化する。
  • 多様な種類の高次時間的関係を捉えるために、マルチヘッドアテンションを組み込むことで行動認識性能を向上させる。
  • 複数モodal表現(関節、ボーン、モーション)を統合し、マルチストリームTE-GCNフレームワークにおける特徴学習を強化する。

提案手法

  • ノードが時間的特徴を表し、エッジが異なる時間ステップにおける特徴間の学習可能な相関関係を表す時間的関係グラフを構築する。
  • 特徴類似度または学習可能なパラメータに基づいて時間的関係を計算する2つのエッジ構築関数—Feature CalculatedおよびFeature Learned—を設計する。
  • 複数のアテンションヘッドを学習するマルチヘッドメカニズムを導入し、非隣接ステップ間の異なる種類の時間的依存関係をそれぞれ捉える。
  • 多ヘッド時間的強化グラフ畳み込みを適用し、多様な時間的関係を集約し、特徴表現を豊かにする。
  • 関節、ボーン、モーションモダリティを別々に処理した後、それらの表現を統合することで、性能向上を図るマルチストリームTE-GCNを統合する。
  • 空間的モデリングには標準的なGCN層を用い、提案された時間的グラフ畳み込みと組み合わせて、エンドツーエンドの行動認識を実現する。

実験結果

リサーチクエスチョン

  • RQ1可学習時間的関係グラフは、隣接ステップ畳み込みを超えて、骨格系列における非隣接時間的依存関係を効果的にモデル化できるか?
  • RQ2マルチヘッドアテンションは、行動認識における多様な時間的関係のモデル化をどのように改善するか?
  • RQ3関節、ボーン、モーションモダリティを統合することで、マルチストリームTE-GCNフレームワークにおける認識性能はどの程度向上するか?
  • RQ4提案された時間的グラフ構築法は、大規模データセットの異なる評価プロトコルにおいて一貫した性能向上をもたらすか?

主な発見

  • 提案されたTE-GCNは、クロスサブジェクト(CS)プロトコル下でNTU-60 RGB+Dデータセットにおいて90.8%の認識正確性を達成し、以前の最先端手法を0.8ポイント上回った。
  • NTU-120 RGB+Dデータセットでは、C-setupプロトコル下で85.9%の正確性を達成し、大規模なデータセットにおいて優れた一般化性能と従来のGCNベース手法に対する優位性を示した。
  • CSプロトコル下で関節とボーンモダリティを統合すると、正確性は87.4%から88.9%に向上した。一方、空間的およびモーション特徴を含む4つのモダリティを統合した場合、CSおよびCVプロトコルでそれぞれ90.84%および96.2%の正確性を達成した。
  • マルチヘッドメカニズムにより、複雑な時間的ダイナミクスのモデル化が向上し、両方のデータセットおよび評価プロトコルにおいて一貫した性能向上が確認された。
  • アブレーションスタディにより、時間的関係グラフとマルチヘッドアテンションが重要なコンポONENTであることが確認され、それらを除去すると性能が著しく低下した。
  • 本手法はモダリティ間で良好に一般化され、関節、ボーン、モーション表現の統合によりマルチストリームTE-GCNが相乗的な改善を示した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。