Skip to main content
QUICK REVIEW

[論文レビュー] GCN-DevLSTM: Path Development for Skeleton-Based Action Recognition

Lei Jiang, Weixin Yang|arXiv (Cornell University)|Mar 22, 2024
Human Pose and Action Recognition被引用数 4
ひとこと要約

本稿では、骨格に基づく行動認識のための新しいハイブリッドモデルであるGCN-DevLSTMを提案する。このモデルは、経路発展に基づくLSTMモジュール(G-DevLSTM)をグラフ畳み込みネットワークに統合し、時間的ダイナミクスをよりよく捉えることを目的としている。Lie群に基づく経路発展を用いることで次元削減を実現し、不規則なサンプリングに対しても頑健性を確保する。このモデルは、NTU60、NTU120、Chalearn2013の各データセットで最先端の精度を達成し、Chalearn2013では既存手法を最大1.43%上回った。

ABSTRACT

Skeleton-based action recognition (SAR) in videos is an important but challenging task in computer vision. The recent state-of-the-art (SOTA) models for SAR are primarily based on graph convolutional neural networks (GCNs), which are powerful in extracting the spatial information of skeleton data. However, it is yet clear that such GCN-based models can effectively capture the temporal dynamics of human action sequences. To this end, we propose the G-Dev layer, which exploits the path development -- a principled and parsimonious representation for sequential data by leveraging the Lie group structure. By integrating the G-Dev layer, the hybrid G-DevLSTM module enhances the traditional LSTM to reduce the time dimension while retaining high-frequency information. It can be conveniently applied to any temporal graph data, complementing existing advanced GCN-based models. Our empirical studies on the NTU60, NTU120 and Chalearn2013 datasets demonstrate that our proposed GCN-DevLSTM network consistently improves the strong GCN baseline models and achieves SOTA results with superior robustness in SAR tasks. The code is available at https://github.com/DeepIntoStreams/GCN-DevLSTM.

研究の動機と目的

  • 既存のGCNベースのモデルが骨格時系列データにおける複雑な時間的ダイナミクスを効果的に捉えることの制限を解決すること。
  • 標準の$K\times1$畳み込み演算を凌駕する骨格に基づく行動認識における時間的モデリングの向上。
  • 粗いパス理論からの経路発展を、学習可能で効率的かつ頑健な時間的モジュールとして、順序付きグラフデータに統合すること。
  • 提案されたG-DevLSTMモジュールのプラグアンドプレイ互換性と、多様なGCNバックボーンにおける性能向上を実証すること。
  • 実世界のシナリオにおけるフレーム欠落や不規則なフレームレートに対して、モデルの頑健性を検証すること。

提案手法

  • 時間変動するノード特徴量を有するグラフ構造データに、元来ベクトル値時系列に用いられる経路発展を拡張した、新しいG-DevLSTMモジュールを提案する。
  • Lie群構造を用いて順序付きノード特徴量をパスとして表現することで、原理的かつ低次元で微分可能な時間的特徴抽出を可能にする。
  • パス発展層とLSTMを統合し、勾配の流れを改善し、標準の畳み込みやシグネチャベース手法よりも長距離の時間的依存関係をより効果的に捉える。
  • 各チャネルが独自の学習可能な隣接行列を持つトポロジー非共有グラフ(例:CTRGCN)を採用し、空間構造を保持しながら柔軟な時間的モデリングを可能にする。
  • G-DevLSTMモジュールをプラグイン型の時間ブロックとして適用し、既存のGCNフレームワークにおける標準的な時間的畳み込みをそのまま置き換えることで、アーキテクチャの大規模な見直しを回避する。
  • ジョイント特徴量を独立してG-DevLSTMモジュールで処理し、その後融合するマルチストリームアーキテクチャを採用することで、識別能を向上させる。

実験結果

リサーチクエスチョン

  • RQ1粗いパス理論からの経路発展を、グラフ構造の骨格時系列データにおける時間的ダイナミクスのモデリングに効果的に適応できるか?
  • RQ2提案されたG-DevLSTMモジュールは、標準の$K\times1$畳み込みやシグネチャベース手法よりも、行動認識における時間的依存関係を効果的に捉えられるか?
  • RQ3実世界の骨格データにおけるフレーム欠落や変動するフレームレートに対して、G-DevLSTMモジュールはどれほど頑健か?
  • RQ4G-DevLSTMモジュールは、さまざまなGCNバックボーンにシームレスに統合可能であり、一貫して性能を向上できるか?
  • RQ5G-DevLSTMモジュール内の各コンポonentが、全体のモデル精度に果たす相対的寄与度はどの程度か?

主な発見

  • NTU60データセットでは、X-subで90.8%、X-viewで95.7%の精度を達成し、以前の最先端手法であるCTRGCNをそれぞれ0.5%および0.8%上回った。
  • より大きなNTU120データセットでは、X-subで88.7%、X-viewで93.1%の精度を達成し、強力なスケーラビリティと性能を示した。
  • Chalearn2013ジェスチャーデータセットでは、95.61%の精度を達成し、以前の最良手法を1.43%上回った。
  • アブレーションスタディの結果、パス発展層を削除すると、X-subで90.8%から90.5%へと最大の性能低下が生じ、これが精度向上の主因であることを裏付けた。
  • 頑健性分析の結果、NTU60において全フレームドロップ率でGCN-DevLSTMが優れた精度を維持し、CTRGCNおよびGCN-LSTMベースラインを一貫して上回った。
  • NTU120およびChalearn2013において、Logsig-RNNやChengら(2023)のシグネチャベース手法よりも10.4%および2.75%高い性能を発揮し、パスシグネチャーよりもパス発展の優位性を検証した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。