Skip to main content
QUICK REVIEW

[論文レビュー] TSGCNeXt: Dynamic-Static Multi-Graph Convolution for Efficient Skeleton-Based Action Recognition with Long-term Learning Potential

Dongjingdin Liu, Pengpeng Chen|arXiv (Cornell University)|Apr 23, 2023
Human Pose and Action Recognition被引用数 5
ひとこと要約

TSGCNeXtは、効率的なスケルトンベースの行動認識を実現するための動的・静的マルチグラフ畳み込みネットワーク(DS-SMG)を提案する。長期間の時系列特徴抽出を可能にしつつ、パラメータ数を削減し、学習が55.08%高速化される。NTU RGB+D 120で最先端性能を達成し、E MAを用いたマルチストリーム統合により、クロスセットで91.74%、クロスサブジェクトで90.22%の精度を達成する。

ABSTRACT

Skeleton-based action recognition has achieved remarkable results in human action recognition with the development of graph convolutional networks (GCNs). However, the recent works tend to construct complex learning mechanisms with redundant training and exist a bottleneck for long time-series. To solve these problems, we propose the Temporal-Spatio Graph ConvNeXt (TSGCNeXt) to explore efficient learning mechanism of long temporal skeleton sequences. Firstly, a new graph learning mechanism with simple structure, Dynamic-Static Separate Multi-graph Convolution (DS-SMG) is proposed to aggregate features of multiple independent topological graphs and avoid the node information being ignored during dynamic convolution. Next, we construct a graph convolution training acceleration mechanism to optimize the back-propagation computing of dynamic graph learning with 55.08\% speed-up. Finally, the TSGCNeXt restructure the overall structure of GCN with three Spatio-temporal learning modules,efficiently modeling long temporal features. In comparison with existing previous methods on large-scale datasets NTU RGB+D 60 and 120, TSGCNeXt outperforms on single-stream networks. In addition, with the ema model introduced into the multi-stream fusion, TSGCNeXt achieves SOTA levels. On the cross-subject and cross-set of the NTU 120, accuracies reach 90.22% and 91.74%.

研究の動機と目的

  • 複雑なグラフ学習メカニズムによる長期間スケルトンベースの行動認識における非効率性とパラメータのボトルネックを解消すること。
  • 従来のGCNベースの手法が長期間の時系列をモデル化する際、精度と学習速度の低下を回避すること。
  • 動的グラフ操作中にノード情報の損失を防ぎつつ、軽量で効率的なグラフ学習メカニズムを構築すること。
  • パフォーマンスを損なわずにバックプロパゲーションの効率を向上させることで、グラフ畳み込みの学習速度を向上させること。
  • ConvNeXtにインspiredされた、段階的計算比調整付きのアーキテクチャに再構築することで、長期間の学習可能性を実現すること。

提案手法

  • 動的・静的グラフを分離する動的・静的分離マルチグラフ畳み込み(DS-SMG)を提案。ノード情報を保持し、注目メカニズムの複雑さを回避する。
  • ポイントワイド畳み込みを用いて、SMGブランチ内の複数の独立した隣接行列からの特徴を統合。注目メカニズムを用いず、学習可能なパラメータとして扱う。
  • バックプロパゲーションの再構築により、グラフ畳み込みの学習加速技術を導入。逆伝播時間を66%削減し、全体で55.08%の高速化を達成。
  • 3つのコアブロック(TSGCNextブロック、時系列スタムブロック、分離時系列ダウンサンプリング(DS)ブロック)を設計。長期間の時系列モデル化に最適化。
  • 段階的計算比調整と分離可能なダウンサンプリングを採用。深層GCNアーキテクチャにおける効率性とスケーラビリティを向上。
  • EMA(指数移動平均)モデルとマルチストリーム統合(ジョイント、ボーン、モーション)を採用。特に困難なベンチマークでも認識精度を向上。

実験結果

リサーチクエスチョン

  • RQ1単純で注目メカニズムを用いないグラフ学習メカニズムが、より少ないパラメータとより高速な学習で、複雑な注目駆動メカニズムを上回ることができるか?
  • RQ2動的グラフ畳み込みをどのように最適化すれば、計算効率を保ちながらノード情報の損失を防げるか?
  • RQ3段階的計算比調整付きの変更されたConvNeXtアーキテクチャが、GCNにおける長期間の時系列特徴抽出にどの程度寄与するか?
  • RQ4グラフ畳み込みに特化した学習加速戦略が、モデルの精度を損なわずに学習時間を顕著に短縮できるか?
  • RQ5EMAと最適化されたストリーム固有の計算比を組み合わせたマルチストリーム統合により、NTU120のような大規模スケルトンデータセットで最先端性能を達成できるか?

主な発見

  • TSGCNeXtは、NTU60のクロスサブジェクトで94.47%の精度を達成し、最高のST-GCN++結果を上回った。
  • NTU120では、クロスセットで91.74%、クロスサブジェクトで90.22%の精度に達し、新たな最先端ベンチマークを樹立した。
  • 長期間の順伝播とは対照的に、最適化されたグラフ畳み込みのバックプロパゲーションにより、55.08%の学習高速化を達成した。
  • DS-SMGメカニズムは、動的グラフ操作中にノード情報を効果的に保持し、複雑な注目モジュールの導入を回避した。
  • EMAと最適化された段階的計算比を組み合わせたマルチストリーム統合により、NW-UCLAを含むすべてのデータセットで一貫した性能向上が得られた(96.55%の精度)。
  • TSGCNeXtは、パラメータの爆発を防ぎつつ、長期間のシーケンスでも精度の向上を維持し、強力な長期間学習可能性を示した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。