Skip to main content
QUICK REVIEW

[論文レビュー] Optimized Skeleton-based Action Recognition via Sparsified Graph Regression

Xiang Gao, Wei Hu|arXiv (Cornell University)|Nov 29, 2018
Human Pose and Action Recognition参考文献 69被引用数 15
ひとこと要約

本稿では、スケルトンベースのアクション認識を目的としたグラフ回帰に基づくグラフ畳み込みネットワークであるGR-GCNを提案する。本手法は統計的学習を用いて空間的・時間的グラフ構造を最適化し、特徴表現を向上させる。フレーム間の物理的・非物理的および時間的接続をモデル化するとともにスパarsityを強制することで、チェビシェフ近似を用いたスペクトル畳み込みを適用し、NTU RGB+D(77.9%)、UT-Kinect(98.5%)、Florence 3D(98.4%)の各データセットで最先端の精度を達成した。

ABSTRACT

With the prevalence of accessible depth sensors, dynamic human body skeletons have attracted much attention as a robust modality for action recognition. Previous methods model skeletons based on RNN or CNN, which has limited expressive power for irregular skeleton joints. While graph convolutional networks (GCN) have been proposed to address irregular graph-structured data, the fundamental graph construction remains challenging. In this paper, we represent skeletons naturally on graphs, and propose a graph regression based GCN (GR-GCN) for skeleton-based action recognition, aiming to capture the spatio-temporal variation in the data. As the graph representation is crucial to graph convolution, we first propose graph regression to statistically learn the underlying graph from multiple observations. In particular, we provide spatio-temporal modeling of skeletons and pose an optimization problem on the graph structure over consecutive frames, which enforces the sparsity of the underlying graph for efficient representation. The optimized graph not only connects each joint to its neighboring joints in the same frame strongly or weakly, but also links with relevant joints in the previous and subsequent frames. We then feed the optimized graph into the GCN along with the coordinates of the skeleton sequence for feature learning, where we deploy high-order and fast Chebyshev approximation of spectral graph convolution. Further, we provide analysis of the variation characterization by the Chebyshev approximation. Experimental results validate the effectiveness of the proposed graph regression and show that the proposed GR-GCN achieves the state-of-the-art performance on the widely used NTU RGB+D, UT-Kinect and SYSU 3D datasets.

研究の動機と目的

  • GCNにおけるスケルトンベースのアクション認識のための固定またはヒューリスティックなグラフ構築法の限界を解消すること。
  • 不規則なグラフ構造データにおけるRNNやCNNと比較して、人間の関節系列の空間的および時間的依存関係をより効果的にモデル化すること。
  • 複数の空間的・時間的フレームから統計的最適化を用いて共通のスパース化されたグラフ構造を学習すること。
  • スペクトルGCNフレームワークにおいて最適化されたグラフトポロジと3次元関節座標を統合することで特徴学習を向上させること。
  • スパース化された複数フレームグラフ構築が、人間の運動における動的変化を捉えるのに有効であることを検証すること。

提案手法

  • 連続する複数の空間的・時間的フレーム観測から最適でスパースなグラフラプラシアンを学習するためのグラフ回帰を提案する。
  • スパarsityを強制し、フレーム内接続、フレーム間接続、時間的接続を捉えるグラフラプラシアン上の最適化問題を定式化する。
  • 強い物理的エッジ、弱い非物理的空間的エッジ、フレーム間の関節にわたる時間的リンクを持つ空間的・時間的グラフを構築する。
  • 高次チェビシェフ多項式近似を用いてスペクトルグラフ畳み込みを効率的かつ表現力豊かに実装する。
  • 3次元関節座標をノード特徴量とし、最適化されたグラフ構造を入力としてGCNに供給し、エンドツーエンドのアクション分類を実現する。
  • 複数のシーケンスにわたる共通のグラフ構造を推定する統計的学習フレームワークを採用し、一般化性能を向上させる。

実験結果

リサーチクエスチョン

  • RQ1データ駆動型で最適化されたグラフ構造は、手作業で設計されたまたは固定されたグラフトポロジと比較して、アクション認識性能を向上させることができるか?
  • RQ2複数の連続フレームにわたる空間的・時間的依存関係を、スケルトンのグラフ構造的表現として効果的にモデル化できるか?
  • RQ3グラフ構造へのスパarsity制約が認識精度および計算効率に与える影響は何か?
  • RQ4異なるチェビシェフ多項式次数が、この設定におけるスペクトルグラフ畳み込みの性能に与える影響は何か?
  • RQ5非物理的空間的および時間的接続は、運動変動のモデル化にどの程度寄与するか?

主な発見

  • 完全なGR-GCNモデルはNTU RGB+Dデータセットで77.9%の精度を達成し、先行する最先端手法を上回った。
  • UT-Kinectデータセットでは98.5%の精度に達し、最高の既存手法と同等の性能を示し、類似したアクションシーケンスを含む困難なデータに対して強いロバストネスを示した。
  • Florence 3Dデータセットでは98.4%の精度を達成し、すべてのベースラインを大きく上回ったが、自己回帰モデルを用いるDeep STGC Kを除いては、すべての手法を上回った。
  • アブレーションスタディの結果、骨格とフレーム内接続のみのモデルに比べ、時間的接続が2.8%の精度向上をもたらしたことが確認され、その重要性が示された。
  • チェビシェフ多項式次数K=4がすべてのデータセットで最良の性能を示したが、K=5では過学習が生じ、性能が低下した。
  • 非物理的フレーム内接続を含めることで、骨格のみのモデルに比べ0.1%の精度向上が得られ、関節関係のわずかだが有意義なモデル化が可能であることが示された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。