Skip to main content
QUICK REVIEW

[論文レビュー] Non-Local Graph Convolutional Networks for Skeleton-Based Action Recognition

Lei Shi, Yifan Zhang|arXiv (Cornell University)|May 20, 2018
Human Pose and Action Recognition参考文献 17被引用数 22
ひとこと要約

本稿では、バックプロパゲーションを介した誤差逆伝播によるエンドツーエンド学習によって、多様なサンプルに適合するグラフトポロジを学習する2ストリーム自己適応グラフ畳み込みネットワーク(2s-AGCN)を提案する。1次および2次スケルトン情報(関節位置とボーンベクトル)を統合的にモデル化することで、NTU-RGBDおよびKinetics-Skeletonデータセットで最先端の性能を達成する。

ABSTRACT

In skeleton-based action recognition, graph convolutional networks (GCNs), which model the human body skeletons as spatiotemporal graphs, have achieved remarkable performance. However, in existing GCN-based methods, the topology of the graph is set manually, and it is fixed over all layers and input samples. This may not be optimal for the hierarchical GCN and diverse samples in action recognition tasks. In addition, the second-order information (the lengths and directions of bones) of the skeleton data, which is naturally more informative and discriminative for action recognition, is rarely investigated in existing methods. In this work, we propose a novel two-stream adaptive graph convolutional network (2s-AGCN) for skeleton-based action recognition. The topology of the graph in our model can be either uniformly or individually learned by the BP algorithm in an end-to-end manner. This data-driven method increases the flexibility of the model for graph construction and brings more generality to adapt to various data samples. Moreover, a two-stream framework is proposed to model both the first-order and the second-order information simultaneously, which shows notable improvement for the recognition accuracy. Extensive experiments on the two large-scale datasets, NTU-RGBD and Kinetics-Skeleton, demonstrate that the performance of our model exceeds the state-of-the-art with a significant margin.

研究の動機と目的

  • 既存のスケルトンベースの行動認識のためのGCNにおける固定で手動で設計されたグラフトポロジの制限を解消すること。
  • 各サンプルごとまたは層全体にわたってグラフ構造をエンドツーエンドで学習することで、モデルの汎化性能を向上させること。
  • 従来の手法で未活用されていた2次スケルトン情報(ボーン長さと方向)を活用すること。
  • 1次(関節位置)および2次(ボーン特徴)の空間的関係を同時にモデル化する統合フレームワークの構築。

提案手法

  • 1つのストリームが関節位置(1次特徴)を処理し、もう1つのストリームがボーンベクトル(2次特徴)を処理する2ストリームアーキテクチャを提案する。
  • バックプロパゲーションで最適化される学習可能な隣接行列を導入し、グラフトポロジを入力サンプルやネットワークの深さに応じて適応可能にする。
  • 手動での設計を必要とせず、トレーニング中に動的にグラフ構造を調整する自己適応グラフ畳み込み層を採用する。
  • 深層GCNアーキテクチャのトレーニングを安定化させるために、アイデンティティショートカットを用いた残差学習フレームワークを採用する。
  • 時間的整合性を保ちながら空間的関係をモデル化するため、空間時間的グラフ畳み込みを適用する。
  • 最終分類の前に、両ストリームの特徴を要素ごとの連結によって統合する。

実験結果

リサーチクエスチョン

  • RQ1エンドツーエンドで学習されたグラフトポロジは、固定で手作業で設計されたグラフと比較して、スケルトンベースの行動認識の性能を向上させるか?
  • RQ21次および2次スケルトン特徴を同時にモデル化することは、認識精度にどのように影響するか?
  • RQ3提案された自己適応グラフ学習機構は、多様な行動サンプルや複雑な人体ポーズに一般化可能か?
  • RQ42ストリーム設計は、GCNにおける判別的表現学習をどの程度向上させるか?

主な発見

  • 提案された2s-AGCNは、NTU-RGBDデータセットで最先端の正確性を達成し、従来手法を顕著に上回る。
  • Kinetics-Skeletonデータセットでは、大規模で多様な行動カテゴリに強く一般化する能力を示し、新たな最先端性能を達成した。
  • アブレーションスタディにより、自己適応グラフ学習と2ストリーム設計の両方が性能向上に顕著な寄与をしていることが確認された。
  • ボーンベクトル(2次情報)の導入により、関節位置のみを用いたモデルと比較して、認識正確性が顕著に向上した。
  • エンドツーエンドで学習されたグラフトポロジは、両データセットのすべての評価プロトコルにおいて一貫して性能向上をもたらした。
  • 柔軟でデータ駆動型のグラフ構築により、ポーズの変化や行動の複雑さの変動に対しても、モデルは頑健であることが示された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。