Skip to main content
QUICK REVIEW

[論文レビュー] Vertex Feature Encoding and Hierarchical Temporal Modeling in a Spatial-Temporal Graph Convolutional Network for Action Recognition

Konstantinos Papadopoulos, Enjie Ghorbel|arXiv (Cornell University)|Dec 20, 2019
Human Pose and Action Recognition参考文献 22被引用数 21
ひとこと要約

本稿では、2つの新規モジュールを導入することで、骨格ベースの行動認識のためのコンactでエンド・ツー・エンドの空間時間グラフ畳み込みネットワークを提案する。1つは、生の関節座標を判別力のある特徴空間に変換する学習可能なグラフ頂点特徴符号化器(GVFE)であり、もう1つは、短期的および長期的時間的依存性を両方モデル化するドーリングド階層的時間畳み込みネットワーク(DH-TCN)である。本手法は、従来の手法よりもはるかに少ない4つのネットワークブロックのみを用いてNTU RGB-Dデータセットで最先端の精度を達成し、パラメータ数、学習時間、メモリ使用量を削減した。

ABSTRACT

This paper extends the Spatial-Temporal Graph Convolutional Network (ST-GCN) for skeleton-based action recognition by introducing two novel modules, namely, the Graph Vertex Feature Encoder (GVFE) and the Dilated Hierarchical Temporal Convolutional Network (DH-TCN). On the one hand, the GVFE module learns appropriate vertex features for action recognition by encoding raw skeleton data into a new feature space. On the other hand, the DH-TCN module is capable of capturing both short-term and long-term temporal dependencies using a hierarchical dilated convolutional network. Experiments have been conducted on the challenging NTU RGB-D-60 and NTU RGB-D 120 datasets. The obtained results show that our method competes with state-of-the-art approaches while using a smaller number of layers and parameters; thus reducing the required training time and memory.

研究の動機と目的

  • 骨格特徴(例:関節座標)の判別力が低いという問題を解決する。
  • 標準的なST-GCNが1つの時間畳み込み層でのみ長期的時間的依存性をモデル化できないという制限を克服する。
  • ST-GCNに基づくモデルにおけるネットワークブロック数とパラメータ数を削減しながら、性能を維持する。
  • 骨格ベースの行動認識のためのより効率的でエンド・ツー・エンドで微分可能なフレームワークを構築する。
  • 学習された頂点特徴と階層的時間モデリングが、層数を減らしても認識精度を顕著に向上させられることを示す。

提案手法

  • 生の3次元関節座標を学習された判別力のある頂点特徴空間に写像する、トレーニング可能なモジュールであるグラフ頂点特徴符号化器(GVFE)を導入。このモジュールはST-GCNとエンド・ツー・エンドで学習される。
  • 短時間的および長期的時間的ダイナミクスの両方を捉えるために、階層的構造でスタックされたドーリング畳み込みを用いるドーリングド階層的時間畳み込みネットワーク(DH-TCN)を提案。
  • ST-GCNブロックにおける標準的な時間畳み込みをDH-TCNモジュールに置き換えることで、時間的モデリング能力を強化する。
  • 各時刻フレームの関節を頂点とする空間時間グラフを構築し、エッジは空間的(フレーム内)および時間的(フレーム間)接続を表す。
  • バックプロパゲーションを用いて、エンド・ツー・エンドで全ネットワークを最適化し、頂点特徴と時間的表現を同時に学習する。
  • 空間グラフ畳み込みとDH-TCNを組み合わせた変更版ST-GCNブロックを用い、時間的特徴の学習を実施。その後、グローバル平均プーリングとSoftMax分類器を適用。

実験結果

リサーチクエスチョン

  • RQ1エンド・ツー・エンドで学習された頂点特徴は、ST-GCNにおける生の関節座標と比較して、行動認識性能を向上させることができるか?
  • RQ2階層的ドーリングド時間畳み込みネットワークは、骨格シーケンスにおける短期的および長期的時間的依存性を効果的にモデル化できるか?
  • RQ3ST-GCNブロックの数を減らすことで、どの程度効率が向上するか?性能を維持または向上させられるか?
  • RQ4GVFEおよびDH-TCNモジュールは、個別および共同で行動認識性能の向上にどの程度寄与しているか?
  • RQ5提案フレームワークは、最先端のST-GCN変種と比較して、より少ないパラメータ数と短い学習時間でより高い精度を達成できるか?

主な発見

  • 提案手法(GVFE + ST-GCN w/ DH-TCN)は、クロスセット設定下でNTU RGB-D 120データセットで74.2%の精度を達成し、元のST-GCN(4ブロック)と比較して22.4%の向上を示した。
  • 4つのブロックのみを用いても、元のST-GCN(クロスサブジェクト:45.3%、クロスクロスセット:51.8%)を22ポイント以上上回った。
  • アブレーションスタディにより、GVFEおよびDH-TCNの両方が顕著な貢献をしていることが確認された。GVFE単体では70.9%、DH-TCN単体では68.3%の精度を達成し、フルモデルでは74.2%に到達した。
  • パラメータ数は、元のAS-GCN(10ブロック)の7,420,696から、4ブロックで7,370,568に削減されたが、NTU-120での精度は維持または向上した。
  • NTU-120データセット(クロスクロスセット)において、学習時間が元のAS-GCN(10ブロック)と比較して24,029秒短縮された。
  • 標準的な時間畳み込みをDH-TCNに置き換えた際の性能向上が顕著で、長期的時間的依存性のモデル化におけるその有効性が示された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。