[論文レビュー] Feedback Graph Convolutional Network for Skeleton-based Action Recognition
本稿では、粗大から細かな段階的空間時系列特徴抽出を可能にするフィードバック接続を備えた新規なGCNアーキテクチャ、フィードバックグラフ畳み込みネットワーク(FGCN)を提案する。マルチステージ時系列サンプリングと側面的・フィードバックスキップ接続を備えたフィードバックグラフ畳み込みブロック(FGCB)を導入することで、特徴表現を向上させ、早期予測を可能にし、NTU-RGB+D、NTU-RGB+D120、Northwestern-UCLAのデータセットで最先端の精度を達成した。
Skeleton-based action recognition has attracted considerable attention in computer vision since skeleton data is more robust to the dynamic circumstance and complicated background than other modalities. Recently, many researchers have used the Graph Convolutional Network (GCN) to model spatial-temporal features of skeleton sequences by an end-to-end optimization. However, conventional GCNs are feedforward networks which are impossible for low-level layers to access semantic information in the high-level layers. In this paper, we propose a novel network, named Feedback Graph Convolutional Network (FGCN). This is the first work that introduces the feedback mechanism into GCNs and action recognition. Compared with conventional GCNs, FGCN has the following advantages: (1) a multi-stage temporal sampling strategy is designed to extract spatial-temporal features for action recognition in a coarse-to-fine progressive process; (2) A dense connections based Feedback Graph Convolutional Block (FGCB) is proposed to introduce feedback connections into the GCNs. It transmits the high-level semantic features to the low-level layers and flows temporal information stage by stage to progressively model global spatial-temporal features for action recognition; (3) The FGCN model provides early predictions. In the early stages, the model receives partial information about actions. Naturally, its predictions are relatively coarse. The coarse predictions are treated as the prior to guide the feature learning of later stages for a accurate prediction. Extensive experiments on the datasets, NTU-RGB+D, NTU-RGB+D120 and Northwestern-UCLA, demonstrate that the proposed FGCN is effective for action recognition. It achieves the state-of-the-art performance on the three datasets.
研究の動機と目的
- 従来の順方向GCNが低レベル特徴学習段階で高レベルの意味的情報を十分に活用できないという制限を解消すること。
- マルチステージ時系列サンプリングにより全系列入力を回避することで計算複雑度を低減すること。
- 高レベル層から低レベル層に意味的特徴をフィードバックさせることで、行動認識の精度を向上させること。
- 段階的処理ステージにおける早期予測を提供することで、リアルタイム推論を可能とすること。
- 密なフィードバック拡張GCNブロック(FGCB)を用いて、グローバルな空間時系列依存関係をモデル化すること。
提案手法
- 骨格系列を離散的な時系列ステージに分割するマルチステージ時系列サンプリング戦略を提案し、段階的処理を可能にする。
- 側面的およびフィードバックスキップ接続を備えたフィードバックグラフ畳み込みブロック(FGCB)を導入し、高レベルの意味的特徴を下位層に逆方向に伝搬させる。
- 上位から下位への原因・結果のフィードバックメカニズムを採用し、出力が次のステージの入力を調整することで、特徴の段階的精錬を実現する。
- 初期ステージからの早期予測を、後続ステージの特徴学習をガイドする事前知識として活用し、最終予測精度を向上させる。
- 複数ステージの予測を統合するための時系列統合戦略を適用し、最終的な動画レベルの行動ラベルを生成する。
- 段階的最適化プロセスを採用し、モデルを段階的に訓練することで、特徴表現力と一般化性能を向上させる。
実験結果
リサーチクエスチョン
- RQ1フィードバック機構により、高レベルの意味的情報を低レベル層に導入することで、骨格ベースの行動認識におけるGCNの特徴学習が向上するか?
- RQ2粗大から細かな段階的時系列サンプリング戦略は、計算コストを低減しつつ認識精度を維持または向上させられるか?
- RQ3部分的な入力系列からの早期予測が、後続ステージの特徴学習を精錬し、最終精度を向上させる有効な事前知識として機能するか?
- RQ4提案されたFGCNモデルは、標準的な骨格行動認識ベンチマークにおいて、最先端手法と比較して精度および推論効率の面で優れているか?
- RQ5フィードバック機構は、人間の行動におけるグローバルな空間時系列依存関係のモデル化をどの程度向上させるか?
主な発見
- NTU-RGB+Dデータセットのクロスサブジェクトベンチマークでは90.2%の精度を達成し、ST-GCNを8.7%上回った。クロスビューベンチマークでは96.3%で、ST-GCNを8.0%上回った。
- より大きなNTU-RGB+D120データセットでは、クロスサブジェクトで85.4%、クロスセットアップで87.4%の精度を達成し、それぞれST-GCNを13.0%および16.1%上回った。
- Northwestern-UCLAデータセットでは95.3%の精度を達成し、以前の最先端手法であるAGC-LSTMを2.0ポイント、HBRNNを16.8ポイント上回った。
- 複数の最近の最先端手法と比較して顕著な向上を示し、NTU-RGB+D120の両ベンチマークにおいてTwo-Stream Attention LSTMを24.0%以上のマージンで上回った。
- FGCNの早期予測機能により、遅延に敏感なアプリケーション(例:ロボット工学や自動走行)においてタイムリーな推論が可能になった。
- アブレーションスタディの結果、フィードバック機構およびマルチステージサンプリング戦略が性能向上に不可欠であることが確認され、FGCBのアブレーションによりNTU-RGB+Dクロスサブジェクトベンチマークで5.1%の精度低下が生じた。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。