[論文レビュー] Action Recognition via Pose-Based Graph Convolutional Networks with Intermediate Dense Supervision
本稿では、アダプティブグラフ畳み込みモジュールを用いて人体部の空間的・時間的相関をモデル化するポーズベースのグラフ畳み込みネットワーク(PGCN)を提案する。この手法は、行動認識性能を顕著に向上させ、バックボーンネットワークが最も判別性の高い人体部にのみ注目するのを防ぐために中間の密な監視を導入しており、追加の推論コストなしにSub-JHMDB、PennAction、NTU-RGBDで最先端性能を達成している。
Pose-based action recognition has drawn considerable attention recently. Existing methods exploit the joint positions to extract the body-part features from the activation map of the convolutional networks to assist human action recognition. However, these features are simply concatenated or max-pooled in previous works. The structured correlations among the body parts, which are essential for understanding complex human actions, are not fully exploited. To address the problem, we propose a pose-based graph convolutional network (PGCN), which encodes the body-part features into a human-based spatiotemporal graph, and explicitly models their correlations with a novel light-weight adaptive graph convolutional module to produce a highly discriminative representation for human action recognition. Besides, we discover that the backbone network tends to identify patterns from the most discriminative areas of the input regardless of the others. Thus the features pooled by the joint positions from other areas are less informative, which consequently hampers the performance of the followed aggregation process for recognizing actions. To alleviate this issue, we introduce a simple intermediate dense supervision mechanism for the backbone network, which adequately addresses the problem with no extra computation cost during inference. We evaluate the proposed approach on three popular benchmarks for pose-based action recognition tasks, i.e., Sub-JHMDB, PennAction and NTU-RGBD, where our approach significantly outperforms state-of-the-arts without the bells and whistles.
研究の動機と目的
- 既存のポーズベースの行動認識手法が関節の特徴を独立して扱い、関節間の構造的相関を無視するという制限を解消すること。
- バックボーンCNNが最も判別性の高い領域にのみ注目する傾向があることによる、情報量が少ないが相関のある特徴の未利用化を軽減すること。
- 軽量なグラフ畳み込みモジュールを用いて、人体部間の動的かつ適応的な関係を明示的にモデル化することで、行動認識性能を向上させること。
- 推論コストを増加させることなく、すべての入力領域における特徴学習を強化する中間の密な監視メカニズムを導入すること。
提案手法
- 最終の3次元CNN特徴マップからプーリングされた人体部特徴を用いて、人間ベースの空間的・時間的グラフを構築する。ノードは関節を表し、エッジは物理的および学習された構造的関係を符号化する。
- 特徴相関に基づいて動的エッジ重みを学習する、新規の軽量なアダプティブグラフ畳み込みモジュールを採用し、複雑な行動ダイナミクスの効果的モデル化を実現する。
- グローバル平均プーリングを置き換え、最後の特徴マップのすべての空間的位置に対して密なヘッド分類損失を用いて直接監視することで、中間の密な監視を導入する。
- RGB動画とポーズ座標を統合的に融合するフレームワークを採用し、外観と空間的・時間的構造の共同最適化を可能にし、認識性能を向上させる。
- I3Dバックボーンから領域特徴を抽出するポーズベースのプーリング機構を適用し、その特徴をグラフモジュールに供給することで、文脈に配慮した表現学習を実現する。
実験結果
リサーチクエスチョン
- RQ1学習可能なグラフ畳み込みモジュールを用いて人体部間の構造的相関をモデル化することで、単純な連結やプーリングを超える行動認識性能の向上が達成できるか?
- RQ2中間の密な監視が、トレーニング中にバックボーンネットワークが最も判別性の高い人体領域にのみ注目する傾向を効果的に抑制できるか?
- RQ3提案されたPGCNは、オプティカルフロー やポーズ推定マップなどの追加入力に依存せずに、ポーズベースの行動認識ベンチマークで最先端性能を達成できるか?
- RQ4統合的なフレームワークを用いて外観とポーズ特徴を統合することで、モダリティ特化型モデルと比較して認識精度がどのように向上するか?
主な発見
- 中間の密な監視を備えたPGCNは、Sub-JHMDBスプリット1で89.9%の正確度を達成し、前回の最先端手法を2.8%上回った。装飾なしのシンプルな設定でも顕著な向上を示した。
- PennActionでは98.1%の正確度を達成し、前回の最先端手法を0.8%上回った。多様な行動カテゴリにわたり高いロバスト性を示した。
- より大きなNTU-RGBDデータセットでは94.0%の正確度を達成し、前回の最先端手法を4.7%上回った。スケーラビリティと一般化性能の高さが裏付けられた。
- 中間の密な監視メカニズムをI3D+FCに適用した場合、Sub-JHMDBで1.1%、PennActionで1.1%の性能向上を示し、特徴多様性の向上が有効であることを実証した。
- RGBとポーズ特徴を統合的なPGCNフレームワークで融合した場合、Sub-JHMDBで91.0%の正確度を達成し、最良の単一モダリティ手法を1.3%上回った。両特徴の相乗効果が顕著に現れた。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。