Skip to main content
QUICK REVIEW

[論文レビュー] Self-Attention Network for Skeleton-based Human Action Recognition

Sangwoo Cho, M. H. Maqbool|arXiv (Cornell University)|Dec 18, 2019
Human Pose and Action Recognition参考文献 38被引用数 8
ひとこと要約

本稿では、3次元スケルトンシーケンス全体にわたる長距離の空間的・時間的依存関係を捉えるために自己注意メカニズムを活用した、スケルトンベースの行動認識のための自己注意ネットワーク(SAN-V1、SAN-V2、SAN-V3)の3つの変種を提案する。TSN(Temporal Segment Network)と統合することで、Kinetics-skeletonではトップ1精度で4.4%、トップ5精度で7.9%の向上を達成し、NTU RGB+Dでも一貫した性能向上を示した。

ABSTRACT

Skeleton-based action recognition has recently attracted a lot of attention. Researchers are coming up with new approaches for extracting spatio-temporal relations and making considerable progress on large-scale skeleton-based datasets. Most of the architectures being proposed are based upon recurrent neural networks (RNNs), convolutional neural networks (CNNs) and graph-based CNNs. When it comes to skeleton-based action recognition, the importance of long term contextual information is central which is not captured by the current architectures. In order to come up with a better representation and capturing of long term spatio-temporal relationships, we propose three variants of Self-Attention Network (SAN), namely, SAN-V1, SAN-V2 and SAN-V3. Our SAN variants has the impressive capability of extracting high-level semantics by capturing long-range correlations. We have also integrated the Temporal Segment Network (TSN) with our SAN variants which resulted in improved overall performance. Different configurations of Self-Attention Network (SAN) variants and Temporal Segment Network (TSN) are explored with extensive experiments. Our chosen configuration outperforms state-of-the-art Top-1 and Top-5 by 4.4% and 7.9% respectively on Kinetics and shows consistently better performance than state-of-the-art methods on NTU RGB+D.

研究の動機と目的

  • RNN、CNN、グラフCNNがスケルトンシーケンスにおける長距離の時間的・空間的依存関係を捉える点で抱える制限を解消すること。
  • 3次元スケルトンデータにおける自己注意メカニズムを用いた長距離相関のモデリングにより表現学習を向上させること。
  • 自己注意と時間的セグメントネットワークの新規統合を用いて、大規模なスケルトンベースの行動認識ベンチマークにおける性能を向上させること。
  • フレーム間の相関を可視化することで、モデルの挙動を解釈可能にする。

提案手法

  • スケールドドットプロダクト注意を用いて、3次元スケルトンシーケンスにおける長距離依存関係をモデル化するための自己注意ネットワーク(SAN-V1、SAN-V2、SAN-V3)の3つの変種を提案する。
  • マルチヘッド自己注意を適用し、すべてのフレーム間の重み付き相関を計算することで、時間的距離に関係なく局所的およびグローバルな文脈モデリングを可能にする。
  • 短い期間の特徴を抽出するため、時間的セグメントネットワーク(TSN)を統合し、複数のセグメントからの予測を統合する。
  • 予測をセグメント間で集約するためのコンSENSUS関数として、要素ごとの平均プーリングを採用し、マックスプーリングを上回る性能を達成した。
  • SANブロックに入力する前に、3次元CNNバックボーンを用いてスケルトンシーケンスから初期特徴を抽出する。
  • 最終の自己注意層からの注意重みを可視化し、フレーム単位の相関関係を分析し、モデルの挙動を解釈する。

実験結果

リサーチクエスチョン

  • RQ1自己注意メカニズムは、行動認識のための3次元スケルトンシーケンスにおける長距離の空間的・時間的依存関係を効果的にモデル化できるか?
  • RQ2自己注意を時間的セグメントネットワーク(TSN)と統合することで、スケルトンベースの行動認識の性能がどのように向上するか?
  • RQ3自己注意ベースのスケルトン認識において、ネットワークの深さ、アテンションヘッド数、コンセンサス関数の最適な設定は何か?
  • RQ4注意パターンは、異なる被験者や行動において一貫した、解釈可能な相関関係を示すか?これにより、変動に強い性能が得られるか?

主な発見

  • 提案されたTS-SAN-V2およびTS-SAN-V3モデルは、Kinetics-skeletonデータセットで最先端性能を達成し、従来の最先端手法と比較してトップ1精度で4.4%、トップ5精度で7.9%の向上を示した。
  • NTU RGB+Dデータセットでは、既存の最先端手法よりも一貫して優れた性能を示し、強力な一般化性能を示した。
  • 要素ごとの平均コンセンサス関数が、要素ごとのマックスプーリングを上回った。これは、自己注意出力の微分可能で重み付き平均の性質と整合している。
  • 適切な層数とアテンションヘッド数のバランスが最適な性能をもたらす。層が少なすぎても多すぎても性能が低下する。
  • 注意マップの可視化により、モデルが意味的で行動固有の長距離相関を学習していることが明らかになった。例えば、「ジャケットを着る」行動では、フレーム31からフレーム0への強い注意が観察された。これは、被験者や視点の変化に対してもモデルが頑健であることを示している。
  • 同じ行動を実行する異なる被験者間で一貫した注意パターンが得られ、モデルが潜在的で意味的意味のある運動構造を学習していることが示唆された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。