Skip to main content
QUICK REVIEW

[論文レビュー] Deep Learning on Lie Groups for Skeleton-based Action Recognition

Zhiwu Huang, Chengde Wan|arXiv (Cornell University)|Dec 18, 2016
Human Pose and Action Recognition参考文献 40被引用数 12
ひとこと要約

この論文では、骨格ベースの行動認識のための深層学習にリー群構造を統合する、LieNetと呼ばれる深層ニューラルネットワークアーキテクチャを提案する。回転マッピング層を用いて時系列特徴を整列させ、回転プーリング層で次元削減を行い、対数マッピング層でデータを接空間に射影することで、LieNetは標準的な3次元行動認識ベンチマークで最先端の性能を達成し、浅いリー群手法や多数の従来の深層学習モデルを上回る性能を発揮する。

ABSTRACT

In recent years, skeleton-based action recognition has become a popular 3D classification problem. State-of-the-art methods typically first represent each motion sequence as a high-dimensional trajectory on a Lie group with an additional dynamic time warping, and then shallowly learn favorable Lie group features. In this paper we incorporate the Lie group structure into a deep network architecture to learn more appropriate Lie group features for 3D action recognition. Within the network structure, we design rotation mapping layers to transform the input Lie group features into desirable ones, which are aligned better in the temporal domain. To reduce the high feature dimensionality, the architecture is equipped with rotation pooling layers for the elements on the Lie group. Furthermore, we propose a logarithm mapping layer to map the resulting manifold data into a tangent space that facilitates the application of regular output layers for the final classification. Evaluations of the proposed network for standard 3D human action recognition datasets clearly demonstrate its superiority over existing shallow Lie group feature learning methods as well as most conventional deep learning methods.

研究の動機と目的

  • 骨格ベースの行動認識における時系列のずれと高次元特徴の処理に課題を抱える浅いリー群特徴学習手法の限界を解消すること。
  • リー群の幾何的構造を内蔵する深層ネットワークアーキテクチャを開発し、より効果的な表現学習を実現すること。
  • 特別な層を用いて深層学習をリーマン多様体へ拡張することで、非ユークリッド幾何学に従う多様体上でエンドツーエンドの学習を可能にすること。
  • 骨格運動軌跡の内在的幾何構造を活用することで、標準的な3次元行動認識データセットにおける分類精度の向上を図ること。

提案手法

  • 入力のリー群特徴を時系列ドメインでより整合性の高い表現に変換する回転マッピング層を導入し、速度変動の影響を軽減する。
  • 多様体上での空間的・時系列的合成を用いて、高次元リー群特徴を回転プーリング層で次元削減する。
  • 多様体構造の特徴を接空間に射影する対数マッピング層を適用し、標準的な全結合層およびソフトマックス出力層の利用を可能にする。
  • リー群に適応した確率的勾配降下法の変種を用いて、リーマン多様体上でバックプロパゲーションとエンドツーエンドの学習を実現する。
  • 回転マッピング(RotMap)、プーリング、対数マッピング(LogMap)のブロックをスタックすることで、階層的な表現を段階的に学習するモジュラーなネットワーク構造を設計する。
  • すべての演算が下位の多様体の非ユークリッド幾何学と一貫性を保つようにすることで、リーマン計算を可能にする。

実験結果

リサーチクエスチョン

  • RQ1骨格ベースの行動認識において、深層学習を非ユークリッド的リー群多様体へ効果的に拡張できるか?
  • RQ2リー群幾何学を用いた深層学習フレームワーク内で、骨格シーケンスの時系列のずれ(速度変動)をどのように軽減できるか?
  • RQ3多様体に注意を払ったプーリングおよびマッピング操作によって高次元リー群特徴を次元削減した場合、分類精度にどのような影響を与えるか?
  • RQ4提案されたLieNetアーキテクチャは、浅いリー群手法および従来の深層学習モデルと比較して、標準ベンチマークでどのように性能を発揮するか?
  • RQ5骨格運動軌跡の幾何的構造を保存する深層ネットワークは、3次元行動認識において優れた性能を達成できるか?

主な発見

  • LieNet-3Blocksは、NTU RGB+Dデータセットのクロスサブジェクトプロトコルで61.37%、クロスビュープロトコルで66.95%の精度を達成し、浅いリー群手法SEおよびSOを上回った。
  • LieNetの性能はアーキテクチャを深くすることで向上し、ブロックのスタックがリー群上での表現学習を強化していることが示された。
  • PA-LSTM や ST-LSTM といった最先端の深層学習モデルと比較して、特に空間的特徴学習において競争力のある結果を達成した。
  • G3D-Gamingデータセットでの可視化により、LieNetの学習は100エポック後に安定した解に到達することが確認され、訓練収束が安定していることが示された。
  • メモリ使用量は中程度(1.1–1.4 GB)、推論時間は3–86分程度であり、GPU実装により顕著な高速化が可能である。
  • 可視化結果から、ネットワークは骨格運動の内在的幾何的性質と整合する意味のある構造的表現を学習していることが示唆された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。