[論文レビュー] Mix Dimension in Poincaré Geometry for 3D Skeleton-based Action Recognition
本稿では、3次元スケルトンベースのアクション認識を、ユークリッド空間よりも効果的にモデル化するため、ポアンカレ幾何学を活用した新規な空間時系列グラフ畳み込みネットワーク(ST-GCN)を提案する。グラフ埋め込みを双曲多様体に投影し、層間で次元を混合することで、先行研究の最良手法の40%のモデルサイズで、NTU RGB+DおよびNTU RGB+D 120で最先端の精度を達成した。
Graph Convolutional Networks (GCNs) have already demonstrated their powerful ability to model the irregular data, e.g., skeletal data in human action recognition, providing an exciting new way to fuse rich structural information for nodes residing in different parts of a graph. In human action recognition, current works introduce a dynamic graph generation mechanism to better capture the underlying semantic skeleton connections and thus improves the performance. In this paper, we provide an orthogonal way to explore the underlying connections. Instead of introducing an expensive dynamic graph generation paradigm, we build a more efficient GCN on a Riemann manifold, which we think is a more suitable space to model the graph data, to make the extracted representations fit the embedding matrix. Specifically, we present a novel spatial-temporal GCN (ST-GCN) architecture which is defined via the Poincaré geometry such that it is able to better model the latent anatomy of the structure data. To further explore the optimal projection dimension in the Riemann space, we mix different dimensions on the manifold and provide an efficient way to explore the dimension for each ST-GCN layer. With the final resulted architecture, we evaluate our method on two current largest scale 3D datasets, i.e., NTU RGB+D and NTU RGB+D 120. The comparison results show that the model could achieve a superior performance under any given evaluation metrics with only 40\% model size when compared with the previous best GCN method, which proves the effectiveness of our model.
研究の動機と目的
- アクション認識における階層的で非ユークリッド的なグラフ構造のスケルトンデータをモデル化する際の、ユークリッド空間の限界を解消すること。
- スケルトンデータの内在的トポロジーをよりよく反映するグラフ表現を学習するための、より適切なリーマン多様体(特にポアンカレ幾何学)を探索すること。
- 双曲空間における各層における最適な投影次元を効率的に特定する手法を開発することにより、特徴の識別能を向上させること。
- 従来のSOTAのGCNベース手法と比較して、より高いアクション認識性能を、モデルサイズを削減することで達成すること。
提案手法
- ノード特徴量とグラフ埋め込みをポアンカレ多様体に投影することで、その内在する階層的・木構造的な性質を活用し、より優れた表現学習を実現する。
- 接空間への投影を用いて畳み込みを実行し、接空間と多様体の間の全単射を介して、双曲幾何における微分可能な演算を可能にする。
- 各層における最適な埋め込み次元を探索するための次元混合戦略を導入し、柔軟性と性能の向上を図る。
- 空間畳み込みをポアンカレ多様体上で定義し、その後に時系列1次元畳み込みを適用する空間時系列GCNアーキテクチャを構築する。
- 各層の計算後に特徴を多様体上に維持するためのプロジェクションバック機構を採用し、幾何的構造を保存する。
- 評価のため、3次元スケルトンシーケンスに本モデルを適用し、NTU RGB+DおよびNTU RGB+D 120データセットを用いる。
実験結果
リサーチクエスチョン
- RQ1ポアンカレ幾何学は、アクション認識における3次元スケルトングラフシーケンスのモデル化において、ユークリッド空間よりも効果的な多様体を提供できるか?
- RQ2双曲グラフネットワークにおける各層の最適次元をどのように選択できるか?
- RQ3ポアンカレに基づくST-GCNは、従来のGCN手法よりも精度が高く、かつモデルサイズが小さいか?
- RQ4提案手法は、大規模データセットにおける異なる評価プロトコル(X-subject、X-view、X-setup)に一般化可能か?
主な発見
- X-subject評価下でNTU RGB+Dでは89.7%の精度を達成し、以前の最良手法NAS-GCN(89.4%)を上回った。
- NTU RGB+D 120では、X-setupで83.2%、X-subjectで80.5%の精度を達成し、以前の最良のGCNベース手法をそれぞれ4.3%および2.8%上回った。
- モデルサイズを以前の最良手法(NAS-GCN)の40%にまで削減し、精度を損なわず、顕著な効率性の向上を示した。
- 次元混合戦略により、各層における最適な投影次元の有効な探索が可能となり、特徴の識別能が向上した。
- ポアンカレ幾何学の使用により、大規模データセットにおける両方の性能向上が裏付けられるように、より区別可能な表現が得られた。
- 本手法は動的グラフ生成とは直交するアプローチを提供し、動的エッジ学習による計算複雑度の増加を伴わず、性能向上を実現した。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。