[論文レビュー] Learning Linear Dynamical Systems with High-Order Tensor Data for Skeleton based Action Recognition
本稿では、3次元スケルトン時系列を高次テンソル時系列としてモデル化し、空間的・時間的構造を保持するとともに、ベクトル化に起因する次元の呪いを回避する一般化線形動的システム(gLDS)を提案する。Tucker分解を用いてgLDSパラメータを推定し、アクションをGrassmann多様体上での部分空間として表現することで、辞書学習とスパースコーディングを用いて、MSR-Action3D(94.96%)、UCF-Kinect(96.48%)、Northwestern-UCLA Multiview(92.99%)データセットで最先端の精度を達成した。
In recent years, there has been renewed interest in developing methods for skeleton-based human action recognition. A skeleton sequence can be naturally represented as a high-order tensor time series. In this paper, we model and analyze tensor time series with Linear Dynamical System (LDS) which is the most common for encoding spatio-temporal time-series data in various disciplines dut to its relative simplicity and efficiency. However, the traditional LDS treats the latent and observation state at each frame of video as a column vector. Such a vector representation fails to take into account the curse of dimensionality as well as valuable structural information with human action. Considering this fact, we propose generalized Linear Dynamical System (gLDS) for modeling tensor observation in the time series and employ Tucker decomposition to estimate the LDS parameters as action descriptors. Therefore, an action can be represented as a subspace corresponding to a point on a Grassmann manifold. Then we perform classification using dictionary learning and sparse coding over Grassmann manifold. Experiments on MSR Action3D Dataset, UCF Kinect Dataset and Northwestern-UCLA Multiview Action3D Dataset demonstrate that our proposed method achieves superior performance to the state-of-the-art algorithms.
研究の動機と目的
- スケルトンベースのアクション認識におけるベクトル表現の限界、特に3次元関節データにおける構造的・高次元依存関係の損失を是正すること。
- 3次元人の動き時系列を高次元テンソル時系列としてモデル化し、空間的・時間的構造を保持するとともに、次元の呪いを緩和すること。
- 従来のLDSをベクトル状態からテンソル状態に拡張する多線形変換を用いた一般化LDS(gLDS)を考案すること。
- gLDSパラメータのTucker分解による特徴抽出と、Grassmann多様体上での部分空間表現を用いて、アクション記述子を学習し、分類精度を向上させること。
- Grassmann多様体上での辞書学習とスパースコーディングを用いて、被験者や視点の変化に対しても頑健なアクション認識を実現すること。
提案手法
- 3次元スケルトン時系列をn階テンソル時系列として表現し、各スケルトンフレームを( n-1 )階テンソルとして扱い、空間的構造を保持する。
- 潜在状態と観測状態をすべてテンソルとして扱い、ベクトルベースの射影の代わりに多線形変換を用いる一般化LDS(gLDS)モデルを提案する。
- テンソル時系列のモードn行列化にTucker分解を適用し、gLDSパラメータを推定するとともに主成分を抽出する。
- gLDSの可観測性行列から各アクションの部分空間表現を学習し、アクションをGrassmann多様体上の点にマッピングする。
- 分類性能を向上させるために、Grassmann多様体上での辞書学習とスパースコーディングを実行する。
- 2RBやLTBSVMといったベースライン手法よりも性能を向上させる、新しい学習アルゴリズム(3RB)を用いてフレームワークを最適化する。
実験結果
リサーチクエスチョン
- RQ13次元スケルトン時系列を高次元テンソル時系列としてモデル化することで、ベクトル化された表現と比較してアクション認識性能が向上するか?
- RQ2テンソル状態で動作する一般化LDS(gLDS)は、従来のベクトルベースのLDSに比べ、空間的・時間的ダイナミクスをより効果的に捉えられるか?
- RQ3gLDSパラメータのTucker分解は、構造的情報を保持しつつ、判別性の高いアクション記述子を効果的に抽出できるか?
- RQ4Grassmann多様体に基づく辞書学習とスパースコーディングは、スケルトンベースのアクション認識タスクにおける分類精度をどのように向上させるか?
- RQ5提案手法は、マルチビュー行動データセットにおける被験者や視点の変化に対して、どの程度一般化可能か?
主な発見
- 提案されたgLDS手法は、困難な1人を除いた被験者を交差検証用に使用する設定下で、MSR-Action3Dデータセットで94.96%の総合精度を達成し、先行研究を上回った。
- UCF-Kinectデータセットでは、全体の精度が96.48%に達し、HOJ3DやLTBSVMと比較してそれぞれ7.98%および5.56%高い結果を示した。
- Northwestern-UCLA Multiviewデータセットの被験者間設定では、92.99%の精度を達成し、MST-AOGに比べて10.8%高い性能を示し、被験者変動に対して強い頑健性を示した。
- 視点間設定では74.6%の精度を達成し、MST-AOGに比べ1.3%の向上を示したが、3次元関節座標に依存するため、視点不変性は限定的であり、性能に限界があることが示唆された。
- 部分空間次元が16まで増加すると認識率が上昇するが、以降はノイズとクラス間の混同が性能を低下させるため、情報量と複雑さの最適なバランスが16程度であると示された。
- 混同行列の結果、ほとんどのアクションで95%以上の分類精度を示しており、主に「ハイアームウェーブ」と「ハンドキャッチ」のような類似したアクション間で誤りが生じていることが明らかになった。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。