Skip to main content
QUICK REVIEW

[論文レビュー] Skeleton-based Gesture Recognition Using Several Fully Connected Layers with Path Signature Features and Temporal Transformer Module

Chenyang Li, Xin Zhang|arXiv (Cornell University)|Nov 17, 2018
Human Pose and Action Recognition参考文献 42被引用数 4
ひとこと要約

本論文は、パス・シグネチャー特徴(S_PS、T_PS、T_S_PS)と時系列変換器モジュール(TTM)を用いたスケルトンベースのジェスチャー認識フレームワークを提案する。空間的・時系列的ダイナミクスをモデル化するため、関節選択に『手に注目する』原則を適用し、特徴抽出に二重的(dyadic)手法を採用することで、完全結合層を最小限に抑えつつ、高い計算効率を実現し、ChaLearn 2013、ChaLearn 2016、MSRC-12で最先端の精度を達成した。

ABSTRACT

The skeleton based gesture recognition is gaining more popularity due to its wide possible applications. The key issues are how to extract discriminative features and how to design the classification model. In this paper, we first leverage a robust feature descriptor, path signature (PS), and propose three PS features to explicitly represent the spatial and temporal motion characteristics, i.e., spatial PS (S_PS), temporal PS (T_PS) and temporal spatial PS (T_S_PS). Considering the significance of fine hand movements in the gesture, we propose an "attention on hand" (AOH) principle to define joint pairs for the S_PS and select single joint for the T_PS. In addition, the dyadic method is employed to extract the T_PS and T_S_PS features that encode global and local temporal dynamics in the motion. Secondly, without the recurrent strategy, the classification model still faces challenges on temporal variation among different sequences. We propose a new temporal transformer module (TTM) that can match the sequence key frames by learning the temporal shifting parameter for each input. This is a learning-based module that can be included into standard neural network architecture. Finally, we design a multi-stream fully connected layer based network to treat spatial and temporal features separately and fused them together for the final result. We have tested our method on three benchmark gesture datasets, i.e., ChaLearn 2016, ChaLearn 2013 and MSRC-12. Experimental results demonstrate that we achieve the state-of-the-art performance on skeleton-based gesture recognition with high computational efficiency.

研究の動機と目的

  • スケルトンベースのジェスチャー認識における特徴抽出の難しさ、特に微細な手の動きに対して、判別性の高い特徴を抽出することに寄与すること。
  • 再帰的ネットワークを用いない、軽量で効率的な分類モデルを設計し、時系列依存関係を捉えること。
  • パス・シグネチャー特徴を用いて、ジェスチャー系列におけるグローバルおよびローカルの時系列ダイナミクスを明示的にモデル化すること。
  • 関節選択戦略とエンド・トゥ・エンドで学習可能な時系列アライメントを組み合わせることで、認識のロバスト性と効率性を向上させること。

提案手法

  • 空間的パス・シグネチャー(S_PS)、時系列的パス・シグネチャー(T_PS)、時系列的空間的パス・シグネチャー(T_S_PS)の3種類のパス・シグネチャー特徴を導入し、空間的構成と時系列的ダイナミクスを符号化する。
  • S_PSのための関節ペア選択およびT_PSのための単一関節選択に『手に注目する』(AOH)原則を提案することで、特徴の凝縮性とロバスト性を向上させる。
  • T_PSおよびT_S_PS特徴の抽出に二重的(dyadic)手法を採用し、次元削減を伴いつつ、グローバルおよびローカルの時系列ダイナミクスを効果的に符号化する。
  • キーフレームの時系列的シフトパラメータを学習可能な方法で推定するための時系列変換器モジュール(TTM)を設計し、微分可能でエンド・トゥ・エンドのアプローチで時系列モデリングを向上させる。
  • 空間的および時系列的特徴を別々に処理した後、早期に融合するマルチストリームの完全結合ネットワークを構築し、モデルの複雑さを最小限に抑える。
  • TTMおよびパス・シグネチャー特徴を標準的なニューラルネットワークアーキテクチャに統合し、プラグアンドプレイでの導入を可能にする。

実験結果

リサーチクエスチョン

  • RQ1パス・シグネチャー特徴は、スケルトンベースのジェスチャー系列における空間的および時系列的ダイナミクスを効果的に捉えることができるか?
  • RQ2『手に注目する』原則は、微細な手のジェスチャーに対する特徴の凝縮性と認識精度をどのように向上させるか?
  • RQ3学習可能な時系列変換モジュール(TTM)は、固定または再帰的時系列モデリングを上回る性能を示せるか?
  • RQ4マルチストリーム特徴処理を施した単純な完全結合ネットワークは、どの程度まで最先端の性能を達成できるか?

主な発見

  • 本手法はChaLearn 2013で92.08%の精度を達成し、先行するスケルトンベースの手法を上回り、動画ベースのモデルに近い性能を示した。
  • ChaLearn 2016では39.95%の精度を記録し、既存のスケルトンベースの手法よりも約4.5ポイント高い性能を達成した。
  • MSRC-12では99.01%の精度を達成し、スケルトンベースのジェスチャー認識分野で新たな最先端の結果を樹立した。
  • モデルはたった269万回の乗加算(FLOPs)で実行可能であり、RNNおよびCNNベースラインと比較して顕著に低い計算コストを実現し、高い計算効率を示した。
  • アブレーションスタディの結果、AOH原則およびTTMモジュールの両方が性能向上に顕著な寄与をしていることが確認された。
  • モデルの複雑さを制限しても高い性能を維持できることから、明示的な特徴工学と軽量アーキテクチャの有効性が裏付けられた。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。