[論文レビュー] A Two-stream Neural Network for Pose-based Hand Gesture Recognition
本稿では、動的空間的関係をモデル化する自己アテンショングラフ畳み込みネットワーク(SAGCN)と、長期的時系列依存関係を捉えるリカレント接続を強化した双方向IndRNN(RBi-IndRNN)を組み合わせた2ストリームニューラルネットワークを、ポーズベースのハンドジェスチャー認識のために提案する。この手法は、類似した運動パターンを示す難しいジェスチャーを認識する上で、従来手法を上回る最先端の性能を達成している。
Pose based hand gesture recognition has been widely studied in the recent years. Compared with full body action recognition, hand gesture involves joints that are more spatially closely distributed with stronger collaboration. This nature requires a different approach from action recognition to capturing the complex spatial features. Many gesture categories, such as "Grab" and "Pinch", have very similar motion or temporal patterns posing a challenge on temporal processing. To address these challenges, this paper proposes a two-stream neural network with one stream being a self-attention based graph convolutional network (SAGCN) extracting the short-term temporal information and hierarchical spatial information, and the other being a residual-connection enhanced bidirectional Independently Recurrent Neural Network (RBi-IndRNN) for extracting long-term temporal information. The self-attention based graph convolutional network has a dynamic self-attention mechanism to adaptively exploit the relationships of all hand joints in addition to the fixed topology and local feature extraction in the GCN. On the other hand, the residual-connection enhanced Bi-IndRNN extends an IndRNN with the capability of bidirectional processing for temporal modelling. The two streams are fused together for recognition. The Dynamic Hand Gesture dataset and First-Person Hand Action dataset are used to validate its effectiveness, and our method achieves state-of-the-art performance.
研究の動機と目的
- 『Grab』と『Pinch』のような、時間的パターンが類似したジェスチャーの認識に課題があることに対処すること。
- 固定された骨格トポロジーを超えて、ジェスチャー依存の関節連携を捉えることで、ハンド関節の空間的モデリングを向上させること。
- 標準的なGCNの受容 field が限られているのを補い、ハンドジェスチャー時系列における長期的時系列依存関係を効果的に学習すること。
- 空間的および長期的時系列モデリングを統合した、より高いジェスチャー認識精度を実現する堅牢なディープラーニングフレームワークの構築。
- 再帰的ネットワークにおける双方向処理とリカレント接続が、ジェスチャー認識における時系列特徴学習に効果的であることを検証すること。
提案手法
- 本手法は2ストリームアーキテクチャを採用している:1本目のストリームは、学習された相関マップを用いて動的にペアワイズ関節関係をモデル化する自己アテンションベースのグラフ畳み込みネットワーク(SAGCN)であり、静的ハンド骨格トポロジーを保持する。
- SAGCNは、すべてのハンド関節間の関係を適応的に重み付けするグローバル自己アテンション機構を統合し、固定された局所的接続性を超えた空間的特徴学習を強化する。
- 2本目のストリームは、リカレント接続を強化した双方向IndRNN(RBi-IndRNN)であり、ジェスチャー時系列における長距離依存関係を捉えるために、深く安定した双方向時系列モデリングを可能にする。
- RBi-IndRNNはリカレント接続を用いて消失勾配問題を緩和し、より深いネットワーク深さを可能にすることで、時系列表現学習の向上を図る。
- 両ストリームの特徴はネットワークの初期段階で統合され、空間的および長期的時系列情報が組み合わされ、最終分類に用いられる。
- 本モデルは、関節のワールド座標と時系列変位特徴を併用して、骨格時系列データ上でエンドツーエンドで学習される。

実験結果
リサーチクエスチョン
- RQ1自己アテンション機構は、ジェスチャーごとに関節関係を適応的に変更することで、ハンドジェスチャー認識におけるグラフ畳み込みネットワークの空間的モデリングを改善できるか?
- RQ2IndRNNにおける双方向処理は、『Grab』と『Pinch』のような微細な時間的差異を有するジェスチャーの認識を向上させられるか?
- RQ3深く双方向的なRNNにおけるリカレント接続は、標準的なGCNが見逃す長期的時系列パターンを効果的に捉えることができるか?
- RQ4SAGCN(空間的/短期的)とRBi-IndRNN(長期的時系列)の補完的特徴が、全体の認識性能をどのように向上させるか?
- RQ52ストリーム統合は、複雑なハンドジェスチャーの認識において、単一ストリームモデルを上回る効果を示すか?
主な発見
- 提案された2ストリームネットワークは、Dynamic Hand Gesture(DHG)データセットで最先端の正確性を達成し、従来の手作業特徴抽出法およびディープラーニング手法を上回っている。
- DHG-14データセットでは、関節のワールド座標と時系列変位を用いた場合、分類正確性が92.19%に達し、シンプルなIndRNNよりも3.05ポイント高い性能を示した。
- FPHAデータセットでは、比較対象手法の中で最高の正確性を達成しており、混同行列からほとんどのジェスチャークラスが効果的に認識されていることが示された。
- SAGCNは、空間的変動が大きく、時間的動きが少ないジェスチャー(例:『Swipe Left』)で最も優れた性能を発揮する一方、RBi-IndRNNは『Grab』のような複雑な時間的ジェスチャーで優位性を示した。
- アブレーションスタディの結果、RBi-IndRNNにおける双方向処理とリカレント接続の両方が性能向上に顕著に寄与しており、完全なRBi-IndRNNが単純および単方向バージョンを上回ることが確認された。
- 強力な性能を発揮しているものの、『ウォレットを開く』や『封筒から手紙を取り出す』といった、ハンドオブジェクト相互作用を伴うジェスチャーでは認識が依然として困難であり、骨格のみの表現の限界に起因する。
![Figure 2: Sample of hand skeleton in the DHG 14/28 dataset [ 8 ] . Referencing to the gravity center of the hand joints (purple cross), the neighbouring connected joints of each joint, called root (blue circle), are grouped into two: 1) centripetal group (yellow circle): adjacent nodes closer to the](https://ar5iv.labs.arxiv.org/html/2101.08926/assets/x2.png)
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。