[論文レビュー] Two-stream Fusion Model for Dynamic Hand Gesture Recognition using 3D-CNN and 2D-CNN Optical Flow guided Motion Template
本稿では、RGBジェスチャー動画からの空間時間的特徴抽出に3D-CNNを、光学フロー誘導型モーショントレーステンプレート(OFMT)を用いたモーショントレースパターン認識に2D-CNNを組み合わせた2ストリーム融合モデルを提案する。グラフィティデータセットでは99.20%、自社データセットでは99%の精度を達成し、手動セグメンテーションを必要とせず、計算コストも低減した最先端の性能を示した。
The use of hand gestures can be a useful tool for many applications in the human-computer interaction community. In a broad range of areas hand gesture techniques can be applied specifically in sign language recognition, robotic surgery, etc. In the process of hand gesture recognition, proper detection, and tracking of the moving hand become challenging due to the varied shape and size of the hand. Here the objective is to track the movement of the hand irrespective of the shape, size, and color of the hand. And, for this, a motion template guided by optical flow (OFMT) is proposed. OFMT is a compact representation of the motion information of a gesture encoded into a single image. In the experimentation, different datasets using bare hand with an open palm, and folded palm wearing green-glove are used, and in both cases, we could generate the OFMT images with equal precision. Recently, deep network-based techniques have shown impressive improvements as compared to conventional hand-crafted feature-based techniques. Moreover, in the literature, it is seen that the use of different streams with informative input data helps to increase the performance in the recognition accuracy. This work basically proposes a two-stream fusion model for hand gesture recognition and a compact yet efficient motion template based on optical flow. Specifically, the two-stream network consists of two layers: a 3D convolutional neural network (C3D) that takes gesture videos as input and a 2D-CNN that takes OFMT images as input. C3D has shown its efficiency in capturing spatio-temporal information of a video. Whereas OFMT helps to eliminate irrelevant gestures providing additional motion information. Though each stream can work independently, they are combined with a fusion scheme to boost the recognition results. We have shown the efficiency of the proposed two-stream network on two databases.
研究の動機と目的
- 手の形状、サイズ、色の変化に対して不変な、頑健な動的ハンドジェスチャー認識システムの開発。
- 光学フローを用いてコン act なモーショントレース表現を生成することで、ハンドセグメンテーションの必要性を排除すること。
- 3D-CNNによる空間時間的特徴と2D-CNNによるモーショントレース特徴を融合することで認識精度を向上させること。
- 3D-CNN/RNN/LSTMなどの深層アーキテクチャと比較して、軽量なOFMT表現を用いることで計算複雑性を低減すること。
- 事前にセグメンテッドされたハンド領域を必要とせず、ベンチマークデータセットで最先端の性能を達成すること。
提案手法
- モデルは2ストリームアーキテクチャを採用:1本目のストリームは3D-CNN(C3D)を用いてRGBジェスチャー動画を処理し、空間時間的特徴を抽出する。
- 2本目のストリームは、光学フローと背景抑制更新ルールを用いて時間的モーショントレースを1枚の2D画像に符号化する、新規の光学フロー誘導型モーショントレーステンプレート(OFMT)を処理する。
- OFMTは光学フローからの動きベクトルを蓄積することで生成され、背景ノイズは動的更新メカニズムにより低減され、モーショントレースの正確性が向上する。
- 2つのストリームは別々に訓練され、最適な融合パラメータ(γ=0.6, δ=0.4)を有する確率的アンサンブル式を用いて意思決定レベルで予測スコアを融合する。
- 融合戦略は、3D-CNNの微細な空間時間的ダイナミクスの捉え方と、2D-CNNがOFMTからのモーショントレースパターンを効率的に認識する能力を組み合わせる。
- フレームワークは、裸手および緑色グローブを用いたジェスチャーを含むグラフィティデータセットおよび自社データセットで評価され、性能向上のためのラテント融合が用いられた。
実験結果
リサーチクエスチョン
- RQ1光学フローで誘導されるモーショントレーステンプレートは、計算複雑性を低減しつつ、ジェスチャー認識精度を向上させることができるか?
- RQ23D-CNNと2D-CNNのストリームを融合することで、個々のモデルよりも優れた性能が得られるか?
- RQ3提案されたOFMT表現は、ハンドセグメンテーションを必要とせず、背景ノイズを効果的に低減し、モーショントレースを正確に保持できるか?
- RQ4提案された2ストリーム融合モデルは、多様なジェスチャーデータセットにおいて、最先端の手法と比較して認識精度と頑健性に優れているか?
- RQ5空間時間的特徴とモーショントレース特徉を融合することで、リソース制約のある環境における認識性能がどの程度向上するか?
主な発見
- 提案された2ストリーム融合モデルは、グラフィティデータセットで99.20%の認識精度を達成し、比較対象のすべての手法、特にCNN-CRF融合モデル(98.40%)を上回った。
- 3D-CNN単体では97.30%、2D-CNN単体では92.60%の精度を示し、2つのストリームが相補的であることが示された。
- 自社データセットでは、融合モデルで99%の認識精度を達成し、過去の手法と同等の性能を発揮したが、ハンドセグメンテーションを必要としなかった。
- 最適な融合パラメータはγ=0.6とδ=0.4であった。これは、3D-CNNからの空間時間的特徴が最終精度により大きな寄与をしていることを示している。
- OFMT表現は背景ノイズを効果的に低減し、モーショントレースを正確に保持した。その結果、長時間で多様な動画シーケンスにおいても正確なジェスチャー検出が可能になった。
- コンパクトなOFMT表現と軽量な2D-CNNストリームのおかげで、計算効率が高く、リソース制約のある環境へのデプロイに適している。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。