Skip to main content
QUICK REVIEW

[論文レビュー] Fast and Robust Dynamic Hand Gesture Recognition via Key Frames Extraction and Feature Fusion

Hao Tang, Hong Liu|arXiv (Cornell University)|Jan 15, 2019
Hand Gesture Recognition Systems参考文献 60被引用数 9
ひとこと要約

本論文では、画像エントロピーと密度クラスタリングを用いたキーフレーム抽出と、外観特徴および運動特徴の統合を組み合わせた、高速かつ頑健な動的ハンドジェスチャー認識フレームワークを提案する。本手法は、ノースウエスタン大学データセットで98.23% ± 0.84%、新しい「ワイルド」データセットで99.21% ± 0.88%の最先端の正確性を達成しており、従来の手法と比較して著しく計算時間を短縮している。

ABSTRACT

Gesture recognition is a hot topic in computer vision and pattern recognition, which plays a vitally important role in natural human-computer interface. Although great progress has been made recently, fast and robust hand gesture recognition remains an open problem, since the existing methods have not well balanced the performance and the efficiency simultaneously. To bridge it, this work combines image entropy and density clustering to exploit the key frames from hand gesture video for further feature extraction, which can improve the efficiency of recognition. Moreover, a feature fusion strategy is also proposed to further improve feature representation, which elevates the performance of recognition. To validate our approach in a "wild" environment, we also introduce two new datasets called HandGesture and Action3D datasets. Experiments consistently demonstrate that our strategy achieves competitive results on Northwestern University, Cambridge, HandGesture and Action3D hand gesture datasets. Our code and datasets will release at https://github.com/Ha0Tang/HandGestureRecognition.

研究の動機と目的

  • 動的ハンドジェスチャー認識における速度と頑健性のバランスを改善すること。
  • 全フレームを処理するのではなく、キーフレームのみを抽出することで計算負荷を低減すること。
  • 外観特徴と運動特徴の有効な統合により、認識性能を向上させること。
  • 背景のごみや運動ノイズが顕著な実世界の制約のない環境での評価を実施すること。
  • 「ワイルド」ジェスチャー認識のベンチマーク化のため、新しいデータセット(HandGesture および Action3D)を公開すること。

提案手法

  • 各フレームの情報量を定量化するために画像エントロピーを用い、フレームエントロピー値を2次元空間にマッピングする。
  • エントロピー曲線における局所的極値(ピークおよびボウンド)を特定し、特徴的なフレームを検出する。
  • 密度クラスタリングを適用して局所的極値をグループ化し、クラスタ中心を最終的なキーフレームとして選択する。
  • 外観特徴は深層畳み込みニューラルネットワーク(例:VGG-16)を用いてキーフレームから抽出する一方、運動特徴は光流に基づいて得る。
  • 早期統合または後期統合の手法を用いて、外観特徴と運動特徴を統合する特徴統合戦略を採用し、表現力を向上させる。
  • 最終的なジェスチャー列分類にはサポートベクターマシン(SVM)を用いる。

実験結果

リサーチクエスチョン

  • RQ1画像エントロピーと密度クラスタリングは、特徴的なジェスチャー内容を保持する代表的キーフレームを効果的に同定できるか?
  • RQ2外観と運動の特徴を統合することで、複雑な環境下での認識の頑健性が向上するか?
  • RQ3標準データセットおよび新しい「ワイルド」データセットにおいて、本手法は最先端の手法と比較して正確性と速度で優れているか?
  • RQ4背景のごみや余分な運動が存在する実世界の制約のないシナリオにも一般化可能か?
  • RQ5実際のパイプラインにおけるキーフレーム抽出および認識の計算効率はどの程度か?

主な発見

  • 提案手法はノースウエスタン大学データセットで98.23% ± 0.84%の正確性を達成し、先行する最先端手法を上回っている。
  • 新しいHandGestureデータセットでは99.21% ± 0.88%の正確性を達成し、制約のない環境下での優れた一般化能力を示している。
  • Action3Dデータセットでは98.98% ± 0.65%の正確性を達成し、複雑なシーンや運動の変動に対しても頑健であることを確認している。
  • テストシーケンスの処理時間は、Cambridgeで4.31秒、ノースウエスタンで10.89秒、HandGestureで13.06秒、Action3Dで4.26秒であり、ベースラインと比較して優れた速度を示している。
  • 最も計算時間がかかる部分は特徴抽出であり、画像サイズの縮小やGPU加速により高速化が可能である。
  • 本手法は、すべてのデータセットにおいて2つの最先端ベースライン(LiuとShao [59]、ZhaoとElgammal [29])を正確性と推論速度の両面で上回っている。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。