Skip to main content
QUICK REVIEW

[論文レビュー] Real-time Hand Gesture Detection and Classification Using Convolutional Neural Networks

Okan Köpüklü, Ahmet Gunduz|arXiv (Cornell University)|Jan 29, 2019
Hand Gesture Recognition Systems参考文献 24被引用数 10
ひとこと要約

本稿では、ハンドジェスチャー認識のための2段階でリソース効率の良いCNNアーキテクチャを提案する。軽量な検出器がジェスチャー活動中にのみ、深層分類器を起動する。EgoGestureでは91.04%のLevenshtein正答率、nvGestureでは77.39%を達成し、重み付き平均化と信頼度ベースの単一時刻アクティベートを活用して最大9フレーム分の早期検出を実現した。

ABSTRACT

Real-time recognition of dynamic hand gestures from video streams is a challenging task since (i) there is no indication when a gesture starts and ends in the video, (ii) performed gestures should only be recognized once, and (iii) the entire architecture should be designed considering the memory and power budget. In this work, we address these challenges by proposing a hierarchical structure enabling offline-working convolutional neural network (CNN) architectures to operate online efficiently by using sliding window approach. The proposed architecture consists of two models: (1) A detector which is a lightweight CNN architecture to detect gestures and (2) a classifier which is a deep CNN to classify the detected gestures. In order to evaluate the single-time activations of the detected gestures, we propose to use Levenshtein distance as an evaluation metric since it can measure misclassifications, multiple detections, and missing detections at the same time. We evaluate our architecture on two publicly available datasets - EgoGesture and NVIDIA Dynamic Hand Gesture Datasets - which require temporal detection and classification of the performed hand gestures. ResNeXt-101 model, which is used as a classifier, achieves the state-of-the-art offline classification accuracy of 94.04% and 83.82% for depth modality on EgoGesture and NVIDIA benchmarks, respectively. In real-time detection and classification, we obtain considerable early detections while achieving performances close to offline operation. The codes and pretrained models used in this work are publicly available.

研究の動機と目的

  • 低遅延、高精度、最小限の電力消費を実現するリアルタイムハンドジェスチャー認識の課題に対処する。
  • 従来のシステムがオフライン精度を重視し、リアルタイム効率やリソース制約を無視するという限界を克服する。
  • 動的ビデオストリームにおける重複検出や検出漏れを防ぐために、1ジェスチャーあたり1回のアクティベートを可能にする。
  • 誤分類、複数検出、検出漏れを同時に測定できる新たな評価指標、Levenshtein正答率を導入する。
  • 信頼度ベースのアクティベートとクラススコアの重み付き平均化により、分類性能を損なわずに早期検出を実現する。

提案手法

  • 軽量な3D CNN検出器と高精度分類のための深層3D CNN分類器(ResNeXt-101)を組み合わせた階層的2モデルアーキテクチャを採用する。
  • ストライド1のスライディングウィンドウをビデオストリームに適用し、リアルタイム推論を可能にする。
  • 時間的経過に伴う分類スコアの重み付き平均化を適用し、ジェスチャー発生時の曇りを軽減し、意思決定の安定性を向上させる。
  • 上位2位の平均クラス確率の差に基づく信頼度測定を用いて、単一時刻アクティベートをトリガーする。
  • Levenshtein距離を統合的評価指標として用い、検出と分類性能を包括的に評価する。
  • 検出器がジェスチャーの存在を示した場合にのみ、高複雑度分類器を起動することで推論を最適化し、電力とメモリ使用量を削減する。

実験結果

リサーチクエスチョン

  • RQ1オフラインで高精度に訓練されたCNNを、動的ジェスチャー認識における効率的リアルタイム推論にどのように適応できるか?
  • RQ2リアルタイムジェスチャー認識における誤分類、複数検出、検出漏れの複合的課題を最もよく捉える評価指標は何か?
  • RQ3分類スコアの重み付き平均化は意思決定の安定性を向上させ、より早期で信頼性の高いジェスチャー検出を可能にするか?
  • RQ4分類性能を損なわせることなく、リアルタイムシステムでどの程度の早期検出が達成できるか?
  • RQ5ストリーミングビデオ環境において、1ジェスチャーあたり1回のアクティベートを信頼性高く実装するにはどうすればよいか?

主な発見

  • 提案システムは、EgoGestureデータセットでリアルタイム評価において91.04%のLevenshtein正答率、nvGestureデータセットで77.39%を達成した。
  • EgoGestureにおける検出閾値τ_early = 0.4の設定下で、Levenshtein正答率が1.71%低下するだけで、平均9フレームの早期検出が可能となった。
  • 深度モダリティはRGBモダリティを上回り、8フレーム入力でnvGestureにおいて検出器が97.30%の正答率を達成した。
  • 分類器(ResNeXt-101)は、EgoGesture(深度モダリティ)で94.04%の最先端のオフライン正答率、nvGestureで83.82%を達成した。
  • 単一のNVIDIA Titan Xp GPU上で、アイドル時では460 fps、ジェスチャー処理時ではResNeXt-101を用いると62 fps、C3Dを用いると41 fpsで動作した。
  • 重み付き平均化は、特に低い閾値での早期検出性能において、均一平均化を大きく上回った。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。