Skip to main content
QUICK REVIEW

[論文レビュー] Hand Segmentation and Fingertip Tracking from Depth Camera Images Using Deep Convolutional Neural Network and Multi-task SegNet

Hai-Duong Nguyen, Do, Tai Nhu|arXiv (Cornell University)|Jan 11, 2019
Hand Gesture Recognition Systems参考文献 17被引用数 6
ひとこと要約

本稿では、RGB-D画像とマルチタスクSegNetアーキテクチャを用いて、リアルタイムでエンドツーエンドに手のセグメンテーションと指先検出を行うシステムを提案する。YOLOv2を用いた手の検出と、同時に手の部品セグメンテーションと指先位置特定を実行する軽量で共有エンコーダーを備えたSegNetを組み合わせることで、ユーザーキャリブレーションを不要とし、複数の手や隠蔽状態に対応しつつ、GPU上で15 fpsの推論速度を達成し、競争力ある精度(親指検出における1.0 cmの誤差閾値で83%の精度)を実現した。

ABSTRACT

Hand segmentation and fingertip detection play an indispensable role in hand gesture-based human-machine interaction systems. In this study, we propose a method to discriminate hand components and to locate fingertips in RGB-D images. The system consists of three main steps: hand detection using RGB images providing regions which are considered as promising areas for further processing, hand segmentation, and fingertip detection using depth image and our modified SegNet, a single lightweight architecture that can process two independent tasks at the same time. The experimental results show that our system is a promising method for hand segmentation and fingertip detection which achieves a comparable performance while model complexity is suitable for real-time applications.

研究の動機と目的

  • 多様で制約のない環境において、頑健でリアルタイムな手のセグメンテーションと指先検出のためのシステムを開発すること。
  • 従来の手法で一般的に必要なユーザー固有のキャリブレーション手順を排除すること。
  • 深度ベースのジェスチャー認識における背景の変動、局所的隠蔽、複数手の状況といった課題に対処すること。
  • 2つのセマンティックセグメンテーションタスクを同時に実行する軽量で単一モデルのアーキテクチャを設計すること。
  • 実用的な人間-マシンインタラクションシステムへの導入を想定し、高い精度と低い計算コストのバランスを取ること。

提案手法

  • システムはRGB画像における手のバウンディングボックスをYOLOv2で検出し、その領域に対応する深度領域を抽出して後続処理に用いる。
  • 深度画像からの手領域の分離には、カメラに近い距離に基づく深度しきい値処理が適用される。
  • 共有エンコーダーを備えたマルチタスクSegNetアーキテクチャが提案され、手の部品セグメンテーションと指先検出のための別々のデコーダーを有する。
  • ネットワークはエンドツーエンドで学習され、共通のエンコーダーが深度データから一般化された手の表現を学習し、タスク固有のデコーダーは初期化から再学習される。
  • 過学習を防ぐため、正規化、回転、スケーリング、ミラー処理を含むデータ拡張が適用される。
  • 2つの独立したSegNetを学習するのと比較して、パラメータ数を10,014,563減少させ、競争力ある性能を維持した。

実験結果

リサーチクエスチョン

  • RQ11つの軽量ディープラーニングアーキテクチャが、深度画像において手の部品セグメンテーションと指先検出の両方を効果的に行えるか。
  • RQ2提案されたマルチタスクSegNetは、従来のシングルタスクまたは二重モデルアプローチと比較して、精度と速度の面でどのように優れているか。
  • RQ3ユーザーキャリブレーションや背景の仮定なしに、多様な環境にどれほど一般化可能か。
  • RQ4局所的隠蔽や複数手の状況に対して、この手法はどの程度効果的に機能するか。
  • RQ5リアルタイムジェスチャー認識において、モデルの複雑さ、推論速度、検出精度のトレードオフはどのようなものか。

主な発見

  • 提案されたマルチタスクSegNetは、HandNetデータセットにおいて親指検出で1.0 cmの誤差閾値で83%の精度を達成し、2つのベースライン手法(76%および81%)を上回った。
  • GeForce GTX 1080上で約15 fpsで動作し、リアルタイムの人間-マシンインタラクションアプリケーションに適している。
  • 手のセグメンテーションは30 fpsで実行され、セグメンテーションタスクとして高い効率性を示した。
  • FingerPaintデータセットにおいて、SharpらやTanらの先行研究を上回り、特に高い誤差閾値での性能が顕著に優れていた。
  • ユーザー固有のキャリブレーションを必要とせず、局所的隠蔽や複数手の状況に対しても効果的に対応できた。
  • 2つの独立したSegNetを学習するのと比較して、モデルパラメータ数を1000万以上削減し、計算コストを顕著に低減しながらも、競争力ある精度を維持した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。