Skip to main content
QUICK REVIEW

[論文レビュー] Hand Segmentation for Hand-Object Interaction from Depth map

Byeongkeun Kang, Kar-Han Tan|arXiv (Cornell University)|Mar 8, 2016
Hand Gesture Recognition Systems参考文献 23被引用数 12
ひとこと要約

本稿では、色ベースの手法に課題があるため、深度マップのみを用いて手と物体のインタラクションにおける手分離を実現する2段階のランダム決定木フォレスト(RDF)手法を提案する。まず手領域を検出しその後、深度特徴を用いてピクセル単位の分離を実行する。F1スコア68.7%という高い精度と、10.7 msという低遅延を達成し、最先端の手法と比較して高速でありながらも、競争力ある精度を維持している。

ABSTRACT

Hand segmentation for hand-object interaction is a necessary preprocessing step in many applications such as augmented reality, medical application, and human-robot interaction. However, typical methods are based on color information which is not robust to objects with skin color, skin pigment difference, and light condition variations. Thus, we propose hand segmentation method for hand-object interaction using only a depth map. It is challenging because of the small depth difference between a hand and objects during an interaction. To overcome this challenge, we propose the two-stage random decision forest (RDF) method consisting of detecting hands and segmenting hands. To validate the proposed method, we demonstrate results on the publicly available dataset of hand segmentation for hand-object interaction. The proposed method achieves high accuracy in short processing time comparing to the other state-of-the-art methods.

研究の動機と目的

  • 照明、メラニン色素、物体の色の変動によって皮膚色ベースの手法が失敗する手と物体のインタラクションにおけるロバストな手分離の課題に対処すること。
  • 色情報に依存しない深度マップ専用のアプローチを開発し、照明や肌色の変動にかかわらずロバストであることを保証すること。
  • 手と近接する身体部位(例:腕)や手と類似した深度を持つ物体を含む複雑なシナリオにおける分離精度の向上。
  • 拡張現実(AR)、ロボット工学、人間-ロボットインタラクションなどの応用に適したリアルタイム性能を達成すること。
  • 27,525個のラベル付き手と物体のインタラクションサンプルを含む、新たに収集され公開可能な深度マップデータセットを用いて手法の妥当性を検証すること。

提案手法

  • 本手法は2段階のRDFフレームワークを採用:まずグローバルな深度マップ解析により手領域を検出し、その後検出領域内で分離を精緻化する。
  • RDF内の各決定木は、深度マップ上の2つの相対的点間の深度差を分割基準として用いる:$ f(\boldsymbol{x},\boldsymbol{D},\boldsymbol{u},\boldsymbol{v}) = D_{\boldsymbol{x}+\boldsymbol{u}/\boldsymbol{D}_{\boldsymbol{x}}}} - D_{\boldsymbol{x}+\boldsymbol{v}/\boldsymbol{D}_{\boldsymbol{x}}}} $。
  • 葉ノードでは、学習時に条件付き確率分布を学習し、推論時にクラスラベル(手または非手)を割り当てる。
  • 空間的および深度重み付きフィルタを適用して予測を精緻化し、ガウス関数を用いる:$ g_r(r) = \exp(-r^2 / (2\sigma_r^2)) $, $ g_s(s) = \exp(-s^2 / (2\sigma_s^2)) $、ここで $ \sigma_r = \sigma_s = 100 $。
  • 第1段階では、ROIとして全深度マップを用いる。第2段階では、検出された手領域に処理を制限することで、効率性と精度を向上させる。
  • 本手法は、Microsoft Kinect v2を用いて収集された27,525組の深度マップ-ラベルペアから構成される独自のデータセットで学習されている。

実験結果

リサーチクエスチョン

  • RQ1照明や肌色の変動に依存しない深度マップ専用のアプローチが、手と物体のインタラクションにおいてロバストな手分離を達成できるか?
  • RQ22段階RDFフレームワークは、単一段階手法と比較して、複雑なインタラクションシナリオにおける分離精度をどのように向上させるか?
  • RQ3RDFベースの手法と深層学習モデルを深度データに適用した場合、精度と処理時間のトレードオフはどのように変化するか?
  • RQ4空間的および深度に敏感なフィルタリングは、重複や曖昧な領域におけるRDFベースの手分離性能をどのように向上させるか?
  • RQ5F1スコアと推論速度の観点から、本手法は最先端の深度ベース分離技術と比較してどのように差をつけるか?

主な発見

  • 本手法は11×11フィルタを用いてF1スコア68.7%を達成し、ベースラインRDF手法(F1: 53.7%)と比較して相対的に25%の向上を示した。
  • 平均して10.7 msで画像処理が可能であり、FCN-8s(377 ms)と比較して42倍高速で、リアルタイム応用に適している。
  • 2段階RDFフレームワークにより、ベースラインRDFと比較して再現率(Recall)が72.7%から77.4%に向上し、真陽性ピクセルの検出能力が向上した。
  • 本手法はベースラインRDFおよびその改良ステップの組み合わせと比較して、精度とF1スコアの両方で優れていることから、段階的設計の有効性が示された。
  • 本手法はベースラインRDF(F1: 53.7%)を上回る精度を達成し、FCN-8s(F1: 72.3%)と比較して7%低いF1スコアであったが、推論時間は著しく短縮された。
  • 可視化比較により、本手法は手が物体や腕と接触する領域でも、より正確で一貫性のある手マスクを生成していることが示された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。