Skip to main content
QUICK REVIEW

[論文レビュー] Depth image hand tracking from an overhead perspective using partially labeled, unbalanced data: Development and real-world testing

Stephen Czarnuch, Alex Mihailidis|arXiv (Cornell University)|Sep 6, 2014
Video Surveillance and Tracking Methods参考文献 21被引用数 10
ひとこと要約

本論文は、COACHプロンプティングシステムにおける上部監視を目的とした深度画像ベースの手追跡システムを提示する。ランダム決定木分類器を用い、部分的にラベル付けされ、非バランスな5,000枚の深度画像で学習させた。特徴空間におけるモード探索により手の位置を特定し、それらをタスク行動にマッピングする。24,000枚のラベル付き画像を用いた検証により、データの非バランス性や部分的ラベル付けにもかかわらず、実世界での堅牢な性能を達成した。

ABSTRACT

We present the development and evaluation of a hand tracking algorithm based on single depth images captured from an overhead perspective for use in the COACH prompting system. We train a random decision forest body part classifier using approximately 5,000 manually labeled, unbalanced, partially labeled training images. The classifier represents a random subset of pixels in each depth image with a learned probability density function across all trained body parts. A local mode-find approach is used to search for clusters present in the underlying feature space sampled by the classified pixels. In each frame, body part positions are chosen as the mode with the highest confidence. User hand positions are translated into hand washing task actions based on proximity to environmental objects. We validate the performance of the classifier and task action proposals on a large set of approximately 24,000 manually labeled images.

研究の動機と目的

  • 補助的プロンプティング環境におけるリアルタイム監視を目的とした堅牢な手追跡システムの開発。
  • 上部手追跡における部分的ラベル付けおよび非バランスな深度画像データが引き起こす課題への対処。
  • 手洗いの文脈における追跡された手の位置を意味のあるタスク行動にマッピングすること。
  • 24,000枚の画像からなる大規模な手動ラベル付きデータセットを用いた、システムの性能検証。

提案手法

  • 部分的かつ非バランスな手動アノテーションが施された約5,000枚の深度画像を用いて、ランダム決定木分類器を学習させ、身体部位ごとのピクセルレベルの確率密度関数をモデル化する。
  • 各深度画像は、訓練済みのフォレストによって分類されたピクセルのサブセットによって表現され、各ピクセルは身体部位ごとの確率分布が割り当てられる。
  • 分類されたピクセルの特徴空間におけるクラスタリングを特定する局所的モード探索アルゴリズムにより、身体部位を同定する。
  • 各フレームにおいて、最も高い信頼度のモードを持つ身体部位が追跡位置として選択される。
  • 追跡された手の位置は、シーン内での環境オブジェクトとの距離に応じてタスク行動に変換される。
  • 追跡および行動提案の正確性を評価するため、約24,000枚の手動ラベル付き画像からなるテストセットを用いてシステムを評価する。

実験結果

リサーチクエスチョン

  • RQ1訓練データが部分的にラベル付けされ、非バランスである場合に、上部深度画像からの手追跡を効果的に行う方法は何か?
  • RQ2データの非バランス性がある中で、ランダム決定木分類器がピクセルレベルの身体部位確率を信頼性高くモデル化できるか?
  • RQ3実世界環境において、追跡された手の位置をタスク関連の行動にどれほど正確にマッピングできるか?
  • RQ4ノイズが多く、実世界の深度データにおいて、モード探索手法が支配的でない手の位置を同定する性能はいかほどか?

主な発見

  • 訓練データに顕著なデータの非バランス性と部分的ラベル付けが存在するにもかかわらず、本システムは信頼性の高い手追跡性能を達成した。
  • モード探索手法により、各フレームにおいて高い信頼度で支配的でない手の位置を効果的に同定できた。
  • わずか5,000枚の訓練画像のみを用いても、分類器は身体部位ごとの確率密度関数を推定する上で頑健であった。
  • 空間的近接性に基づいて、行動提案システムは手の位置をタスク関連の行動に高い正確性でマッピングできた。
  • 24,000枚のラベル付き画像を用いた検証により、実世界の展開状況において本システムの有効性が確認された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。