Skip to main content
QUICK REVIEW

[論文レビュー] Enhanced Touchable Projector-depth System with Deep Hand Pose Estimation

Zhi Chai, Roy Shilkrot|arXiv (Cornell University)|Dec 28, 2018
Tactile and Sensory Interactions参考文献 21被引用数 3
ひとこと要約

この論文では、3次元手のポーズ推定とタッチ検出を統合することで、耐障害性と機能性を向上させる深層学習強化型プロジェクターディープスシステムを提案する。上位からの手のタッチデータを用いてトレーニングされたCNNにより、指別タッチ検出、ボイド分解、ノイズに強い指先推定が可能となり、マルチタッチインタラクションが大幅に向上し、指別入力割り当てを備えたジェスチャー対応バーチャルキーボードなど、新たな応用が可能になる。

ABSTRACT

Touchable projection with structured light range cameras is a prolific medium for large interaction surfaces, affording multiple simultaneous users and simple, cheap setup. However robust touch detection in such projector-depth systems is difficult to achieve due to measurement noise. We propose a novel combination of surface touch detection and a deep network for hand pose estimation, which aids in detecting both on- and above-surface hand gestures, disambiguating multiple touch fingers, as well as recovering fingertip positions in face of noisy input. We present the details of our GPU-accelerated system and an evaluation of its performance, as well as applications such as an enhanced virtual keyboard that utilizes the added features.

研究の動機と目的

  • センサーノイズや重なったタッチボイドの影響により、プロジェクターディープスシステムにおけるタッチ検出が不安定になるという課題に対処すること。
  • 深層手のポーズ推定をタッチ検出パイプラインに統合することで、細分化された指別タッチインタラクションを実現すること。
  • 遮蔽や測定ノイズに対して耐障害性の高い、表面上および表面上でのジェスチャーを両方サポートするシステムを開発すること。
  • 指割り当てベースのバーチャルキーボードやマルチフィンガージェスチャー制御など、新たなインタラクションパラダイムを可能にすること。

提案手法

  • 背景モデリング、手分離、および上位からの深度画像からの深層畳み込みニューラルネットワーク(CNN)ベースの3次元手のポーズ推定を統合したGPU加速処理パイプライン。
  • 表面タッチのシナリオに特に最適化された20関節手のポーズ推定を実現する、カスタムトレーニング済みの深層畳み込みニューラルネットワーク(CNN)。
  • 推定された手のスケルトンを用いて、重なったタッチボイドを分解し、各指を特定のタッチポイントに割り当てるポーズに依存するタッチ検出。
  • 実際のタッチインタラクションから収集した大規模な上位からの手のポーズデータセット。ノイズの多い深度入力への汎化性能を向上させるためにCNNのトレーニングに使用。
  • ポーズ推定とボイド解析を統合することで、複数指タッチの曖昧さを解消し、ステレオ視差やセンサーノイズ下でも検出精度を向上。
  • 異なる指が異なる文字セット(小文字、大文字、数字、記号)に割り当てられる、指別入力のバーチャルキーボードとしての応用。

実験結果

リサーチクエスチョン

  • RQ1深層手のポーズ推定は、ノイズの多いプロジェクターディープスシステムにおけるタッチ検出の耐障害性を向上させ得るか?
  • RQ2従来のボイドベース手法ではなく、ポーズに依存する分析によって指別タッチ検出を達成できるか?
  • RQ33次元手のポーズ推定を統合することで、マルチフィンガージェスチャーおよび表面上ジェスチャーの検出がどの程度向上するか?
  • RQ4バーチャルキーボード入力のような実世界のインタラクションタスクにおいて、システムの性能はどの程度向上するか?
  • RQ5ステレオ視差や遮蔽といった一般的な深度センサーアーティファクトに対しても、システムは正確性を維持できるか?

主な発見

  • 10名の被験者を対象としたバーチャルキーボードタスクにおいて、平均WPMは12.72、CERは21.63を記録し、マルチフィンガータイピングの実用的実現を示した。
  • 自動補完機能を導入したところ、平均WPMが57%向上し19.98に達し、テキスト入力における顕著な性能向上を示した。
  • ポーズに依存する分析により、重なったタッチボイドが個々の指タッチに正確に分解され、正確な指の指定が可能になった。
  • センサーノイズや遮蔽下でも指先位置が正確に予測された。従来の連結成分解析に比べて信頼性が向上した。
  • バーチャルキーボードプロトタイプにより、同時に複数の指を押すことで二重文字入力(例:インデックスと中指で「ff」を入力)のような新たなタイピングパターンが可能になった。
  • 提案手法は深度センサーノイズおよびステレオ視差に対して耐障害性を示し、複雑なタッチシナリオにおいて従来のボイドベース検出を上回った。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。