Skip to main content
QUICK REVIEW

[论文解读] Enhanced Touchable Projector-depth System with Deep Hand Pose Estimation

Zhi Chai, Roy Shilkrot|arXiv (Cornell University)|Dec 28, 2018
Tactile and Sensory Interactions参考文献 21被引用 3
一句话总结

本文提出了一种增强深度学习的投影仪-深度系统,将3D手部姿态估计与触控检测相结合,以提升可触摸投影界面的鲁棒性和功能性。通过在俯视图手部触控数据上训练卷积神经网络(CNN),该系统实现了针对手指的触控检测、斑点分解以及抗噪的指尖估计,显著提升了多点触控交互能力,并支持新型应用,例如基于手势感知的虚拟键盘,实现基于手指的打字分配。

ABSTRACT

Touchable projection with structured light range cameras is a prolific medium for large interaction surfaces, affording multiple simultaneous users and simple, cheap setup. However robust touch detection in such projector-depth systems is difficult to achieve due to measurement noise. We propose a novel combination of surface touch detection and a deep network for hand pose estimation, which aids in detecting both on- and above-surface hand gestures, disambiguating multiple touch fingers, as well as recovering fingertip positions in face of noisy input. We present the details of our GPU-accelerated system and an evaluation of its performance, as well as applications such as an enhanced virtual keyboard that utilizes the added features.

研究动机与目标

  • 解决由于传感器噪声和重叠触控斑点导致的投影仪-深度系统中触控检测不可靠的问题。
  • 通过将深度手部姿态估计集成到触控检测流程中,实现细粒度的、基于手指的触控交互。
  • 开发一种系统,支持表面内与表面之上的手势操作,并提升对遮挡和测量噪声的鲁棒性。
  • 实现新型交互范式,例如基于手指分配的虚拟键盘与多指手势控制。

提出的方法

  • 一种基于GPU加速的处理流水线,结合背景建模、手部分割与从俯视深度图像中进行的深度卷积神经网络(CNN)3D手部姿态估计。
  • 一个定制训练的深度卷积神经网络(CNN),用于20关节手部姿态估计,特别针对高遮挡与噪声的表面触控场景进行优化。
  • 基于姿态的触控检测方法,利用估计的手部骨骼结构对合并的触控斑点进行分解,并将手指分配至特定触控点。
  • 一个大规模的俯视图手部姿态数据集,从真实触控交互中收集,用于训练CNN,以提升对噪声深度输入的泛化能力。
  • 将姿态估计与斑点分析相结合,以消除多指触控的歧义,并在立体视差与传感器噪声下提升检测精度。
  • 将系统应用于一种新型虚拟键盘,其中不同手指被分配至不同的字符集(小写字母、大写字母、数字、符号),实现基于手势的打字。

实验结果

研究问题

  • RQ1深度手部姿态估计能否提升在噪声投影仪-深度系统中的触控检测鲁棒性?
  • RQ2能否通过基于姿态的分析而非传统的斑点基方法,实现针对手指的触控检测?
  • RQ3集成3D手部姿态估计在多指触控与空中手势检测方面有何提升作用?
  • RQ4该系统在真实世界交互任务(如虚拟键盘输入)中的性能提升程度如何?
  • RQ5在常见的深度传感器伪影(如立体视差与遮挡)下,系统能否保持准确性?

主要发现

  • 在10名志愿者参与的虚拟键盘任务中,系统实现了平均12.72 WPM与21.63% CER,证明了功能性多指打字的可行性。
  • 在自动补全功能支持下,平均WPM提升了57%至19.98,显示出文本输入性能的显著提升。
  • 系统通过基于姿态的分析成功将合并的触控斑点分解为单个手指触控,实现了准确的手指指派。
  • 即使在传感器噪声与遮挡条件下,指尖位置也能被准确预测,相比传统的连通域分析,可靠性显著提高。
  • 虚拟键盘原型支持新型打字模式,例如通过同时多指按键实现双字母输入(如用食指与中指输入'ff')。
  • 所提方法在深度传感器噪声与立体视差下表现出鲁棒性,在复杂触控场景中优于传统的斑点基检测方法。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。