Skip to main content
QUICK REVIEW

[论文解读] Hand Segmentation and Fingertip Tracking from Depth Camera Images Using Deep Convolutional Neural Network and Multi-task SegNet

Hai-Duong Nguyen, Do, Tai Nhu|arXiv (Cornell University)|Jan 11, 2019
Hand Gesture Recognition Systems参考文献 17被引用 6
一句话总结

该论文提出了一种基于RGB-D图像的实时端到端系统,用于手部分割和指尖检测,采用多任务SegNet架构。通过结合YOLOv2进行手部检测与一种轻量级、共享编码器的SegNet,该方法同时完成手部组件分割和指尖定位,实现了具有竞争力的精度(在1.0 cm误差阈值下拇指检测精度达83%),并在GPU上达到15 fps的推理速度,无需用户校准,且能处理多只手和遮挡情况。

ABSTRACT

Hand segmentation and fingertip detection play an indispensable role in hand gesture-based human-machine interaction systems. In this study, we propose a method to discriminate hand components and to locate fingertips in RGB-D images. The system consists of three main steps: hand detection using RGB images providing regions which are considered as promising areas for further processing, hand segmentation, and fingertip detection using depth image and our modified SegNet, a single lightweight architecture that can process two independent tasks at the same time. The experimental results show that our system is a promising method for hand segmentation and fingertip detection which achieves a comparable performance while model complexity is suitable for real-time applications.

研究动机与目标

  • 开发一种在多样化、非受限环境中具有鲁棒性的实时手部分割与指尖检测系统。
  • 消除先前方法中通常需要的用户特定校准步骤。
  • 解决基于深度信息的手势识别中背景变化、局部遮挡和多只手场景等挑战。
  • 设计一种轻量级单模型架构,可同时执行两项语义分割任务。
  • 在高精度与低计算成本之间取得平衡,以实现人机交互系统中的实际部署。

提出的方法

  • 系统使用YOLOv2在RGB图像中检测手部边界框,随后提取对应的深度区域以供进一步处理。
  • 应用深度阈值处理,根据与相机的接近程度从深度图像中分离出手部区域。
  • 提出一种多任务SegNet架构,共享单一编码器,同时使用独立解码器分别处理手部组件分割和指尖检测。
  • 网络采用端到端训练,共享编码器从深度数据中学习通用的手部表征,而任务特定的解码器则从零开始训练。
  • 应用数据增强技术,包括归一化、旋转、缩放和镜像,以提高鲁棒性并防止过拟合。
  • 与分别训练两个SegNet相比,模型参数减少了10,014,563个,同时保持了具有竞争力的性能。

实验结果

研究问题

  • RQ1单一轻量级深度学习架构能否有效在深度图像中同时完成手部组件分割和指尖检测?
  • RQ2所提出的多任务SegNet在精度和速度方面与现有单任务或双模型方法相比如何?
  • RQ3该方法在无需用户校准或背景假设的前提下,其泛化能力在多样化环境中能达到何种程度?
  • RQ4该系统在处理局部遮挡和多只手场景时表现如何?
  • RQ5在实时手势识别中,模型复杂度、推理速度与检测精度之间的权衡关系如何?

主要发现

  • 所提出的多任务SegNet在HandNet数据集上,于1.0 cm误差阈值下对拇指的检测精度达到83%,优于两种基线方法(76%和81%)。
  • 系统在GeForce GTX 1080上运行速度约为15 fps,适用于实时人机交互应用。
  • 手部分割速度达到30 fps,显示出该任务的高效率。
  • 在FingerPaint数据集上,该方法优于Sharp等人和Tan等人先前的工作,尤其在较高误差阈值下表现更优。
  • 该模型在无需用户特定校准的情况下,成功处理了局部遮挡和多只手场景。
  • 与分别训练两个SegNet相比,该架构减少了超过1000万个参数,显著降低了计算成本,同时保持了具有竞争力的精度。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。