Skip to main content
QUICK REVIEW

[论文解读] Joint Hand Detection and Rotation Estimation by Using CNN

Xiaoming Deng, Ye Yuan|arXiv (Cornell University)|Dec 8, 2016
Hand Gesture Recognition Systems被引用 4
一句话总结

本文提出一种基于卷积神经网络(CNN)的联合深度学习框架,用于手部检测与平面内旋转估计,引入一种新颖的去旋转层,实现端到端优化。该方法在Oxford和Egohands基准测试中达到最先进性能,推理时间减少7倍,并通过检测任务与旋转估计任务之间的相互促进,提升了检测精度。

ABSTRACT

Hand detection is essential for many hand related tasks, e.g. parsing hand pose, understanding gesture, which are extremely useful for robotics and human-computer interaction. However, hand detection in uncontrolled environments is challenging due to the flexibility of wrist joint and cluttered background. We propose a deep learning based approach which detects hands and calibrates in-plane rotation under supervision at the same time. To guarantee the recall, we propose a context aware proposal generation algorithm which significantly outperforms the selective search. We then design a convolutional neural network(CNN) which handles object rotation explicitly to jointly solve the object detection and rotation estimation tasks. Experiments show that our method achieves better results than state-of-the-art detection models on widely-used benchmarks such as Oxford and Egohands database. We further show that rotation estimation and classification can mutually benefit each other.

研究动机与目标

  • 解决由于手腕旋转和杂乱背景导致的外观高度变化,在非受控环境下进行手部检测的挑战。
  • 联合优化手部检测与平面内旋转估计,以提升准确率与效率。
  • 设计一种上下文感知的区域建议生成方法,其在召回率与平均最佳重叠(MABO)上优于选择性搜索与objectness。
  • 开发一种监督式、可微的去旋转层,支持旋转对齐与检测的端到端训练。
  • 通过显式旋转估计避免暴力旋转搜索,从而减少推理时间。

提出的方法

  • 提出一种上下文感知的建议生成算法,通过利用判别性特征,提升召回率与MABO,优于选择性搜索与objectness。
  • 引入一种去旋转层,根据预测的旋转角度显式地将特征图旋转至直立方向,支持端到端训练。
  • 采用双流CNN架构,通过共享特征提取实现旋转估计与检测任务的联合优化,提升效率。
  • 使用监督式旋转估计网络预测平面内旋转角度,并通过去旋转层将输入建议对齐至正确方向后进行检测。
  • 应用ROI池化从旋转后的建议中提取固定尺寸特征,确保空间一致性。
  • 采用端到端联合优化方式训练整个网络,使检测与旋转任务能够相互提升性能。

实验结果

研究问题

  • RQ1与单独训练相比,手部检测与平面内旋转估计的联合学习是否能提升检测准确率?
  • RQ2通过可微的去旋转层实现显式旋转对齐,是否能增强特征学习与模型泛化能力?
  • RQ3上下文感知的建议生成方法是否能在召回率与MABO上显著优于选择性搜索与objectness?
  • RQ4联合训练在保持或提升性能的同时,能在多大程度上减少推理时间?
  • RQ5旋转估计质量如何影响检测性能,反之亦然?

主要发现

  • 在Oxford数据集上,所提方法的平均精度均值(mAP)达到53.5%,优于最先进模型。
  • 在Egohands数据集上,联合模型的mAP达到75.7%,超过基线方法(73.3%),并展现出更强的泛化能力。
  • 在Egohands数据集上,旋转估计的准确率达到49.01%(误差在10°以内),76.68%在20°以内,表明旋转估计性能优异。
  • 去旋转层使推理时间相比暴力旋转搜索减少7倍,达到每张图像8秒。
  • 与非联合训练模型相比,联合训练使检测mAP提升2%,旋转估计准确率提升1%,证实了任务间的相互促进作用。
  • 使用真实旋转标签训练的模型mAP为50.9%,而所提方法达到48.3% mAP,表明优化能力强,性能差距极小。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。