Skip to main content
QUICK REVIEW

[论文解读] Egocentric Pose Recognition in Four Lines of Code

Grégory Rogez, James Steven Supančič|arXiv (Cornell University)|Nov 29, 2014
Human Pose and Action Recognition参考文献 22被引用 3
一句话总结

本文提出了一种实时、仅需四行代码的自指3D上半身姿态识别方法,采用自指工作空间的全局体素表示。通过从虚拟胸挂式摄像头合成深度数据,并使用稀疏多分类SVM对完整的3D工作空间配置进行分类,该方法通过利用视角感知的深度特征和上下文先验,实现了最先进性能(72%准确率),优于以往的局部窗口方法。

ABSTRACT

We tackle the problem of estimating the 3D pose of an individual's upper limbs (arms+hands) from a chest mounted depth-camera. Importantly, we consider pose estimation during everyday interactions with objects. Past work shows that strong pose+viewpoint priors and depth-based features are crucial for robust performance. In egocentric views, hands and arms are observable within a well defined volume in front of the camera. We call this volume an egocentric workspace. A notable property is that hand appearance correlates with workspace location. To exploit this correlation, we classify arm+hand configurations in a global egocentric coordinate frame, rather than a local scanning window. This greatly simplify the architecture and improves performance. We propose an efficient pipeline which 1) generates synthetic workspace exemplars for training using a virtual chest-mounted camera whose intrinsic parameters match our physical camera, 2) computes perspective-aware depth features on this entire volume and 3) recognizes discrete arm+hand pose classes through a sparse multi-class SVM. Our method provides state-of-the-art hand pose recognition performance from egocentric RGB-D images in real-time.

研究动机与目标

  • 解决在物体交互过程中自指视角下鲁棒的3D上肢姿态估计挑战,其中遮挡和视角变化会降低性能。
  • 通过将整个自指工作空间建模为3D体素描述符,克服局部、平移不变特征提取的局限性。
  • 利用具有真实相机内参的虚拟胸挂式摄像头生成的合成数据,生成多样化训练样本以实现泛化。
  • 通过使用视角感知的体素二值化而非正交投影,提升对视角效应和自遮挡的鲁棒性。
  • 通过在紧凑、全局上下文化的特征上运行简单稀疏多分类SVM分类器,实现实时推理。

提出的方法

  • 通过在虚拟场景中动画化具有不同手臂、手部和物体配置的3D人体模型,并使用与物理相机内参匹配的虚拟深度相机进行渲染,生成120,000个训练样本。
  • 将自指工作空间表示为32×24×35的3D体素网格,每个体素表示2×2×2 cm立方体内是否存在3D点,并使用透视投影以保留深度和尺寸变化的影响。
  • 计算一种视角感知的二值体素特征:若任意3D点投影到该体素的空间箱内,则设为1,从而增强对错位和透视引起的尺寸变化的鲁棒性。
  • 使用1-vs-all学习训练稀疏多分类SVM分类器,每个类别对应一个离散的姿态配置(K=750为最优),特征源自完整的工作空间体积。
  • 通过背景聚类减少杂乱或动态背景的干扰,提升对未见场景的泛化能力。
  • 在推理时应用训练好的模型,通过从真实自指深度图像中提取相同的体素特征,并通过预训练SVM进行分类。

实验结果

研究问题

  • RQ1与基于局部窗口的方法相比,自指工作空间的全局体素表示是否能提升3D手部与手臂姿态识别的准确率?
  • RQ2在基于自指深度的姿态估计中,使用视角感知的体素二值化是否优于正交或非视角特征表示?
  • RQ3从具有真实相机参数的虚拟胸挂式摄像头生成的合成数据,在多大程度上能泛化到真实世界的自指深度图像?
  • RQ4离散姿态类别数(K)对模型性能和泛化能力的影响如何?在分辨率与过拟合之间的最优权衡是什么?
  • RQ5简单的稀疏多分类SVM分类器是否能在保持最先进准确率的同时实现实时性能?

主要发现

  • 所提出的视角感知体素特征实现了72%的手部姿态识别准确率,显著优于最先进方法[21](在相同评估协议下报告60%准确率)。
  • 最优姿态类别数(K)为750,超过此值性能趋于平稳或下降,原因在于数据稀疏性和模型过拟合,表明粒度与泛化能力之间存在关键权衡。
  • 每类正样本数量的增加带来稳定但渐进的准确率提升,表明通过更大、更多样化的数据集可进一步提升性能。
  • 与缺乏一致深度投影建模的正交特征相比,基于视角的体素特征对类内错位和视角引起的尺寸变化更具鲁棒性。
  • 该方法实现了实时性能,整个推理流程仅需四行代码即可实现,展现出良好的实际可部署性。
  • 系统对新物体(如信封、长钉盒、台灯)泛化良好,能处理噪声深度和杂乱背景,但在反光表面或严重遮挡情况下性能下降。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。