Skip to main content
QUICK REVIEW

[论文解读] Point-to-Pose Voting based Hand Pose Estimation using Residual Permutation Equivariant Layer

Shile Li, Dongheui Lee|arXiv (Cornell University)|Dec 5, 2018
Human Pose and Action Recognition参考文献 35被引用 4
一句话总结

本文提出了一种新颖的基于点到姿态投票的单目手部姿态估计方法,采用残差排列等变层(ResidualPEL)处理无序3D点云,无需KNN或法向量估计等预处理步骤。该方法在Hands2017挑战赛数据集上实现了9.82毫米的平均关节点误差,达到当前最先进水平,并通过学习到的重要权重实现自监督手部分割。

ABSTRACT

Recently, 3D input data based hand pose estimation methods have shown state-of-the-art performance, because 3D data capture more spatial information than the depth image. Whereas 3D voxel-based methods need a large amount of memory, PointNet based methods need tedious preprocessing steps such as K-nearest neighbour search for each point. In this paper, we present a novel deep learning hand pose estimation method for an unordered point cloud. Our method takes 1024 3D points as input and does not require additional information. We use Permutation Equivariant Layer (PEL) as the basic element, where a residual network version of PEL is proposed for the hand pose estimation task. Furthermore, we propose a voting based scheme to merge information from individual points to the final pose output. In addition to the pose estimation task, the voting-based scheme can also provide point cloud segmentation result without ground-truth for segmentation. We evaluate our method on both NYU dataset and the Hands2017Challenge dataset. Our method outperforms recent state-of-the-art methods, where our pose accuracy is currently the best for the Hands2017Challenge dataset.

研究动机与目标

  • 开发一种对点顺序不变且无需KNN或表面法向量估计等预处理的深度学习方法,用于3D手部姿态估计。
  • 解决基于PointNet的方法依赖最大池化操作而损失局部空间信息的局限性。
  • 实现从3D点云端到端学习手部姿态与分割,无需任何分割真实标签。
  • 在最小内存与计算资源下实现高精度与高效率的手部姿态估计。

提出的方法

  • 以残差排列等变层(ResidualPEL)为核心构建模块,实现对点排列保持不变的特征学习,并保留局部空间结构。
  • 提出一种点到姿态的投票机制,将每个点的局部预测聚合为全局手部姿态,替代PointNet中使用的最大池化层。
  • 利用投票机制中的重要性权重生成无需任何分割标注的自监督手部分割结果。
  • 直接处理1024个输入3D点,避免体素化处理,保持完整的空间分辨率。
  • 在PEL模块内部采用残差网络设计,以提升网络深度与特征表示能力。
  • 仅使用3D点云坐标与真实关节点位置进行端到端训练。

实验结果

研究问题

  • RQ1与基于PointNet的方法相比,排列等变的深度学习架构是否能提升3D手部姿态估计的精度?
  • RQ2基于投票的融合机制是否在基于点云的手部姿态估计中优于最大池化操作的全局特征聚合?
  • RQ3投票机制中的重要性权重是否能实现无需真实分割标签的高质量自监督手部分割?
  • RQ4所提方法是否能在更低内存与推理成本下实现超越现有3D手部姿态估计方法的最先进性能?

主要发现

  • 在Hands2017挑战赛数据集上,该方法实现了9.82毫米的平均关节点误差,为提交时报告的最低值。
  • 对于未见受试者,该方法实现了12.04毫米的平均关节点误差,展现出强大的泛化能力,且无需显式正则化。
  • 在NYU数据集上,单视角下表现位列第二,三视角下优于所有近期最先进方法。
  • 模型大小仅为38–44 MB,显著小于基于3D CNN的方法(如420 MB),有利于高效部署。
  • 在单块中等性能GPU上,每帧推理时间仅为10.7–12.5毫秒,尽管使用了性能较弱的硬件,仍优于其他最先进方法的推理速度。
  • 通过重要性权重实现的自监督分割能够生成清晰、有意义的手指与手部区域分割结果,即使在自遮挡情况下也表现良好,且无需任何分割标注。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。