Skip to main content
QUICK REVIEW

[论文解读] Keypoint Transformer: Solving Joint Identification in Challenging Hands and Object Interactions for Accurate 3D Pose Estimation

Shreyas Hampali, Sayan Sarkar|arXiv (Cornell University)|Apr 29, 2021
Hand Gesture Recognition Systems被引用 9
一句话总结

该论文提出Keypoint Transformer,一种新颖的3D手部与物体姿态估计方法,通过卷积神经网络特征与自注意力机制,将关键点定位与关节识别解耦。该方法在InterHand2.6M和HO-3D数据集上达到最先进性能,参数量仅为先前方法的一半,同时引入了一个包含75,000张完全标注3D手部-物体交互图像的新大规模H2O-3D数据集。

ABSTRACT

We propose a robust and accurate method for estimating the 3D poses of two hands in close interaction from a single color image. This is a very challenging problem, as large occlusions and many confusions between the joints may happen. State-of-the-art methods solve this problem by regressing a heatmap for each joint, which requires solving two problems simultaneously: localizing the joints and recognizing them. In this work, we propose to separate these tasks by relying on a CNN to first localize joints as 2D keypoints, and on self-attention between the CNN features at these keypoints to associate them with the corresponding hand joint. The resulting architecture, which we call "Keypoint Transformer", is highly efficient as it achieves state-of-the-art performance with roughly half the number of model parameters on the InterHand2.6M dataset. We also show it can be easily extended to estimate the 3D pose of an object manipulated by one or two hands with high performance. Moreover, we created a new dataset of more than 75,000 images of two hands manipulating an object fully annotated in 3D and will make it publicly available.

研究动机与目标

  • 解决在严重遮挡和外观模糊情况下的双手交互中准确进行3D姿态估计的挑战。
  • 将关键点定位与关节身份识别解耦,避免基于热力图的关节回归方法的局限性。
  • 开发一种轻量化但高精度的架构,用于基于注意力机制的3D手部与物体姿态估计。
  • 创建并发布一个全新的大规模、完全3D标注的手部-物体交互数据集,用于基准测试。

提出的方法

  • 首先,使用基于单个CNN的热力图预测潜在的2D关键点位置,但不分配身份。
  • 然后,通过自注意力机制建模关键点特征之间的关系,将每个关键点与关节或背景关联。
  • 交叉注意力模块为每个3D关节查询选择相关的关键点,实现针对关节的特征聚合。
  • 该架构与姿态表示无关,支持多种参数化方式,包括MANO网格和关节角度格式。
  • 该方法在InterHand2.6M和HO-3D上进行训练与评估,并进行了广泛的消融实验与定性分析。
  • 引入了一个新的H2O-3D数据集,包含来自17个多视角序列的75,000张图像,3D标注通过无标记优化流程获得。

实验结果

研究问题

  • RQ1与基于热力图的回归相比,基于Transformer的方法是否能在严重遮挡的双手交互中提升关节消歧性能?
  • RQ2将关键点定位与关节身份识别分离,是否能在减少参数量的同时提升性能?
  • RQ3当手部操作物体时,该方法是否能泛化到3D物体姿态估计?
  • RQ4在具有严重遮挡的复杂真实世界手部-物体交互序列中,模型表现如何?
  • RQ5关键点特征之间的自注意力机制相比直接热力图回归,在多大程度上提升了鲁棒性?

主要发现

  • Keypoint Transformer在InterHand2.6M数据集上实现了最先进性能,参数量约为先前方法的一半。
  • 在HO-3D数据集上,该方法实现了16.7毫米的3D关节误差,优于先前的最先进方法。
  • 在H2O-3D数据集上,该模型实现了7.9厘米的物体姿态MSSD,个体物体误差范围为6.5厘米(水杯)至13.5厘米(剪刀)。
  • 注意力可视化结果表明,模型能够学习关注可见关节的正确关键点特征,以及遮挡关节附近的特征。
  • 该方法在复杂交互中泛化能力良好,但在极端遮挡或关节穿插情况下偶尔会出现失败。
  • 所引入的H2O-3D数据集包含60,998张训练图像和15,342张测试图像,具有精确的3D标注,将公开发布。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。