Skip to main content
QUICK REVIEW

[论文解读] A2J-Transformer: Anchor-to-Joint Transformer Network for 3D Interacting Hand Pose Estimation from a Single RGB Image

Changlong Jiang, Xiao Yang|arXiv (Cornell University)|Apr 7, 2023
Human Pose and Action Recognition被引用 5
一句话总结

A2J-Transformer 提出了一种基于 Transformer 的新方法,用于从单张 RGB 图像中进行 3D 交互手部姿态估计,通过将可学习的 3D 锚点作为查询,联合建模局部细节与全局关节结构。其在 InterHand2.6M 数据集上实现了 9.63 mm 的 MPJPE,达到当前最先进性能,展现出对遮挡的优越鲁棒性,并在深度数据上表现出强大的泛化能力。

ABSTRACT

3D interacting hand pose estimation from a single RGB image is a challenging task, due to serious self-occlusion and inter-occlusion towards hands, confusing similar appearance patterns between 2 hands, ill-posed joint position mapping from 2D to 3D, etc.. To address these, we propose to extend A2J-the state-of-the-art depth-based 3D single hand pose estimation method-to RGB domain under interacting hand condition. Our key idea is to equip A2J with strong local-global aware ability to well capture interacting hands' local fine details and global articulated clues among joints jointly. To this end, A2J is evolved under Transformer's non-local encoding-decoding framework to build A2J-Transformer. It holds 3 main advantages over A2J. First, self-attention across local anchor points is built to make them global spatial context aware to better capture joints' articulation clues for resisting occlusion. Secondly, each anchor point is regarded as learnable query with adaptive feature learning for facilitating pattern fitting capacity, instead of having the same local representation with the others. Last but not least, anchor point locates in 3D space instead of 2D as in A2J, to leverage 3D pose prediction. Experiments on challenging InterHand 2.6M demonstrate that, A2J-Transformer can achieve state-of-the-art model-free performance (3.38mm MPJPE advancement in 2-hand case) and can also be applied to depth domain with strong generalization.

研究动机与目标

  • 解决在严重自遮挡和交互遮挡条件下,从单张 RGB 图像中进行 3D 交互手部姿态估计的挑战。
  • 克服现有无模型方法缺乏全局上下文感知能力,且在双手之间存在模糊外观模式的问题。
  • 通过将 3D 空间先验嵌入锚点,改进 2D 到 3D 的提升过程,以实现更优的深度估计。
  • 通过用查询特定的自适应多尺度特征学习替代共享特征,提升局部特征的区分能力。
  • 实现灵活的无模型回归,无需个性化手部模型,即可对复杂手部交互保持鲁棒性。

提出的方法

  • 引入基于 Transformer 的非局部编码-解码框架,使锚点通过自注意力机制实现全局交互,捕捉关节之间的结构化关系。
  • 将每个 3D 锚点视为可学习查询,预测其到所有手部关节的 3D 偏移量,通过加权融合所有查询预测结果实现关节位置估计。
  • 为每个查询引入自适应多尺度卷积特征学习(MSDAM),以增强模式拟合能力,并区分外观相似的手部区域。
  • 将锚点定位在 3D 空间而非 2D 空间,实现直接的 3D 偏移预测,提升单目 RGB 图像的深度估计性能。
  • 根据锚点对关节预测的相关性,为其分配可学习权重,提升对遮挡的鲁棒性。
  • 集成基于 Transformer 的 3D 锚点精炼模块,用于优化锚点位置,改善空间上下文建模。

实验结果

研究问题

  • RQ1可学习的、基于查询的 3D 锚点机制是否能提升在单张 RGB 图像中严重遮挡条件下的 3D 手部姿态估计性能?
  • RQ2锚点之间的全局自注意力机制在多大程度上增强了模型捕捉交互手部中关节结构化关系的能力?
  • RQ3与 2D 锚点相比,3D 锚点定位在 2D 到 3D 提升任务中能带来多大程度的性能提升?
  • RQ4自适应多尺度特征学习在关节回归过程中区分外观相似手部区域的效率如何?
  • RQ5所提出的方法在基于深度和基于 RGB 的 3D 手部姿态估计基准上是否具备良好的泛化能力?

主要发现

  • A2J-Transformer 在 InterHand2.6M 数据集上实现了 9.63 mm MPJPE 的新 SOTA 性能,适用于双手交互场景,优于以往的无模型方法。
  • 消融实验表明,若移除基于 Transformer 的全局建模组件,MPJPE 上升 5 mm,证明其在遮挡鲁棒性中的关键作用。
  • 若将自适应多尺度特征学习(MSDAM)替换为标准注意力机制,性能下降 1 mm,验证了其在特征区分能力上的贡献。
  • 当移除 3D 锚点权重机制时,性能下降 4.4 mm,表明并非所有锚点对关节预测的贡献均等。
  • 使用 256 个平面内锚点和 3 个深度锚点可在准确率(9.63 mm MPJPE)与推理速度(25.65 FPS)之间取得最佳平衡,当锚点数量减少时性能下降。
  • 该模型在基于深度数据的测试中也表现出良好泛化能力,在 NYU 和 HANDS 2017 数据集上均取得优异性能,证实了其跨模态鲁棒性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。