Skip to main content
QUICK REVIEW

[论文解读] HandOccNet: Occlusion-Robust 3D Hand Mesh Estimation Network

JoonKyu Park, Yeonguk Oh|arXiv (Cornell University)|Mar 28, 2022
Human Pose and Action Recognition被引用 13
一句话总结

HandOccNet 是一种新颖的 3D 手部网格估计网络,通过引入两个基于 Transformer 的模块——FIT(特征注入 Transformer)和 SET(空间增强 Transformer)——实现了在遮挡鲁棒性手部重建方面的最先进性能。FIT 利用结合 softmax 和 sigmoid 注意力的混合注意力机制,将手部特定特征注入遮挡区域;SET 则通过带有残差学习的自注意力机制对特征进行精细化处理,最终在 Dex-YCB 数据集上实现了 14.04 MPJPE 和 5.80 PA-MPJPE 的性能,优于先前所有方法。

ABSTRACT

Hands are often severely occluded by objects, which makes 3D hand mesh estimation challenging. Previous works often have disregarded information at occluded regions. However, we argue that occluded regions have strong correlations with hands so that they can provide highly beneficial information for complete 3D hand mesh estimation. Thus, in this work, we propose a novel 3D hand mesh estimation network HandOccNet, that can fully exploits the information at occluded regions as a secondary means to enhance image features and make it much richer. To this end, we design two successive Transformer-based modules, called feature injecting transformer (FIT) and self- enhancing transformer (SET). FIT injects hand information into occluded region by considering their correlation. SET refines the output of FIT by using a self-attention mechanism. By injecting the hand information to the occluded region, our HandOccNet reaches the state-of-the-art performance on 3D hand mesh benchmarks that contain challenging hand-object occlusions. The codes are available in: https://github.com/namepllet/HandOccNet.

研究动机与目标

  • 解决手部因物体遮挡或自交导致严重遮挡时,准确进行 3D 手部网格估计的挑战。
  • 提升在复杂手-物体交互和部分可见的真实场景下的鲁棒性。
  • 设计一种深度学习架构,有效利用遮挡区域中的局部与长距离空间依赖关系。
  • 在 HO-3D 和 Dex-YCB 等基准数据集上,于 MPJPE 和 PA-MPJPE 指标下超越现有方法。
  • 验证混合注意力机制在遮挡区域中有效注入与优化手部特征的效能。

提出的方法

  • FIT 使用双注意力机制:基于 softmax 的注意力用于捕捉全局上下文,基于 sigmoid 的注意力用于抑制噪声注意力得分,从而生成优化的注意力图。
  • 将注意力图应用于主特征图中的值特征,生成残差特征,再通过带有层归一化和跳跃连接的前馈网络进行细化。
  • SET 采用标准的自注意力机制,包含查询、键和值的投影,随后通过残差连接和前馈网络细化,以增强空间表征能力。
  • 网络以级联方式集成 FIT 和 SET 模块:FIT 将手部信息注入遮挡区域,SET 进而对生成的特征进行进一步优化,以提升网格估计精度。
  • 通过 1×1 卷积和重塑操作处理特征图,以支持跨模态注意力计算的空间标记(spatial tokens)之间交互。
  • 模型采用标准的 3D 网格监督进行训练,并在 Procrustes 对齐前后使用 MPJPE 和 PA-MPJPE 指标进行评估。

实验结果

研究问题

  • RQ1结合 softmax 和 sigmoid 注意力的混合注意力机制是否能提升遮挡手部区域中的特征注入效果?
  • RQ2FIT 和 SET 模块的级联使用如何增强在严重遮挡条件下的 3D 手部网格估计性能?
  • RQ3所提方法是否在 Dex-YCB 等大规模、高度遮挡的数据集上优于当前最先进方法?
  • RQ4在未进行 Procrustes 对齐的情况下,模型的准确性保持程度如何,反映出其内在的几何鲁棒性?
  • RQ5模型是否能泛化到真实场景中多样的手-物体交互与复杂遮挡模式?

主要发现

  • 在 Dex-YCB 数据集上,HandOccNet 实现了 14.04 MPJPE 和 5.80 PA-MPJPE,优于第二名方法(Liu et al. [8])的 15.28 MPJPE 和 6.58 PA-MPJPE。
  • 即使在未进行 Procrustes 对齐的情况下,HandOccNet 在 HO-3D 上仍取得 24.9 MPJPE 的性能,优于 Pose2Mesh(33.2)、Hasson et al.(55.2)、I2L-MeshNet(26.8)和 Liu et al.(30.0)。
  • 在 HO-3D 数据集中严重遮挡图像上的定性结果表明,由于 FIT 的有效特征注入,HandOccNet 更好地重建了被遮挡的手指(如拇指)。
  • 在 FPHA 数据集上的视觉对比显示,与 Hasson et al. [6] 相比,HandOccNet 生成了更准确且一致的网格重建结果,尤其在具有挑战性的遮挡情况下表现更优。
  • 消融实验表明,FIT 中的混合注意力机制显著提升了注意力图质量,减少了遮挡区域中的误报。
  • FIT 与 SET 的结合使模型即使在手部大部分区域被遮挡时,仍能保持精细的手部几何结构。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。