Skip to main content
QUICK REVIEW

[论文解读] HandTailor: Towards High-Precision Monocular 3D Hand Recovery

Jun Lv, Wenqiang Xu|arXiv (Cornell University)|Feb 18, 2021
Human Pose and Action Recognition参考文献 43被引用 15
一句话总结

HandTailor 提出了一种两阶段框架,用于实现高精度的单目 3D 手部网格重建,结合了一个基于 CNN 的手部模块(支持透视投影和弱透视投影)与一个基于可微优化的裁缝模块,后者在每帧约 8ms 内对网格进行精细化处理。该方法实现了最先进性能,在 RHD 基准测试中将 AUC_{5-20} 提升了近 0.1,显著改善了 2D-3D 一致性。

ABSTRACT

3D hand pose estimation and shape recovery are challenging tasks in computer vision. We introduce a novel framework HandTailor, which combines a learning-based hand module and an optimization-based tailor module to achieve high-precision hand mesh recovery from a monocular RGB image. The proposed hand module unifies perspective projection and weak perspective projection in a single network towards accuracy-oriented and in-the-wild scenarios. The proposed tailor module then utilizes the coarsely reconstructed mesh model provided by the hand module as initialization, and iteratively optimizes an energy function to obtain better results. The tailor module is time-efficient, costs only 8ms per frame on a modern CPU. We demonstrate that HandTailor can get state-of-the-art performance on several public benchmarks, with impressive qualitative results on in-the-wild experiments. Code and video are available on our project webpage https://sites.google.com/view/handtailor.

研究动机与目标

  • 为解决单目 3D 手部重建中 2D-3D 投影不一致的问题,即预测的 3D 网格无法在输入图像上保持一致投影。
  • 通过支持双重视角投影,使单一模型既能适应需相机参数的高精度场景,也能适用于无相机参数的野外应用。
  • 通过引入轻量级、可微的精炼模块,超越端到端学习,提升网格精度,纠正几何不一致性。
  • 设计一个即插即用的裁缝模块,可增强基于各类中间表示方法的性能。

提出的方法

  • 手部模块使用单一深度神经网络,在透视投影和弱透视投影下均预测 3D 手部网格,可适配相机参数或在无参数条件下运行。
  • 裁缝模块对来自手部模块的粗略网格执行可微优化,最小化包含关节、几何与身份约束的综合能量函数。
  • 该能量函数包含关节位置误差项($\mathcal{E}_J$)、几何一致性项($\mathcal{E}_g$)和身份保持项($\mathcal{E}_{id}$),并可选地加入深度项($\mathcal{E}_d$)与轮廓项($\mathcal{E}_s$)。
  • 通过可微渲染器加速优化过程,计算渲染后的深度与轮廓作为监督信号,实现反向传播通过精炼过程。
  • 裁缝模块设计轻量化,仅在现代 CPU 上每帧增加约 8ms 推理时间。
  • 该框架支持与其他基于中间表示方法的即插即用集成,无需微调即可提升其性能。

实验结果

研究问题

  • RQ1统一的深度学习模型是否能在不修改网络结构的前提下,有效处理透视投影与弱透视投影?
  • RQ2基于可微优化的精炼模块是否能在保持低推理成本的同时,显著提升 3D 手部网格与输入图像的投影一致性?
  • RQ3裁缝模块是否具备跨多种基于中间表示方法的泛化能力,作为插件组件提升其性能?
  • RQ4裁缝模块在多大程度上减少了重建手部网格的 2D-3D 投影不一致性?

主要发现

  • 裁缝模块将 RHD 基准测试中的 AUC_{5-20} 指标从 0.653 提升至 0.658,实现近 0.1 的显著提升,证明了其在量化指标上的显著增益。
  • 在 20 次迭代下,裁缝模块在 Intel i7-8700 CPU 上实现每帧 8.02ms 的推理时间,证明即使在基于优化的精炼下,仍具备极高的效率。
  • 消融实验表明,添加深度与轮廓约束($\mathcal{E}_d$,$\mathcal{E}_s$)会降低性能并增加耗时,表明其不利于收敛或精度提升。
  • 若缺少 $\mathcal{E}_g$ 与 $\mathcal{E}_{id}$,则导致不自然的网格形变,证实其在保持真实手部几何结构与身份特征方面的重要性。
  • 定性结果表明,裁缝模块能有效修正重投影中微小但可见的手指偏移,显著提升与输入图像的视觉一致性。
  • 即插即用评估验证了裁缝模块可普遍提升多种基线方法的性能,证明其泛化能力与可复用性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。