Skip to main content
QUICK REVIEW

[论文解读] Single Image 3D Hand Reconstruction with Mesh Convolutions

Dominik Kulon, Haoyang Wang|arXiv (Cornell University)|May 4, 2019
Human Pose and Action Recognition参考文献 41被引用 16
一句话总结

该论文提出了一种基于网格卷积和谱自编码器的实时单目3D手部重建系统,用于学习手部形状的非线性、轻量级图可变形模型。通过在高分辨率手部网格上训练谱解码器,并结合图像编码器和相机回归器,该方法在仅使用6倍少的参数量下实现了SOTA级别的重建精度,并达到实时推理速度(53 FPS)。

ABSTRACT

Monocular 3D reconstruction of deformable objects, such as human body parts, has been typically approached by predicting parameters of heavyweight linear models. In this paper, we demonstrate an alternative solution that is based on the idea of encoding images into a latent non-linear representation of meshes. The prior on 3D hand shapes is learned by training an autoencoder with intrinsic graph convolutions performed in the spectral domain. The pre-trained decoder acts as a non-linear statistical deformable model. The latent parameters that reconstruct the shape and articulated pose of hands in the image are predicted using an image encoder. We show that our system reconstructs plausible meshes and operates in real-time. We evaluate the quality of the mesh reconstructions produced by the decoder on a new dataset and show latent space interpolation results. Our code, data, and models will be made publicly available.

研究动机与目标

  • 为解决SMPL和MANO等线性统计模型在捕捉非线性手部形变和软组织效应方面的局限性。
  • 利用无监督谱自编码器在高分辨率手部网格上进行训练,开发一种轻量级、非线性的3D手部形状先验。
  • 通过将预训练的谱解码器与图像编码器和相机回归器结合,实现在单张RGB图像上实时重建3D手部网格。
  • 构建一个全新的高分辨率、高保真度的3D手部网格数据集,涵盖逼真的姿态和形状变化,用于训练与评估。
  • 证明所学习的基于图的可变形模型在重建质量和效率方面优于传统线性模型。

提出的方法

  • 在大规模3D手部网格集合上训练谱自编码器,通过归一化尺度和全局朝向,学习手部形状的非线性潜在空间表征。
  • 在图拉普拉斯矩阵的谱域上使用图卷积网络执行网格上的内在卷积,实现旋转不变的特征学习。
  • 将预训练的谱解码器固定为非线性统计可变形模型,并与学习得到的图像编码器连接,从单张图像预测潜在形状和姿态参数。
  • 训练一个独立的弱透视相机回归器,将生成的网格与输入图像对齐,同时阻断梯度流向网格生成器,以保持重建质量。
  • 使用高顶点数的手部模型拟合1,000组扫描数据和Panoptic Studio的3D标注,通过欧拉角的K均值聚类进行姿态采样,合成训练数据。
  • 利用解码器的潜在空间实现平滑插值和解耦的形状/姿态表征,支持合理网格生成与可视化。

实验结果

研究问题

  • RQ1在手部网格上训练的谱自编码器是否能学习到比SMPL或MANO等线性模型更具表现力的非线性形状先验?
  • RQ2所学习的图可变形模型是否能实现比基线线性模型更高的单目图像3D手部重建质量?
  • RQ3该系统是否能在保持高重建精度和在多样化姿态与形状上良好泛化的同时实现实时推理?
  • RQ4与空间卷积相比,网格上的谱卷积在建模细微形变和参数效率方面表现如何?
  • RQ5该自编码器的潜在空间在支持形状与姿态因子的有意义插值和解耦方面能达到何种程度?

主要发现

  • 所提出的谱自编码器在Panoptic DomeDb数据集上的网格L1重建误差为2.33 mm,优于基线MANO类模型的2.56 mm,尽管后者用于生成真实值。
  • 基于谱的生成器仅含393,080个参数,仅为250万个参数的MANO类基线的1/6,同时推理速度高达329 FPS。
  • 完整系统在使用DenseNet-121图像编码器时运行速度达53 FPS,实现了从单张图像实时重建3D手部。
  • 潜在空间插值可生成平滑且视觉上合理的不同手部形状与姿态之间的过渡,包括手指长度和关节角度的变化。
  • 微调谱解码器可进一步将重建误差降低至2.30 mm,表明端到端训练可提升性能而不增加模型大小。
  • 系统在具有挑战性的姿态和形状上泛化良好,如测试集中困难样本的定性结果所示。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。