Skip to main content
QUICK REVIEW

[论文解读] Pixel-wise Regression: 3D Hand Pose Estimation via Spatial-form Representation and Differentiable Decoder

Xingyuan Zhang, Fuhai Zhang|arXiv (Cornell University)|May 6, 2019
Human Pose and Action Recognition参考文献 27被引用 4
一句话总结

本文提出了一种新颖的像素级回归框架用于3D手部姿态估计,结合空间形态表征(SFR)与可微解码器,以保留空间结构并实现在3D关节坐标上的直接监督。通过将3D坐标分解为平面与深度分量,并使用独立的平面回归(PR)与深度回归(DR)模块,该方法在MSRA数据集上将平均3D误差降低了25%,实现了最先进性能。

ABSTRACT

3D Hand pose estimation from a single depth image is an essential topic in computer vision and human-computer interaction. Although the rising of deep learning method boosts the accuracy a lot, the problem is still hard to solve due to the complex structure of the human hand. Existing methods with deep learning either lose spatial information of hand structure or lack a direct supervision of joint coordinates. In this paper, we propose a novel Pixel-wise Regression method, which use spatial-form representation (SFR) and differentiable decoder (DD) to solve the two problems. To use our method, we build a model, in which we design a particular SFR and its correlative DD which divided the 3D joint coordinates into two parts, plane coordinates and depth coordinates and use two modules named Plane Regression (PR) and Depth Regression (DR) to deal with them respectively. We conduct an ablation experiment to show the method we proposed achieve better results than the former methods. We also make an exploration on how different training strategies influence the learned SFRs and results. The experiment on three public datasets demonstrates that our model is comparable with the existing state-of-the-art models and in one of them our model can reduce mean 3D joint error by 25%.

研究动机与目标

  • 解决全连接层中因展平操作导致的回归式3D手部姿态估计中空间信息丢失的问题。
  • 克服依赖不可微解码器的检测式方法在3D关节坐标上缺乏直接监督的问题。
  • 设计一种空间形态表征(SFR),在保留空间结构的同时支持端到端训练与直接的3D坐标监督。
  • 在自遮挡与深度噪声等挑战性条件下,提升3D手部姿态估计的准确性。
  • 通过消融实验与公开数据集上的基准评估,验证可微解码与SFR设计的有效性。

提出的方法

  • 该方法引入一种空间形态表征(SFR),将3D关节坐标编码为2D特征图,以保留手部各部分之间的空间结构。
  • 设计了一种可微解码器(DD),可直接从SFR重建3D关节坐标,从而实现端到端训练与3D监督。
  • 解码器被分解为两个并行模块:平面回归(PR)用于2D(u,v)坐标,深度回归(DR)用于深度(z)值。
  • SFR通过全卷积网络(FCN)学习,DD作为网络内部的可学习层实现,支持整个流程的反向传播。
  • 模型使用联合损失函数进行训练,最小化预测值与真实3D关节坐标之间的L2误差。
  • 该方法在保持空间归纳偏置的同时,实现了对3D坐标的直接监督,与传统依赖不可微解码器的检测式方法不同。

实验结果

研究问题

  • RQ1可微解码器是否能通过实现对关节坐标的直接监督,提升3D手部姿态估计的准确性?
  • RQ2通过空间形态表征(SFR)保留空间结构,是否能带来更好的泛化能力并降低3D手部姿态估计误差?
  • RQ3SFR的设计及其与可微解码器的关联,如何影响在存在自遮挡与深度噪声的挑战性数据集上的性能表现?
  • RQ4训练策略的选择在多大程度上影响所学习SFR的质量与最终3D姿态估计的准确性?
  • RQ5所提出的像素级回归框架是否能在准确性和鲁棒性方面超越传统的回归式与检测式方法?

主要发现

  • 在MSRA数据集上,所提方法实现了5.186 mm的平均3D误差,相比之前最先进方法降低了25%。
  • 在MSRA数据集上,该模型在平均误差与误差低于阈值的帧比例方面均优于所有基线模型,尤其在高精度区间表现突出。
  • 在ICVL数据集上,该方法实现了6.177 mm的平均3D误差,与最佳性能模型(V2V-PoseNet,6.284 mm)非常接近,并在10 mm以下误差阈值内优于其他模型。
  • 在HAND17数据集上,该模型实现了12.22 mm的平均误差,显著优于基线模型(19.71 mm),尽管略逊于顶尖性能模型。
  • 消融实验表明,通过可微解码器实现的直接监督至关重要,且SFR设计对性能影响显著,尤其在遮挡关节上表现更优。
  • 定性结果表明,该模型泛化能力良好,部分预测甚至优于真实标注,表明其学习到了超越记忆化的鲁棒特征。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。