[论文解读] Two-hand Global 3D Pose Estimation Using Monocular RGB
该论文提出了首个仅通过单目RGB图像估计双手三维全局关节位置的系统,采用多阶段CNN流水线,并结合一种新颖的投影算法,在无深度传感器的情况下重建绝对三维姿态。该方法在三维标准姿态估计任务上达到最先进性能,并引入了一个基于大规模合成第一视角数据集的新基准。
We tackle the challenging task of estimating global 3D joint locations for both hands via only monocular RGB input images. We propose a novel multi-stage convolutional neural network based pipeline that accurately segments and locates the hands despite occlusion between two hands and complex background noise and estimates the 2D and 3D canonical joint locations without any depth information. Global joint locations with respect to the camera origin are computed using the hand pose estimations and the actual length of the key bone with a novel projection algorithm. To train the CNNs for this new task, we introduce a large-scale synthetic 3D hand pose dataset. We demonstrate that our system outperforms previous works on 3D canonical hand pose estimation benchmark datasets with RGB-only information. Additionally, we present the first work that achieves accurate global 3D hand tracking on both hands using RGB-only inputs and provide extensive quantitative and qualitative evaluation.
研究动机与目标
- 仅使用单目RGB输入,实现双手三维全局手部姿态估计的高精度,克服遮挡、背景噪声以及缺乏深度信息的挑战。
- 通过构建高质量的合成第一视角数据集,解决双手三维姿态估计中缺乏大规模真实世界标注数据的问题。
- 开发一种新颖的视角不变投影算法,利用二维和三维标准姿态估计结果重建绝对三维关节位置。
- 基于仅RGB输入,建立新的评估协议与三维全局手部姿态估计基准。
提出的方法
- 多阶段CNN流水线:(1) 手部分割与检测,(2) 二维手部姿态估计,(3) 三维标准姿态估计,(4) 通过投影实现三维全局姿态估计。
- 一种新颖的全局投影算法,利用估计的三维标准姿态、二维关节位置以及已知骨骼长度,计算绝对三维关节位置。
- 使用包含静态与动态手部姿态的合成第一视角RGB-D数据集进行训练,以模拟真实世界视角条件。
- 引入一种新型损失函数 $\mathcal{L}_{proj}$,尽管在标准姿态性能上略有下降,但显著提升了全局姿态估计的准确性。
- 引入手部分割与批量归一化层,以提升二维与三维姿态估计的精度。
- 采用球坐标系评估方法,用于全局姿态估计,以评估根关节的方向与距离准确性(mMCP)。
实验结果
研究问题
- RQ1仅使用单目RGB输入,能否准确实现双手三维全局手部姿态估计,而无需依赖深度信息或多视角数据?
- RQ2当缺乏深度信息时,如何从二维和三维标准姿态中重建绝对三维关节位置?
- RQ3具有真实纹理与视角变化的合成第一视角数据集,在多大程度上能实现对真实世界RGB数据的泛化?
- RQ4不同损失函数与网络组件对二维、三维标准姿态及全局三维姿态估计精度的影响如何?
- RQ5所提出方法在标准姿态与全局三维姿态估计基准上,与最先进方法相比表现如何?
主要发现
- 在 $Ego3D_{s}$-test 与 $Ego3D_{d}$-test 数据集上,该方法在全局三维姿态估计任务中,于3°角阈值与7 cm半径阈值下,球面PCK达到约0.90。
- 尽管仅依赖RGB输入,该方法仍优于使用额外深度或多视角数据的最先进单手三维标准姿态估计方法。
- 使用 $\mathcal{L}_{proj}$ 损失显著提升了全局姿态估计的准确性,球面PCK提升,尽管标准姿态AUC与EPE略有下降。
- 在STB数据集上,该方法在未访问真实根关节位置的情况下,于3°与7 cm阈值下达到0.90的球面PCK,表明其对真实世界数据具有良好的泛化能力。
- 在RHP数据集上,该方法在方位角($\theta$)上AUC为0.960,仰角($\phi$)为0.958,半径为0.690,表明方向估计准确度高,但深度估计仍有改进空间。
- 消融实验表明,手部分割与批量归一化显著提升了二维与三维姿态估计性能,且 $\mathcal{L}_{bone}$ 将平均骨骼长度误差从3.7mm降低至1.8mm。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。