[论文解读] 3D Hand Pose Estimation using Simulation and Partial-Supervision with a Shared Latent Space
该论文提出LSPS,一种新颖的3D手部姿态估计方法,通过VAE-GAN混合模型与循环一致性约束,在合成深度图像、真实深度图像和3D手部姿态之间学习共享潜在空间。通过结合使用合成数据与部分标注的真实数据,该模型在NYU数据集上将误差降低至15.83mm(接近完全监督训练性能),在ICVL数据集上达到14.09mm,相较于以往方法在具有挑战性的基准测试中准确率最高提升达35%。
Tremendous amounts of expensive annotated data are a vital ingredient for state-of-the-art 3d hand pose estimation. Therefore, synthetic data has been popularized as annotations are automatically available. However, models trained only with synthetic samples do not generalize to real data, mainly due to the gap between the distribution of synthetic and real data. In this paper, we propose a novel method that seeks to predict the 3d position of the hand using both synthetic and partially-labeled real data. Accordingly, we form a shared latent space between three modalities: synthetic depth image, real depth image, and pose. We demonstrate that by carefully learning the shared latent space, we can find a regression model that is able to generalize to real data. As such, we show that our method produces accurate predictions in both semi-supervised and unsupervised settings. Additionally, the proposed model is capable of generating novel, meaningful, and consistent samples from all of the three domains. We evaluate our method qualitatively and quantitively on two highly competitive benchmarks (i.e., NYU and ICVL) and demonstrate its superiority over the state-of-the-art methods. The source code will be made available at https://github.com/masabdi/LSPS.
研究动机与目标
- 通过结合合成数据与有限的真实标注,解决真实3D手部姿态数据标注成本过高的问题。
- 弥合合成与真实深度数据之间的域差距,该差距通常会阻碍深度学习模型的泛化能力。
- 开发一种统一的生成模型,学习三种模态之间的共享潜在表征:合成深度图像、真实深度图像与3D手部姿态。
- 利用共享潜在空间实现在所有三个领域内的一致且有意义的零样本生成。
- 在真实世界基准上,展示在半监督与无监督设置下的优越泛化能力与鲁棒性。
提出的方法
- 该方法使用两个VAE-GAN混合模型分别建模真实与合成深度图像域,无需成对数据即可学习解耦且共享的表征。
- 另使用一个独立的VAE建模3D手部姿态域,并通过权重共享与循环一致性约束,在所有三个模态之间强制实现共享潜在空间。
- 模型采用后验估计函数(P)与映射函数(M),将深度图像的潜在空间与3D姿态的潜在空间对齐,从而支持跨域转换。
- 通过循环一致性损失对齐无配对的真实与合成深度图像,确保通过共享空间的编码-解码过程保持结构一致性。
- 该框架支持无监督训练(仅使用合成数据与未标注的真实数据)以及半监督微调(使用少量标注的真实数据)。
- 通过从共享潜在空间中的先验噪声(如𝒩(0, I))解码,实现生成采样,从而在所有三个领域生成逼真的样本。
实验结果
研究问题
- RQ1在合成深度图像、真实深度图像与3D手部姿态之间建立共享潜在空间,是否能提升从合成数据到真实数据的泛化能力?
- RQ2在仅使用少量真实数据标注的半监督设置下,该方法的有效性如何?
- RQ3共享潜在空间在多大程度上能跨所有三个模态生成一致且有意义的样本?
- RQ4该模型是否在NYU与ICVL等标准基准上优于现有最先进方法?
- RQ5该模型如何处理合成与真实数据分布之间较大的域差距?
主要发现
- 在NYU数据集上,所提方法实现了15.83mm的平均3D误差,非常接近在真实数据上完全监督训练的性能。
- 在ICVL数据集上,该方法将误差降低至14.09mm,显著优于仅使用合成数据训练的结果(误差23.91mm)。
- 与最先进基线相比,该方法在NYU数据集上使40mm以内误差的帧数绝对提升19%,在ICVL数据集上提升达35%。
- 仅使用10%的真实数据标注时,该模型在NYU数据集上相比监督基线实现17%的相对性能提升,相比crossingNet的半监督方法提升10%。
- 该模型在所有三个模态中均能生成高质量且一致的样本,包括从先验噪声生成,证明了潜在空间的平滑性与语义意义。
- 定性结果表明,当同时使用合成与真实数据时,预测结果显著更准确,尤其在仅使用合成数据会失效的区域表现更优。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。