[论文解读] Weakly-Supervised 3D Pose Estimation from a Single Image using Multi-View Consistency
本文提出了一种基于单张图像的弱监督3D人体姿态估计方法,利用多视角一致性作为数据驱动正则化器。通过将源自多视角几何的重投影损失整合到网络的训练损失中,该方法消除了漂移问题,实现了几乎与强监督方法无差别的性能,在训练过程中未使用3D真实值的情况下,其在Panoptic数据集上的精度达到了当前最先进水平。
We present a novel data-driven regularizer for weakly-supervised learning of 3D human pose estimation that eliminates the drift problem that affects existing approaches. We do this by moving the stereo reconstruction problem into the loss of the network itself. This avoids the need to reconstruct 3D data prior to training and unlike previous semi-supervised approaches, avoids the need for a warm-up period of supervised training. The conceptual and implementational simplicity of our approach is fundamental to its appeal. Not only is it straightforward to augment many weakly-supervised approaches with our additional re-projection based loss, but it is obvious how it shapes reconstructions and prevents drift. As such we believe it will be a valuable tool for any researcher working in weakly-supervised 3D reconstruction. Evaluating on Panoptic, the largest multi-camera and markerless dataset available, we obtain an accuracy that is essentially indistinguishable from a strongly-supervised approach making full use of 3D groundtruth in training.
研究动机与目标
- 为解决由于3D标注成本高昂而导致的大规模野外3D人体姿态数据集缺乏的问题。
- 消除弱监督3D姿态估计中常见的漂移问题,该问题会降低模型收敛性和准确性。
- 实现在无需3D真实值或监督预训练阶段的、不受约束的多相机数据上的训练。
- 开发一种简单且可泛化的正则化器,以提升弱监督3D姿态学习中的重建稳定性和准确性。
- 证明仅使用2D关键点检测结果和相机标定信息,弱监督模型即可达到强监督模型的性能。
提出的方法
- 提出一种基于重投影的损失函数,通过已知相机参数将预测的3D姿态重新投影回2D图像空间,以实现多视角间的一致性。
- 使用Huber损失(Smooth L1)计算预测2D投影与OpenPose检测得到的真实2D关键点之间的差异。
- 将多视角一致性损失直接嵌入网络的训练目标中,避免了对独立3D重建或预训练阶段的需求。
- 基于验证误差采用早停策略,并在Panoptic数据集上使用每关节3D误差的均值(单位为毫米)进行评估。
- 仅使用2D监督和相机标定信息,端到端训练3D姿态回归网络,训练过程中完全不使用3D标签。
- 利用多视角立体几何的约束,隐式正则化3D姿态预测,防止漂移。
实验结果
研究问题
- RQ1多视角一致性能否作为弱监督3D姿态估计中的有效正则化器,以防止漂移?
- RQ2在不使用3D真实值的情况下,弱监督模型在多大程度上可以达到与强监督模型相当的性能?
- RQ3将重投影损失集成到训练目标中,是否能消除对3D监督预热阶段的需求?
- RQ4与强基线模型相比,该方法在肘部、手腕、脚踝和耳朵等困难关节上的表现如何?
- RQ5该方法在无需显式3D监督的情况下,能否在多样化的姿态和遮挡场景中实现良好泛化?
主要发现
- 在仅包含身体的姿势任务中,弱监督模型的平均3D误差为71.019毫米,而强监督基线模型的误差为71.013毫米。
- 在包含身体和双手的配置下,弱监督模型的误差为87.015毫米,仅比强监督模型的84.115毫米高出3毫米。
- 弱监督方法在多个关节上表现优于强监督模型,包括左右肘部和手腕,这些部位通常难以准确估计。
- 该模型在定性结果上与强监督基线模型几乎完全一致,两者在视觉示例中均能紧密匹配Panoptic的3D真实值。
- 失败案例源于2D检测错误(如误检的手部或被遮挡的肢体),而非弱监督架构本身的局限性。
- 该方法在未使用任何3D真实值的情况下,于Panoptic数据集上达到了最先进性能,充分证明了多视角一致性正则化器的有效性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。