[论文解读] HMOR: Hierarchical Multi-Person Ordinal Relations for Monocular Multi-Person 3D Pose Estimation
本文提出HMOR(分层多人序数关系),一种新颖的监督方法,通过分层方式编码人物、身体部位和关节之间的深度与角度关系,以提升单目多人3D姿态估计中的全局一致性。所提出的端到端自顶向下模型采用粗到细的深度细化策略,联合估计人体检测、深度和3D姿态,实现在MuPoTS-3D和CMU Panoptic数据集上的最先进性能,且计算与参数成本更低。
Remarkable progress has been made in 3D human pose estimation from a monocular RGB camera. However, only a few studies explored 3D multi-person cases. In this paper, we attempt to address the lack of a global perspective of the top-down approaches by introducing a novel form of supervision - Hierarchical Multi-person Ordinal Relations (HMOR). The HMOR encodes interaction information as the ordinal relations of depths and angles hierarchically, which captures the body-part and joint level semantic and maintains global consistency at the same time. In our approach, an integrated top-down model is designed to leverage these ordinal relations in the learning process. The integrated model estimates human bounding boxes, human depths, and root-relative 3D poses simultaneously, with a coarse-to-fine architecture to improve the accuracy of depth estimation. The proposed method significantly outperforms state-of-the-art methods on publicly available multi-person 3D pose datasets. In addition to superior performance, our method costs lower computation complexity and fewer model parameters.
研究动机与目标
- 解决自顶向下单目多人3D姿态估计方法中缺乏全局场景理解的问题。
- 缓解复杂杂乱场景中多人交互时的深度模糊与遮挡挑战。
- 通过引入人物、身体部位和关节之间的分层序数关系,提升绝对3D姿态估计的准确性。
- 开发一种端到端可训练的集成模型,联合执行人体检测、深度估计与3D姿态回归。
- 与现有方法相比,实现更优性能的同时降低模型复杂度与计算成本。
提出的方法
- 提出分层多人序数关系(HMOR),在三个层级上建模深度与角度关系:人物实例、身体部位和关节。
- 将序数监督编码为跨层级的相对深度与角度约束,以在预测的3D姿态中强制实现全局一致性。
- 提出一种集成的自顶向下模型,以端到端方式同时执行人体检测、3D姿态估计与人体深度估计。
- 采用粗到细的深度估计架构:首先生成全局深度图,然后通过残差校正细化个体人体深度。
- 采用兼容2D姿态标注的2D-3D混合训练策略,实现高效且有效的预训练。
- 设计一种新型损失函数,将HMOR监督与标准3D姿态和深度回归损失结合,实现联合优化。
实验结果
研究问题
- RQ1人物、身体部位和关节之间的分层序数关系能否提升单目多人3D姿态估计的全局一致性?
- RQ2与直接回归绝对3D姿态相比,HMOR监督在准确性和鲁棒性方面表现如何?
- RQ3粗到细的深度估计策略在从单张RGB图像估计绝对3D姿态方面,能将准确性提升多少?
- RQ4集成的端到端模型能否在降低计算成本的同时,联合优化检测、深度与3D姿态估计?
- RQ5在混合使用2D与3D标注进行训练时,该方法的有效性如何?其在真实场景中的泛化能力如何?
主要发现
- 在MuPoTS-3D数据集上,该方法相比最先进方法实现了12.3 PCK abs的性能提升。
- 在CMU Panoptic数据集上,该方法将MPJPE降低了20.5 mm,证明了其在绝对姿态估计准确性方面的优越性。
- 与Moon等人[39](唯一公开的多人3D姿态估计基线)相比,模型参数减少73%,GFLOPs降低41%。
- 与直接回归绝对3D姿态相比,HMOR监督使MPJPE降低7.4 mm,其中实例层级关系对绝对姿态准确性的贡献最大。
- 与直接输出深度相比,粗到细的深度细化策略使MPJPE降低15.1 mm,证明了其在准确深度估计中的必要性。
- 训练期间采样更多视角方向可使MPJPE降低0.6 mm,表明其在复杂场景中具有更强的泛化能力。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。