Skip to main content
QUICK REVIEW

[论文解读] Ray3D: ray-based 3D human pose estimation for monocular absolute 3D localization

Yu Zhan, Fenghai Li|arXiv (Cornell University)|Mar 22, 2022
Human Pose and Action Recognition被引用 7
一句话总结

Ray3D 提出了一种新颖的单目 3D 人体姿态估计方法,通过将 2D 关键点检测结果转换为 3D 归一化射线,解耦相机内参,同时通过学习的嵌入显式建模相机外参(例如高度和俯仰角)。该设计在相机内参和外参变化下实现了最先进水平的泛化能力,在 3DHP 数据集上达到 307.4 mm 的 MRPE,优于所有 SOTA 方法。

ABSTRACT

In this paper, we propose a novel monocular ray-based 3D (Ray3D) absolute human pose estimation with calibrated camera. Accurate and generalizable absolute 3D human pose estimation from monocular 2D pose input is an ill-posed problem. To address this challenge, we convert the input from pixel space to 3D normalized rays. This conversion makes our approach robust to camera intrinsic parameter changes. To deal with the in-the-wild camera extrinsic parameter variations, Ray3D explicitly takes the camera extrinsic parameters as an input and jointly models the distribution between the 3D pose rays and camera extrinsic parameters. This novel network design is the key to the outstanding generalizability of Ray3D approach. To have a comprehensive understanding of how the camera intrinsic and extrinsic parameter variations affect the accuracy of absolute 3D key-point localization, we conduct in-depth systematic experiments on three single person 3D benchmarks as well as one synthetic benchmark. These experiments demonstrate that our method significantly outperforms existing state-of-the-art models. Our code and the synthetic dataset are available at https://github.com/YxZhxn/Ray3D .

研究动机与目标

  • 解决由于尺度、深度和相机参数模糊性导致的单目绝对 3D 人体姿态估计问题的病态性。
  • 在真实场景中提升对相机内参(焦距、主点)和外参(俯仰角、高度、偏航角)变化的泛化能力。
  • 克服现有提升法和基于图像方法的局限性,这些方法在参数变化下表现不佳或对视角变化缺乏鲁棒性。
  • 通过在神经网络中显式引入标定后的相机外参,实现在度量空间中的准确绝对 3D 定位。
  • 系统性地评估在受控的尺度、相机位姿和深度变化下,合成与真实世界基准的鲁棒性。

提出的方法

  • 将 2D 关键点坐标转换为与相机无关空间中的 3D 归一化射线,以解耦模型与相机内参。
  • 应用时间卷积在连续帧之间融合 3D 射线,提升对遮挡的鲁棒性并增强姿态精度。
  • 引入基于多层感知机(MLP)的相机嵌入模块,以相机高度和俯仰角作为输入,建模外参分布。
  • 将相机嵌入与时间融合后的射线特征拼接,以指导世界坐标系中准确的 3D 关键点回归。
  • 通过归一化解耦内参,确保在焦距和主点变化下性能稳定。
  • 在真实基准(H36M、3DHP、MPI-INF-3DWP)和一个具有受控参数变化的自定义合成数据集上进行训练与评估。

实验结果

研究问题

  • RQ1将 2D 关键点转换为 3D 归一化射线在多大程度上提升了对相机内参变化(如焦距和主点)的鲁棒性?
  • RQ2显式建模相机外参(如高度和俯仰角)在多大程度上增强了对多样化相机位姿的泛化能力?
  • RQ3与 SOTA 基线相比,该方法在极端的体型尺度和相机-主体距离变化下表现如何?
  • RQ4射线的时间融合在提升遮挡和噪声条件下的精度与稳定性方面有何贡献?
  • RQ5内参解耦与相机嵌入在跨数据集泛化性能中各自及联合贡献如何?

主要发现

  • Ray3D 在 H36M 上训练并在 3DHP 数据集上测试时,达到 307.4 mm 的 MRPE,显著优于 RIE 基线(1079.2 mm)和其他 SOTA 方法。
  • 该方法在所有测试的相机内参变化(焦距、主点)下均保持稳定性能,性能下降极小。
  • 在相机俯仰角变化下,Ray3D 显著优于基线,在 -30° 至 +30° 范围内保持一致的高精度。
  • 在相机平移(与主体距离)变化下,Ray3D 在 5 米距离时仍保持低误差(MRPE 低于 800 mm),而基线性能急剧下降。
  • 在体型尺度变化(0.6× 至 1.1× 原始尺寸)下,Ray3D 的 MRPE 上升至 800 mm,仍远优于基线(PoseFormer 和 RIE 最差可达 4 米)。
  • 消融实验表明,内参解耦、相机归一化和相机嵌入各自均有显著贡献,完整模型在跨数据集泛化中表现最佳。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。