Skip to main content
QUICK REVIEW

[论文解读] Markerless 3D human pose tracking through multiple cameras and AI: Enabling high accuracy, robustness, and real-time performance

Luca Fortini, Mattia Leonori|arXiv (Cornell University)|Mar 31, 2023
Human Pose and Action Recognition被引用 4
一句话总结

本文提出了一种基于多相机设置和基于人工智能的2D姿态估计的无标记3D人体姿态追踪框架,通过加权最小二乘(WLS)三角测量方法融合数据,实现在非受控环境下的高精度、实时性能和鲁棒性。该方法可实现用户干扰最小化,并在机器人、医疗保健和虚拟现实等多种应用中具备高可靠性,支持实际部署。

ABSTRACT

Tracking 3D human motion in real-time is crucial for numerous applications across many fields. Traditional approaches involve attaching artificial fiducial objects or sensors to the body, limiting their usability and comfort-of-use and consequently narrowing their application fields. Recent advances in Artificial Intelligence (AI) have allowed for markerless solutions. However, most of these methods operate in 2D, while those providing 3D solutions compromise accuracy and real-time performance. To address this challenge and unlock the potential of visual pose estimation methods in real-world scenarios, we propose a markerless framework that combines multi-camera views and 2D AI-based pose estimation methods to track 3D human motion. Our approach integrates a Weighted Least Square (WLS) algorithm that computes 3D human motion from multiple 2D pose estimations provided by an AI-driven method. The method is integrated within the Open-VICO framework allowing simulation and real-world execution. Several experiments have been conducted, which have shown high accuracy and real-time performance, demonstrating the high level of readiness for real-world applications and the potential to revolutionize human motion capture.

研究动机与目标

  • 解决基于标记的动作捕捉系统存在的局限性,包括用户不适、设置复杂性和在真实场景中可用性受限的问题。
  • 克服现有无标记3D姿态估计方法在精度、实时性能和鲁棒性之间的权衡问题。
  • 仅使用标准RGB摄像头和基于人工智能的2D姿态估计器,实现无需物理标记的实际、实时3D人体运动追踪。
  • 开发一种三角测量框架,通过自适应加权融合多视角2D关键点检测结果,提升在遮挡和低置信度预测情况下的3D重建精度。
  • 将系统集成至Open-VICO框架中,以支持在多样化环境下的仿真与实际部署。

提出的方法

  • 利用多个RGB摄像头捕捉人体运动的同步视频流,通过空间多样性避免视线遮挡问题。
  • 采用基于人工智能的2D姿态估计方法(如OpenPose)在每个摄像头视角中检测21个人体关节,使用置信度分数和可见性指标作为输入。
  • 应用加权最小二乘(WLS)三角测量方法,从2D检测结果中重建3D关节位置,最小化加权残差。
  • 通过三个分量计算每个关节和摄像头的自适应权重:置信度分数($w_{c,j}^s$)、基于距离的可靠性($w_{c,j}^d$)以及正交性指数($w_{c,j}^o$)以评估可见性。
  • 实施阈值策略:将置信度低于0.4的关节从三角测量中排除,以减少噪声和异常值的影响。
  • 采用国际生物力学协会(ISB)标准的关节坐标系(JCS)来计算由重建的3D关节生成的3D骨骼角度和解剖学坐标系。

实验结果

研究问题

  • RQ1多视角2D姿态估计结合WLS三角测量能否在无标记条件下实现高精度、实时的3D人体姿态重建?
  • RQ2基于置信度、距离和可见性的自适应权重在遮挡和低质量检测条件下如何提升3D姿态精度?
  • RQ3在真实环境中,该框架在精度和延迟方面相较于现有无标记3D姿态估计方法的优越程度如何?
  • RQ4该系统是否能在无需特殊标定或受控背景的情况下,保持在多样化环境和复杂人体动作下的鲁棒性能?
  • RQ5该框架集成至Open-VICO平台后,在仿真与实际部署中的有效性如何?

主要发现

  • 所提出的框架在3D人体姿态重建中实现了高精度,结果表明其在非受控环境下的表现与基于标记的系统相当。
  • 基于置信度、距离和可见性的自适应权重显著提升了系统鲁棒性,尤其在遮挡和低置信度检测情况下表现突出。
  • 系统可实时运行,延迟低,适用于虚拟现实、机器人和数字孪生等交互式应用。
  • 通过阈值机制排除低置信度关节(置信度 < 0.4)可有效减少错误2D检测的影响,从而提升整体三角测量精度。
  • 集成至Open-VICO框架后,实现了仿真与实际部署的无缝衔接,验证了系统在多样化应用中的实际可用性。
  • 该方法在不同身体姿态和相机配置下表现出强泛化能力,保持一致性能,无需重新训练或复杂标定。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。