Skip to main content
QUICK REVIEW

[论文解读] Kinematics-Guided Reinforcement Learning for Object-Aware 3D Ego-Pose Estimation

Zhengyi Luo, Ryo Hachiuma|arXiv (Cornell University)|Nov 10, 2020
Human Pose and Action Recognition参考文献 25被引用 4
一句话总结

本论文提出了一种基于运动学引导的强化学习框架,用于从第一视角视频中进行3D自我姿态估计,通过在残差动作空间中结合运动学姿态估计器与基于物理的动力学模型,实现物理上合理的真人-物体交互。该方法在根节点和关节位置估计方面相比基线方法误差降低了31%–48%,尤其在漂移校正和真实世界场景下的泛化能力方面表现优异。

ABSTRACT

We propose a method for incorporating object interaction and human body dynamics into the task of 3D ego-pose estimation using a head-mounted camera. We use a kinematics model of the human body to represent the entire range of human motion, and a dynamics model of the body to interact with objects inside a physics simulator. By bringing together object modeling, kinematics modeling, and dynamics modeling in a reinforcement learning (RL) framework, we enable object-aware 3D ego-pose estimation. We devise several representational innovations through the design of the state and action space to incorporate 3D scene context and improve pose estimation quality. We also construct a fine-tuning step to correct the drift and refine the estimated human-object interaction. This is the first work to estimate a physically valid 3D full-body interaction sequence with objects (e.g., chairs, boxes, obstacles) from egocentric videos. Experiments with both controlled and in-the-wild settings show that our method can successfully extract an object-conditioned 3D ego-pose sequence that is consistent with the laws of physics.

研究动机与目标

  • 解决从单个第一人称视角摄像头图像中估计3D全身人体运动及人体-物体交互的挑战,其中身体常被遮挡。
  • 通过结合精确的运动学姿态估计与物理一致的动力学优化,克服纯运动学或纯动力学方法的局限性。
  • 将3D场景上下文(尤其是物体姿态)整合到强化学习的状态表示中,以提升交互预测性能。
  • 利用来自真实第一视角视频的单目视觉-惯性里程计(VIO)对齐的微调步骤,校正长时序交互中的模拟漂移。
  • 在真实世界、非受控环境(in-the-wild)中验证方法的泛化能力,此时缺乏真实3D姿态标注。

提出的方法

  • 使用预训练的运动学姿态估计器提供强初始姿态估计,作为强化学习策略的参考,使其预测相对于运动学模型输出的残差关节角,而非绝对关节目标。
  • 设计一种新型强化学习策略动作空间,输出对运动学模型输出的残差调整,从而实现更稳定和精确的策略学习。
  • 将6-DoF物体姿态作为强化学习智能体的状态输入,使策略具备物体感知能力,并基于场景交互上下文进行决策。
  • 在模拟环境中训练基于物理的动力学模型,其中人形机器人的运动由关节力矩控制,确保实现物理上合理的交互(如推、坐等)。
  • 通过VIO导出的相机运动对模拟结果进行微调,以校正模拟中全局根节点轨迹的漂移,使模拟运动与真实世界相机运动对齐。
  • 在微调阶段设计多组件奖励函数,包含头部位置/朝向/速度、运动学正则化以及动作平滑性,以稳定学习过程并提升动作的逼真度。

实验结果

研究问题

  • RQ1与纯运动学或纯动力学方法相比,混合式运动学引导的强化学习框架是否能提升从第一视角视频中估计3D自我姿态的准确性和物理合理性?
  • RQ2将3D物体姿态信息引入强化学习状态空间,对提升人体-物体交互估计的质量与真实性有何影响?
  • RQ3利用VIO数据进行微调的步骤在多大程度上能缓解模拟漂移,并提升对真实世界第一视角视频的泛化能力?
  • RQ4不同奖励组件(如头部跟踪、正则化)对最终姿态估计性能和运动平滑性有何影响?
  • RQ5所提出的方法能否在存在显著领域偏移的真实世界场景中实现泛化,即使在缺乏真实3D姿态标注的情况下?

主要发现

  • 所提出的残差动作表示相比直接预测PD目标的基线方法,将均方根误差(RMSE)降低了31%。
  • 消融实验表明,采用完整奖励设计(包含头部、运动学和动作正则化)的微调步骤误差最低:根位置RMSE为0.322,关节位置为0.788,速度为5.063。
  • 在真实世界场景评估中,该方法显著优于基线方法,尤其在涉及漂移的动作(如推、避障)中,根节点误差比次优方法降低了34%。
  • 微调后的策略成功校正了全局轨迹漂移,实现了对坐椅子或推箱子等复杂交互的可靠模拟。
  • 与基线方法相比,该方法生成的姿势序列显著更平滑(平滑度提升2.0倍),这一结果通过加速度和速度指标得到验证。
  • 尽管性能优异,但在真实世界数据中仍存在失败案例,主要由于初始姿态回归器输出质量差,导致生成不自然动作,微调阶段难以完全纠正。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。