[论文解读] Dynamics-Regulated Kinematic Policy for Egocentric Pose Estimation
这项工作将运动学与动力学以及场景上下文结合起来,利用单个头戴相机估计物理上合理的自我视角三维姿态,使用动力学调控的训练使运动学策略与在物理仿真中学习的通用人形控制器对齐。
We propose a method for object-aware 3D egocentric pose estimation that tightly integrates kinematics modeling, dynamics modeling, and scene object information. Unlike prior kinematics or dynamics-based approaches where the two components are used disjointly, we synergize the two approaches via dynamics-regulated training. At each timestep, a kinematic model is used to provide a target pose using video evidence and simulation state. Then, a prelearned dynamics model attempts to mimic the kinematic pose in a physics simulator. By comparing the pose instructed by the kinematic model against the pose generated by the dynamics model, we can use their misalignment to further improve the kinematic model. By factoring in the 6DoF pose of objects (e.g., chairs, boxes) in the scene, we demonstrate for the first time, the ability to estimate physically-plausible 3D human-object interactions using a single wearable camera. We evaluate our egocentric pose estimation method in both controlled laboratory settings and real-world scenarios.
研究动机与目标
- 激发并解决从单个前向摄像头估计物理上合理的自我视角全身姿态和对象交互的挑战。
- 从大量 MoCap 数据中学习一个通用的人形物理控制器,以模拟多样的人体动作。
- 提出一个动力学调控训练过程,将运动学、动力学和场景上下文紧密集成,以实现鲁棒的自我视角姿态估计。
- 证明对象上下文和场景约束如何提升绝对三维姿态和交互的真实感。
- 在受控的 MoCap 实验室数据和真实世界序列上进行评估,以展示在姿态和基于物理的度量指标上的改进。
提出的方法
- 从大量 MoCap 数据中学习一个通用的人形控制器(UHC),以在物理仿真器中模仿多样的人体动作。
- 开发一个面向对象的运动学策略,输出逐帧目标姿态,受视频证据和场景上下文引导。
- 引入动力学调控训练,将监督学习(运动学目标)与强化学习(通过仿真实现的物理合理性)相结合。
- 使用自回归的、以智能体为中心的运动学策略,融合初始场景上下文、对象状态和下一帧观测,以预测每一步的目标。
- 整合基于姿态的损失用于监督学习,以及基于物理的奖励,鼓励运动模仿和动力学一致性(通过 UHC)。
- 在测试时,在物理仿真器中展开运动学策略,使用 UHC 作为低层控制器以产生物理上合理的姿态。
实验结果
研究问题
- RQ1是否可以通过集成运动学、动力学和场景上下文,从单个前向摄像头估计出物理上合理的3D自我视角姿态和人–物体交互?
- RQ2在由面向对象的运动学策略引导下,学习得到的、任务无关的人形控制器是否能够在物理仿真器中实现对广泛人类动作的鲁棒模仿?
- RQ3与纯运动学或纯动力学方法相比,动力学调控训练是否提高对现实世界域偏移的鲁棒性并改善绝对姿态跟踪?
- RQ4将 6DoF 物体姿态和场景上下文纳入对自我视角姿态估计和交互真实感的影响如何?
主要发现
- 该方法能够从单个头戴相机估计出物理上合理的3D自我视角姿态和交互。
- 从 MoCap 学习得到的通用人形控制器可以在物理仿真器内模仿广泛的动作。
- 动力学调控训练将运动学、动力学与场景上下文协同,为提高鲁棒性和姿态准确性。
- 在 MoCap 数据集和真实世界数据上的实验显示,在姿态基于度量和物理基度量方面超过了最先进的方法。
- 该方法在场景中明确建模6DoF物体姿态,以实现现实的人与物体交互。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。