[论文解读] Learning Motion Priors for 4D Human Body Capture in 3D Scenes
本文提出 LEMO 方法,通过从 AMASS 数据集学习运动先验,提升在复杂 3D 场景中从单目 RGB(D) 视频进行 4D 人体捕捉的性能。通过结合数据驱动的运动平滑先验与通过实例自监督学习训练的接触感知运动补全器,LEMO 有效减少了抖动和脚滑伪影,实现了比以往方法更平滑、更自然且对遮挡更具鲁棒性的运动重建。
Recovering high-quality 3D human motion in complex scenes from monocular videos is important for many applications, ranging from AR/VR to robotics. However, capturing realistic human-scene interactions, while dealing with occlusions and partial views, is challenging; current approaches are still far from achieving compelling results. We address this problem by proposing LEMO: LEarning human MOtion priors for 4D human body capture. By leveraging the large-scale motion capture dataset AMASS, we introduce a novel motion smoothness prior, which strongly reduces the jitters exhibited by poses recovered over a sequence. Furthermore, to handle contacts and occlusions occurring frequently in body-scene interactions, we design a contact friction term and a contact-aware motion infiller obtained via per-instance self-supervised training. To prove the effectiveness of the proposed motion priors, we combine them into a novel pipeline for 4D human body capture in 3D scenes. With our pipeline, we demonstrate high-quality 4D human body capture, reconstructing smooth motions and physically plausible body-scene interactions. The code and data are available at https://sanweiliti.github.io/LEMO/LEMO.html.
研究动机与目标
- 为解决在复杂 3D 场景中从单目 RGB(D) 序列重建高质量、自然的人体运动的挑战,其中遮挡和部分视角会降低重建质量。
- 减少现有单目捕捉流水线(如 PROX)中常见的运动抖动和脚滑伪影。
- 通过联合建模接触动力学与全身运动,提升 4D 重建中人体与场景交互的逼真度与物理合理性。
- 开发一种自监督的、基于实例的微调策略,将通用运动补全器适配到具有部分观测的特定测试实例。
- 通过数据驱动的先验,弥合单目 RGB(D) 捕捉与高端标记式运动捕捉系统之间的性能差距。
提出的方法
- 一个全卷积自编码器在潜在空间中学习运动平滑先验,捕捉大范围时空感受野内的整体全身动力学。
- 使用表面标记而非关节点表示人体运动,从而更好地建模肢体旋转与自由度。
- 在 AMASS 上训练接触感知运动补全器,联合预测身体运动与脚与地面的接触状态,以减少脚滑伪影。
- 采用基于实例的自监督微调方案,通过仅在可见身体部位上最小化损失,将预训练补全器适配到测试序列。
- 引入受物理启发的接触摩擦项,进一步正则化脚与地面的相互作用,提升物理合理性。
- 采用多阶段优化流程,整合运动先验、接触建模与 SMPL-X 拟合,以重建平滑、准确且对遮挡具有鲁棒性的 4D 人体运动。
实验结果
研究问题
- RQ1从大规模动捕数据中学习的数据驱动运动平滑先验是否能显著减少抖动并提升单目 4D 人体运动重建的时间一致性?
- RQ2在 AMASS 上训练的接触感知运动补全器是否能有效重建被遮挡的身体部位,同时保持逼真的脚与地面交互并减少滑动伪影?
- RQ3对运动补全器进行基于实例的自监督微调是否能相比固定先验,实现对具有部分观测的个体测试序列更优的适应?
- RQ4将运动先验与接触建模相结合,是否能显著提升复杂 3D 场景中人体与场景交互的逼真度与物理合理性?
- RQ5所提出的流水线是否能仅使用单目 RGB(D) 输入,实现与标记式动捕系统相当的运动重建质量?
主要发现
- 所提出的运动平滑先验在 PROX 和 3DPW 数据集上均有效减少了运动抖动并提升了重建质量,MPJPE、MPMPE 和 PVE 指标均有可测量的提升。
- 接触感知运动补全器优于启发式接触规则,显著降低了脚滑比率,并在被遮挡身体部位上实现了更低的重建误差(MPJPE-L 和 MPMPE-L)。
- 自监督的基于实例微调在完整身体与被遮挡身体指标上均持续提升性能,证明了其对个体测试实例的有效适应能力。
- 当集成到流水线中时,运动补全器显著提升了 2D 关节点精度,并在 PROX 数据集上降低了 PSKL 和非碰撞得分,优于基线方法。
- 改变阶段顺序的消融实验表明,当将补全器应用于抖动的 PROX 输出时性能失败,证实了在补全前进行运动平滑至关重要。
- 消融研究确认,接触感知补全器与自监督微调均为关键组件,移除任一均导致性能显著下降。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。