Skip to main content
QUICK REVIEW

[论文解读] Universal Humanoid Motion Representations for Physics-Based Control

Zhengyi Luo, Jinkun Cao|arXiv (Cornell University)|Oct 6, 2023
Human Pose and Action Recognition被引用 4
一句话总结

该论文提出了PULSE,一种用于基于物理的人形控制的通用运动表征,通过变分信息瓶颈方法,将预训练的运动模仿器中的多样化运动技能提炼到一个概率潜在空间中。通过联合学习一种本体感觉条件化的先验分布,PULSE 实现了高效、稳定且自然的运动生成,在地形穿越和VR运动追踪等多样化任务中,显著提升了分层强化学习的采样效率与性能。

ABSTRACT

We present a universal motion representation that encompasses a comprehensive range of motor skills for physics-based humanoid control. Due to the high dimensionality of humanoids and the inherent difficulties in reinforcement learning, prior methods have focused on learning skill embeddings for a narrow range of movement styles (e.g. locomotion, game characters) from specialized motion datasets. This limited scope hampers their applicability in complex tasks. We close this gap by significantly increasing the coverage of our motion representation space. To achieve this, we first learn a motion imitator that can imitate all of human motion from a large, unstructured motion dataset. We then create our motion representation by distilling skills directly from the imitator. This is achieved by using an encoder-decoder structure with a variational information bottleneck. Additionally, we jointly learn a prior conditioned on proprioception (humanoid's own pose and velocities) to improve model expressiveness and sampling efficiency for downstream tasks. By sampling from the prior, we can generate long, stable, and diverse human motions. Using this latent space for hierarchical RL, we show that our policies solve tasks using human-like behavior. We demonstrate the effectiveness of our motion representation by solving generative tasks (e.g. strike, terrain traversal) and motion tracking using VR controllers.

研究动机与目标

  • 解决现有运动表征空间覆盖范围有限的问题,这些空间通常在狭窄、专业化的数据集上进行训练,难以泛化到复杂或自由形式的运动任务。
  • 通过学习一个紧凑且表达能力强的潜在空间,以克服强化学习中直接运动学控制的低效与不稳定性,实现分层控制。
  • 通过复用单一统一的运动先验,使下游任务(如VR控制器运动追踪和复杂地形穿越)无需从零开始重新训练。
  • 通过学习一个结构化、本体感觉条件化的先验,提升强化学习中的采样效率与探索能力,从而实现更高效、更稳定的运动生成。
  • 证明单一运动表征可同时支持生成任务(如地形穿越)和估计任务(如运动追踪),且保持高保真度与稳定性。

提出的方法

  • 在大规模非结构化运动数据集(如AMASS)上训练运动模仿器,以从运动学序列中学习高保真的人体运动。
  • 使用带有变分信息瓶颈的变分自编码器,将运动模仿器中的运动技能直接蒸馏到低维潜在空间中,以确保概率建模。
  • 设计编码器-解码器架构,其中解码器将潜在码映射为关节轨迹,编码器将观测到的运动映射为潜在码。
  • 联合训练一个基于本体感觉(当前姿态与速度)条件化的可学习先验,以指导采样并提升下游强化学习中的探索效率。
  • 将该先验作为分层强化学习中的残差动作,使高层策略能够从结构化、物理上合理的运动空间中采样。
  • 应用正则化损失($\mathcal{L}_{\text{regu}}$),以惩罚连续潜在码之间的大偏离,确保潜在空间的连续性与紧凑性。

实验结果

研究问题

  • RQ1能否学习到一个单一、统一的运动表征,覆盖从步行、舞蹈等狭窄领域之外的广泛人类运动技能?
  • RQ2如何使基于物理的运动表征在下游强化学习中既具有表现力又高效,特别是在需要自由形式或复杂运动的任务中?
  • RQ3本体感觉条件化的先验在分层强化学习中如何提升采样效率与稳定性?
  • RQ4从预训练的模仿器中进行在线蒸馏,在无需任务特定微调的情况下,能在多大程度上实现对多样化运动风格的覆盖?
  • RQ5所学习的潜在空间能否在高保真度与真实性下,同时支持生成任务(如地形穿越)和估计任务(如VR控制器运动追踪)?

主要发现

  • 在完整框架(包含可学习先验、正则化与联合训练)下,PULSE 在具有挑战性的VR控制器追踪任务中实现了93.4%的成功率,显著优于缺少这些组件的消融实验。
  • 引入正则化项($\mathcal{L}_{\text{regu}}$)后,平均全局MPJPE误差降低至88.6毫米,相比无正则化的基线,成功率提升了46.5个百分点。
  • 结合残差动作使用所学习的先验,运动追踪的成功率达到71.0%,而使用固定高斯先验时仅为18.1%,证明其在探索中的关键作用。
  • 与ASE、CALM和HuMoR等基线方法相比,PULSE 生成的运动更自然、更多样化,且更少出现不合理的动作,经定性与定量比较验证。
  • 使用完整PULSE框架训练后,平均MPJPE误差降至67.7毫米,速度误差降至14.9,表明在运动追踪中具有高保真度。
  • 该方法可加快分层强化学习的收敛速度:使用PULSE潜在空间训练的策略比从零开始训练收敛更快,如图5中的成功率曲线所示。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。