[论文解读] LAGOON: Language-Guided Motion Control
LAGOON 是一个多阶段框架,通过首先使用运动扩散模型生成人类运动,然后在仿真环境中训练强化学习(RL)策略以模仿该运动,最后将策略部署到真实的四足机器人上,从而根据自然语言指令生成物理上逼真的机器人运动。该方法成功使真实机器人狗在接收到“扔个球”指令时能够站起来并挥动前肢,展示了在领域随机化和混合奖励设计下稳健的仿真到现实的迁移能力。
We aim to control a robot to physically behave in the real world following any high-level language command like "cartwheel" or "kick". Although human motion datasets exist, this task remains particularly challenging since generative models can produce physically unrealistic motions, which will be more severe for robots due to different body structures and physical properties. Deploying such a motion to a physical robot can cause even greater difficulties due to the sim2real gap. We develop LAnguage-Guided mOtion cONtrol (LAGOON), a multi-phase reinforcement learning (RL) method to generate physically realistic robot motions under language commands. LAGOON first leverages a pretrained model to generate a human motion from a language command. Then an RL phase trains a control policy in simulation to mimic the generated human motion. Finally, with domain randomization, our learned policy can be deployed to a quadrupedal robot, leading to a quadrupedal robot that can take diverse behaviors in the real world under natural language commands
研究动机与目标
- 使机器人能够对高层级自然语言指令(如“后空翻”或“踢”)做出物理上逼真的运动响应。
- 解决当源运动为合成生成、可能包含不现实姿态或缺失帧时,生成物理上合理机器人运动的挑战。
- 通过在仿真环境中使用领域随机化训练控制策略并部署到真实四足机器人,弥合仿真到现实的差距。
- 设计一种结合对抗奖励与状态误差奖励的奖励机制,以确保语义一致性与精细的运动模仿。
- 通过单一统一的流程,实现对不同机器人形态(包括人形和四足机器人)的泛化能力。
提出的方法
- 首先,使用预训练的运动扩散模型(MDM)根据给定的语言指令生成人类运动。
- 将生成的人类运动重定向到机器人骨骼上,生成语义对齐但物理上不现实的目标运动。
- 在物理仿真环境中训练强化学习策略,通过结合对抗奖励与状态误差奖励的混合奖励函数,模仿目标运动。
- 奖励函数使用评论家网络评估语义相似性,同时通过状态误差部分在关键帧处强制实现精确对齐。
- 在训练过程中应用领域随机化,以提升鲁棒性并实现成功的仿真到现实迁移。
- 最终策略部署到真实四足机器人上,仅使用上半身重定向以确保物理安全与稳定。
实验结果
研究问题
- RQ1语言条件的运动扩散模型是否能有效用于生成机器人控制的目标运动,即使这些运动在物理上不现实?
- RQ2如何训练强化学习策略以模仿合成的、可能包含错误的目标运动(如缺失帧或不可能姿态)?
- RQ3何种奖励设计能够实现在机器人控制模仿学习中,既保证高层语义一致性,又实现精细的运动保真度?
- RQ4单一统一的流程是否能为多样化机器人形态(如人形和四足机器人)生成稳健的控制策略?
- RQ5在仿真环境中使用领域随机化训练的策略,在多大程度上能成功部署到真实世界四足机器人上,以实现复杂语言引导行为?
主要发现
- 四足机器人成功响应“那个人扔个球”这一指令,站起来并挥动前肢,证明了 LAGOON 策略在真实世界中的部署成功。
- 消融实验证明,对抗奖励与状态误差奖励均不可或缺:缺少任一奖励,机器人都无法正确站立或移动前肢。
- 混合初始化策略使机器人能够学会从俯卧姿势站立,而无此策略则无法实现。
- 该方法在多种重定向策略中均表现出泛化能力,实现了仅用后肢行走后退或后退奔跑同时抬起手臂等行为。
- 定量评估显示,LAGOON 在人形和四足机器人上的运动统计指标上均优于所有强化学习基线方法。
- 真实世界实验确认,尽管仿真与现实之间存在动力学差异,但使用领域随机化训练的策略仍实现了稳定且物理上合理的运动行为。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。