[论文解读] Learning Agile Skills via Adversarial Imitation of Rough Partial Demonstrations
本文提出WASABI,一种基于Wasserstein GAN的对抗性模仿学习方法,使敏捷四足机器人能够从粗糙、不完整且与机器人物理上不兼容的人类示范中学习复杂技能(如后空翻)。通过利用来自手持动作的状态-动作转移的对抗性训练,该方法推断出与任务无关的奖励函数,从而生成可在仿真到现实环境中部署的鲁棒、高性能策略。
Learning agile skills is one of the main challenges in robotics. To this end, reinforcement learning approaches have achieved impressive results. These methods require explicit task information in terms of a reward function or an expert that can be queried in simulation to provide a target control output, which limits their applicability. In this work, we propose a generative adversarial method for inferring reward functions from partial and potentially physically incompatible demonstrations for successful skill acquirement where reference or expert demonstrations are not easily accessible. Moreover, we show that by using a Wasserstein GAN formulation and transitions from demonstrations with rough and partial information as input, we are able to extract policies that are robust and capable of imitating demonstrated behaviors. Finally, the obtained skills such as a backflip are tested on an agile quadruped robot called Solo 8 and present faithful replication of hand-held human demonstrations.
研究动机与目标
- 解决在缺乏专家示范或示范与机器人物理上不兼容时,学习高度动态机器人技能的挑战。
- 通过从最少且不完美的示范中推断有意义的奖励,减少强化学习中对手动设计奖励函数的依赖。
- 仅使用部分手持人类运动数据,无需专家策略或完整状态轨迹,实现敏捷行为的仿真到现实迁移。
- 通过使用Wasserstein GAN框架减轻模式崩溃并提升训练稳定性,从而提高策略的鲁棒性和泛化能力。
提出的方法
- 采用Wasserstein GAN(WASABI)框架,其中判别器区分来自粗糙示范的专家式状态-动作转移与策略生成的转移。
- 将判别器的输出作为奖励信号,通过强化学习训练策略,实现在无专家动作可用情况下的模仿。
- 采用基于转移的输入方式,使用状态-动作对序列(时间跨度H)以提升时间一致性并减少模式崩溃。
- 引入与任务无关的正则化项(如静止奖励、速度跟踪)以在无特定任务奖励时稳定学习。
- 采用最小二乘Gan(LSGAN)基线进行对比,证明Wasserstein框架在处理不完整和噪声示范时的优越性。
- 通过条件观测空间修改和奖励塑造,将框架扩展至主动速度控制和单次翻滚执行。
实验结果
研究问题
- RQ1生成对抗性模仿学习方法能否从粗糙、不完整且与机器人物理上不兼容的人类示范中推断出有效的奖励函数?
- RQ2在无专家动作的情况下,LSGAN与Wasserstein GAN损失的选择如何影响策略学习性能与鲁棒性?
- RQ3在仅使用不完整或手持示范训练的策略,能在多大程度上泛化至真实世界中的敏捷机器人行为(如后空翻)?
- RQ4判别器的观测时间跨度(H)如何影响在部分示范下模仿学习的策略收敛性与性能?
- RQ5通过额外的奖励塑造(如速度跟踪、静止奖励),能否在无专家示范的情况下实现对运动时长和着陆稳定性控制?
主要发现
- WASABI成功仅从人类执行动作的手持式、不完整示范中学习到后空翻策略,且这些示范与四足机器人在物理上不兼容。
- 该方法在真实世界的Solo 8四足机器人上忠实复现了人类示范,动态时间归一化(DTW)距离表明轨迹对齐度高。
- 使用Wasserstein GAN框架训练的策略在仿真和真实部署中均优于LSGAN基线,尤其在处理不完整或噪声示范时表现更优。
- 更长的判别器观测时间跨度(H=8)在站立和后空翻等任务中提升了策略收敛性与性能,减少了模式崩溃并增强了时间一致性。
- 通过利用人类示范数据中的速度变化,成功实现了主动速度控制,使机器人能够按需调节运动速度。
- 通过修改策略的观测空间以检测翻滚完成状态,并应用静止奖励,成功实现了单次翻滚执行,显著提升了着陆姿态的稳定性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。