[论文解读] Adversarial Motion Priors Make Good Substitutes for Complex Reward Functions
本文提出使用从极少运动捕捉数据中学习到的对抗性运动先验,作为强化学习中复杂且手工设计的奖励函数的替代方案,用于足式机器人。通过使用这些数据驱动的风格奖励训练策略,该方法实现了自然、节能的运动,具备逼真的步态转换,并能有效迁移到真实世界中的四足机器人上,在效率和真实性方面优于无结构化奖励和手工设计的替代方案。
Training a high-dimensional simulated agent with an under-specified reward function often leads the agent to learn physically infeasible strategies that are ineffective when deployed in the real world. To mitigate these unnatural behaviors, reinforcement learning practitioners often utilize complex reward functions that encourage physically plausible behaviors. However, a tedious labor-intensive tuning process is often required to create hand-designed rewards which might not easily generalize across platforms and tasks. We propose substituting complex reward functions with "style rewards" learned from a dataset of motion capture demonstrations. A learned style reward can be combined with an arbitrary task reward to train policies that perform tasks using naturalistic strategies. These natural strategies can also facilitate transfer to the real world. We build upon Adversarial Motion Priors -- an approach from the computer graphics domain that encodes a style reward from a dataset of reference motions -- to demonstrate that an adversarial approach to training policies can produce behaviors that transfer to a real quadrupedal robot without requiring complex reward functions. We also demonstrate that an effective style reward can be learned from a few seconds of motion capture data gathered from a German Shepherd and leads to energy-efficient locomotion strategies with natural gait transitions.
研究动机与目标
- 解决在不依赖复杂且手工调校的奖励函数的情况下,在仿真中训练出真实、可迁移的足式机器人运动策略的挑战。
- 探究从少量运动捕捉数据中学习到的运动先验是否可作为强化学习中复杂奖励塑造的有效替代方案。
- 评估使用对抗性运动先验训练的策略在能量效率和真实性方面,相较于使用手工设计奖励或无风格正则化的策略的表现。
- 证明使用运动先验训练的策略能够泛化至真实世界部署,展现出自然的步态转换和稳定的速度跟踪性能。
提出的方法
- 利用对抗性运动先验(AMP)框架——一种类似生成对抗网络的结构——从仅4.5秒德国牧羊犬运动捕捉数据的小型数据集中学习风格奖励。
- 通过结合学习到的AMP风格奖励与简单的任务特定奖励(如速度跟踪),训练策略以同时促进任务表现和自然运动。
- 使用判别器网络最小化生成轨迹分布与参考运动数据集之间的皮尔逊散度,从而有效编码示范运动的“风格”。
- 通过强化学习训练策略,使用组合奖励:任务奖励 + 对抗性风格奖励,使策略能够学习到物理上合理且节能的行为。
- 将训练好的策略直接应用于真实四足机器人(A1)上,以评估其在真实世界中的可迁移性和性能表现。
- 通过分析步态转换、能耗(运输成本,Cost of Transport)和速度跟踪精度,评估运动的真实性和效率。

实验结果
研究问题
- RQ1从极少量运动捕捉数据中学习到的对抗性运动先验是否能有效替代训练运动策略时的复杂手工设计奖励函数?
- RQ2与使用标准或复杂奖励塑造训练的策略相比,使用运动先验训练的策略是否展现出更自然的步态转换和更真实的运动模式?
- RQ3与使用手工设计或无结构化奖励训练的策略相比,使用运动先验训练的策略是否能实现更高的能量效率(更低的运输成本)?
- RQ4策略在多大程度上能泛化至真实世界部署,同时在真实四足机器人上保持稳定性和跟踪性能?
主要发现
- 使用对抗性运动先验训练的策略相比使用手工设计奖励训练的策略,实现了更低的运输成本(COT),表明能量效率更高。
- 该策略能够根据指令速度自然地在不同步态之间转换,例如从慢走转换为快跑,与生物四足动物的运动方式高度相似。
- 尽管参考数据集仅包含4.5秒的运动数据,策略仍能成功跟踪广泛速度范围内的速度指令,包括数据集中未出现的速度。
- 在A1机器人上的真实世界部署表明,策略实现了稳定、自然的运动,具备精确的速度跟踪能力,且能耗波动极小。
- 当需要完成任务时,运动先验使策略能够有意义地偏离参考运动,展现出鲁棒性和适应性。
- AMP与简单任务奖励的结合,在能量效率和运动真实性方面,均优于复杂的手工设计奖励方案。

更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。