[论文解读] Learning Agile Locomotion via Adversarial Training
该论文提出了一种对抗性训练框架,其中四足机器人通过追逐一组专门化的逃逸对手来学习敏捷的运动能力,采用协方差矩阵自适应-进化策略(CMA-ES)迭代优化策略。仅经过三轮进化后,该方法生成的控制器在追逐速度、平衡性和对未见对手的泛化能力方面显著优于基线方法和当前最先进的多智能体强化学习算法。
Developing controllers for agile locomotion is a long-standing challenge for legged robots. Reinforcement learning (RL) and Evolution Strategy (ES) hold the promise of automating the design process of such controllers. However, dedicated and careful human effort is required to design training environments to promote agility. In this paper, we present a multi-agent learning system, in which a quadruped robot (protagonist) learns to chase another robot (adversary) while the latter learns to escape. We find that this adversarial training process not only encourages agile behaviors but also effectively alleviates the laborious environment design effort. In contrast to prior works that used only one adversary, we find that training an ensemble of adversaries, each of which specializes in a different escaping strategy, is essential for the protagonist to master agility. Through extensive experiments, we show that the locomotion controller learned with adversarial training significantly outperforms carefully designed baselines.
研究动机与目标
- 为解决在无需大量手动设计奖励函数或环境的情况下,为腿式机器人设计敏捷运动控制器的挑战。
- 探究在追逐者与逃逸智能体之间进行对抗性自博弈,是否能自然地诱导出敏捷、动态的运动行为。
- 评估与策略专业化对手组成的集合进行训练,是否相比单个对手或基线设置,能提升泛化能力和鲁棒性。
- 证明进化策略(如CMA-ES)能够在演员-critic方法失效的多智能体对抗环境中,有效训练复杂的运动策略。
- 展示所得到的控制器能够良好泛化至未见过的对手和复杂轨迹,优于精心设计的基线方法。
提出的方法
- 该方法采用多智能体对抗设置,其中四足机器人(主角)学习追逐目标,而目标(对手)学习逃逸,从而形成协同进化训练过程。
- 主角的策略通过CMA-ES进行优化,这是一种无梯度的进化策略,基于累积奖励表现,对策略参数的高斯分布进行采样与更新。
- 为防止过拟合,该方法训练一组对手,每个对手专注于一种特定的逃逸策略(例如:侧向闪避、突然停止),以确保训练场景的多样性和挑战性。
- 训练过程被解耦:追逐与逃逸行为被迭代训练以稳定学习,因为MADDPG和MATD3等演员-critic方法在此联合学习设置中失效。
- 奖励函数被设计为鼓励速度、接近度和成功捕获,不使用折扣因子(γ = 1),以聚焦于长时程性能。
- 泛化性通过在训练中未见过的对手上测试主角来评估,使用捕获率、跌倒率、与目标的距离以及航向误差等指标。
实验结果
研究问题
- RQ1在无需手动奖励塑造的情况下,追逐者与逃逸智能体之间的对抗性自博弈是否能诱导出敏捷、动态的运动行为?
- RQ2与单个对手训练相比,使用策略专业化对手集合进行训练是否能产生更鲁棒且更具泛化能力的运动策略?
- RQ3所提出的基于CMA-ES的对抗性训练方法在性能和泛化能力方面,与精心设计的基线环境及当前最先进的多智能体强化学习算法相比如何?
- RQ4所学控制器在泛化至训练集中未出现的对手策略和复杂轨迹方面,其泛化程度如何?
- RQ5为何基于演员-critic的多智能体强化学习方法(如MADDPG和MATD3)在此多智能体运动设置中失效,而进化策略能否克服这些局限?
主要发现
- 仅经过三轮对抗性训练后,主角便学会了敏捷步态,能够实现高速、稳定的追逐,其在追逐速度和平衡性方面全面优于所有基线方法。
- 使用对手集合训练的控制器在未见对手上实现了98%的捕获率,显著优于次佳基线(π_single的51%捕获率)。
- 在沿复杂正弦和之字形轨迹的追逐任务中,对抗策略的平均航向误差(θ)为0.14弧度,而最佳基线为0.47弧度,表明其具备更优的跟踪精度。
- 该方法在未见对手测试中将跌倒率降低至0%,而基线方法每100轮最多出现11次跌倒,展现出更高的稳定性和鲁棒性。
- 使用单个对手(π_single)训练导致过拟合,因其依赖快速奔跑捕获目标,但在曲线轨迹上表现失败,凸显了使用集合对手对泛化能力的必要性。
- 对抗性训练方案使主角掌握了诸如突然停止和急转弯等复杂动作,这些动作在基线环境中即使经过精心设计也未能学习到。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。