Skip to main content
QUICK REVIEW

[论文解读] Evolving Rewards to Automate Reinforcement Learning

Aleksandra Faust, Anthony Francis|arXiv (Cornell University)|May 18, 2019
Reinforcement Learning in Robotics参考文献 26被引用 22
一句话总结

该论文提出 AutoRL,一种基于进化强化学习的框架,通过将奖励调优视为超参数优化,实现了奖励工程的自动化。该框架在参数化奖励函数上采用基于种群的搜索来演化代理奖励,在复杂 MuJoCo 任务中相比人工调优和超参数调优基线模型性能显著提升——最高达 489% 的改进,尤其在 Humanoid 任务中使用 SAC 时表现突出。

ABSTRACT

Many continuous control tasks have easily formulated objectives, yet using them directly as a reward in reinforcement learning (RL) leads to suboptimal policies. Therefore, many classical control tasks guide RL training using complex rewards, which require tedious hand-tuning. We automate the reward search with AutoRL, an evolutionary layer over standard RL that treats reward tuning as hyperparameter optimization and trains a population of RL agents to find a reward that maximizes the task objective. AutoRL, evaluated on four Mujoco continuous control tasks over two RL algorithms, shows improvements over baselines, with the the biggest uplift for more complex tasks. The video can be found at: \url{https://youtu.be/svdaOFfQyC8}.

研究动机与目标

  • 自动化连续控制任务中繁琐的奖励塑造过程,该过程目前需要大量人工调优。
  • 解决稀疏或结构不良的奖励带来的挑战,这些挑战会阻碍高维控制任务中的样本高效学习。
  • 通过自动优化发现有效的代理奖励,减少对人工设计的多目标奖励的依赖。
  • 评估进化奖励搜索是否能在多种强化学习算法和任务上超越传统的超参数调优和人工奖励工程。
  • 证明优化更简单、单任务目标(如行进距离)可产生与基于复杂标准回报训练的策略相当的性能。

提出的方法

  • 应用进化算法(EA)在参数化奖励函数上进行搜索,将奖励权重视为需优化的超参数。
  • 并行训练一组强化学习智能体,每个智能体使用来自标准环境奖励参数化版本的不同奖励配置。
  • 使用任务目标(如行进距离、达到的高度)或标准回报作为适应度信号,评估并选择表现最佳的奖励配置。
  • 通过变异和选择等进化策略优化奖励参数,基于智能体性能迭代改进奖励函数。
  • 将演化后的奖励集成到标准强化学习算法(SAC 和 PPO)中进行训练,实现与人工调优及超参数调优基线的端到端比较。
  • 在基于任务目标和标准回报训练的策略之间进行交叉评估,以评估泛化能力和性能一致性。

实验结果

研究问题

  • RQ1在连续控制任务中,自动化进化奖励设计方法是否能超越人工奖励塑造和超参数调优?
  • RQ2优化更简单、单任务目标(如行进距离)是否能产生与基于复杂多目标标准回报训练的策略性能相当的策略?
  • RQ3在样本效率和最终策略性能方面,AutoRL 的奖励搜索与传统超参数调优相比如何?
  • RQ4AutoRL 是否能在不同强化学习算法(SAC 与 PPO)和环境(Ant、Walker2D、HumanoidStandup、Humanoid)之间实现泛化?
  • RQ5在相同训练预算下,演化后的奖励是否能带来更快的收敛速度和更高质量的策略,优于基线方法?

主要发现

  • 在 Humanoid 任务中,使用 SAC 优化单任务目标(行进距离)时,AutoRL 相较于超参数调优实现了 489% 的性能提升。
  • 在单任务目标上使用 AutoRL 训练的策略性能与基于标准多目标回报训练的策略相当,显著减少了复杂奖励工程的需求。
  • 在所有四个 MuJoCo 环境中,AutoRL 均优于人工调优和超参数调优的基线模型,尤其在更复杂的任务中提升最大。
  • 对于 SAC,AutoRL 实现了最快且最稳定的训练过程,智能体达到更高的平均回报,并表现出优于 PPO 基线的更强行为一致性。
  • 在 HumanoidStandup 任务中,只有 AutoRL 搭配 SAC 的方法能够完全站立,而其他方法仅能实现稳定的下蹲姿态,表明其策略质量更优。
  • 交叉评估表明,基于任务目标优化的策略在标准回报评估中也表现出良好泛化能力,证实了简单目标可有效代理复杂奖励函数。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。