Skip to main content
QUICK REVIEW

[论文解读] Discovered Policy Optimisation

Chris Xiaoxuan Lu, Jakub Grudzien Kuba|arXiv (Cornell University)|Oct 11, 2022
Machine Learning and Data Classification被引用 16
一句话总结

本文提出了一种通过镜像学习框架中的元学习发现的新型深度强化学习算法——发现策略优化(DPO)。通过使用进化策略元优化神经网络漂移函数,作者首先学习到一种名为学习到的策略优化(LPO)的算法,随后将其关键行为洞见——谨慎乐观与回滚机制——提炼为一种闭式、理论严谨的算法DPO。该算法在无需超参数调优的情况下,性能与LPO相当,并在Brax环境上优于PPO。

ABSTRACT

Tremendous progress has been made in reinforcement learning (RL) over the past decade. Most of these advancements came through the continual development of new algorithms, which were designed using a combination of mathematical derivations, intuitions, and experimentation. Such an approach of creating algorithms manually is limited by human understanding and ingenuity. In contrast, meta-learning provides a toolkit for automatic machine learning method optimisation, potentially addressing this flaw. However, black-box approaches which attempt to discover RL algorithms with minimal prior structure have thus far not outperformed existing hand-crafted algorithms. Mirror Learning, which includes RL algorithms, such as PPO, offers a potential middle-ground starting point: while every method in this framework comes with theoretical guarantees, components that differentiate them are subject to design. In this paper we explore the Mirror Learning space by meta-learning a "drift" function. We refer to the immediate result as Learnt Policy Optimisation (LPO). By analysing LPO we gain original insights into policy optimisation which we use to formulate a novel, closed-form RL algorithm, Discovered Policy Optimisation (DPO). Our experiments in Brax environments confirm state-of-the-art performance of LPO and DPO, as well as their transfer to unseen settings.

研究动机与目标

  • 通过自动化算法发现来解决手工设计的强化学习算法存在的超参数敏感性和鲁棒性不足等问题。
  • 在理论基础扎实的框架(特别是镜像学习)中探索算法发现,以确保收敛性和稳定性。
  • 通过漂移函数的元学习发现高性能、可泛化的强化学习算法,避免依赖人类直觉。
  • 将从基于神经网络的漂移函数中学习到的洞见提炼为简单、闭式表达的算法,以实现实际部署。

提出的方法

  • 使用进化策略(ES)在镜像学习框架中元学习漂移函数的神经网络参数化形式。
  • 在Brax环境的一个子集(具体为Ant)上训练漂移函数,以在多个随机种子下优化策略性能。
  • 分析学习到的LPO漂移函数,识别关键算法行为,如对高优势动作的谨慎乐观,以及对低奖励动作的回滚机制。
  • 推导出一种闭式、无参数的漂移函数——发现策略优化(DPO)——通过使用ReLU和tanh激活函数来复现LPO的关键行为。
  • 将DPO实现为仅两行的解析更新规则,其依赖于优势符号和动作奖励历史。
  • 在未见过的Brax环境和Minatar环境中评估LPO与DPO,以测试零样本泛化能力和鲁棒性。

实验结果

研究问题

  • RQ1在理论基础扎实的框架(如镜像学习)上进行元学习,是否能够发现超越手工设计基线的强化学习算法?
  • RQ2在学习到的漂移函数中,哪些行为模式会促进策略优化的改进?
  • RQ3能否从基于神经网络的、学习到的漂移函数中提炼出一种简单、闭式表达的算法,且不损失性能?
  • RQ4所发现的算法是否能在不进行超参数调优的情况下泛化到训练分布之外的环境?
  • RQ5元学习算法是否能在保持理论收敛保证的同时实现最先进性能?

主要发现

  • 学习到的策略优化(LPO)在Brax环境中实现了最先进性能,在所有评估任务中均优于PPO,且无需超参数调优。
  • 发现策略优化(DPO)在所有Brax环境中与LPO性能相当,并超越了PPO,尽管其为仅两行、闭式表达的解析更新规则。
  • DPO可泛化至Minatar环境,在使用PPO的调优超参数进行评估时仍保持强劲性能,展现出强大的零样本迁移能力。
  • 对LPO的分析揭示了两个关键行为特征:对高优势动作的谨慎乐观,以及对低奖励动作的回滚机制,这些是其成功的关键。
  • DPO的漂移函数被显式设计为通过ReLU和tanh组件重现这些特征,其中常数α=2,β=0.6,且满足镜像学习收敛所需的漂移条件。
  • LPO与DPO在不同随机种子下均表现出比PPO更高的稳定性,表明其对训练变异性具有更强的鲁棒性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。