Skip to main content
QUICK REVIEW

[论文解读] Importance mixing: Improving sample reuse in evolutionary policy search methods

Aloïs Pourchot, Nicolas Perrin|arXiv (Cornell University)|Aug 17, 2018
Reinforcement Learning in Robotics参考文献 23被引用 11
一句话总结

本文提出了一种增强的重要度混合机制,以提升进化策略搜索中的样本重用效率,将其扩展至重用多个先前世代的样本。尽管标准重要度混合显著提升了样本效率,但扩展版本仅带来微小增益;即使在高重用率(约90%)下,进化方法仍远不如深度强化学习样本高效,尽管在稀疏奖励设置下更具稳定性。

ABSTRACT

Deep neuroevolution, that is evolutionary policy search methods based on deep neural networks, have recently emerged as a competitor to deep reinforcement learning algorithms due to their better parallelization capabilities. However, these methods still suffer from a far worse sample efficiency. In this paper we investigate whether a mechanism known as "importance mixing" can significantly improve their sample efficiency. We provide a didactic presentation of importance mixing and we explain how it can be extended to reuse more samples. Then, from an empirical comparison based on a simple benchmark, we show that, though it actually provides better sample efficiency, it is still far from the sample efficiency of deep reinforcement learning, though it is more stable.

研究动机与目标

  • 探究重要度混合是否能显著提升深度神经进化方法的样本效率。
  • 将原始重要度混合机制扩展至重用多个先前世代的样本,而不仅限于前一个世代。
  • 通过实验评估扩展重要度混合对不同进化策略样本效率的影响。
  • 在样本效率与稳定性方面,对比增强重要度混合的进化方法与最先进的深度强化学习方法(如DDPG)的性能。
  • 探讨在样本效率差距持续存在的前提下,结合进化方法与深度强化学习方法的可行性。

提出的方法

  • 本文引入一个教学性框架以理解重要度混合,通过根据当前策略下样本的似然性对先前策略生成的轨迹进行加权,实现样本重用。
  • 提出一种扩展方法,可重用多个先前世代的样本,按顺序逐步整合,直至新世代完成。
  • 该方法对过去世代的样本应用重要度加权,根据当前策略与过去策略分布之间的差异调整其贡献。
  • 该方法在连续控制基准任务上进行了评估,包括Continuous CartPole和一个稀疏奖励变体(ContinuousCartPoleHard),使用ES变体如SNES和Open-ES。
  • 样本重用率量化为一个比例(最高约90%),性能通过时间步或评估次数内的平均回报衡量。
  • 为保证公平性,与一种最先进的深度强化学习算法DDPG进行对比,采用相同的网络架构和超参数。

实验结果

研究问题

  • RQ1重要度混合是否能显著提升进化策略搜索方法的样本效率?
  • RQ2将重要度混合扩展至重用多个先前世代的样本,是否能显著优于仅重用前一个世代?
  • RQ3与深度强化学习算法(如DDPG)相比,增强重要度混合的进化策略在样本效率上表现如何?
  • RQ4重要度混合带来的样本效率提升是否足以缩小与深度强化学习在收敛速度上的差距?
  • RQ5在哪些环境(尤其是稀疏奖励设置)下,进化方法能优于或与深度强化学习保持竞争力?

主要发现

  • 标准重要度混合在进化策略搜索中显著提升了样本效率,减少了达到收敛所需的评估次数。
  • 扩展的重要度混合机制(重用多个先前世代的样本)相较于标准重要度混合仅带来微小的额外增益。
  • 尽管样本重用率约为90%,在密集奖励的Continuous CartPole环境中,进化方法(snes + EIM)的收敛速度仍比DDPG慢约10倍。
  • 在稀疏奖励环境(ContinuousCartPoleHard)中,DDPG在100万时间步后无法取得进展,而进化方法仍持续改进,凸显了进化方法在该类设置下的稳定性和鲁棒性。
  • 即使采用先进的样本重用技术,进化方法与深度强化学习之间在样本效率上的差距依然显著,表明样本效率并非唯一瓶颈。
  • 结果表明,未来研究应聚焦于结合进化与深度强化学习方法的混合框架,而非直接比较,因为仅靠重要度混合无法独立弥合效率差距。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。