Skip to main content
QUICK REVIEW

[论文解读] Actor-critic versus direct policy search: a comparison based on sample complexity

Arnaud de Froissard de Broissia, Olivier Sigaud|arXiv (Cornell University)|Jun 29, 2016
Reinforcement Learning in Robotics参考文献 20被引用 9
一句话总结

本文在连续悬崖车基准任务上比较了深度确定性策略梯度(DDPG)——一种演员-评论家深度强化学习算法——与协方差矩阵自适应进化策略(CMA-ES)——一种直接策略搜索方法——的样本效率。DDPG展现出显著更优的样本效率,由于其使用了回放缓冲区和基于梯度的优化,因此在收敛过程中所需的环境交互次数远少于CMA-ES。尽管CMA-ES具备奖励加权机制,但其基于随机、无梯度的搜索方式仍不及DDPG高效。

ABSTRACT

Sample efficiency is a critical property when optimizing policy parameters for the controller of a robot. In this paper, we evaluate two state-of-the-art policy optimization algorithms. One is a recent deep reinforcement learning method based on an actor-critic algorithm, Deep Deterministic Policy Gradient (DDPG), that has been shown to perform well on various control benchmarks. The other one is a direct policy search method, Covariance Matrix Adaptation Evolution Strategy (CMA-ES), a black-box optimization method that is widely used for robot learning. The algorithms are evaluated on a continuous version of the mountain car benchmark problem, so as to compare their sample complexity. From a preliminary analysis, we expect DDPG to be more sample efficient than CMA-ES, which is confirmed by our experimental results.

研究动机与目标

  • 评估并比较先进策略优化算法在连续控制任务中的样本效率。
  • 探究类似DDPG的演员-评论家方法是否比CMA-ES等直接策略搜索方法更具样本效率。
  • 在受控基准环境中,分离出导致DDPG与CMA-ES之间样本效率差异的关键因素。
  • 为深度强化学习与黑箱优化在机器人学习场景下的相对性能提供实证证据。

提出的方法

  • 本研究采用连续版本的悬崖车问题作为策略优化的基准环境。
  • DDPG使用深度神经网络分别表示演员(策略)和评论家(价值函数),并通过回放缓冲区存储和重用经验转移。
  • DDPG采用目标网络和批量归一化以稳定训练,利用时序差分学习结合离策略更新。
  • CMA-ES通过随机、无梯度的优化执行直接策略搜索,基于多变量正态分布采样并根据性能更新策略参数。
  • 两种算法均使用相同的280参数神经网络策略表示,以确保公平比较。
  • 实验测量达到性能阈值所需的环境交互次数,结果在多次运行后取平均。

实验结果

研究问题

  • RQ1在连续控制任务中,DDPG是否比CMA-ES更具样本效率?
  • RQ2哪些特定的算法组件导致DDPG相比CMA-ES展现出更优的样本效率?
  • RQ3与基于随机、无梯度的搜索相比,DDPG中回放缓冲区和基于梯度的优化在数据复用和收敛速度方面表现如何?
  • RQ4演员-评论家方法中引入价值函数近似是否能减少达到收敛所需的环境交互次数?

主要发现

  • DDPG在连续悬崖车基准任务上实现收敛所需的环境交互次数显著少于CMA-ES,展现出更优的样本效率。
  • DDPG中使用的回放缓冲区能够有效重用已收集的经验,使策略更新无需额外的环境交互。
  • 与CMA-ES相比,DDPG在各次运行中表现出更低的方差,表明其学习动态更稳定、更可预测。
  • 尽管CMA-ES具备奖励加权机制,但DDPG中使用的解析梯度下降法仍比其近似自然梯度下降更有效。
  • DDPG中的评论家使策略改进无需重新评估轨迹,从而减少了对新环境样本的依赖。
  • 结果表明,类似DDPG的演员-评论家方法在样本受限的机器人学习场景中,比直接策略搜索更具优势。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。