Skip to main content
QUICK REVIEW

[论文解读] Learning to Run with Actor-Critic Ensemble

Zhewei Huang, Shuchang Zhou|arXiv (Cornell University)|Dec 25, 2017
Reinforcement Learning in Robotics参考文献 3被引用 17
一句话总结

本文提出Actor-Critic Ensemble(ACE),一种通过使用多个智能体生成多样化动作、并在推理时通过评论家集成选择得分最高、最安全动作来增强深度确定性策略梯度(DDPG)的方法。ACE减少了导致跌倒的致命‘毁灭性动作’,提升了鲁棒性和性能——在100集环境中实现了39.26的平均奖励,仅跌倒4次,优于DDPG的0平均奖励和25次跌倒。

ABSTRACT

We introduce an Actor-Critic Ensemble(ACE) method for improving the performance of Deep Deterministic Policy Gradient(DDPG) algorithm. At inference time, our method uses a critic ensemble to select the best action from proposals of multiple actors running in parallel. By having a larger candidate set, our method can avoid actions that have fatal consequences, while staying deterministic. Using ACE, we have won the 2nd place in NIPS'17 Learning to Run competition, under the name of "Megvii-hzwer".

研究动机与目标

  • 解决DDPG中‘毁灭性动作’的问题,即单一智能体可能因不稳定性而选择导致不可逆跌倒的动作。
  • 通过在推理时从多样化候选动作集中选择动作,提升连续控制任务中的样本效率和鲁棒性。
  • 探索演员-评论家框架中的集成学习,利用异质性演员和评论家提升决策质量。
  • 在NIPS 2017《学习跑步》竞赛中取得优异表现,获得第二名。

提出的方法

  • 使用不同超参数独立训练多个演员-评论家对,以生成异质性演员。
  • 在推理时并行部署多个演员,同时提出动作,扩大动作候选集。
  • 使用评论家集成——将与演员配对的多个评论家输出进行平均——以评估并选择Q值最高的动作。
  • 在训练过程中修改贝尔曼更新方式,使即使未被选中的动作,其对应演员也能被更新,从而提升策略学习效率。
  • 采用缩放指数线性单元(SELU)作为激活函数,实证表明其性能优于ReLU、Leaky ReLU、Tanh和Sigmoid。
  • 使用更大的仿真时间步长(4倍),以加速训练并缓解长时序任务中的梯度消失问题。

实验结果

研究问题

  • RQ1通过避免致命的‘毁灭性动作’,演员-评论家集成是否能提升连续控制任务中的鲁棒性?
  • RQ2使用异质性演员和评论家是否能带来优于同质性或单策略DDPG的性能?
  • RQ3在长时序运动任务中,从多样化候选动作集中进行推理时的动作选择,是否能显著降低跌倒率?
  • RQ4与标准DDPG相比,基于集成的动作选择在平均和最大回合奖励方面表现如何?

主要发现

  • ACE采用10个演员和10个评论家(A10C10)时,平均奖励达到39.2579,显著高于DDPG(A1C0)的32.0789。
  • 跌倒次数从A1C0的25次降至A10C10的4次,证明了鲁棒性的显著提升。
  • 最大回合奖励从A1C0的41.4203提升至A10C10的41.9507,表明性能上限得到增强。
  • 相比相同或基于训练周期的模型,使用异质性演员和评论家带来了更好的性能,支持了集成多样性带来的优势。
  • ACE训练阶段与推理阶段性能相近,表明策略学习在训练和推理阶段均保持稳定。
  • SELU激活函数在训练稳定性和最终性能方面均优于ReLU、Leaky ReLU、Tanh和Sigmoid。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。