Skip to main content
QUICK REVIEW

[论文解读] Diversity-Enriched Option-Critic

Anand Kamat, Doina Precup|arXiv (Cornell University)|Nov 4, 2020
Reinforcement Learning in Robotics参考文献 31被引用 6
一句话总结

本文提出多样性增强型选项评论家(DEOC),一种端到端强化学习方法,通过引入基于信息论的内在奖励和一种新颖的终止目标,增强选项评论家框架,以促进选项之间的行为多样性。该方法在离散和连续控制任务中显著优于选项评论家和PPO,生成鲁棒、可解释且可重用的选项。

ABSTRACT

Temporal abstraction allows reinforcement learning agents to represent knowledge and develop strategies over different temporal scales. The option-critic framework has been demonstrated to learn temporally extended actions, represented as options, end-to-end in a model-free setting. However, feasibility of option-critic remains limited due to two major challenges, multiple options adopting very similar behavior, or a shrinking set of task relevant options. These occurrences not only void the need for temporal abstraction, they also affect performance. In this paper, we tackle these problems by learning a diverse set of options. We introduce an information-theoretic intrinsic reward, which augments the task reward, as well as a novel termination objective, in order to encourage behavioral diversity in the option set. We show empirically that our proposed method is capable of learning options end-to-end on several discrete and continuous control tasks, outperforms option-critic by a wide margin. Furthermore, we show that our approach sustainably generates robust, reusable, reliable and interpretable options, in contrast to option-critic.

研究动机与目标

  • 解决选项评论家框架中的选项坍塌问题,即多个选项学习到相同或冗余的行为。
  • 通过内在动机鼓励多样、与任务相关的选项策略,提升探索效率和学习效率。
  • 设计一种终止目标,以维持对多样化选项的探索,而非允许某一选项过早主导。
  • 在无需显式奖励塑形或手动设计启动集的情况下,学习可重用、可解释且鲁棒的选项。
  • 在离散和连续控制任务中实现最先进性能,同时保持选项的可解释性。

提出的方法

  • 引入基于信息论的内在奖励,以鼓励学习到的选项策略之间的多样性,促进对不同行为策略的探索。
  • 提出一种基于选项价值比较的新型终止目标,通过延迟次优选项的终止来维持探索,防止其过早主导。
  • 将内在多样性奖励与标准任务奖励结合,联合优化任务性能与选项多样性。
  • 采用基于梯度的策略学习方法,在无模型设置下端到端训练选项策略和终止函数。
  • 采用多选项策略梯度框架,使每个选项在最大化任务回报与多样性激励的联合目标下进行训练。
  • 将该方法应用于标准控制基准测试,包括MuJoCo环境和表格任务,证明其在不同领域的泛化能力。

实验结果

研究问题

  • RQ1基于行为多样性的内在奖励是否能改善选项评论家框架中的选项学习?
  • RQ2一种在训练期间保留次优选项的新型终止目标,是否能带来更鲁棒、更多样化的选项集合?
  • RQ3选项策略的多样性是否能提升复杂控制任务中的样本效率和最终性能?
  • RQ4所学习的选项在迁移学习场景中在多大程度上保持可解释性和可重用性?
  • RQ5与选项评论家和PPO相比,该方法在性能、鲁棒性和选项质量方面表现如何?

主要发现

  • 所提出的方法TDEOC在所有评估的连续控制任务中均达到最先进性能,优于选项评论家和PPO。
  • 在TMaze迁移任务中,TDEOC在目标改变后仍优于选项评论家,表现出更强的鲁棒性和适应性。
  • 可视化结果表明,TDEOC中的选项终止点定位于决策点——如TMaze中的垂直走廊或Hopper-v2中的空中状态——表明其行为具有直观的目标导向性。
  • 在OneRoom环境中,一个选项学习扫描房间,另一个选项则导航至目标,证实了选项发展出互补且可解释的角色。
  • 该方法在无需手动奖励塑形或显式启动集设计的情况下,始终生成多样化、可靠且可重用的选项。
  • 实证结果证实,内在多样性奖励与新型终止目标共同提升了探索效率,并有效防止了选项坍塌。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。