Skip to main content
QUICK REVIEW

[论文解读] Composing Entropic Policies using Divergence Correction

Jonathan J. Hunt, André Barreto|arXiv (Cornell University)|Dec 5, 2018
Reinforcement Learning in Robotics被引用 13
一句话总结

本文提出Divergence Correction(DC)方法,通过显式学习基础策略之间的Rényi散度来校正策略迁移过程中的策略不相容性,从而在强化学习中构建最大熵策略。DC在具有挑战性的迁移任务中优于先前方法(如Generalized Policy Improvement,GPI)和Compositional Optimism(CO),尤其在基础策略冲突时表现更优,并在连续控制环境中通过自适应重要性采样实现接近最优的性能。

ABSTRACT

Composing previously mastered skills to solve novel tasks promises dramatic improvements in the data efficiency of reinforcement learning. Here, we analyze two recent works composing behaviors represented in the form of action-value functions and show that they perform poorly in some situations. As part of this analysis, we extend an important generalization of policy improvement to the maximum entropy framework and introduce an algorithm for the practical implementation of successor features in continuous action spaces. Then we propose a novel approach which addresses the failure cases of prior work and, in principle, recovers the optimal policy during transfer. This method works by explicitly learning the (discounted, future) divergence between base policies. We study this approach in the tabular case and on non-trivial continuous control problems with compositional structure and show that it outperforms or matches existing methods across all tasks considered.

研究动机与目标

  • 解决现有策略组合方法在基础策略不相容时迁移学习失败的问题。
  • 将后继特征(successor features)和策略改进方法扩展至最大熵框架。
  • 开发一种实用算法,利用散度校正实现连续动作空间中的零样本迁移。
  • 证明DC在多样化迁移任务中能持续恢复最优或近似最优策略。
  • 在复杂且非平凡的控制环境中,将DC与CondQ和Compositional Optimism等现有方法进行比较。

提出的方法

  • 提出一种基于基础策略之间Rényi散度的新型校正项,用于在迁移过程中调整动作值函数。
  • 引入max-ent GPI,将GPI定理扩展至最大熵目标,以保证策略改进的理论保障。
  • 开发AISBP算法,利用自适应重要性采样在连续动作空间中训练DC和max-ent GPI模型。
  • 通过奖励函数的凸组合定义新的迁移任务,假设基础任务与迁移任务具有共享的转移动态。
  • 在最大熵框架中使用后继特征,以建模策略下预期的未来状态访问情况。
  • 实现一种启发式变体DC-Cheap,用于在完整散度估计计算成本过高时进行高效近似。

实验结果

研究问题

  • RQ1现有策略组合方法(如GPI和CO)在迁移学习中何时会失效?
  • RQ2基于散度的校正项是否能恢复基础策略冲突的迁移任务中的最优策略?
  • RQ3在具有组合结构的连续控制任务中,DC与CondQ和CO相比性能如何?
  • RQ4自适应重要性采样在多大程度上能支持高维动作空间中DC的有效训练?
  • RQ5DC在策略兼容与不兼容的场景下是否均能保持强性能?

主要发现

  • 在基础策略冲突的‘棘手’迁移任务中,DC在连续控制环境(如8自由度蚂蚁和5自由度机械臂)中持续优于GPI、CO和CondQ。
  • 在点质量‘棘手’任务中,DC恢复的迁移策略质量优于GPI和CO,轨迹收敛至最优蓝色方块。
  • DC-Cheap作为启发式近似,在大多数任务中表现接近完整DC,表明其具有较低计算成本下的实用价值。
  • 当受限于GPI时,DC-Cheap+GPI在点质量任务中仍表现出色,表明对近似误差具有鲁棒性。
  • 实证结果表明,CondQ比DC更难训练,且在训练过程中需要额外观测奖励嵌入ϕ。
  • 在基础策略不相容的任务场景中(附录图9),DC表现与GPI相当,显著优于CO,证明其能一致地恢复最优策略。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。