Skip to main content
QUICK REVIEW

[论文解读] Efficient Deep Reinforcement Learning via Adaptive Policy Transfer

Tianpei Yang, Jianye Hao|arXiv (Cornell University)|Feb 19, 2020
Reinforcement Learning in Robotics参考文献 32被引用 5
一句话总结

本文提出了一种新颖的策略迁移框架(PTF),将多策略迁移建模为选项学习问题,实现在目标任务学习过程中自适应选择和动态终止源策略。通过与现有深度强化学习算法集成,PTF 显著加速了学习过程,并在离散和连续控制任务中均优于最先进迁移方法,且无需显式测量任务相似性。

ABSTRACT

Transfer Learning (TL) has shown great potential to accelerate Reinforcement Learning (RL) by leveraging prior knowledge from past learned policies of relevant tasks. Existing transfer approaches either explicitly computes the similarity between tasks or select appropriate source policies to provide guided explorations for the target task. However, how to directly optimize the target policy by alternatively utilizing knowledge from appropriate source policies without explicitly measuring the similarity is currently missing. In this paper, we propose a novel Policy Transfer Framework (PTF) to accelerate RL by taking advantage of this idea. Our framework learns when and which source policy is the best to reuse for the target policy and when to terminate it by modeling multi-policy transfer as the option learning problem. PTF can be easily combined with existing deep RL approaches. Experimental results show it significantly accelerates the learning process and surpasses state-of-the-art policy transfer methods in terms of learning efficiency and final performance in both discrete and continuous action spaces.

研究动机与目标

  • 解决现有策略迁移方法依赖显式任务相似性度量或假设源策略完全正确所带来的局限性。
  • 实现在目标任务学习过程中高效、自适应地重用多个源策略,且无需手动构建策略库。
  • 通过动态判断何时切换或终止使用源策略,防止负迁移。
  • 与现有深度强化学习算法无缝集成,包括基于值函数和基于策略的方法。
  • 在状态-动作空间较大的复杂环境中提升学习效率与最终性能。

提出的方法

  • 将策略迁移建模为选项学习问题,其中每个源策略对应一个具有独立策略和终止条件的选项。
  • 引入一个动态加权因子 f(βₒ,t),用于平衡目标策略的原始目标与所选源策略的模仿。
  • 使用标准深度强化学习算法(如 A3C 和 PPO)端到端学习选项策略与终止条件。
  • 将终止概率用作性能指标,避免对次优或有害源策略的长期利用。
  • 采用启发式机制根据当前有用性优先选择源策略,实现选项间的自动切换。
  • 形式化地将源策略知识作为辅助优化目标,即使无单一策略完全最优,也能实现部分知识迁移。

实验结果

研究问题

  • RQ1多策略迁移能否被有效建模为选项学习问题,以实现源策略的自适应重用?
  • RQ2框架如何动态选择并终止源策略使用,以防止负迁移?
  • RQ3所提方法能否在离散和连续控制任务中均提升学习效率与最终性能?
  • RQ4加权因子 f(βₒ,t) 如何影响目标策略优化与源策略模仿之间的平衡?
  • RQ5该框架在源策略仅部分有用的环境中具有多大程度的泛化能力?

主要发现

  • 与原始 DRL 方法相比,PTF 在离散控制任务(网格世界)和连续控制任务(Reacher)中均显著加速了学习过程。
  • 在网格世界环境中,即使源任务与目标任务仅部分相似,PTF 仍优于 deep-CAPS 及其他迁移基线方法。
  • 在 Reacher 任务中,PTF 获得了更高的平均折扣奖励,PTF-A3C 和 PTF-PPO 均持续优于 A3C 和 PPO 基线方法。
  • 消融实验表明,加权因子 f(βₒ,t) 至关重要:若无该因子,性能因过度依赖源策略模仿而下降。
  • 选项切换频率随时间减少,表明 PTF 成功学习到在适当时机识别并使用最有效的源策略。
  • 该框架在连续动作空间中具有良好泛化能力,且无需手动添加基础策略,与 deep-CAPS 不同。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。