Skip to main content
QUICK REVIEW

[论文解读] Context-Aware Policy Reuse

Siyuan Li, Fangda Gu|arXiv (Cornell University)|Jun 11, 2018
Reinforcement Learning in Robotics参考文献 38被引用 9
一句话总结

本文提出上下文感知策略复用(CAPS),一种无模型的多策略迁移学习方法,能够根据上下文状态动态选择并复用源策略,同时学习最优的复用时机与终止时机。CAPS在网格世界和Pygame环境中的表现均优于当前最先进方法,收敛速度更快,性能更优,并具备最优性与收敛性的理论保证。

ABSTRACT

Transfer learning can greatly speed up reinforcement learning for a new task by leveraging policies of relevant tasks. Existing works of policy reuse either focus on only selecting a single best source policy for transfer without considering contexts, or cannot guarantee to learn an optimal policy for a target task. To improve transfer efficiency and guarantee optimality, we develop a novel policy reuse method, called Context-Aware Policy reuSe (CAPS), that enables multi-policy transfer. Our method learns when and which source policy is best for reuse, as well as when to terminate its reuse. CAPS provides theoretical guarantees in convergence and optimality for both source policy selection and target task learning. Empirical results on a grid-based navigation domain and the Pygame Learning Environment demonstrate that CAPS significantly outperforms other state-of-the-art policy reuse methods.

研究动机与目标

  • 为解决强化学习迁移学习中单策略复用效率低下的问题。
  • 实现在目标任务中基于上下文动态选择多个源策略进行复用。
  • 为源策略选择与目标策略学习提供理论收敛性与最优性保证。
  • 通过调用-返回执行模型支持时序扩展的策略复用。
  • 在无需环境模型或源策略表示先验知识的前提下,提升迁移效率。

提出的方法

  • CAPS学习一个源策略选择策略,根据当前状态上下文决定复用哪个源策略。
  • 它联合学习每个源策略的终止函数,以控制复用何时结束。
  • 该方法采用调用-返回执行模型,以支持时序扩展的策略复用。
  • CAPS通过引入原始策略扩展动作空间,确保完备性,并在源策略不足时支持导航。
  • 通过共享经验,实现对多个源策略的并发Q值更新,提升样本效率。
  • 该方法为无模型且对源策略表示无感,无需对转移函数或目标结构作任何假设。

实验结果

研究问题

  • RQ1多策略复用方法能否根据上下文状态动态选择最合适的源策略,从而提升迁移效率?
  • RQ2学习最优复用时机与终止函数是否能带来目标任务中更快的收敛速度与更优性能?
  • RQ3CAPS能否在不依赖环境模型先验知识的前提下,实现策略学习的理论最优性保证?
  • RQ4当多个源策略部分有用时,CAPS相较于单策略复用及其他最先进迁移方法表现如何?
  • RQ5当仅一个源策略有益时,CAPS与单策略基线相比性能保持程度如何?

主要发现

  • 在基于网格的导航与Pygame学习环境中,CAPS显著优于当前最先进策略复用方法,尤其在多个源策略均有用时表现更优。
  • 在多个有用源策略的情境下,CAPS的学习速度更快,最终性能优于PRQL、OPS-TL及其他基线方法。
  • 当仅一个源策略有益时,CAPS的性能与单策略复用方法相当或更优,展现出强鲁棒性。
  • CAPS学习到最优的源策略选择策略,通过时序扩展复用,减少对原始动作的依赖,加速收敛。
  • 即使源策略质量不佳或参差不齐,该方法仍能保持理论收敛性与最优性保证,与Q-learning相当。
  • 实验结果表明,CAPS在许多状态下选择有用策略的概率高于选择最优原始动作,从而提升学习速度。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。