[论文解读] An Optimal Online Method of Selecting Source Policies for Reinforcement Learning
本文提出了一种最优在线方法,用于在强化学习中选择源策略,通过将源策略选择建模为多臂赌博机(MAB)问题,并将策略复用引入Q-learning。该方法在确保收敛至最优策略的同时,实现了高效且理论基础坚实的迁移学习,在速度和鲁棒性方面优于先前的PRQL方法,尤其在源知识无关或次优时表现更优。
Transfer learning significantly accelerates the reinforcement learning process by exploiting relevant knowledge from previous experiences. The problem of optimally selecting source policies during the learning process is of great importance yet challenging. There has been little theoretical analysis of this problem. In this paper, we develop an optimal online method to select source policies for reinforcement learning. This method formulates online source policy selection as a multi-armed bandit problem and augments Q-learning with policy reuse. We provide theoretical guarantees of the optimal selection process and convergence to the optimal policy. In addition, we conduct experiments on a grid-based robot navigation domain to demonstrate its efficiency and robustness by comparing to the state-of-the-art transfer learning method.
研究动机与目标
- 解决在缺乏任务相似性先验知识的情况下,强化学习中在线源策略选择的挑战。
- 通过在学习过程中动态选择仅具用的源策略,防止负迁移。
- 在通过策略复用实现知识迁移的同时,保持Q-learning的理论收敛性保证。
- 开发一种对无关源策略具有鲁棒性的方法,确保持续探索并实现最优收敛。
- 提出一种理论基础坚实、自适应的源策略选择方法,优于现有启发式或非收敛方法。
提出的方法
- 将在线源策略选择建模为多臂赌博机(MAB)问题,其中每个源策略被视为一个老虎机臂。
- 通过策略复用增强Q-learning,使智能体在训练期间能够利用先前学习到的策略。
- 采用探索概率 $ p_t $ 递减的ε-greedy策略,确保所有状态-动作对被无限次访问。
- 通过基于估计回报动态调整选择源策略的概率,实现探索与利用的动态平衡。
- 通过确保充分探索和有界学习率,保持与标准Q-learning相同的理论收敛特性。
- 将策略复用集成到Q-learning更新规则中,使智能体在适用时能够使用源策略输出初始化Q值。
实验结果
研究问题
- RQ1能否将在线源策略选择建模为多臂赌博机问题,以实现最优、自适应的策略复用?
- RQ2在Q-learning中引入策略复用后,是否能保持理论收敛性保证的同时加速学习?
- RQ3当源策略次优或无关时,所提方法与PRQL相比表现如何?
- RQ4当贪婪策略被某源策略超越时,该方法是否仍能保证收敛至最优策略?
- RQ5在无任何源策略有用的环境中,该算法行为如何?是否能避免过早收敛?
主要发现
- 所提方法在所有测试的目标任务中均比PRQL实现更快的学习收敛速度,且平均评估奖励更高。
- 当无任何源策略相关时(例如目标位于不同房间),该方法性能与标准Q-learning相当,而PRQL因过早收敛而停滞。
- 通过基于递减 $ ho_t $ 的ε-greedy策略,算法保持持续探索,即使在源策略具有误导性时,也能确保收敛至最优策略。
- 在高度相似任务($ heta_s $)上,PRQL在10次运行中有2次收敛至次优策略,而所提方法始终持续探索,避免了过早收敛。
- 当源策略有用时,该方法成功实现知识迁移;当源策略无用时,又能避免负迁移,展现出鲁棒性与适应性。
- 实证结果证实,该方法在加速迁移与非迁移场景下均能实现近似最优性能,验证了其理论保证。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。