[论文解读] Clustering Markov Decision Processes For Continual Transfer
本文提出一种聚类框架,通过选择一个最小的源MDP子集(构成ε-网),以紧凑方式表示大量先前求解的马尔可夫决策过程(MDP),使得每个原始MDP均存在一个源策略,其遗憾值小于ε。该研究引入了EXP-3-Transfer策略重用算法,并提出MHAV聚类算法,该算法基于一种新颖的MDP距离度量$ d_V $和代价函数$ g(\cdot) $,实现可证明收敛,且在高任务复杂度的监控任务中,显著提升了终身强化学习的样本效率。
We present algorithms to effectively represent a set of Markov decision processes (MDPs), whose optimal policies have already been learned, by a smaller source subset for lifelong, policy-reuse-based transfer learning in reinforcement learning. This is necessary when the number of previous tasks is large and the cost of measuring similarity counteracts the benefit of transfer. The source subset forms an `$ε$-net' over the original set of MDPs, in the sense that for each previous MDP $M_p$, there is a source $M^s$ whose optimal policy has $
研究动机与目标
- 为解决当先前求解的MDP数量庞大时,终身强化学习中的可扩展性挑战,特别是当相似性度量成本超过迁移收益时。
- 提出一种系统化的方法,选择一个最小且具代表性的源MDP子集(即ε-网),使得每个先前的MDP均存在一个遗憾值小于ε的源策略。
- 设计一种策略重用算法EXP-3-Transfer,以最优方式利用所选的源子集来学习新MDP中的策略。
- 构建一个聚类框架,其中包含一个可证明收敛的算法(MHAV),该算法基于策略相似性最小化代价函数。
- 在具有动态渗透模式的监控领域中验证该方法,结果表明在任务复杂度增加时,样本效率得到显著提升。
提出的方法
- 引入一种基于最优值函数差异的策略驱动MDP距离度量$ d_V $,用于衡量MDP之间的相似性。
- 定义代价函数$ g(\cdot) $,通过量化所选源子集在低遗憾下对原始MDP集合的覆盖程度,评估聚类质量。
- 提出MHAV算法,一种基于马尔可夫链蒙特卡洛的算法,利用Metropolis-Hastings采样探索聚类配置,并收敛至最优聚类。
- 在聚类配置上建立转移模型,采用详细的提议分布以实现合并、拆分及点在聚类间移动,确保细致平衡。
- 在MHAV中使用对称提议比,以维持细致平衡,确保收敛至聚类分布的平稳分布。
- 将聚类框架与EXP-3-Transfer集成,后者是一种上下文Bandit风格算法,可基于源子集中的策略实现带遗憾边界的学习。
实验结果
研究问题
- RQ1能否自动选择一个紧凑的先前求解MDP源子集,使得每个新MDP均存在一个遗憾值小于ε的源策略?
- RQ2如何形式化度量MDP之间的策略相似性,以指导有效的聚类?
- RQ3能否设计一种聚类算法,可证明收敛至最优或近似最优的源子集,以支持迁移学习?
- RQ4与朴素策略重用相比,所提出的聚类框架是否能提升终身强化学习中的样本效率?
- RQ5随着先前任务数量和复杂度的增加,整个系统(聚类 + EXP-3-Transfer)的性能如何变化?
主要发现
- 所提出的MHAV聚类算法收敛至聚类分布的平稳分布,确保了源MDP选择的可靠性。
- 在任务复杂度和先前任务数量增加的监控任务中,结合聚类的EXP-3-Transfer优于标准策略重用和Q-learning。
- 当先前任务数量和任务复杂度较低时,无聚类的策略重用表现更优,但随着复杂度上升,该优势逐渐减弱。
- 聚类框架通过紧凑表示大规模MDP集合,显著降低了相似性度量的计算成本。
- 累积奖励曲线显示,所提方法在高复杂度场景下表现占优,证实了聚类对终身迁移的增益。
- 时间对比结果表明,基于聚类的方法在复杂场景中保持了更低的学习时间与更小的方差。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。