[论文解读] Transfer of Deep Reactive Policies for MDP Planning
本文提出 ToRPIDo,一种用于 RDDL 表示的 MDP 规划的领域无关迁移学习框架。通过利用符号化状态结构、转移函数以及图卷积网络来学习与实例无关的状态嵌入,该方法实现了近乎零样本的策略迁移——仅需在新实例上微调动作解码器——相比从零开始训练或最先进的强化学习迁移方法,实现了显著更快的学习速度和更优的性能。
Domain-independent probabilistic planners input an MDP description in a factored representation language such as PPDDL or RDDL, and exploit the specifics of the representation for faster planning. Traditional algorithms operate on each problem instance independently, and good methods for transferring experience from policies of other instances of a domain to a new instance do not exist. Recently, researchers have begun exploring the use of deep reactive policies, trained via deep reinforcement learning (RL), for MDP planning domains. One advantage of deep reactive policies is that they are more amenable to transfer learning. In this paper, we present the first domain-independent transfer algorithm for MDP planning domains expressed in an RDDL representation. Our architecture exploits the symbolic state configuration and transition function of the domain (available via RDDL) to learn a shared embedding space for states and state-action pairs for all problem instances of a domain. We then learn an RL agent in the embedding space, making a near zero-shot transfer possible, i.e., without much training on the new instance, and without using the domain simulator at all. Experiments on three different benchmark domains underscore the value of our transfer algorithm. Compared against planning from scratch, and a state-of-the-art RL transfer algorithm, our transfer solution has significantly superior learning curves.
研究动机与目标
- 为解决领域无关的概率规划中问题实例间有效策略迁移的不足。
- 实现在同一领域内等大小 MDP 实例之间快速、近乎零样本的深度反应策略迁移。
- 利用 RDDL 中的符号化结构(状态变量、连接性、转移函数)学习状态与状态-动作对的共享、与实例无关的表示。
- 通过使用基于模型的组件(转移模型、实例分类器)在 RDDL 模型上进行训练,减少迁移过程中对环境滚动(rollouts)的依赖。
- 在学习效率和最终性能上均优于从零开始训练和最先进的强化学习迁移算法。
提出的方法
- 使用图卷积网络(GCNs)基于 RDDL 定义的状态连接结构,将符号化状态编码为共享的、与实例无关的嵌入。
- 在共享嵌入空间中训练一个深度强化学习智能体(A3C),以学习可在不同问题实例间迁移的策略。
- 引入一个动作解码器,将与实例无关的状态-动作嵌入映射到与实例相关的具体动作,实现无需重训练主策略的迁移。
- 利用 RDDL 转移函数在嵌入空间中训练一个与实例无关的转移模型,以加速动作解码器的训练。
- 采用对抗性训练的实例分类器,以促使嵌入空间对实例身份保持不变,从而提升泛化能力。
- 通过直接将策略、状态编码器、转移模型和实例分类器迁移到新实例上,仅微调动作解码器来完成迁移。
实验结果
研究问题
- RQ1能否为 RDDL 中的 MDP 规划设计一种领域无关的迁移算法,实现在同一领域内不同问题实例间的有效策略迁移?
- RQ2在 RDDL 中,符号化结构(状态连接性、转移函数)在多大程度上可被利用来学习状态与状态-动作对的共享、与实例无关的表示?
- RQ3与完整微调或现有迁移方法相比,仅微调动作解码器的近乎零样本迁移效果如何?
- RQ4各架构组件(GCN、动作解码器、转移模型、实例分类器)对整体迁移性能的增量贡献是什么?
- RQ5所提出方法是否能在学习曲线上实现显著更快的收敛速度,并在最终性能上超越从零开始训练或最先进的强化学习迁移算法?
主要发现
- 与从零开始训练(A3C)和最先进的强化学习迁移方法(A2T)相比,ToRPIDo 在所有训练步骤中均展现出显著更优的学习曲线,获得更高的奖励。
- 该模型展现出强大的近乎零样本迁移能力:在初始化阶段(α(0)),ToRPIDo 平均达到 α ≈ 0.5,表明其从高绩效状态开始训练,而基线方法则从接近 α = 0 的状态开始。
- 消融研究显示,仅使用基于 GCN 的状态编码器即可优于原始 A3C,但动作解码器和转移模型对实现快速近乎零样本迁移至关重要。
- 实例分类器在早期训练中提供了显著性能提升,但其增量收益迅速衰减,最终性能仅比 A3C+GCN+SAD 变体略高。
- 在 IPPC 竞赛的三个基准领域中,ToRPIDo 均持续优于基线方法,且在早期训练阶段性能差距最为显著。
- 该方法在迁移过程中无需任何仿真器调用,仅依赖 RDDL 模型和预训练组件即可实现有效迁移。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。