[论文解读] SPOTTER: Extending Symbolic Planning Operators through Targeted Reinforcement Learning
SPOTTER 是一种框架,将符号规划与有针对性的强化学习相结合,当现有符号操作符不足以达成目标时,能自主发现并合成新的符号操作符。通过探索环境以找到使规划成为可能的子目标,SPOTTER 训练强化学习智能体学习这些新操作符的策略,随后将这些策略添加到符号领域中——相比纯强化学习,该方法在样本效率和迁移能力方面表现更优,且无需先验知识或成功计划轨迹。
Symbolic planning models allow decision-making agents to sequence actions in arbitrary ways to achieve a variety of goals in dynamic domains. However, they are typically handcrafted and tend to require precise formulations that are not robust to human error. Reinforcement learning (RL) approaches do not require such models, and instead learn domain dynamics by exploring the environment and collecting rewards. However, RL approaches tend to require millions of episodes of experience and often learn policies that are not easily transferable to other tasks. In this paper, we address one aspect of the open problem of integrating these approaches: how can decision-making agents resolve discrepancies in their symbolic planning models while attempting to accomplish goals? We propose an integrated framework named SPOTTER that uses RL to augment and support ("spot") a planning agent by discovering new operators needed by the agent to accomplish goals that are initially unreachable for the agent. SPOTTER outperforms pure-RL approaches while also discovering transferable symbolic knowledge and does not require supervision, successful plan traces or any a priori knowledge about the missing planning operator.
研究动机与目标
- 解决符号规划智能体因部分指定领域中缺少或错误的操作符而无法达成目标的挑战。
- 实现在缺乏对缺失操作符的先验知识或成功计划轨迹的情况下,自主发现新符号操作符及其底层控制器。
- 通过聚焦于使符号规划可行的子目标来引导探索,提升强化学习在符号规划中的样本效率与迁移能力。
- 以一种支持任务执行过程中动态合成操作符的方式,整合符号规划与强化学习。
- 开发一种框架,使智能体能够通过动态扩展其符号动作模型来适应未预期的情境。
提出的方法
- 智能体首先使用当前领域模型尝试符号规划以达成目标。
- 当无法找到可行计划时,一个在线探索器执行随机探索,以到达使符号规划成为可能的状态。
- 一旦到达此类子目标状态,便启动离线强化学习学习器,学习能够从相关前提条件可靠抵达该状态的策略。
- 强化学习学习器利用探索器生成的轨迹数据训练策略,并定期尝试推断其学习策略能获得高回报的符号前提条件。
- 若发现有效前提条件,则合成一个新的符号操作符,并将其连同这些前提条件添加到规划领域中。
- 该过程迭代进行:新操作符使新计划成为可能,循环持续直至达成目标或无法取得进一步进展。
实验结果
研究问题
- RQ1当当前模型不足以达成目标时,符号规划智能体如何能自主发现新操作符?
- RQ2在无法访问成功计划轨迹且缺乏对缺失操作符先验知识的情况下,能否利用强化学习学习可迁移的符号操作符?
- RQ3如何将探索聚焦于使符号规划可行的子目标,以提升样本效率?
- RQ4所合成的操作符在相同领域内的不同任务中可重用的程度如何?
- RQ5符号规划与强化学习的集成能否在部分指定领域中实现比纯强化学习更快的收敛速度与更优性能?
主要发现
- 在涉及门解锁与物体操作的网格世界益智谜题中,SPOTTER 在累积奖励和学习速率方面显著优于纯强化学习基线方法。
- 该框架成功发现原始领域模型中不存在的新符号操作符(如“将球移开”),从而实现了原本无法达成的目标。
- SPOTTER 学习到可迁移的符号知识:所合成的操作符具有泛化能力,可在新规划情境中重复使用。
- 通过聚焦于与目标达成结构相关的子目标,该方法实现了高样本效率,避免了随机探索。
- 由于无需成功计划轨迹或对缺失操作符的先验知识,SPOTTER 在动态、部分已知的现实环境中部署时表现出更强的鲁棒性。
- 在网格世界环境中的评估表明,SPOTTER 使智能体能够解决标准符号规划器或纯强化学习智能体无法处理的复杂谜题。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。