Skip to main content
QUICK REVIEW

[论文解读] CAMPs: Learning Context-Specific Abstractions for Efficient Planning in Factored MDPs

Rohan Chitnis, Tom Silver|arXiv (Cornell University)|Jul 26, 2020
AI-based Problem Solving and Planning被引用 7
一句话总结

该论文提出上下文相关抽象MDP(CAMPs),一种基于学习的方法,通过自设约束诱导上下文相关独立性(CSIs),在因子化MDP中提升规划效率。通过训练上下文选择器以优化奖励与计算成本之间的权衡,CAMPs在多种领域中实现更快、近似最优的规划,优于基线规划器和机器人导航与操作任务中的领域特定算法。

ABSTRACT

Meta-planning, or learning to guide planning from experience, is a promising approach to improving the computational cost of planning. A general meta-planning strategy is to learn to impose constraints on the states considered and actions taken by the agent. We observe that (1) imposing a constraint can induce context-specific independences that render some aspects of the domain irrelevant, and (2) an agent can take advantage of this fact by imposing constraints on its own behavior. These observations lead us to propose the context-specific abstract Markov decision process (CAMP), an abstraction of a factored MDP that affords efficient planning. We then describe how to learn constraints to impose so the CAMP optimizes a trade-off between rewards and computational cost. Our experiments consider five planners across four domains, including robotic navigation among movable obstacles (NAMO), robotic task and motion planning for sequential manipulation, and classical planning. We find planning with learned CAMPs to consistently outperform baselines, including Stilman's NAMO-specific algorithm. Video: https://youtu.be/wTXt6djcAd4 Code: https://git.io/JTnf6

研究动机与目标

  • 解决复杂因子化MDP中在线规划的高计算成本问题。
  • 通过利用自设约束诱导的上下文相关独立性(CSIs)来提升规划效率。
  • 学习一个上下文选择器,以优化规划奖励与计算成本之间的权衡。
  • 在包括机器人导航、序列操作和经典规划在内的多样化领域中实现泛化。
  • 证明学习施加上下文比直接学习反应式策略更具通用性和有效性。

提出的方法

  • 该方法提出上下文相关抽象MDP(CAMPs),通过移除由约束诱导的无关变量,对原始因子化MDP进行抽象化。
  • 通过监督学习或模仿学习训练上下文选择器,基于先前规划经验的训练数据,预测给定任务的最优约束。
  • 上下文选择器被训练以最大化一个加权目标,该目标平衡期望回报与计算成本,由λ参数化。
  • 从训练任务中识别出CSIs,由此生成的CAMPs用于在测试时高效规划。
  • 该方法使用由上下文诱导的变量无关性导出的结构化抽象假设空间,实现在无需完整求解MDP的情况下高效规划。
  • 在CAMPs上评估多种规划器(如蒙特卡洛树搜索、FastDownward、任务-运动规划器),以检验其通用性与鲁棒性。

实验结果

研究问题

  • RQ1规划中的自设约束是否能诱导出显著降低规划复杂度的上下文相关独立性?
  • RQ2学习到的上下文选择器在奖励与计算效率方面是否优于手工设计或领域特定的规划器?
  • RQ3在复杂因子化MDP中,学习预测有用约束是否比学习反应式策略具有更好的泛化能力?
  • RQ4不同上下文选择下,奖励与规划成本之间的权衡如何变化?是否能有效优化?
  • RQ5CAMPs是否能在具有离散与连续状态、关系结构及稀疏奖励的多样化领域中有效应用?

主要发现

  • 在通用任务与运动规划器下,CAMPs在奖励与规划速度方面均优于Stilman的领域特定NAMO算法。
  • 在NAMO领域中,CAMPs学习到的上下文约束使目标达成速度更快、回报更高,即使存在多个等效路径,也优于基线方法。
  • 在所有λ值下,CAMP策略的目标值始终高于随机策略,而纯规划方法在λ增大时性能显著下降。
  • 在包括经典规划与序列操作在内的四个领域中,使用学习到的CAMPs进行规划始终优于基线规划器。
  • 该方法在奖励与计算成本之间实现了良好平衡,回报值在纯规划(λ=0)与随机动作选择(λ→∞)之间平滑插值。
  • 即使在稀疏奖励与长规划时域的复杂环境中,上下文选择器仍能成功识别出有用的约束,展现出超越训练数据的泛化能力。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。