Skip to main content
QUICK REVIEW

[论文解读] Solving Hard AI Planning Instances Using Curriculum-Driven Deep Reinforcement Learning

Dieqiao Feng, Carla P. Gomes|arXiv (Cornell University)|Jun 4, 2020
AI-based Problem Solving and Planning参考文献 19被引用 6
一句话总结

本文提出了一种基于课程学习的深度强化学习框架,通过在逐步复杂的子问题上进行训练,并利用带有价值网络的蒙特卡洛树搜索(MCTS)引导规划,成功解决了此前无法求解的高难度Sokoban规划实例——这些实例此前对最先进的基于搜索的规划器而言是不可行的。该方法在一天的训练时间内即完成求解,优于针对需超过200步解法的实例设计的专用求解器。

ABSTRACT

Despite significant progress in general AI planning, certain domains remain out of reach of current AI planning systems. Sokoban is a PSPACE-complete planning task and represents one of the hardest domains for current AI planners. Even domain-specific specialized search methods fail quickly due to the exponential search complexity on hard instances. Our approach based on deep reinforcement learning augmented with a curriculum-driven method is the first one to solve hard instances within one day of training while other modern solvers cannot solve these instances within any reasonable time limit. In contrast to prior efforts, which use carefully handcrafted pruning techniques, our approach automatically uncovers domain structure. Our results reveal that deep RL provides a promising framework for solving previously unsolved AI planning problems, provided a proper training curriculum can be devised.

研究动机与目标

  • 解决当前组合搜索方法无法处理的高难度、此前未解的AI规划实例的挑战。
  • 通过设计逐步复杂的子问题课程,克服单智能体深度强化学习在规划中缺乏正向奖励信号的问题。
  • 证明深度强化学习可自动发现领域结构,而无需手工设计的剪枝技术。
  • 通过渐进式学习与价值函数蒸馏,在Sokoban等PSPACE完全问题中实现有效的泛化与规划。
  • 探究通过课程学习训练的深度网络是否能捕捉有意义的问题结构,并引导MCTS实现长而复杂的解法。

提出的方法

  • 该框架使用从原始高难度Sokoban实例衍生出的、逐步复杂的子问题课程,从更小的箱子配置开始。
  • 对于每个课程层级,使用自我对弈和蒙特卡洛模拟训练深度Q网络,以预测状态的价值(到目标的距离)。
  • 训练好的价值网络用于引导蒙特卡洛树搜索(MCTS)求解课程中更复杂的下一级问题。
  • 通过MCTS模拟生成的数据对网络进行微调,使其能泛化到未见过但可解的棋盘状态。
  • 设计课程进展路径,使小规模子问题的解法为更大问题的求解提供信息与引导,从而缩小搜索空间。
  • 通过将较大问题的网络初始化为较小问题训练所得策略的权重,实现跨层级的知识迁移。

实验结果

研究问题

  • RQ1基于课程学习的深度强化学习能否求解现有组合搜索方法无法处理的高难度AI规划实例?
  • RQ2深度强化学习智能体在训练期间无法获得正向奖励信号的情况下,如何学习求解长时域规划问题?
  • RQ3在子问题课程上训练的深度神经网络,能在多大程度上泛化以求解完整的原始问题实例?
  • RQ4所学的价值函数是否捕捉了规划领域中具有意义的结构性特征,如到目标的距离和动作质量?
  • RQ5在从较小问题实例向较大问题实例迁移知识时,该框架是否能避免灾难性遗忘?

主要发现

  • 所提出的基于课程学习的深度强化学习框架成功求解了一个包含16个箱子、需超过200步的高难度Sokoban实例,此前的专用求解器在任何合理时间限制内均未能求解。
  • 该方法在一天的训练时间内即获得解法,表明在先前未解的实例上,其性能显著优于现有的基于搜索的规划器。
  • 从8个箱子课程学习到的价值网络在初始配置附近的状态中,对到目标距离的预测表现出强劲性能,表明其有效捕捉了问题结构。
  • 在随机放置的8个箱子子问题上,泛化能力较弱,表明网络更关注MCTS模拟中频繁访问的状态,而非所有可能状态。
  • 在从8个箱子向16个箱子问题迁移时,网络表现出灾难性遗忘的迹象,对未见过状态的策略与价值预测性能下降。
  • 尽管如此,来自较小子问题的知识集合仍使系统能够求解原始的、此前未解的16个箱子实例,证明了课程学习在复杂规划领域中的强大能力。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。