[论文解读] Single-Agent Policy Tree Search With Guarantees
本论文提出了两种策略引导的树搜索算法——LevinTS 和 LubyTS——在单智能体规划中提供了节点扩展数的理论保证。利用 A3C 训练的神经网络策略,LevinTS 在 Sokoban 游戏中表现卓越,以更少的节点扩展数和更短的解序列解决了全部 1,000 个关卡,优于当前最先进的启发式规划器(LAMA)。
We introduce two novel tree search algorithms that use a policy to guide search. The first algorithm is a best-first enumeration that uses a cost function that allows us to prove an upper bound on the number of nodes to be expanded before reaching a goal state. We show that this best-first algorithm is particularly well suited for `needle-in-a-haystack' problems. The second algorithm is based on sampling and we prove an upper bound on the expected number of nodes it expands before reaching a set of goal states. We show that this algorithm is better suited for problems where many paths lead to a goal. We validate these tree search algorithms on 1,000 computer-generated levels of Sokoban, where the policy used to guide the search comes from a neural network trained using A3C. Our results show that the policy tree search algorithms we introduce are competitive with a state-of-the-art domain-independent planner that uses heuristic search.
研究动机与目标
- 解决蒙特卡洛树搜索(MCTS)在确定性、稀疏奖励的单智能体问题中的局限性,此类问题中启发式引导至关重要,但缺乏理论边界。
- 通过引入具有正式性能保证的策略引导搜索,弥合经典规划(具有启发式保证)与强化学习(具有策略学习)之间的鸿沟。
- 开发能够利用学习到的策略减少搜索开销,同时保持解时间理论边界的算法。
- 在具有挑战性的 PSPACE-难问题领域——Sokoban 上验证该方法,使用通过 A3C 训练的神经策略。
提出的方法
- LevinTS 使用由策略引导的最优优先搜索策略,其代价函数可确保在到达目标前节点扩展数的严格上界。
- LubyTS 采用基于 Luby 序列的随机采样策略,为找到任意解前的期望节点扩展数提供上界。
- 两种算法均以策略作为输入,其中策略定义了动作序列的概率,从而实现依赖于成功路径可能性的边界。
- 策略通过在 1,000 个计算机生成的 Sokoban 关卡数据集上使用 A3C 强化学习获得。
- 搜索在动作序列的树上进行,节点表示动作历史,仅在转移时识别目标状态。
- 理论保证基于策略下成功动作序列的概率质量推导,确保性能边界独立于启发式质量。
实验结果
研究问题
- RQ1策略引导的树搜索能否在确定性单智能体问题中提供搜索努力的可证明边界?
- RQ2在解质量与搜索效率方面,策略引导搜索与最先进的启发式规划器(如 LAMA)相比表现如何?
- RQ3通过深度强化学习(A3C)学习到的策略是否能在仅在最简单关卡上训练的情况下,仍为树搜索提供有效引导?
- RQ4当使用策略而非启发式函数时,能否推导出节点扩展数的理论边界?
- RQ5在解的数量较少与较多的问题中,所提出的两种算法——LevinTS(最优优先)与 LubyTS(采样型)——在有效性上存在何种差异?
主要发现
- LevinTS 成功解决了全部 1,000 个 Sokoban 关卡,平均每关卡扩展 168 个节点,显著低于 LAMA 每关卡 200–1,000 个节点的扩展数。
- LevinTS 找到的解在移动次数上明显更短,表明其解质量更优。
- LubyTS(32 步边界,即 LubyTS (256, 32))实现了超过 90% 的成功率,优于 LubyTS (256, 1) 和 LubyTS (256, 32)(32 步边界),显示出对解长度估计的敏感性。
- LubyTS (256, 32) 的性能与 multiTS (200, 100) 相当,后者使用人工调校的解长度上界,尽管 LubyTS 仅依赖学习到的策略。
- LevinTS 在 1% 噪声下,总节点扩展数为 999,成功解决所有关卡,优于 I2A(一种混合型无模型/有模型规划器),后者在 95% 的关卡上平均需 4,000 个节点扩展。
- 训练期间策略对更难关卡的覆盖不足,并未阻碍 LevinTS 解决这些关卡,因为该算法通过系统性搜索进行了补偿,显示出对策略局限性的鲁棒性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。