[论文解读] Scalable Online Planning via Reinforcement Learning Fine-Tuning
本文提出了一种可扩展的在线规划方法,该方法在推理时通过强化学习微调预训练策略网络,替代了传统的表格化搜索。通过利用基于模型的轨迹回放和端到端强化学习微调,该方法在部分可观察的随机环境(如Hanabi)中实现了最先进性能,并在Ms. Pacman中超越了蒙特卡洛树搜索,展现出相较于表格化方法更优的可扩展性和泛化能力。
Lookahead search has been a critical component of recent AI successes, such as in the games of chess, go, and poker. However, the search methods used in these games, and in many other settings, are tabular. Tabular search methods do not scale well with the size of the search space, and this problem is exacerbated by stochasticity and partial observability. In this work we replace tabular search with online model-based fine-tuning of a policy neural network via reinforcement learning, and show that this approach outperforms state-of-the-art search algorithms in benchmark settings. In particular, we use our search algorithm to achieve a new state-of-the-art result in self-play Hanabi, and show the generality of our algorithm by also showing that it outperforms tabular search in the Atari game Ms. Pacman.
研究动机与目标
- 解决在Hanabi等大规模、随机且部分可观察环境中,传统表格化搜索方法面临的可扩展性限制。
- 开发一种非表格化的规划方法,利用神经网络的函数逼近技术,在相似状态间实现泛化。
- 通过在推理阶段使用强化学习微调预训练策略网络,提升推理时的规划性能。
- 在多样化环境中(包括具有部分可观测性和随机性的离散动作游戏)展示该方法的通用性和有效性。
- 证明端到端强化学习微调可超越传统树搜索算法(如MCTS)在复杂基准测试中的表现。
提出的方法
- 在推理过程中,通过在线、基于模型的微调方式替代表格化搜索,对预训练策略神经网络进行优化。
- 使用有限时域的基于模型的轨迹回放,生成用于策略微调的轨迹。
- 利用回放中获得的值函数,对策略网络执行强化学习更新。
- 在单智能体和多智能体设置中应用该方法,基于动作-观测历史进行信念状态更新。
- 采用联合策略更新规则,考虑多智能体场景中的相互信念状态,实现协同搜索。
- 通过端到端强化学习微调实现规划的摊销,而非依赖迭代式树搜索或启发式剪枝。
实验结果
研究问题
- RQ1在部分可观察和随机环境中,对预训练策略网络进行强化学习微调是否能优于表格化搜索?
- RQ2在高维状态空间中,基于在线强化学习的规划是否比蒙特卡洛树搜索具有更优的可扩展性?
- RQ3在Hanabi等复杂领域中,非表格化规划是否能对相似状态实现泛化,而传统表格化搜索因状态空间指数级增长而不可行?
- RQ4与结合强化学习和表格化搜索的现有方法(如专家迭代或Q值摊销)相比,基于强化学习的微调表现如何?
- RQ5该方法是否能在Hanabi和Ms. Pacman等基准测试中实现最先进性能,而无需依赖表格化搜索?
主要发现
- 所提方法在自对弈Hanabi中实现了新的最先进结果,优于依赖表格化搜索的先前方法。
- 该方法能够有效搜索多个动作步长,并发现联合策略偏差,而传统表格化搜索因状态空间指数级增长而无法实现此目标。
- 在Atari游戏Ms. Pacman中,该方法在确定性和随机版本中均优于蒙特卡洛树搜索,展现出广泛适用性。
- 该方法在具有随机性和部分可观测性的环境中表现出有效的可扩展性,而传统表格化搜索因状态空间爆炸而失效。
- 通过强化学习实现的微调能够提升在相似状态间的泛化能力,减少对每个状态的独立计算,从而提升推理效率。
- 该方法表明,端到端强化学习微调可在保持可扩展性的同时超越树搜索的性能,支持学习与搜索可被有效统一的观点。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。