[论文解读] Feedback-Based Tree Search for Reinforcement Learning
本文提出基于反馈的树搜索(FBTS),一种批量、基于模型的强化学习方法,通过在有限时域马尔可夫决策过程(MDP)上使用蒙特卡洛树搜索(MCTS),迭代改进策略和价值函数近似。通过利用MCTS生成的反馈来优化叶节点评估器,FBTS在MOBA游戏《王者荣耀》中实现了最先进性能,超越DQN、AVI和监督学习基线方法,同时首次为基于树搜索的强化学习提供了样本复杂度边界。
Inspired by recent successes of Monte-Carlo tree search (MCTS) in a number of artificial intelligence (AI) application domains, we propose a model-based reinforcement learning (RL) technique that iteratively applies MCTS on batches of small, finite-horizon versions of the original infinite-horizon Markov decision process. The terminal condition of the finite-horizon problems, or the leaf-node evaluator of the decision tree generated by MCTS, is specified using a combination of an estimated value function and an estimated policy function. The recommendations generated by the MCTS procedure are then provided as feedback in order to refine, through classification and regression, the leaf-node evaluator for the next iteration. We provide the first sample complexity bounds for a tree search-based RL algorithm. In addition, we show that a deep neural network implementation of the technique can create a competitive AI agent for the popular multi-player online battle arena (MOBA) game King of Glory.
研究动机与目标
- 为解决实时决策环境(如电子游戏)中在线树搜索速度慢的挑战。
- 开发一种方法,不仅将MCTS用于规划,更将其作为训练信号,以改进全局策略和价值函数近似。
- 通过为批量MCTS强化学习算法提供样本复杂度边界,弥补理论理解的不足。
- 在复杂真实环境——《王者荣耀》(Arena of Valor)中,证明该方法的有效性。
提出的方法
- 该方法在从原始无限时域MDP衍生出的有限时域MDP批量上应用MCTS,使用价值函数和策略函数的组合作为叶节点评估器。
- 每次MCTS运行后,利用根节点观测结果(动作和回报)通过回归和分类方法更新价值函数和策略函数近似器。
- 更新后的函数随后在下一轮迭代中作为改进的叶节点评估器使用,形成反馈循环,从而随时间提升MCTS性能。
- 算法采用改进的UCT变体,通过基于UCB得分的Softmax采样实现并行模拟,降低相关性。
- 函数近似器采用具有SELU激活函数的深度神经网络实现,回归任务使用余弦接近度损失,分类任务使用负对数似然损失。
- 为降低相关性,丢弃约2/3的模拟轨迹状态,并在MCTS模拟过程中注入噪声以增强探索。
实验结果
研究问题
- RQ1是否可以利用MCTS的反馈,在批量强化学习设置中迭代改进价值函数和策略函数近似?
- RQ2基于树搜索的强化学习算法的样本复杂度是多少?是否可以进行理论上的边界界定?
- RQ3基于反馈的MCTS方法是否能在复杂、实时的电子游戏中超越标准强化学习基线?
- RQ4与使用静态价值或策略函数作为叶节点评估器相比,该反馈机制如何提升策略性能?
主要发现
- FBTS在1v1《王者荣耀》对战中显著优于DPI、AVI、SL以及内部DiRenJie AI基线模型,对六名选定对手英雄取得更高的胜率。
- FBTS在对局中取得1.25至1.75的金币比率,表明具有显著的经济优势和稳定的性能表现。
- 该方法首次为批量MCTS强化学习算法提供了理论上的样本复杂度边界,表明在足够数据和搜索投入下,可收敛至近似最优策略。
- FBTS的深度神经网络实现生成了一个具有竞争力的AI代理,在MOBA环境中超越了监督学习和价值迭代基线方法。
- FBTS性能仅略优于NR(另一款MCTS基代理),表明MCTS反馈机制虽有效,但在双方使用相似搜索机制时,优势并不显著。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。