[论文解读] Modeling Strong and Human-Like Gameplay with KL-Regularized Search
本文提出KL正则化搜索,以在多智能体游戏中平衡强大性能与类人行为。通过在蒙特卡洛树搜索(MCTS)和后悔最小化(piKL-hedge)中引入模仿学习得到的策略作为参考,并利用KL散度正则化,该方法在国际象棋、围棋、外交游戏和汉诺比游戏中,实现了优于单纯模仿学习的人类行为预测准确率和更强的游戏表现。
We consider the task of building strong but human-like policies in multi-agent decision-making problems, given examples of human behavior. Imitation learning is effective at predicting human actions but may not match the strength of expert humans, while self-play learning and search techniques (e.g. AlphaZero) lead to strong performance but may produce policies that are difficult for humans to understand and coordinate with. We show in chess and Go that regularizing search based on the KL divergence from an imitation-learned policy results in higher human prediction accuracy and stronger performance than imitation learning alone. We then introduce a novel regret minimization algorithm that is regularized based on the KL divergence from an imitation-learned policy, and show that using this algorithm for search in no-press Diplomacy yields a policy that matches the human prediction accuracy of imitation learning while being substantially stronger.
研究动机与目标
- 解决强人工智能策略与多智能体决策中类人行为之间的差距。
- 在复杂战略游戏中提升人类行为预测准确率,同时不牺牲性能。
- 开发一种统一框架,将模仿学习与基于搜索的规划相结合,以生成与人类对齐的强策略。
- 将该方法扩展至标准MCTS不适用的不完美信息游戏中。
- 实现既高度胜任又可解释的人工智能代理,以促进人类协作。
提出的方法
- 在MCTS中使用搜索策略与模仿学习策略之间的KL散度作为正则化项,以引导搜索向类人行为偏移。
- 在一种新颖的后悔最小化算法piKL-hedge中应用该正则化,该算法引入了对人类模仿基准策略的KL惩罚。
- 在后悔最小化中的效用函数中加入奖励项和KL散度惩罚项,惩罚系数为λ。
- 基于累积后悔对策略更新采用指数加权,正则化效用函数指导策略演化。
- 使用基准策略τ作为参考,确保搜索策略在保持游戏性能优化的同时,仍与人类行为保持接近。
- 在多个领域应用该方法:完全信息游戏(国际象棋、围棋)、单轮不完美信息游戏(无压力外交游戏)以及顺序游戏(汉诺比)。
实验结果
研究问题
- RQ1KL正则化搜索是否能在保持或超越纯模仿学习策略强度的同时,提升人类行为预测准确率?
- RQ2如何对基于搜索的规划进行正则化,以在复杂战略游戏中生成既强大又类人的策略?
- RQ3后悔最小化算法能否被调整以在不完美信息游戏中引入对人类模仿策略的KL正则化?
- RQ4在合作或混合动机情境下,搜索中的KL正则化是否能带来与人类惯例更好的对齐?
- RQ5正则化方向的选择(KL(π||τ)与KL(τ||π))在后悔最小化中对收敛性和性能的影响有多大?
主要发现
- 在国际象棋和围棋中,使用模仿学习策略作为先验的KL正则化MCTS,其人类行为预测准确率高于单纯模仿学习。
- 该方法生成的策略强于纯模仿学习策略,同时在国际象棋和围棋中保持或超越了人类行为预测准确率。
- 在无压力外交游戏中,piKL-hedge实现了与模仿学习相当的人类行为预测准确率,但与先前智能体对战时表现出显著更强的胜率。
- 后悔最小化算法piKL-hedge被证明可收敛至一个均衡状态,其中策略在给定基准策略和偏离成本下达到最优。
- 在汉诺比游戏中,将KL正则化应用于SPARTA搜索算法,显著提升了人类行为预测准确率,并大幅优于基线模仿学习策略。
- 该方法在所有四个测试领域中,始终生成比纯模仿学习模型更具类人行为且更强的智能体。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。