[论文解读] Rolling Horizon Coevolutionary Planning for Two-Player Video Games
本文提出滚动时域协同进化算法(RHCA),一种用于双人实时视频游戏的新型决策方法,将滚动时域进化规划扩展至协同进化双方玩家的动作序列。RHCA在多种自定义双人太空对战游戏变体中表现优于多种通用游戏AI算法(包括MCTS和基于启发式的控制器),即使在无前期训练的情况下也展现出优异性能。
This paper describes a new algorithm for decision making in two-player real-time video games. As with Monte Carlo Tree Search, the algorithm can be used without heuristics and has been developed for use in general video game AI. The approach is to extend recent work on rolling horizon evolutionary planning, which has been shown to work well for single-player games, to two (or in principle many) player games. To select an action the algorithm co-evolves two (or in the general case N) populations, one for each player, where each individual is a sequence of actions for the respective player. The fitness of each individual is evaluated by playing it against a selection of action-sequences from the opposing population. When choosing an action to take in the game, the first action is chosen from the fittest member of the population for that player. The new algorithm is compared with a number of general video game AI algorithms on three variations of a two-player space battle game, with promising results.
研究动机与目标
- 开发一种适用于双人实时视频游戏的通用决策算法,且无需前期训练。
- 将已在单人游戏中取得成功的滚动时域进化算法(RHEA)扩展至多人环境。
- 在可控且可定制的双人对战环境中,评估所提算法与多种通用游戏AI方法的性能表现。
- 评估宏观动作大小(每段序列的动作数量)对算法性能的影响。
- 探索协同进化规划作为实时游戏中蒙特卡洛树搜索(MCTS)的可行替代方案的潜力。
提出的方法
- RHCA使用滚动时域框架,协同进化两个独立的行动序列种群(每名玩家一个),其中每个个体代表一个固定规划时域内的动作序列。
- 通过在对手机器人种群中抽取样本的行动序列进行多次模拟,评估每个行动序列的适应度。
- 在每个玩家的种群中,选择适应度最高的个体的第一个动作,作为当前游戏状态下的执行动作。
- 该算法采用固定的模拟深度(即规划时域),并在每个游戏周期重新评估并重新优化种群,从而维持一个未来动作的滚动窗口。
- 通过在多次随机初始化和游戏运行中取平均值,该方法支持随机性游戏。
- 该方法与MCTS及其他开环控制器(如OneStep、OLMCTS,以及随机或旋转基线代理)进行对比。
实验结果
研究问题
- RQ1滚动时域进化规划能否成功地从单人游戏扩展至双人实时游戏?
- RQ2在双人环境中,RHCA与MCTS和基于启发式的控制器等成熟通用游戏AI算法相比表现如何?
- RQ3宏观动作大小(每段序列的动作数量)是否显著影响RHCA和RHGA的性能?
- RQ4协同进化规划是否能在无前期训练的情况下实现优异性能,从而适用于快速游戏设计反馈?
- RQ5RHCA是否是实时双人游戏中MCTS的可行且具有竞争力的替代方案?
主要发现
- 在所有测试游戏中,RHCA实现了76.1%的最高平均胜率,优于轮盘赛中所有其他控制器。
- 在无武器的简单对战游戏(G₁)中,RHCA对随机控制器(RND)的胜率为93.5%,对旋转控制器(ROT)的胜率为100%,对OneStep控制器的胜率为87.0%。
- RHCA显著优于OLMCTS(平均胜率68.3%)和RHGA(平均胜率70.1%)。
- 随着每段宏观动作中的动作数量增加,RHCA和RHGA的性能均下降,表明较短的规划时域能获得更优结果。
- OneStep整体表现较差,对RND的胜率仅为51.0%,对ROT的胜率为0.0%,仅在特定情况下(即在G₁中击败ROT)例外。
- OLMCTS表现中等,平均胜率为68.3%,但在任何游戏变体中均未展现出相对于RHCA或RHGA的明显优势。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。