Skip to main content
QUICK REVIEW

[论文解读] Application of Self-Play Reinforcement Learning to a Four-Player Game of Imperfect Information

Henry Charlesworth|arXiv (Cornell University)|Aug 30, 2018
Artificial Intelligence in Games参考文献 9被引用 6
一句话总结

本文提出了一种新颖的自对弈强化学习框架,用于Big 2——一种具有复杂动作空间的四人不完美信息纸牌游戏。采用近端策略优化(PPO)方法,模型通过纯自对弈训练深度神经网络,实现了超越人类业余玩家的超人类表现,且无需蒙特卡洛树搜索或对手采样。

ABSTRACT

We introduce a new virtual environment for simulating a card game known as "Big 2". This is a four-player game of imperfect information with a relatively complicated action space (being allowed to play 1,2,3,4 or 5 card combinations from an initial starting hand of 13 cards). As such it poses a challenge for many current reinforcement learning methods. We then use the recently proposed "Proximal Policy Optimization" algorithm to train a deep neural network to play the game, purely learning via self-play, and find that it is able to reach a level which outperforms amateur human players after only a relatively short amount of training time and without needing to search a tree of future game states.

研究动机与目标

  • 开发一个可扩展、易访问的多智能体强化学习环境,用于不完美信息游戏。
  • 评估通过自对弈的深度强化学习是否能够在不依赖蒙特卡洛树搜索或对手建模的情况下掌握像Big 2这样复杂的四人纸牌游戏。
  • 证明PPO能够有效训练在非平稳、高维动作空间的多智能体环境中的智能体。
  • 确立Big 2作为测试下一代多智能体强化学习算法的基准。

提出的方法

  • 作者构建了一个Big 2的虚拟仿真环境,严格遵守标准规则,包括牌面大小顺序、花色顺序以及合法牌型组合(例如顺子、葫芦、同花等)。
  • 使用近端策略优化(PPO)训练深度神经网络,联合学习策略 π(a|s) 和价值函数,通过广义优势估计(GAE)估计优势 Â(a|s)。
  • 通过自对弈进行训练,使用四个当前策略的副本,经验从48个并行游戏、每轮20步的轨迹中收集,小批量大小为960。
  • 模型在单台配备GPU的个人电脑上训练了1.5亿步(156,250次更新),仅使用当前游戏状态,未进行未来状态模拟。
  • 未使用对手采样或课程学习;在整个训练过程中,智能体始终与自身最新版本对弈。
  • 性能通过与随机智能体及早期网络检查点的对战进行评估,并通过公开网络界面组织了人类与AI的对战。

实验结果

研究问题

  • RQ1自对弈深度强化学习是否能在具有复杂动作空间的四人不完美信息纸牌游戏中实现超人类表现?
  • RQ2PPO是否能有效泛化到具有高维动作空间和部分可观测性的非平稳多智能体环境?
  • RQ3深度强化学习智能体是否能够在不依赖蒙特卡洛树搜索或对未来游戏状态进行启发式搜索的情况下,学会在Big 2中制定强策略?
  • RQ4性能在训练过程中如何演变?其表现是否在观察到的训练周期后仍持续提升?
  • RQ5训练好的智能体是否能在直接对战中持续击败经验丰富的业余人类玩家?

主要发现

  • 智能体在训练前1,000次更新内即对三名随机玩家取得显著正分,表明其初始学习速度极快。
  • 性能在整个训练过程中持续稳步提升,表明若训练时间更长,仍有进一步提升空间。
  • 最终模型在与所有测试的业余人类玩家的直接对战中显著胜出,表现为胜率和最终得分均更优。
  • 模型仅需标准PPO超参数设置,无需额外调参,且在未使用对手采样的情况下表现出稳健收敛。
  • 智能体仅依赖当前游戏状态即可有效对战,无需模拟未来游戏状态或使用树搜索。
  • 结果表明,PPO可成功应用于复杂、多智能体、不完美信息游戏,且无需辅助搜索机制。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。