Skip to main content
QUICK REVIEW

[论文解读] Multiplayer Support for the Arcade Learning Environment

Justin K. Terry, Benjamin Black|arXiv (Cornell University)|Sep 20, 2020
Reinforcement Learning in Robotics参考文献 19被引用 5
一句话总结

本论文为雅达利学习环境(Arcade Learning Environment, ALE)引入了多人游戏支持,通过扩展的ALE API与PettingZoo集成,实现了对18款雅达利2600游戏(支持2–4名玩家)的程序化访问,并提供了基于Ape-X DQN的自对弈基线,揭示了部分游戏(如Joust、Wizard of Wor)因混合博弈论结构而出现病态训练现象,凸显了采用联赛制等高级训练机制的必要性。

ABSTRACT

The Arcade Learning Environment ("ALE") is a widely used library in the reinforcement learning community that allows easy programmatic interfacing with Atari 2600 games, via the Stella emulator. We introduce a publicly available extension to the ALE that extends its support to multiplayer games and game modes. This interface is additionally integrated with PettingZoo to allow for a simple Gym-like interface in Python to interact with these games. We additionally introduce experimental baselines for all environments included.

研究动机与目标

  • 将雅达利学习环境(Arcade Learning Environment, ALE)扩展以支持多人雅达利2600游戏,此前该环境仅限单智能体设置。
  • 提供标准化、向后兼容的API扩展,通过动作列表和每智能体奖励支持多智能体交互。
  • 将扩展后的多人ALE环境集成至PettingZoo,提供与OpenAI Gym一致的Python接口,适用于多智能体强化学习。
  • 通过自对弈和Ape-X DQN建立基线,以表征每个新环境的难度和可训练性。
  • 识别在自对弈训练中出现病态训练动态的环境,表明需要采用如联赛制训练等高级训练方法。

提出的方法

  • 通过为`getAvailableModes`方法增加`num_players`参数并返回对应人数的游戏模式,扩展ALE API。
  • 为`step`方法增加重载,以接受动作列表(每名玩家一个动作),并返回每名智能体的奖励、观测和游戏状态列表。
  • 新增`allLives`方法,返回每名玩家的生命数列表,实现对多人游戏中智能体存活状态的准确追踪。
  • 将扩展后的ALE与PettingZoo集成,提供类似OpenAI Gym的多智能体接口,实现在Python中无缝交互环境。
  • 使用Ape-X DQN与标准雅达利预处理包装器训练自对弈基线,通过与随机智能体对战评估泛化能力。
  • 在易发生停滞的游戏(如Double Dunk、Othello)中修改奖励结构,对前300帧后持续无动作的行为施加惩罚,防止游戏陷入无限状态,确保训练稳定。

实验结果

研究问题

  • RQ1雅达利学习环境能否在保持与单智能体环境向后兼容的前提下,扩展以支持多人雅达利2600游戏?
  • RQ2多人雅达利游戏中不同的博弈论结构(竞争性、合作性、混合型)如何影响多智能体强化学习策略的可训练性?
  • RQ3自对弈基线在多样化多人雅达利环境中的性能特征如何?哪些环境表现出病态的训练动态?
  • RQ4与随机对手对战的训练在多大程度上能揭示自对弈训练出的策略在多智能体设置下的泛化能力?
  • RQ5现有的深度强化学习方法是否足以在复杂多人雅达利游戏中训练出有效策略?还是必须采用联赛制训练机制?

主要发现

  • 扩展后的ALE支持18款ROM和24种不同的多人游戏模式,涵盖竞争性、合作性和混合和游戏,如Warlords(4人)、Space Invaders(2人)和Entombed(合作模式)。
  • 使用Ape-X DQN训练的自对弈基线在Boxing和Tennis等游戏中表现优异,智能体学会了如墙压或最优站位等有效策略。
  • 在Joust和Wizard of Wor中,训练后的智能体表现甚至不如随机智能体,表明其训练动态存在病态,可能源于这些环境的混合博弈论结构。
  • 在易发生停滞的游戏(如Tennis、Othello)中,对前300帧后无动作行为施加惩罚,防止游戏陷入无限状态,从而实现稳定训练。
  • 观察到涌现行为,例如Boxing智能体学会后退躲避拳击并把对手推入墙角,展示了策略适应能力。
  • 结果表明,对于某些多人雅达利游戏,可能需要采用类似Vinyals等人(2019)提出的联赛制训练等高级训练机制,以克服训练不稳定性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。