Skip to main content
QUICK REVIEW

[논문 리뷰] Multiplayer Support for the Arcade Learning Environment

Justin K. Terry, Benjamin Black|arXiv (Cornell University)|2020. 09. 20.
Reinforcement Learning in Robotics참고 문헌 19인용 수 5
한 줄 요약

이 논문은 Arcade Learning Environment (ALE)에 멀티플레이어 지원을 도입하여, 2–4명의 플레이어가 참여하는 18종의 Atari 2600 게임에 프로그래밍 방식으로 접근할 수 있도록 확장된 ALE API와 PettingZoo 통합을 통해 Gym 유사 인터페이스를 제공한다. Ape-X DQN을 사용한 자가대전 기반 테이터를 통해 일부 게임(예: Joust, Wizard of Wor)이 혼합 게임 이론적 구조로 인해 병리적인 학습 동역학을 보이며, 리그 시스템과 같은 고급 학습 제도가 필요함을 시사한다.

ABSTRACT

The Arcade Learning Environment ("ALE") is a widely used library in the reinforcement learning community that allows easy programmatic interfacing with Atari 2600 games, via the Stella emulator. We introduce a publicly available extension to the ALE that extends its support to multiplayer games and game modes. This interface is additionally integrated with PettingZoo to allow for a simple Gym-like interface in Python to interact with these games. We additionally introduce experimental baselines for all environments included.

연구 동기 및 목표

  • 기존에 단일 에이전트 설정에 국한되어 있던 Arcade Learning Environment (ALE)를 멀티플레이어 Atari 2600 게임을 지원하도록 확장하는 것.
  • 행동 목록과 각 에이전트별 보상 구조를 통해 다중 에이전트 상호작용을 가능하게 하는 표준화되고 후행 호환 가능한 API 확장을 제공하는 것.
  • 멀티플레이어 ALE 환경을 PettingZoo에 통합하여 다중 에이전트 강화학습에 적합한 일관된 Gym 유사 Python 인터페이스를 제공하는 것.
  • 자기대전 및 Ape-X DQN을 사용한 기반 테이터를 통해 각 새로운 환경의 난이도와 학습 가능성 특성을 규명하는 것.
  • 자기대전 하에서 병리적인 학습 역학을 보이는 환경를 식별하여, 리그 기반 학습과 같은 고급 학습 방법이 필요함을 시사하는 것.

제안 방법

  • 플레이어 수를 지정할 수 있도록 `getAvailableModes` 메서드를 오버로딩하여 `num_players` 인자를 수락하고, 해당 플레이어 수를 가진 게임 모드를 반환하도록 확장하였다.
  • `step` 메서드를 오버로딩하여 플레이어 수에 따라 행동 목록을 수락하고, 각 에이전트별로 보상, 관측값, 게임 상태 목록을 반환하도록 하였다.
  • 각 플레이어의 생명 수를 리스트 형태로 반환하는 `allLives` 메서드를 추가하여 멀티플레이어 게임에서 에이전트 생존 상태를 정확히 추적할 수 있도록 하였다.
  • 확장된 ALE를 PettingZoo와 통합하여 OpenAI Gym의 다중 에이전트 버전을 제공함으로써 Python 환경에서의 원활한 환경 상호작용을 가능하게 하였다.
  • 표준 Atari 전처리 워퍼를 사용한 Ape-X DQN을 활용해 자기대전 기반 테이터를 학습시키고, 무작위 상대와의 대결 성능을 평가하여 일반화 능력을 평가하였다.
  • 지속적 정지가 발생하기 쉬운 게임(예: Double Dunk, Othello)의 보상 구조를 수정하여 300 프레임 이후의 정지 행동에 대해 패널티를 적용함으로써 게임 정지 상태를 방지하고 안정적인 학습을 가능하게 하였다.

실험 결과

연구 질문

  • RQ1Arcade Learning Environment는 단일 에이전트 환경과의 후행 호환성을 유지하면서도 멀티플레이어 Atari 2600 게임을 지원하도록 확장될 수 있는가?
  • RQ2멀티플레이어 아케이드 게임에서의 다양한 게임 이론적 구조(경쟁, 협력, 혼합)는 다중 에이전트 강화학습 정책의 학습 가능성에 어떻게 영향을 미치는가?
  • RQ3다양한 멀티플레이어 아케이드 환경에서 자기대전 기반 테이터의 성능 특성은 어떠한가? 어떤 환경에서 병리적인 학습 역학이 나타나는가?
  • RQ4무작위 상대와의 대결에서 학습된 자기대전 정책의 일반화 능력은 어느 정도로 평가될 수 있는가?
  • RQ5기존의 딥 강화학습 방법은 복잡한 멀티플레이어 아케이드 게임에서 효과적인 정책을 학습하는 데 충분한가, 아니면 리그 기반 학습 제도가 필수적인가?

주요 결과

  • 확장된 ALE는 18종의 ROM과 24개의 고유한 멀티플레이어 게임 모드를 지원하며, 전략적 경쟁, 협력, 혼합합계 게임을 포함한다. 예를 들어 Warlords(4인), Space Invaders(2인), Entombed(협동 모드) 등이 있다.
  • Ape-X DQN을 사용한 자기대전 기반 테이터는 Boxing과 Tennis와 같은 게임에서 뛰어난 성능을 기록하였으며, 벽 압박이나 최적의 위치 선정과 같은 효과적인 전략을 학습하였다.
  • Joust와 Wizard of Wor에서는 학습된 에이전트가 무작위 에이전트보다 성능이 열 劣하므로, 이러한 환경의 혼합 게임 이론적 구조로 인해 병리적인 학습 역학이 발생할 가능성이 높다.
  • 정지 행동이 자주 발생하는 게임(예: Tennis, Othello)의 보상 구조를 수정하여 300 프레임 이후의 정지 행동에 대해 패널티를 적용함으로써 무한정 지속되는 게임 상태를 방지하고 안정적인 학습을 가능하게 하였다.
  • 에이전트가 편향된 타격을 피하고 상대를 벽에 밀어내는 전략적 적응 행동이 관찰되었으며, 이는 Boxing 게임에서의 전략적 행동이 학습되었음을 시사한다.
  • 결과적으로, 일부 멀티플레이어 아케이드 게임에서 학습 불안정성을 극복하기 위해 Vinyals 등(2019)과 유사한 리그 기반 학습 제도와 같은 고급 학습 제도가 필수적일 것으로 보인다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.