Skip to main content
QUICK REVIEW

[논문 리뷰] Discovering Multi-Agent Auto-Curricula in Two-Player Zero-Sum Games.

Xidong Feng, Oliver Slumbers|arXiv (Cornell University)|2021. 06. 04.
Sports Analytics and Performance참고 문헌 41인용 수 5
한 줄 요약

이 논문은 두 명의 플레이어로 구성된 제로섬 게임을 위한 다중 에이전트 강화 학습에서 상대 선택 및 최적 반응 업데이트 규칙을 자동으로 발견하는 LMAC이라는 메타기울기 하강 프레임워크를 제안한다. 수작업으로 설계된 게임 이론적 설계가 필요 없으며, 기량 테스트 게임, 러트오, 팔짱 게임, 쿠른 포커 및 레두크 포커에서 최신 기술 수준에 맞추거나 이를 초월한다. 이는 소규모 게임에서 대규모 게임으로의 일반화를 가능하게 한다.

ABSTRACT

When solving two-player zero-sum games, multi-agent reinforcement learning (MARL) algorithms often create populations of agents where, at each iteration, a new agent is discovered as the best response to a mixture over the opponent population. Within such a process, the update rules of who to compete (i.e., the opponent mixture) and how to beat them (i.e., finding best responses) are underpinned by manually developed game theoretical principles such as fictitious play and Double Oracle. In this paper we introduce a framework, LMAC, based on meta-gradient descent that automates the discovery of the update rule without explicit human design. Specifically, we parameterise the opponent selection module by neural networks and the best-response module by optimisation subroutines, and update their parameters solely via interaction with the game engine, where both players aim to minimise their exploitability. Surprisingly, even without human design, the discovered MARL algorithms achieve competitive or even better performance with the state-of-the-art population-based game solvers (e.g., PSRO) on Games of Skill, differentiable Lotto, non-transitive Mixture Games, Iterated Matching Pennies, and Kuhn Poker. Additionally, we show that LMAC is able to generalise from small games to large games, for example training on Kuhn Poker and outperforming PSRO on Leduc Poker. Our work inspires a promising future direction to discover general MARL algorithms solely from data.

연구 동기 및 목표

  • 두 명의 플레이어로 구성된 제로섬 게임을 위한 다중 에이전트 강화 학습에서 상대 선택 및 최적 반응 업데이트 규칙의 자동 발견을 위한 것이다.
  • 인구 기반 다중 에이전트 강화 학습에서 허구적 플레이 및 더블 오라클과 같은 수작업으로 설계된 게임 이론적 원칙에 의존하는 것을 제거하기 위한 것이다.
  • 게임 환경과의 상호작용을 직접적으로 통해 효과적인 다중 에이전트 강화 학습 알고리즘을 학습하는 데이터 기반 프레임워크를 개발하기 위한 것이다.
  • 소규모 게임(예: 쿠른 포커)에서 대규모 게임(예: 레두크 포커)으로의 학습된 알고리즘의 일반화를 가능하게 하기 위한 것이다.

제안 방법

  • 신경망을 사용해 상대 선택 모듈을 파arameter화하고, 최적 반응 모듈을 최적화 서브루틴을 사용해 파라미터화한다.
  • 두 에이전트가 노출 가능성을 최소화하도록 게임 엔진과의 상호작용만을 사용해 메타기울기 하강을 통해 두 모듈을 동시에 훈련한다.
  • 상대 혼합 및 최적 반응 정책을 동시에 최적화하기 위해 엔드 투 엔드로 미분 가능한 훈련을 사용한다.
  • 외부 루프가 상대를 선택하고 내부 루프가 최적 반응을 계산하는 이중 최적화 문제로 학습 과정을 프레임워크화한다.
  • 최적 반응 정책의 성능에 기반해 상대 선택 정책에 기반한 기울기 기반 업데이트를 적용한다.
  • 소규모 게임에서 사전 훈련하고 대규모 게임에서 미세조정함으로써 일반화를 가능하게 한다. 예를 들어 쿠른 포커에서 레두크 포커로의 전이를 포함한다.

실험 결과

연구 질문

  • RQ1수작업으로 설계된 게임 이론적 원칙이 없는 데이터 기반 프레임워크가 다중 에이전트 강화 학습에서 효과적인 상대 선택 및 최적 반응 업데이트 규칙를 자동으로 발견할 수 있는가?
  • RQ2LMAC 알고리즘의 성능는 PSRO와 같은 최신 기술 수준의 인구 기반 해법과 비교해 다양한 두 명의 플레이어로 구성된 제로섬 게임에서 어떻게 되는가?
  • RQ3LMAC는 소규모 게임(예: 쿠른 포커)에서 대규모이고 더 복잡한 게임(예: 레두크 포커)으로의 일반화를 어느 정도까지 가능하게 하는가?
  • RQ4LMAC에서 명시적인 게임 이론적 설계 원칙이 없음에도 불구하고, 기존 방법과 비교해 노출 가능성을 최소화하는 데 있어 경쟁력 있거나 우수한 성능을 보이는가?

주요 결과

  • LMAC는 기량 테스트 게임, 미분 가능한 러트오, 비순서성 혼합 게임, 반복 팔짱 게임, 쿠른 포커에서 PSRO와 비교해 경쟁력 있거나 뛰어난 성능을 달성한다.
  • 이 프레임워크는 쿠른 포커에서 레두크 포커로의 일반화에 성공하여, 소규모 게임에서만 훈련된 상태에서 더 큰 게임에서 PSRO를 능가한다.
  • LMAC는 허구적 플레이나 더블 오라클과 같은 수작업으로 설계된 게임 이론적 메커니즘에 의존하지 않고 효과적인 다중 에이전트 강화 학습 업데이트 규칙을 발견한다.
  • LMAC를 통해 학습된 알고리즘은 낮은 노출 가능성을 보이며, 제로섬 환경에서 강력한 전략 수렴을 나타낸다.
  • 메타기울기 하강의 사용은 게임 상호작용만을 통해 상대 선택 및 최적 반응 정책의 엔드 투 엔드 학습을 가능하게 한다.
  • 이 프레임워크는 비순서성 및 미분 가능한 게임을 포함한 다양한 게임 유형에서 뛰어난 내재적 안정성을 보이며, 넓은 적용 가능성을 시사한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.