Skip to main content
QUICK REVIEW

[논문 리뷰] DouZero: Mastering DouDizhu with Self-Play Deep Reinforcement Learning

Daochen Zha, Jingru Xie|arXiv (Cornell University)|2021. 06. 11.
Digital Games and Media인용 수 21
한 줄 요약

DouZero는 불완전 정보와 막대한 행동 공간을 가진 세 명의 플레이어가 참가하는 복잡한 트릭 테이킹 카드 게임인 두더지( DouDizhu)를 마스터하는 자기학습 딥 강화학습 에이전트이다. 몬테카를로 트리 탐색과 딥 네트워크를 조합하고, 카드 매트릭스를 통한 행동 인코딩 및 병렬 자기학습 훈련을 통해 DouZero는 인간이 설계한 추상화나 영역 전용 히우리스틱에 의존하지 않고 초인간 수준의 성능을 달성하였다—344개의 에이전트 중 Botzone 랭킹에서 1위를 기록하였다.

ABSTRACT

Games are abstractions of the real world, where artificial agents learn to compete and cooperate with other agents. While significant achievements have been made in various perfect- and imperfect-information games, DouDizhu (a.k.a. Fighting the Landlord), a three-player card game, is still unsolved. DouDizhu is a very challenging domain with competition, collaboration, imperfect information, large state space, and particularly a massive set of possible actions where the legal actions vary significantly from turn to turn. Unfortunately, modern reinforcement learning algorithms mainly focus on simple and small action spaces, and not surprisingly, are shown not to make satisfactory progress in DouDizhu. In this work, we propose a conceptually simple yet effective DouDizhu AI system, namely DouZero, which enhances traditional Monte-Carlo methods with deep neural networks, action encoding, and parallel actors. Starting from scratch in a single server with four GPUs, DouZero outperformed all the existing DouDizhu AI programs in days of training and was ranked the first in the Botzone leaderboard among 344 AI agents. Through building DouZero, we show that classic Monte-Carlo methods can be made to deliver strong results in a hard domain with a complex action space. The code and an online demo are released at https://github.com/kwai/DouZero with the hope that this insight could motivate future work.

연구 동기 및 목표

  • 불완전 정보와 막대하고 동적인 행동 공간을 가진 도전적인 세 명의 플레이어가 참가하는 트릭 테이킹 게임인 두더지에 대해 강력한 AI 에이전트를 개발하는 것.
  • DQN과 A3C와 같은 전통적인 강화학습 알고리즘의 한계를 극복하는 것—이들은 큰 행동 공간에서 과소평가 및 일반화 능력 부족 문제를 겪는다.
  • 킥퍼 네트워크나 분해 규칙과 같은 인간이 설계한 히우리스틱이나 행동 추상화에 의존하지 않는 것—이러한 방법들은 실수를 범하기 쉬우며 계산 비용이 크다.
  • 클래식한 몬테카를로 방법이 딥 러닝과 조합될 경우 복잡한 고차원 게임 환경에서 강력한 성능을 낼 수 있음을 보여주는 것.
  • 단일 서버와 네 개의 GPU만을 사용하여 게임 규칙과 자기학습만으로 에이전트를 완전히 새로 훈련시켜 초인간 수준의 성능을 달성하는 것—기존 방법보다 훨씬 짧은 시간에 성과를 내는 것.

제안 방법

  • 다양한 게임 트랙토리(경로)를 효율적으로 생성하기 위해 병렬 액터를 사용하는 자기학습 강화학습 프레임워크를 적용한다.
  • 원시적인 카드 상태를 사용하여 정책 함수와 가치 함수를 예측하는 딥 네트워크를 활용해 몬테카를로 트리 탐색(MCTS)을 향상시킨다.
  • 행동를 카드 매트릭스(예: 쌍, 연속, 조합 등)로 인코딩하여 모델이 알려지지 않은 합법적 행동으로의 일반화를 가능하게 한다.
  • 잔차 합성 컨볼루션 신경망을 사용해 카드 손을 처리하고 행동 표현을 인코딩함으로써 일반화 능력을 향상시키고 과소평가 편향을 줄인다.
  • 자기학습 중에 가중 정책(WP) 목적함수를 적용하여 학습 안정성 향상과 정책 수렴 개선을 도모한다.
  • 인간의 예시나 히우리스틱 사전 지식 없이 게임 규칙과 자기학습만으로 에이전트를 종합적으로 끝내기까지 훈련시킨다.

실험 결과

연구 질문

  • RQ1인간이 설계한 행동 추상화에 의존하지 않고 자기학습 딥 강화학습 에이전트가 두더지에서 초인간 수준의 성능을 달성할 수 있는가?
  • RQ2신경망이 향상시킨 몬테카를로 트리 탐색은 두더지의 막대하고 동적인 행동 공간을 효과적으로 다룰 수 있는가?
  • RQ3카드 매트릭스를 통한 행동 인코딩이 복잡한 카드 게임에서 드물게 발생하거나 알려지지 않은 합법적 수를 일반화하는 데 얼마나 효과적인가?
  • RQ4단일 서버와 네 대의 GPU에서만 훈련된 시스템이 복잡한 히우리스틱이나 베이지안 추론을 사용하는 기존 AI 에이전트를 뛰어넘을 수 있는가?
  • RQ5영역 전용 추상화가 없는 경우, 불완전 정보 기반의 팀 기반 카드 게임에서 더 견고하고 일반화 능력이 뛰어난 정책이 도출되는가?

주요 결과

  • DouZero는 훈련을 시작한 지 며칠 만에 344개의 에이전트 중 Botzone 랭킹에서 1위를 기록하며 모든 기존 두더지 AI 프로그램을 압도하였다.
  • 반나절 이내의 훈련으로 CQN 및 히우리스틱 기반 규칙 기반 에이전트와의 대결에서 90퍼센트 이상의 승률을 기록하였다.
  • 두더지에서 과거 SOTA를 기록한 DeltaDou(베이지안 추론과 히우리스틱 킥퍼를 사용)가 2개월 이상 훈련이 필요했음에도 불구하고, DouZero는 이를 뛰어넘는 성능을 보였다.
  • 모델은 행동 인코딩 메커니즘 덕분에 드문 또는 알려지지 않은 카드 조합을 효과적으로 처리하는 강력한 일반화 능력을 보였다.
  • 인간이 설계한 추상화 없이도 자기학습과 신경망 정책/가치 네트워크에 의존하여 초인간 수준의 성능을 달성하였다.
  • 카드 매트릭스 인코딩을 사용함으로써, 훈련 중 자주 발생하지 않는 행동들에 대해서도 일반화가 가능했으며, 표준 DQN 접근 방식에 비해 과소평가 편향이 감소하였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.