Skip to main content
QUICK REVIEW

[논문 리뷰] PerfectDou: Dominating DouDizhu with Perfect Information Distillation

Yang Guan, Minghuan Liu|arXiv (Cornell University)|2022. 03. 30.
Reinforcement Learning in Robotics인용 수 14
한 줄 요약

이 논문은 완전한 정보 추출 기법을 완전 훈련-불완전 실행(PTIE) 프레임워크 내에서 사용하는 최신 기술인 PerfectDou를 소개한다. 완전한 게임 지식으로 훈련하고, 불완전한 정보만 관찰하는 정책을 배포함으로써 PerfectDou는 뛰어난 성능과 샘플 효율성을 달성하며, 10,000벌의 카드 토너먼트에서 이전 모든 AI 시스템을 능가한다. 이는 더 낮은 샘플 요구량과 낮은 추론 지연 시간을 동반한다.

ABSTRACT

As a challenging multi-player card game, DouDizhu has recently drawn much attention for analyzing competition and collaboration in imperfect-information games. In this paper, we propose PerfectDou, a state-of-the-art DouDizhu AI system that dominates the game, in an actor-critic framework with a proposed technique named perfect information distillation. In detail, we adopt a perfect-training-imperfect-execution framework that allows the agents to utilize the global information to guide the training of the policies as if it is a perfect information game and the trained policies can be used to play the imperfect information game during the actual gameplay. To this end, we characterize card and game features for DouDizhu to represent the perfect and imperfect information. To train our system, we adopt proximal policy optimization with generalized advantage estimation in a parallel training paradigm. In experiments we show how and why PerfectDou beats all existing AI programs, and achieves state-of-the-art performance.

연구 동기 및 목표

  • 기존 DouDizhu AI 시스템, 특히 복잡한 전투 상황에서의 전략적 약점이 있는 DouZero의 한계를 해결하기 위해.
  • 세 플레이어의 불완전 정보 게임에서 협력과 경쟁의 역동성을 더 잘 포착하는 더 강력하고 이성적인 AI 정책을 개발하기 위해.
  • 실제 배포 환경에서 높은 성능을 유지하면서 샘플 효율성과 추론 속도를 향상시키기 위해.
  • 완전한 정보 추출이 불완전 정보 게임 플레이에 대한 일반화 능력을 훼손하지 않으면서도 더 강력한 정책 학습을 가능하게 함을 입증하기 위해.
  • 크고 비대칭적인 행동 공간과 은폐된 정보를 가진 복잡한 카드 게임에서 PTIE 패러다임의 효과성을 검증하기 위해.

제안 방법

  • 완전한 게임 상태 시야로 훈련하고, 배포 시에는 불완전한 정보만 관찰하는 정책을 사용하는, CTDE의 변형인 완전 훈련-불완전 실행(PTIE) 프레임워크를 제안한다.
  • 완전한 정보와 불완전한 정보를 모두 표현할 수 있도록 특화된 카드 및 게임 기능을 설계하여, 글로벌 지식을 로컬 정책으로 효과적으로 전달할 수 있도록 한다.
  • 자기 품질 향상(self-play), 분산 훈련 환경에서 Proximal Policy Optimization(PPO)과 일반화된 이득 추정(GAE)을 사용하여 정책을 최적화한다.
  • 훈련 중 정책의 이성과 전략적 일관성을 향상시키기 위해 노드 수준의 보상 메커니즘을 도입한다.
  • 완전한 정보 기반 중앙 집중식 가치 함수를 사용하여 정책 학습을 안내함으로써, 정책이 글로벌 게임 상태로부터 암묵적으로 학습할 수 있도록 한다.
  • 경량 네트워크 아키텍처와 기능 처리를 최적화하여 추론 효율성을 높이고, 실시간 배포를 가능하게 한다.

실험 결과

연구 질문

  • RQ1완전한 정보 추출 기법이 DouDizhu와 같은 불완전 정보 게임에서 정책 성능을 크게 향상시킬 수 있는가?
  • RQ2복잡한 카드 게임에서 샘플 효율성과 최종 성능 측면에서 표준 CTDE와 비교해 PTIE 프레임워크는 어떻게 다른가?
  • RQ3PerfectDou는 DouZero와 같은 기존 AI 시스템에 비해 전략적 사고와 동료 플레이어 간 협력에서 얼마나 뛰어나게 성과를 내는가?
  • RQ4PerfectDou의 추론 지연 시간은 얼마이며, 실시간 배포 환경에서 이전 시스템과 비교해 어떻게 되는가?
  • RQ5훈련 중 완전한 정보를 사용할 경우, 고위험 게임 상황에서 정책의 이성과 일관성은 어떻게 영향을 받는가?

주요 결과

  • PerfectDou는 10,000벌의 카드 토너먼트에서 기존 모든 AI 시스템을 능가하는 최고 수준의 성능을 달성했다.
  • 이전 최고 성능 기록을 세운 방법보다 샘플 요구량이 10배 이상 적어, 뛰어난 샘플 효율성을 입증했다.
  • PerfectDou는 더 이성적이고 인간과 유사한 행동을 보였다: 땅주인이 되면 점수를 보존하기 위해 폭탄을 덜 쓰며, 농민이 되면 전략적 폭탄 플레이를 통해 동료와 더 잘 협력한다.
  • PerfectDou의 오른쪽 농민 에이전트는 DouZero의 동료에 비해 더 많은 폭탄을 사용하며, 이는 인간 전문가 전략과 일치한다.
  • 한 번의 수동 추론 시간은 6밀리초이며, DouZero의 2ms보다 略로 느리지만 여전히 실시간 온라인 게임 배포에 적합하다.
  • 실행 시간 분석 결과, PerfectDou는 DeltaDou나 CQN과 같은 몬테카를로 기반 시스템보다 뚜렷하게 빠르며, 규칙 기반 또는 복잡한 네트워크 기반 대안보다도 더 효율적이다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.