Skip to main content
QUICK REVIEW

[논문 리뷰] Application of Self-Play Reinforcement Learning to a Four-Player Game of Imperfect Information

Henry Charlesworth|arXiv (Cornell University)|2018. 08. 30.
Artificial Intelligence in Games참고 문헌 9인용 수 6
한 줄 요약

이 논문은 복잡한 동작 공간을 가진 4인용 불완전 정보 기반 게임인 빅2에 대해 새로운 자기대전 강화학습 프레임워크를 소개한다. Proximal Policy Optimization (PPO)를 사용하여 순수 자기대전을 통해 딥 네ural 네트워크를 훈련시켜, 트리 탐색이나 상대방 샘플링 없이도 아마추어 인간 플레이어를 크게 능가하는 초인간 수준의 성능을 달성한다.

ABSTRACT

We introduce a new virtual environment for simulating a card game known as "Big 2". This is a four-player game of imperfect information with a relatively complicated action space (being allowed to play 1,2,3,4 or 5 card combinations from an initial starting hand of 13 cards). As such it poses a challenge for many current reinforcement learning methods. We then use the recently proposed "Proximal Policy Optimization" algorithm to train a deep neural network to play the game, purely learning via self-play, and find that it is able to reach a level which outperforms amateur human players after only a relatively short amount of training time and without needing to search a tree of future game states.

연구 동기 및 목표

  • 불완전 정보를 가진 게임을 위한 확장 가능하고 접근 가능한 다중 에이전트 강화학습 환경을 개발하기 위해.
  • 자기대전을 통한 딥 강화학습이 몬테카를로 트리 탐색이나 상대방 모델링에 의존하지 않고도 빅2와 같은 복잡한 4인용 카드 게임을 마스터할 수 있는지 평가하기 위해.
  • PPO가 고차원적 동작 공간과 부분 관찰 가능성이 있는 비정적, 다중 에이전트 환경에서 효과적으로 일반화될 수 있는지 보여주기 위해.
  • 빅2를 차세대 다중 에이전트 강화학습 알고리즘 테스트를 위한 기준으로 설정하기 위해.

제안 방법

  • 저자들은 표준 규칙(카드 등수, 무늬 순서, 유효한 손패 조합 등, 예: 스트레이트, 포일드, 플러시)을 준수하는 빅2용 가상 시뮬레이션 환경을 구축하였다.
  • 딥 네ural 네트워크는 Proximal Policy Optimization (PPO)를 사용하여 훈련되었으며, 일반화된 이득 추정(GAE)을 통해 정책 π(a|s)와 보상의 이득 Â(a|s)를 추정하는 가치 함수를 동시에 학습한다.
  • 훈련은 4개의 현재 정책 복제본을 사용한 자기대전 방식으로 수행되었으며, 20단계 롤아웃을 통해 48개의 병렬 게임에서 경험을 수집하고, 배치 크기가 960인 미니배치를 사용하였다.
  • 모델은 단일 GPU가 탑재된 PC에서 1억 5천만 단계(156,250회 업데이트) 동안 훈련되었으며, 향후 상태 시뮬레이션 없이 현재 게임 상태만을 사용하였다.
  • 상대방 샘플링이나 커리큘럼 학습을 사용하지 않았으며, 훈련 전반에 걸쳐 항상 가장 최근의 자신과 대전하였다.
  • 성능 평가는 무작위 에이전트와 이전 네트워크 체크포인트를 대상으로 평가하였으며, 인간 대 AI 대결은 공개 웹 인터페이스를 통해 실시하였다.

실험 결과

연구 질문

  • RQ1자기대전 기반 딥 강화학습이 복잡한 동작 공간을 가진 불완전 정보 기반 4인용 게임에서 초인간 수준의 성능을 달성할 수 있는가?
  • RQ2PPO는 고차원적 동작 공간과 부분 관찰 가능성이 있는 비정적, 다중 에이전트 환경에 효과적으로 일반화되는가?
  • RQ3몬테카를로 트리 탐색이나 미래 게임 상태에 대한 히우리스틱 탐색 없이도 딥 RL 에이전트가 빅2에서 강력한 전략을 학습할 수 있는가?
  • RQ4훈련 중 성능은 어떻게 변화하며, 관측된 훈련 기간을 초월해도 향상될 수 있는가?
  • RQ5훈련된 에이전트는 직접 플레이에서 숙련된 아마추어 인간 플레이어를 일관되게 능가할 수 있는가?

주요 결과

  • 에이전트는 첫 1,000회 훈련 업데이트 내에 무작위 플레이어 3명과의 대결에서 큰 양의 점수를 확보하여 초기 학습 속도가 매우 빠름을 보였다.
  • 훈련 전반에 걸쳐 성능이 안정적으로 향상되었으며, 더 긴 훈련 기간을 거치면 추가적인 향상이 가능할 것으로 보인다.
  • 최종 모델은 직접 대결에서 테스트된 모든 아마추어 인간 플레이어를 승률과 최종 점수 측면에서 크게 능가하였다.
  • 표준 PPO 설정을 초과하는 하이퍼파rameter 튜닝 없이도 모델가 수렴했으며, 상대방 샘플링 없이도 강건한 수렴 성능를 보였다.
  • 에이전트는 향후 상태 시뮬레이션 없이도 현재 게임 상태만으로 효과적으로 플레이하는 전략을 학습하였다.
  • 결과적으로 PPO는 보조적 탐색 기법 없이도 복잡한 다중 에이전트, 불완전 정보 기반 게임에 성공적으로 적용될 수 있음을 보여주었다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.