Skip to main content
QUICK REVIEW

[논문 리뷰] Combining Deep Reinforcement Learning and Search for Imperfect-Information Games

Noam Brown, Anton Bakhtin|arXiv (Cornell University)|2020. 07. 27.
Artificial Intelligence in Games참고 문헌 54인용 수 62
한 줄 요약

이 논문은 ReBeL을 소개한다. 이는 두 플레이어 제로합 불완전정보 게임에서 자가 학습 RL+탐색 프레임워크로 내쉬 균형으로 수렴하고, 도메인 지식이 감소된 상태에서 포커에서 초인적 성능을 달성한다.

ABSTRACT

The combination of deep reinforcement learning and search at both training and test time is a powerful paradigm that has led to a number of successes in single-agent settings and perfect-information games, best exemplified by AlphaZero. However, prior algorithms of this form cannot cope with imperfect-information games. This paper presents ReBeL, a general framework for self-play reinforcement learning and search that provably converges to a Nash equilibrium in any two-player zero-sum game. In the simpler setting of perfect-information games, ReBeL reduces to an algorithm similar to AlphaZero. Results in two different imperfect-information games show ReBeL converges to an approximate Nash equilibrium. We also show ReBeL achieves superhuman performance in heads-up no-limit Texas hold'em poker, while using far less domain knowledge than any prior poker AI.

연구 동기 및 목표

  • 불완전정보 게임에서 RL+탐색의 필요성을 동기화하고, 이전 방법에서 누락된 수렴 이슈를 해결한다.
  • 상태를 공개적인 믿음 상태(PBS)로 확장하고 이로써 RL+탐색을 가능하게 하며 이론적 보장을 제공하는 일반 프레임워크(ReBeL)를 개발한다.
  • 도메인 지식이 줄어든 상태에서 대규모 불완전정보 게임과 포커 벤치마크에서 실험적으로 성공을 보여준다.

제안 방법

  • 불완전정보 게임을 연속상태의 완전정보에 가까운 설정으로 변환하기 위해 공개적 믿음 상태(PBS)를 도입한다.
  • 정보상(infostates) 위에 가치 네트워크와 정책 네트워크를 학습시키고, 자가 학습 및 탐색을 사용하여 깊이 제한된 하위게임을 해결한다.
  • 하위게임 내부의 균형 찾기 루틴으로 CFR-D(또는 FP)를 사용하고, 리드된 가치 네트워크가 리프 값을 제공한다.
  • infostate 값이 PBS 값의 초그라디언트로 작용한다는 것을 증명하여 탐색이 수렴 가능함을 보인다.
  • 테스트 시 안전한 탐색을 통해 학습 시의 알고리즘을 동일하게 실행하여 기대값에서 균형 플레이를 유지하도록 한다.

실험 결과

연구 질문

  • RQ1RL+탐색 프레임워크를 두 플레이어 제로합 불완전정보 게임에서 sound하고 수렴 가능하게 만들 수 있는가?
  • RQ2PBS 기반 가치 네트워크와 정책 네트워크를 통한 감독이 큰 불완전정보 도메인에서 내쉬 균형으로의 수렴을 가능하게 하는가?
  • RQ3제한된 도메인 지식으로 Heads-up No-Limit Texas Hold’em과 같은 현실의 불완전정보 게임에서 초인적 성능을 달성할 수 있는가?

주요 결과

  • ReBeL은 Liar’s Dice와 같은 불완전정보 벤치마크에서 근사 내쉬 균형으로 수렴한다.
  • 헤드업 노리미트 텍사스 홀덤 포커에서 ReBeL은 이전의 포커 인공지능들보다 훨씬 적은 도메인 지식으로 초인적 성능을 달성한다.
  • 강한 프리봇과 비교했을 때 ReBeL은 경쟁력 있는 익실가능도 지표와 빠른 의사결정 시간(보통 몇 초 이내)을 보인다.
  • 이 프레임워크는 이론적 보장을 제공한다: infostate 값은 초그래디언트에 대응하고, T CFR 반복으로 학습하면 오차가 한정된다(O(1/√T)).
  • 테스트 시 잘 학습된 PBS 가치 네트워크를 사용할 때 안전한 탐색은 근사 내쉬 균형으로의 수렴을 보장한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.