Skip to main content
QUICK REVIEW

[논문 리뷰] Single Deep Counterfactual Regret Minimization

Eric Steinberger|arXiv (Cornell University)|2019. 01. 22.
Artificial Intelligence in Games참고 문헌 30인용 수 13
한 줄 요약

이 논문은 단일 딥 컨트라플룰리지 미니멀라이제이션(이하 SD-CFR)을 소개한다. SD-CFR는 이전 반복에서의 가치 네트워크를 직접 활용해 최종 정책을 계산함으로써 별도의 평균 전략 네트워크가 필요 없도록 하는 딥 CFR의 변종이다. SD-CFR는 근사 오차와 학습 복잡도를 감소시켜, 딥 CFR에 비해 포커 게임에서 더 빠른 수렴과 낮은 유용성(exploitability)을 달성한다.

ABSTRACT

Counterfactual Regret Minimization (CFR) is the most successful algorithm for finding approximate Nash equilibria in imperfect information games. However, CFR's reliance on full game-tree traversals limits its scalability. For this reason, the game's state- and action-space is often abstracted (i.e. simplified) for CFR, and the resulting strategy is then translated back to the full game, which requires extensive expert-knowledge and often converges to highly exploitable policies. A recently proposed method, Deep CFR, applies deep learning directly to CFR, allowing the agent to intrinsically abstract and generalize over the state-space from samples, without requiring expert knowledge. In this paper, we introduce Single Deep CFR (SD-CFR), a simplified variant of Deep CFR that has a lower overall approximation error by avoiding the training of an average strategy network. We show that SD-CFR is more attractive from a theoretical perspective and empirically outperforms Deep CFR with respect to exploitability and one-on-one play in poker.

연구 동기 및 목표

  • 딥 CFR가 별도의 평균 전략 네트워크에 의존함에 따라 발생하는 높은 근사 오차와 학습 비효율성 문제를 해결하기 위해.
  • 대규모 불완전 정보 게임에서 정책 학습을 위한 더 이론적으로 타당하고 실증적으로 효과적인 방법을 개발하기 위해.
  • 전문가가 설계한 추상화나 전체 게임 트리 탐색을 요구하지 않는 엔드 투 엔드 딥 강화 학습을 광범위한 형태의 게임에서 가능하게 하기 위해.
  • 크거나 연속적인 행동 공간을 가진 게임에서 일반화 능력과 확장성을 향상시키기 위해.

제안 방법

  • SD-CFR는 딥 CFR의 이중 네트워크 아키텍처를 대체로 단일 가치 네트워크로 대체하여, 반사적 가치를 직접 근사한다.
  • 최종 정책은 이전 반복에서의 가치 네트워크 출력을 평균화하여 계산하며, 별도의 평균 전략 네트워크가 필요 없도록 한다.
  • 학습된 이전 반복의 가치 네트워크 예측을 저장하기 위해 리플레이 버퍼를 사용하여 효율적인 전략 집계를 가능하게 한다.
  • 표본 기반 트리 탐색을 적용해 반사적 회피를 추정함으로써, 아직 보지 않은 상태로의 일반화를 가능하게 한다.
  • 값과 전략을 모두 근사하기 위해 단일 신경망을 사용함으로써 모델 복잡도와 오차 전파를 감소시킨다.
  • 최종 정책은 가치 네트워크에서 유도된 이점 추정치를 정규화하여 유도하며, 연속적인 행동 간격에 걸쳐 통합된 전략 기반으로 행동을 선택한다.

실험 결과

연구 질문

  • RQ1딥 CFR에서 평균 전략 네트워크를 제거함으로써 전체 근사 오차를 줄이고 불완전 정보 게임에서 수렴을 향상시킬 수 있는가?
  • RQ2한 명 대 한 명의 포커 게임 플레이에서 SD-CFR는 딥 CFR에 비해 어떤가? 특히, 유용성과 성능 측면에서 어떻게 비교되는가?
  • RQ3단일 가치 네트워크가 반사적 가치와 최종 정책을 모두 효과적으로 근사할 수 있는가? 추가적인 기능 근사가 필요 없도록 할 수 있는가?
  • RQ4기존의 딥 CFR 변종에 비해 SD-CFR는 크거나 연속적인 행동 공간으로의 일반화 능력이 더 뛰어나다고 할 수 있는가?
  • RQ5오차 누적이 줄어들었기 때문에, SD-CFR의 이론적 수렴 성능이 딥 CFR보다 뛰어나다고 할 수 있는가?

주요 결과

  • 헤즈업 노리밋 텍사스 홀드아임에서 SD-CFR는 딥 CFR보다 유의미하게 낮은 유용성을 기록하여, 더 강건하고 덜 유용성 있는 전략을 확보했다.
  • 반복적인 학습 실행 결과, SD-CFR는 딥 CFR에 비해 더 빠르게 수렴하고 분산이 적은 것으로 나타났다.
  • 기본 기준 에이전트와의 한 명 대 한 명 대결에서 SD-CFR는 딥 CFR를 능가하는 성능을 보였다.
  • 별도의 평균 전략 네트워크 학습을 피함으로써 전체 근사 오차를 감소시켜, 딥 CFR에서 오차의 주요 원인이 되는 요소를 제거했다.
  • 다수의 의사결정 지점 이후 도달하는 정보 집합에서 딥 CFR가 더 큰 오차를 보이는 것과는 달리, SD-CFR는 게임 트리의 깊은 부분에서도 강력한 성능 유지를 유지했다.
  • SD-CFR는 아직 보지 않은 상태로의 일반화가 효과적으로 이루어졌으며, 정책 학습에 있어 가치 네트워크 직접 활용의 이점을 입증했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.