Skip to main content
QUICK REVIEW

[논문 리뷰] DREAM: Deep Regret minimization with Advantage baselines and Model-free learning

Eric Steinberger, Adam Lerer|arXiv (Cornell University)|2020. 06. 18.
Advanced Bandit Algorithms Research인용 수 13
한 줄 요약

DREAM은 완벽한 시뮬레이터가 필요로 하지 않는 모델 프리 딥 강화학습 알고리즘으로, Leduc 포커나 플롭 텍사스 홀드'em 포커와 같은 비완전 정보 이인간 제로섬 게임에서 최신 기술 수준의 성능을 달성한다. 학습된 애드밴티지 기준선과 단일 행동 샘플링을 통한 위험 최소화 기법을 사용하여 분산을 줄이고 $\epsilon$-Nash 평형에 수렴하며, 다른 모델 프리 방법보다 뛰어난 성능을 보이며 시뮬레이션 기반 기준선과도 동등한 성능을 내는다.

ABSTRACT

We introduce DREAM, a deep reinforcement learning algorithm that finds optimal strategies in imperfect-information games with multiple agents. Formally, DREAM converges to a Nash Equilibrium in two-player zero-sum games and to an extensive-form coarse correlated equilibrium in all other games. Our primary innovation is an effective algorithm that, in contrast to other regret-based deep learning algorithms, does not require access to a perfect simulator of the game to achieve good performance. We show that DREAM empirically achieves state-of-the-art performance among model-free algorithms in popular benchmark games, and is even competitive with algorithms that do use a perfect simulator.

연구 동기 및 목표

  • 비완전 정보 이인간 제로섬 게임에서 나슈 평형에 수렴하는 모델 프리 딥 강화학습 알고리즘을 개발하는 것.
  • 기존 신경망 기반 CFR 방법이 낮은 분산과 양호한 성능을 위해 필요로 하는 완벽한 시뮬레이터에 의존하는 것을 제거하는 것.
  • 단일 행동 샘플링과 학습된 애드밴티지 기준선을 사용하여 모델 프리 환경에서 효과적인 위험 최소화를 가능하게 하는 것.
  • Leduc 홀드'em과 플롭 텍사스 홀드'em과 같은 벤치마크 게임에서 모델 프리 알고리즘 중 최신 기술 수준의 성능을 달성하는 것.
  • NFSP와 같은 기존 모델 프리 기준선 대비 샘플 복잡도와 공격 가능성 감소를 이루는 것.

제안 방법

  • DREAM은 각 결정 포인트에서 단일 행동만 샘플링하는 신경망 기반의 대조적 위험 최소화(CFR) 기법을 사용하여 모델 프리 학습을 가능하게 한다.
  • 표본 기반 신경망 애드밴티지 기준선 네트워크 $\hat{Q}$ 를 사용하여 단일 행동 샘플링에서 발생하는 분산을 줄이며, 표본 기반 CFR 기법을 영감으로 삼는다.
  • 알고리즘은 시간이 지남에 따라 위험을 최소화하며, 신경망 모델링 오차 비례하는 $\epsilon$-Nash 평형에 수렴한다.
  • 가치 네트워크 $\hat{D}^t$ 는 이전 반복의 결과를 미세조정하여 업데이트하여 학습 오버헤드를 줄이며, 리셋 전략에 대한 분석 연구를 수행한다.
  • 정책은 정보상태에서 가치 함수와 행동 확률을 근사하기 위해 신경망을 사용하여 자기대칭 학습(self-play) 방식으로 훈련된다.
  • 초기화 조정을 통해 반복당 상태 방문 수를 SD-CFR와 같은 기준선과 동일하게 맞추어 공정한 비교를 보장한다.

실험 결과

연구 질문

  • RQ1완벽한 시뮬레이터에 접근할 수 없는 환경에서 딥 강화학습 알고리즘이 비완전 정보 게임에서 뛰어난 성능을 낼 수 있는가?
  • RQ2각 결정 포인트에서 단일 행동만 샘플링할 경우, 학습된 애드밴티지 기준선이 위험 최소화 과정에서 분산을 효과적으로 줄일 수 있는가?
  • RQ3Leduc 홀드'em과 플롭 텍사스 홀드'em 포커에서 DREAM의 성능은 모델 프리 및 시뮬레이션 기반 기준선과 비교해 어떻게 되는가?
  • RQ4다양한 가치 네트워크 업데이트 전략(예: 리셋 대비 미세조정)이 DREAM의 수렴성과 공격 가능성에 미치는 영향은 어떠한가?
  • RQ5DREAM은 완전히 모델 프리임에도 불구하고 SD-CFR와 같은 시뮬레이션 기반 알고리즘의 성능을 어느 정도까지 따라할 수 있는가?

주요 결과

  • DREAM은 Leduc 홀드'em에서 NFSP보다 공격 가능성을 두 자리 수 감소시켜 모든 다른 모델 프리 딥 강화학습 알고리즘보다 뛰어난 성능을 보였다.
  • 플롭 텍사스 홀드'em에서 DREAM은 수일에 걸친 훈련 후 NFSP보다 낮은 공격 가능성을 달성하여 뛰어난 샘플 효율성을 입증했다.
  • 완벽한 시뮬레이터 없이도 DREAM은 Leduc 홀드'em에서 SD-CFR와 동등한 성능을 내었으며, 학습된 기준선가 시뮬레이션 부족을 상쇄할 수 있음을 보여주었다.
  • 재학습이 아닌 미세조정된 가치 네트워크($\hat{D}^t$)를 사용함으로써 학습 오버헤드를 크게 줄였고, 성능 손실는 최소한도로 유지했다.
  • 아블레이션 연구 결과, $\hat{Q}$ 기준선 네트워크에 대해 반복당 몇 개의 미니배치 업데이트만으로도 충분하여 계산 비용이 낮음을 확인했다.
  • DREAM은 신경망 모델링 오차 비례하는 $\epsilon$-Nash 평형에 수렴하며, 이는 이론적 수렴 성질의 타당성을 입증한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.