Skip to main content
QUICK REVIEW

[논문 리뷰] Monte Carlo Neural Fictitious Self-Play: Approach to Approximate Nash equilibrium of Imperfect-Information Games

Li Zhang, Wei Wang|arXiv (Cornell University)|2019. 03. 22.
Artificial Intelligence in Games참고 문헌 19인용 수 5
한 줄 요약

이 논문은 몬테카를로 트리 탐색(MCTS)과 신경망 가짜 자기대칭학습(NFSP)을 융합하여, 대규모 불완전정보 게임에서 약한 나시 균형에 빠르고 안정적으로 수렴하는 몬테카를로 신경망 가짜 자기대칭학습(MC-NFSP)과 비동기 신경망 가짜 자기대칭학습(ANFSP)을 제안한다. MC-NFSP는 샘플 효율성을 향상시키고, NFSP가 실패하는 깊고 복잡한 게임인 올리미어(Othello)에서도 수렴을 가능하게 하며, ANFSP는 병렬 액터-학습자 아키텍처를 통해 학습을 가속화하여 포커 게임에서 메모리 사용량과 학습 시간을 감소시킨다.

ABSTRACT

Researchers on artificial intelligence have achieved human-level intelligence in large-scale perfect-information games, but it is still a challenge to achieve (nearly) optimal results (in other words, an approximate Nash Equilibrium) in large-scale imperfect-information games (i.e. war games, football coach or business strategies). Neural Fictitious Self Play (NFSP) is an effective algorithm for learning approximate Nash equilibrium of imperfect-information games from self-play without prior domain knowledge. However, it relies on Deep Q-Network, which is off-line and is hard to converge in online games with changing opponent strategy, so it can't approach approximate Nash equilibrium in games with large search scale and deep search depth. In this paper, we propose Monte Carlo Neural Fictitious Self Play (MC-NFSP), an algorithm combines Monte Carlo tree search with NFSP, which greatly improves the performance on large-scale zero-sum imperfect-information games. Experimentally, we demonstrate that the proposed Monte Carlo Neural Fictitious Self Play can converge to approximate Nash equilibrium in games with large-scale search depth while the Neural Fictitious Self Play can't. Furthermore, we develop Asynchronous Neural Fictitious Self Play (ANFSP). It use asynchronous and parallel architecture to collect game experience. In experiments, we show that parallel actor-learners have a further accelerated and stabilizing effect on training.

연구 동기 및 목표

  • 오프라인 딥Q네트워크(DQN)에 의존함으로써 대규모이고 깊은 불완전정보 게임에서 신경망 가짜 자기대칭학습(NFSP)의 수렴 성능이 열 劣한 문제를 해결하기 위해.
  • MCTS를 NFSP에 통합하여 온라인-오프라인 하이브리드 학습 방식을 도입함으로써 자가대칭 학습에서 샘플 효율성과 학습 안정성을 향상시키기 위해.
  • 경험 수집을 위한 이종적이고 병렬적인 액터-학습자 아키텍처를 도입하여 NFSP의 학습 시간과 메모리 사용량을 감소시키기 위해.
  • 복잡한 환경, 특히 올리미어, 수정된 레두크 홀드아임(Leduc Hold’em), 10v10 팀 전투 FPS 게임에서 제안된 방법을 평가하여 초인 수준의 성능을 입증하기 위해.

제안 방법

  • MC-NFSP는 MCTS를 NFSP에 통합하여, 최고의 반응 Q네트워크 학습을 위한 고품질 롤아웃을 생성하며, 기존 NFSP에서 사용하는 오프라인 DQN을 대체한다.
  • 이 알고리즘은 두 개의 네트워크를 유지한다: MCTS 가이드 롤아웃을 통해 최고의 반응을 학습하는 Q네트워크와, 이전 행동에서 평균 정책을 학습하는 지도 학습 네트워크.
  • MCTS는 온라인 계획과 탐색을 가능하게 하여, 상대의 전략 변화에 적응하고 깊은 게임 트리에서 샘플 효율성을 향상시킨다.
  • ANFSP는 독립된 환경과 상호작용하는 비동기 병렬 액터-학습자 아키텍처를 사용하며, 파라미터를 공유하고 미니배치로 기울기 업데이트를 수행하여 메모리 사용량을 줄이고 학습 속도를 높인다.
  • ANFSP에서는 병렬로 수집된 경험을 바탕으로 공유된 Q네트워크와 정책 네트워크에서 기울기 업데이트를 수행하며, 타겟 네트워크는 주기적으로 갱신된다.
  • 이 방법은 예측 동적 전략을 통해 평균 정책과 최고의 반응의 혼합을 사용하며, $ε$-greedy 탐색은 시간이 지남에 따라 감소시킨다.

실험 결과

연구 질문

  • RQ1깊은 탐색 트리가 있는 대규모 불완전정보 게임에서 MCTS가 NFSP의 수렴성과 성능을 향상시킬 수 있는가?
  • RQ2오프라인 DQN을 온라인 MCTS 기반 롤아웃으로 대체하면 자가대칭 학습에서 더 빠르고 안정적인 학습이 가능한가?
  • RQ3비동기 병렬 액터-학습자 아키텍처는 NFSP의 학습 시간과 메모리 사용량을 줄일 수 있으며, 수렴성은 유지 또는 향상시킬 수 있는가?
  • RQ4MC-NFSP와 ANFSP는 표준 NFSP가 수렴하지 못하는 게임에서 약한 나시 균형에 도달할 수 있는가?
  • RQ5결합된 접근법은 올리미어와 같은 복잡하고 실시간 불완전정보 게임, 특히 팀 기반 FPS 전투 게임에서 초인 수준의 정책을 생성할 수 있는가?

주요 결과

  • MC-NFSP는 올리미어에서 약한 나시 균형에 성공적으로 수렴했으며, 표준 NFSP는 70만 에피소드가 넘도록 수렴하지 못했다.
  • 수정된 레두크 홀드아임에서 ANFSP는 NFSP보다 낮은 유용성과 더 빠른 수렴을 달성했으며, 학습은 2시간 이내에 완료되었고, NFSP의 0.75보다 낮은 유용성을 기록했다.
  • ANFSP는 병렬 경험 수집과 미니배치 기울기 업데이트를 통해 메모리 요구량과 학습 시간을 감소시켰다.
  • FPS 팀 전투 게임에서 MC-NFSP 에이전트는 100판 동안 10명의 대학생과의 대결에서 75%의 승률을 기록하여 초인 수준의 성능을 입증했다.
  • FPS 게임에서 학습은 150 에피소드 이내에 수렴했으며, 인간 기반 기준 모델(SL-Human)에 비해 승률이 80%를 초과했고, 학습 손실은 거의 0에 가까웠다.
  • MCTS와 NFSP의 조합은 전략적 깊이가 깊고 불완전정보가 많은 환경에서 안정적이고 고성능의 정책 학습을 가능하게 했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.