Skip to main content
QUICK REVIEW

[논문 리뷰] Optimize Neural Fictitious Self-Play in Regret Minimization Thinking

Yuxuan Chen, Li Zhang|arXiv (Cornell University)|2021. 04. 22.
Artificial Intelligence in Games참고 문헌 20인용 수 4
한 줄 요약

이 논문은 신경 가짜 상호작용 학습(NFSP)의 변종을 제안하며, 기존의 최적 반응 계산을 이득 기반의 회귀 최소화(ARM)로 대체한다. ARM는 회귀 매칭 방법이다. 최적성 갭이 단조롭게 감소함으로써, 새로운 방법은 다양한 완전 정보 및 부분 정보 게임에서 원래의 NFSP보다 더 빠르게 수렴하고, 우수한 유용성과 승리율을 달성한다.

ABSTRACT

Optimization of deep learning algorithms to approach Nash Equilibrium remains a significant problem in imperfect information games, e.g. StarCraft and poker. Neural Fictitious Self-Play (NFSP) has provided an effective way to learn approximate Nash Equilibrium without prior domain knowledge in imperfect information games. However, optimality gap was left as an optimization problem of NFSP and by solving the problem, the performance of NFSP could be improved. In this study, focusing on the optimality gap of NFSP, we have proposed a new method replacing NFSP's best response computation with regret matching method. The new algorithm can make the optimality gap converge to zero as it iterates, thus converge faster than original NFSP. We have conduct experiments on three typical environments of perfect-information games and imperfect information games in OpenSpiel and all showed that our new algorithm performances better than original NFSP.

연구 동기 및 목표

  • 지속적인 최적성 갭으로 인해 수렴 속도와 균형 품질이 제한되는 신경 가짜 상호작용 학습(NFSP) 문제를 해결하기 위해.
  • 회귀 최소화 기법이 NFSP의 최적 반응 계산을 최적화하고 수렴 행동을 향상시킬 수 있는지 조사하기 위해.
  • 학습 중 최적성 갭이 단조롭게 감소하도록 보장하는 방법을 개발하여 더 빠르고 안정적인 수렴을 이끌기 위해.
  • 다양한 게임 환경, 특히 완전 정보 및 부분 정보 게임에서 제안된 방법을 평가하여 일반화 가능성과 성능 향상을 입증하기 위해.

제안 방법

  • NFSP의 딥 강화학습 기반 최적 반응 계산을, 회귀 매칭 방법인 이득 기반의 회귀 최소화(ARM)로 대체한다.
  • 행동에 대해 반복적으로 회귀를 최소화하기 위해 회귀 매칭을 적용하여, 각 업데이트 시 최적성 갭이 단조롭게 감소하도록 보장한다.
  • NFSP의 이중 스트림 아키텍처를 유지한다: 하나의 스트림은 정책 평균화(가짜 상호작용와 유사함)를 위한 것이고, 다른 하나는 ARM를 통한 최적 반응를 위한 것이다.
  • 상대의 평균 전략을 입력으로 받아, 최적성 갭을 최소화하는 최적 반응을 계산함으로써 각 반복에서 전략 품질을 향상시킨다.
  • ARM를 NFSP 프레임워크에 통합하여, FSP와 회귀 최소화의 장점을 결합한 하이브리드 자기학습 알고리즘을 만든다.
  • 회귀 매칭을 통해 최적성 갭의 단조 감소를 구현함으로써, 이론적으로 나시 균형 수렴을 보장한다.

실험 결과

연구 질문

  • RQ1회귀 최소화 기법이 NFSP의 최적 반응 계산에서 최적성 갭을 줄일 수 있는가?
  • RQ2NFSP의 최적 반응을 회귀 매칭 방법으로 대체하면 자기학습 훈련에서 더 빠른 수렴이 이루어지는가?
  • RQ3제안된 방법은 완전 정보 및 부분 정보 게임 모두에서 원래의 NFSP보다 더 낮은 유용성과 높은 승리율을 달성할 수 있는가?
  • RQ4ARM를 NFSP에 적용할 때 최적성 갭의 단조 감소가 실제로 달성되고 유익한가?
  • RQ5다양한 게임 환경, 특히 선수 1의 우위가 있는 경우에서 신규 방법의 성능은 NFSP와 비교해 어떻게 되는가?

주요 결과

  • 제안된 방법은 테스트된 모든 환경에서 원래의 NFSP보다 우수한 유용성과 더 빠르고 안정적인 수렴을 보였다. 이는 타이크택토 및 기타 OpenSpiel 게임을 포함한다.
  • 틱택토에서 선수 1로 플레이할 경우, 승리율이 83.7%였고, 선수 2로 플레이할 경우 67.4%의 승리(30.9%의 무승부)를 기록하여 NFSP를 크게 능가했다.
  • 선수 1로 플레이할 경우 평균 보상은 0.80을 기록했고, 선수 2로 플레이할 경우 0.658에 도달하여 불리한 위치에서도 강력한 성능을 보였다.
  • 학습 곡선을 통해 신규 방법은 선수 1 및 선수 2의 위치에서 모두 NFSP보다 더 빠르게 수렴하고, 더 높은 안정성과 보상 진행을 보였다.
  • 최적성 갭이 반복 과정에서 실제로 단조롭게 감소하는 것으로 실험적으로 입증되었으며, 이는 개선된 수렴 행동에 대한 이론적 주장의 타당성을 뒷받침한다.
  • 모든 세 가지 테스트 환경에서 일관된 성능 향상이 나타났으며, 이는 회귀 최소화를 NFSP 프레임워크에 통합하는 것이 효과적임을 확인한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.