Skip to main content
QUICK REVIEW

[논문 리뷰] Scalable Deep Reinforcement Learning Algorithms for Mean Field Games

Mathieu Laurière, Sarah Perrin|arXiv (Cornell University)|2022. 03. 22.
Game Theory and Applications인용 수 13
한 줄 요약

이 논문은 신경망을 사용한 정책 및 가치 함수 근사로 유한 수명 평균장 게임(MFG)을 해결하기 위해 두 가지 확장 가능한 딥강화학습 알고리즘—딥 어바지드 네트워크 피어플레이(D-AFP)와 딥 문크하우젠 온라인 미러 디센트(D-MOMD)—을 제안한다. D-AFP는 과거 정책을 저장하지 않고 혼합 정책을 학습하기 위해 정수화를 사용하며, D-MOMD는 정규화를 통해 Q함수의 합을 암묵적으로 처리한다. 두 방법 모두 다섯 개의 벤치마크 MFG 환경에서 수렴 속도와 유전적 취약성 측면에서 기존 최고 성능(SotA) 기준보다 뛰어나다.

ABSTRACT

Mean Field Games (MFGs) have been introduced to efficiently approximate games with very large populations of strategic agents. Recently, the question of learning equilibria in MFGs has gained momentum, particularly using model-free reinforcement learning (RL) methods. One limiting factor to further scale up using RL is that existing algorithms to solve MFGs require the mixing of approximated quantities such as strategies or $q$-values. This is far from being trivial in the case of non-linear function approximation that enjoy good generalization properties, e.g. neural networks. We propose two methods to address this shortcoming. The first one learns a mixed strategy from distillation of historical data into a neural network and is applied to the Fictitious Play algorithm. The second one is an online mixing method based on regularization that does not require memorizing historical data or previous estimates. It is used to extend Online Mirror Descent. We demonstrate numerically that these methods efficiently enable the use of Deep RL algorithms to solve various MFGs. In addition, we show that these methods outperform SotA baselines from the literature.

연구 동기 및 목표

  • 평균장 게임(MFG) 알고리즘에서 비선형 함수 근사(예: 신경망)의 평균화(예: 전략 또는 Q값)를 다루는 도전 과제를 해결하기 위해.
  • 표나 메모리 집약적인 방법 대신 미분 가능하고 신경망 기반 근사를 사용하여 MFG에서 확장 가능한 딥강화학습을 가능하게 하기 위해.
  • 고차원 상태 및 행동 공간에서 딥러닝의 일반화 능력을 활용하면서도 수렴 보장을 유지하는 알고리즘 개발을 위해.
  • 유한 수명 MFG에서 수렴 속도와 균형 품질 측면에서 기존 최고 성능(SotA) 기준을 초월하기 위해.

제안 방법

  • D-AFP는 신경망 가짜 자기 복제(NFSP)를 사용해 과거 최적 반응의 역사적 정보를 단일 신경망 정책으로 정수화함으로써, 기존의 피어플레이(Fictitious Play)를 확장하여 메모리 효율적인 정책 평균화를 가능하게 한다.
  • 이 방법은 과거 정책의 평균을 암시 학습을 통해 근사하기 위해 신경망을 훈련시켜, 모든 이전 정책을 저장하지 않도록 한다.
  • D-MOMD는 문크하우젠 재정의를 사용하여 온라인 미러 디센트를 재구성함으로써, 정규화된 목표 함수를 통해 Q함수의 합을 암묵적으로 처리한다.
  • D-MOMD의 정규화는 Q네트워크의 엔드 투 엔드 훈련을 가능하게 하며, 과거 Q함수를 명시적으로 저장하거나 합산할 필요 없이 확장성을 보장한다.
  • 두 방법 모두 딥신경망을 함수 근사를 위해 사용하며, 정책 기반 강화학습 또는 Q러닝과 같은 표준 딥RL 최적화 기법을 통해 훈련된다.
  • 알고리즘은 연속 상태 공간과 비대칭 보상 구조를 가진 다중 인구 MFG에서 평가되었으며, 취약성과 분포 진화를 지표로 사용했다.

실험 결과

연구 질문

  • RQ1과거 정책의 역사적 평균을 저장하지 않고도 신경망을 사용해 Fictitious Play에서 정책의 평균을 효율적으로 근사할 수 있는가?
  • RQ2명시적인 누적 대신, 미분 가능한 정규화 기반 방법을 사용해 온라인 미러 디센트에서 Q함수의 합을 암묵적으로 처리할 수 있는가?
  • RQ3모델 기반 또는 표기 기반 기준 대비, 딥RL 기반 MFG 알고리즘이 수렴 속도와 균형 품질 측면에서 어떻게 성능을 내는가?
  • RQ4정규화 기반 방법인 D-MOMD는 명시적 정규화의 편향을 피하면서도 나슈 균형으로의 수렴을 유지할 수 있는가?
  • RQ5제안된 접근법은 다수의 상호작용 인구를 포함한 복잡한 고차원 MFG에 확장 가능한가?

주요 결과

  • D-MOMD는 테스트한 다섯 개의 벤치마크 MFG 환경 전반에서 D-AFP 및 모든 SotA 기준보다 더 빠른 수렴 속도를 보였다.
  • D-AFP는 과거 정책을 저장하지 않고도 혼합 정책을 성공적으로 학습하여 복잡한 MFG에 대한 확장성을 확보했다.
  • D-MOMD는 D-AFP 및 기준보다 낮은 취약성을 기록하여 더 높은 품질의 균형 정책을 달성했다.
  • D-MOMD의 문크하우젠 재정의 기법은 Q함수의 효과적인 암묵적 합산을 가능하게 하여 명시적 누적을 피했다.
  • 다중 인구 추격 게임에서 D-MOMD는 취약성과 분포 수렴 속도 측면에서 D-AFP를 모두 뛰어넘었다.
  • 제안된 방법은 연속 상태 공간과 비대칭 보상 구조를 포함한 다양한 MFG 설정에서 견고한 성능을 보였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.