[논문 리뷰] Reinforcement Learning for Mean Field Game.
이 논문은 행동 결합이 있는 평균장 게임에 대해 사후 표본 추출 기반 강화 학습 알고리즘을 제안하며, 에이전트들이 과거 행동의 경험적 분포를 사용해 인구의 행동을 근사한다. 이 방법은 정책과 행동 분포가 최적의 무관 전략과 그 한계 분포로 수렴함을 보장하며, 평균장 균형(MFE)으로의 수렴을 확립한다.
Stochastic games provide a framework for interactions among multiple agents and enable a myriad of applications. In these games, agents decide on actions simultaneously, the state of every agent moves to the next state, and each agent receives a reward. However, finding an equilibrium (if exists) in this game is often difficult when the number of agents becomes large. This paper focuses on finding a mean-field equilibrium (MFE) in an action coupled stochastic game setting in an episodic framework. It is assumed that the impact of the other agents' can be assumed by the empirical distribution of the mean of the actions. All agents know the action distribution and employ lower-myopic best response dynamics to choose the optimal oblivious strategy. This paper proposes a posterior sampling based approach for reinforcement learning in the mean-field game, where each agent samples a transition probability from the previous transitions. We show that the policy and action distributions converge to the optimal oblivious strategy and the limiting distribution, respectively, which constitute an MFE.
연구 동기 및 목표
- 행동 결합이 있는 대규모 인구의 확률적 게임에서 평균장 균형을 계산하는 데 도전하는 데 목적을 두며.
- 전체 인구 역학에 대한 지식이 제한된 상태에서도 에이전트가 최적의 무관 전략으로 수렴할 수 있도록 강화 학습 알고리즘을 설계하는 데 목적을 두며.
- 에피소드 학습 설정 하에서 정책과 행동 분포의 이론적 수렴성을 확립하는 데 목적을 두며.
제안 방법
- 에이전트들은 과거 행동의 경험적 분포를 사용해 인구의 평균장 효과를 근사한다.
- 각 에이전트는 이력 전이 데이터로부터 전이 확률을 사후 표본 추출 기반으로 샘플링한다.
- 샘플된 전이 모델을 기반으로 하향적 이성적 최적 반응 역학을 사용한다.
- 에이전트들은 샘플된 모델을 반복적으로 업데이트하여 최적의 무관 전략으로 수렴하도록 정책을 갱신한다.
- 이 방법은 행동 분포가 평균장 균형과 일치하는 한계 분포로 수렴함을 보장한다.
- 이론적 분석을 통해 제안된 학습 역학 하에서 정책과 행동 분포가 MFE로 수렴함을 증명한다.
실험 결과
연구 질문
- RQ1사후 표본 추출 기반 강화 학습 알고리즘이 행동 결합이 있는 확률적 게임에서 평균장 균형으로 수렴할 수 있는가?
- RQ2에피소드 프레임워크에서 경험적 평균장 근사 설정 하에서 에이전트의 정책과 행동 분포는 어떻게 진화하는가?
- RQ3샘플된 전이 모델의 사용이 대규모 인구 설정에서 안정적이고 최적의 행동을 이끌어내는가?
- RQ4정책과 행동 분포가 최적의 무관 전략과 그 한계 분포로 수렴하기 위한 조건은 무엇인가?
주요 결과
- 제안된 알고리즘은 각 에이전트의 정책이 최적의 무관 전략으로 수렴함을 보장한다.
- 에이전트 간의 경험적 행동 분포가 평균장 균형과 일치하는 한계 분포로 수렴한다.
- 에이전트들이 이력 전이 데이터로부터 전이 동역학을 사후 표본 추출로 모델링하는 것을 전제로 수렴이 확립된다.
- 샘플된 모델 기반의 하향적 이성적 최적 반응 역학을 활용하여 균형 수렴을 달성한다.
- 행동 결합이 있는 에피소드 평균장 게임에서 수렴에 대한 이론적 보장을 제공한다.
- 경험적 행동 분포를 통해 인구 효과를 효과적으로 근사함으로써 대규모 에이전트 환경에서의 확장 가능한 학습을 가능하게 한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.