Skip to main content
QUICK REVIEW

[논문 리뷰] Q-Learning in Regularized Mean-field Games

Berkay Anahtarcı, Can Deha Karıksız|arXiv (Cornell University)|2020. 03. 24.
Receptor Mechanisms and Signaling인용 수 4
한 줄 요약

이 논문은 강력한 볼록성 가정이 필요 없는 강화학습에서의 수렴성과 오차 분석을 가능하게 하는 정규화된 평균장 게임 프레임워크를 제안한다. 일단계 보상에 강하게 볼록한 정규화 항을 통합함으로써, 최적 정책의 리프시츠 연속성을 보장하는 피팅된 Q-학습 알고리즘을 개발하여 이전 연구보다 더 유연한 조건에서도 수렴 보장을 확보한다.

ABSTRACT

In this paper, we introduce a regularized mean-field game and study learning of this game under an infinite-horizon discounted reward function. Regularization is introduced by adding a strongly concave regularization function to the one-stage reward function in the classical mean-field game model. We establish a value iteration based learning algorithm to this regularized mean-field game using fitted Q-learning. The regularization term in general makes reinforcement learning algorithm more robust to the system components. Moreover, it enables us to establish error analysis of the learning algorithm without imposing restrictive convexity assumptions on the system components, which are needed in the absence of a regularization term.

연구 동기 및 목표

  • 최소한의 가정 조건 하에서 평균장 게임 학습의 수렴성과 오차 경계를 확립하는 데 도전한다.
  • 이전 연구에서 정책의 리프시츠 연속성을 확보하기 위해 요구하던 보상 함수의 강한 볼록성과 미분 가능성 조건을 극복한다.
  • 정규화된 설정에서 평균장 균형에 수렴하는 밸류 이터레이션 기반 학습 알고리즘을 개발한다.
  • 정규화를 활용하여 모델 프리 Q-학습을 평균장 게임으로 일반화하여 정책 학습의 안정성을 제고한다.
  • 시스템 구성 요소에 대한 제한적인 볼록성 조건을 부과하지 않고도 학습 알고리즘의 이론적 오차 경계를 제공한다.

제안 방법

  • 일단계 보상에 강하게 볼록한 함수를 추가하여 정규화된 평균장 게임을 도입함으로써 안정성과 내성적 강건성을 향상시킨다.
  • 무한 시간 할인 보상 기준 하에서 정규화된 평균장 게임을 해결하기 위해 피팅된 Q-학습 기반의 밸류 이터레이션 알고리즘을 제안한다.
  • 강한 볼록성과 미분 가능성의 이중성 관계를 활용하여 평균장 항에 대해 최적 정책의 리프시츠 연속성을 확립한다.
  • 오차 분석 기법을 활용하여 정규화된 최적 정책의 가치 함수와 ε-최적 정책의 가치 함수 간의 차이를 경계한다.
  • 보상, 전이 커널, 가치 함수의 리프시츠 상수를 활용하여 정량적 오차 경계를 유도하고, 이를 통해 수렴 속도를 도출한다.
  • 유한 인구 게임의 수렴을 평균장 극한으로 활용하여, 유한 시스템에서의 ε-네시 균형이 평균장 균형을 점점 더 잘 근사함을 보여준다.

실험 결과

연구 질문

  • RQ1정규화가 보상 함수의 강한 볼록성이 요구되지 않는 Q-학습 기반 알고리즘의 수렴성을 가능하게 할 수 있는가?
  • RQ2정규화는 평균장 분포에 대한 최적 정책의 리프시츠 연속성에 어떻게 영향을 미치는가?
  • RQ3최소한의 가정 조건 하에서 정규화된 평균장 게임에서 피팅된 Q-학습 알고리즘에 대해 확립할 수 있는 오차 경계는 무엇인가?
  • RQ4정규화된 평균장 게임 프레임워크는 비정규화된 모델 대비 학습의 강건성과 안정성에 얼마나 기여하는가?
  • RQ5정규화된 설정에서, 유한 인구 게임 균형은 어떻게 평균장 균형으로 수렴하는가?

주요 결과

  • 정규화 항은 최적 정책이 평균장 분포에 대해 리프시츠 연속적이 되도록 보장하여 최적성 연산자의 수축을 가능하게 한다.
  • 미세한 정규성 조건 하에서, $\|J_{\mu_*}^{\text{reg}}(\pi_*,\cdot) - J_{\mu_*}^{\text{reg}}(\pi_\varepsilon,\cdot)\|_{\infty} \leq \frac{C_3 \varepsilon}{1 - \beta}$ 형태의 오차 경계를 확립하였으며, 여기서 $C_3 = L_1 + L_{\text{reg}} + \frac{\beta K_1 K_{\text{Lip}}}{2}$이다.
  • 피팅된 Q-학습 알고리즘은 보상 함수의 강한 볼록성이나 미분 가능성 조건 없이도 정규화된 프레임워크 하에서 평균장 균형으로 수렴한다.
  • 최적 정책과 ε-최적 정책 간 가치 함수의 차이에 대한 오차 경계는 $\frac{C_2 \varepsilon}{1 - \beta}$이며, $C_2 = \left(L_1 + \frac{\beta K_1 K_{\text{Lip}}}{2}\right)\frac{K_1}{1 - C_1}$로 표현되며, 정책 근사 오차에 의존함을 보여준다.
  • 유한 인구 게임은 평균장 균형으로 수렴하며, $N \to \infty$일 때 점점 더 잘 수렴한다. 충분히 큰 $N$에 대해 $J_1^{(N)}(\boldsymbol{\pi}^{(N)}) \geq \sup_{\pi^1} J_1^{(N)}(\boldsymbol{\pi}^{(N)}_{-1}, \pi^1) - \tau\varepsilon - \delta$ 가 성립한다.
  • 이 프레임워크는 이전에 평균장 균형 연산자의 수축을 증명하기 위해 요구되었던 강한 볼록성 및 미분 가능성 가정을 제거한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.