Skip to main content
QUICK REVIEW

[논문 리뷰] Global Convergence of Policy Gradient for Linear-Quadratic Mean-Field Control/Game in Continuous Time

Wei-Chen Wang, Jiequn Han|arXiv (Cornell University)|2020. 08. 16.
Reinforcement Learning in Robotics참고 문헌 51인용 수 6
한 줄 요약

이 논문은 연속 시간 선형-제곱형 평균장 제어 및 게임 문제에 대해 정책 기울기 방법의 전역 수렴성을 확립하며, 미묘한 조건 하에서 선형 수렴 속도를 보여준다. 이는 리카티 및 선형 시스템에 대한 새로운 안정성 및 민감도 경계를 사용하여 이산 시간 정책 기울기 분석을 연속 시간 스토케스틱 동역학으로 확장한다.

ABSTRACT

Reinforcement learning is a powerful tool to learn the optimal policy of possibly multiple agents by interacting with the environment. As the number of agents grow to be very large, the system can be approximated by a mean-field problem. Therefore, it has motivated new research directions for mean-field control (MFC) and mean-field game (MFG). In this paper, we study the policy gradient method for the linear-quadratic mean-field control and game, where we assume each agent has identical linear state transitions and quadratic cost functions. While most of the recent works on policy gradient for MFC and MFG are based on discrete-time models, we focus on the continuous-time models where some analyzing techniques can be interesting to the readers. For both MFC and MFG, we provide policy gradient update and show that it converges to the optimal solution at a linear rate, which is verified by a synthetic simulation. For MFG, we also provide sufficient conditions for the existence and uniqueness of the Nash equilibrium.

연구 동기 및 목표

  • 연속 시간 평균장 제어 및 게임(MFC/MFG) 설정에서 정책 기울기 방법에 대한 이론적 수렴 분석의 격차를 메운다.
  • 기존의 이산 시간 정책 기울기 수렴 결과를 선형-제곱형 구조를 가진 연속 시간 스토케스틱 동역학으로 확장한다.
  • 평균장 제어(MFC) 및 평균장 게임(MFG) 설정 모두에 대해 선형 수렴 속도를 보장하는 증명 가능한 전역 수렴을 제공한다.
  • MFG 설정에서 나시 균형의 존재성과 유일성을 위한 충분조건을 확립한다.
  • 상호작용하는 평균장 동역학을 가진 MFG 설정에서 선형 수렴을 보장하는 이중 단계 알고리즘 프레임워크를 개발한다.

제안 방법

  • 재매aram터라이제이션을 통해 평균장 제어(MFC) 문제를 표준 선형-제곱형 조절기(LQR) 문제로 재구성한다.
  • 더 복잡한 MFG 설정을 분석하기 위한 중간 단계로, 이격된 LQR 문제를 도입한다.
  • 최적의 반응 문제(이격된 LQR)를 해결하고 평균장 상태를 갱신하는 것을 번갈아가며 수행하는 정책 기울기 알고리즘을 설계한다.
  • 시스템 매개변수의 리프시츠 연속성과 역행렬 민감도를 사용하여 리카티 및 선형 시스템의 안정성 경계를 유도한다.
  • 스펙트럴 노름과 조건수를 활용하여 반복값과 최적 정책 간의 거리를 제한하기 위해 재귀적 오차 분해를 사용한다.
  • 수렴을 보장하기 위해 문제 특화 상수에 기반한 적응형 단계 크기(ε_s)를 설정한다. 이는 최적 해의 ε-근처로 수렴을 보장한다.

실험 결과

연구 질문

  • RQ1정책 기울기 방법은 연속 시간 선형-제곱형 평균장 제어 문제에서 전역 수렴을 달성할 수 있는가?
  • RQ2연속 시간 MFC 및 MFG 설정에서 정책 기울기의 수렴 속도는 무엇인가?
  • RQ3이산 시간 정책 기울기의 이론적 분석은 어떻게 연속 시간 스토케스틱 동역학으로 확장될 수 있는가?
  • RQ4연속 시간 평균장 게임에서 나시 균형이 존재하고 유일하게 유지되는 조건은 무엇인가?
  • RQ5상호작용하는 평균장 동역학을 가진 MFG 설정에서 선형 수렴을 보장하는 알고리즘 구조는 무엇인가?

주요 결과

  • 연속 시간 선형-제곱형 평균장 제어에 대한 정책 기울기 방법은 최적 해로 선형 속도로 전역 수렴한다.
  • 평균장 게임의 경우, 제안된 이중 단계 알고리즘이 존재성과 유일성에 대한 충분 조건을 만족할 경우 나시 균형으로 선형 수렴을 달성한다.
  • 수렴 속도는 기하급수 감쇠 인자 L₀ < 1로 정량화되며, 이는 S 반복 후 오차가 ε 이내로 제한됨을 보장한다.
  • S = O(log(1/ε)) 반복 후 정책 매개변수(K 및 b)에 대해 ε-정확도를 달성하며, S는 초기 오차와 L₀에 따라 달라진다.
  • 매개변수 오차의 경계는 시스템 행렬(R, D, Dᵀ)의 스펙트럴 성질에 의존하며, σ_min(R) 및 σ_min(DDᵀ)에 명시적인 의존성이 있다.
  • 오차 경계에 포함된 C_b(μ_s) 및 C_K(μ_s)는 시스템 및 정책 민감도에 비례하므로, 소음에 대한 수렴이 강건함을 보여준다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.