Skip to main content
QUICK REVIEW

[논문 리뷰] Last-iterate Convergence of Decentralized Optimistic Gradient Descent/Ascent in Infinite-horizon Competitive Markov Games

Chen-Yu Wei, Chung‐Wei Lee|arXiv (Cornell University)|2021. 02. 08.
Reinforcement Learning in Robotics참고 문헌 44인용 수 13
한 줄 요약

이 논문은 무한 시간 할인율을 가진 두 명의 플레이어가 참여하는 제로섬 마르코프 게임에서, 최적화된 경사 하강/상승(OGDA)과 천천히 업데이트되는 비평가를 기반으로 하는 탈중앙화된 대칭 알고리즘을 제안한다. 이 알고리즘은 자가 연습(self-play) 하에서 나시 균형에 유한 시간 내에 마지막 반복 수렴(last-iterate convergence)을 달성하며, 이는 합리성, 무지성, 수렴성이라는 세 가지 성질을 동시에 만족시키는 최초의 알고리즘으로, 이 설정에서 네 가지 성질을 동시에 충족시킨다.

ABSTRACT

We study infinite-horizon discounted two-player zero-sum Markov games, and develop a decentralized algorithm that provably converges to the set of Nash equilibria under self-play. Our algorithm is based on running an Optimistic Gradient Descent Ascent algorithm on each state to learn the policies, with a critic that slowly learns the value of each state. To the best of our knowledge, this is the first algorithm in this setting that is simultaneously rational (converging to the opponent's best response when it uses a stationary policy), convergent (converging to the set of Nash equilibria under self-play), agnostic (no need to know the actions played by the opponent), symmetric (players taking symmetric roles in the algorithm), and enjoying a finite-time last-iterate convergence guarantee, all of which are desirable properties of decentralized algorithms.

연구 동기 및 목표

  • 자기 연습 하에서 나시 균형에 수렴하는 탈중앙화된 알고리즘을 개발하는 것.
  • 알고리즘이 합리적이며, 어떤 정적 상대 플레이어 정책에도 최적 반응(best-respond)하는 것.
  • 글로벌 지식이나 조율 없이도 유한 시간 내에 마지막 반복 수렴을 달성하는 것.
  • 탈중앙화된 환경에서 대칭성, 무지성, 수렴 보장성을 유지하는 것.
  • 이전에 행렬 게임에서 사용된 OGDA를 더 복잡한 비볼록(non-convex) 설정인 무한 시간 할인율 마르코프 게임으로 확장하는 것.

제안 방법

  • 각 상태에서 정책을 업데이트하기 위해 최적화된 경사 하강/상승(OGDA)을 사용하며, 학습 안정화를 위해 지연 업데이트 규칙을 적용한다.
  • 비평가 성분은 재귀적 업데이트를 통해 값 함수 $V_t^s$ 를 천천히 학습한다: $V_t^s = (1 - \alpha_t)V_{t-1}^s + \alpha_t \rho_t^s$.
  • 비평가 성분은 $Q_t^s y^s$ 와 $x_t^{s\top} Q_t^s y^s$ 의 $\varepsilon$-근사값 $\ell_t^s$ 와 $\rho_t^s$ 를 사용하여 Q-값과 값 함수를 추정한다.
  • 합리성 증명을 위해 단일 행동 상대 플레이어를 갖는 수정된 게임을 구성하며, 정책 업데이트가 최적 반응 역학을 그대로 반영함을 보인다.
  • 기본 구조 가정(예: 정적 정책에 의해 유도된 마르코프 체인의 비가역성) 하에, 기울기 및 값 추정 오차 분석과 귀납적 방법을 통해 수렴성을 확립한다.
  • 알고리즘은 대칭적이며, 상대 플레이어 행동을 알 필요가 없는 무지성이며, 지역 피드백만으로도 탈중앙화 실행이 가능하도록 설계되어 있다.

실험 결과

연구 질문

  • RQ1무한 시간 할인율을 가진 두 명의 플레이어가 참여하는 제로섬 마르코프 게임에서 탈중앙화된 알고리즘이 나시 균형에 마지막 반복 수렴을 달성할 수 있는가?
  • RQ2이러한 알고리즘이 정적 상대 플레이어 정책에 대해 최적 반응을 보이며 자가 연습 하에서 수렴할 수 있는가?
  • RQ3비볼록, 비볼록(non-concave) 설정에서 유한 시간 수렴을 달성하면서도 대칭성과 무지성을 유지할 수 있는가?
  • RQ4OGDA는 어떻게 행렬 게임에서 상태에 따라 달라지는 동역학과 값 함수를 갖는 마르코프 게임으로 확장될 수 있는가?
  • RQ5천천히 업데이트되는 비평가는 정책 학습의 안정성과 수렴성 달성에 어떤 역할을 하는가?

주요 결과

  • 제안된 알고리즘은 무한 시간 할인율을 가진 두 명의 플레이어가 참여하는 제로섬 마르코프 게임에서 자가 연습 하에서 나시 균형 집합에 대해 유한 시간 내에 마지막 반복 수렴을 달성한다.
  • 알고리즘은 합리적이다: 상대 플레이어가 정적 정책을 사용할 경우, 에이전트의 정책은 최적 반응으로 수렴한다.
  • 알고리즘은 대칭적이며, 무지성이며, 탈중앙화되어 있다: 상대 플레이어 행동을 아는 것 없이도 작동한다.
  • 비평가의 천천히 업데이트되는 특성 덕분에 안정성이 확보되며, 수렴 속도는 기울기 및 값 추정 오차에 의존한다.
  • 기본 구조 가정(예: 정적 정책에 의해 유도된 마르코프 체인의 비가역성) 하에 알고리즘의 수렴성이 강건함을 분석을 통해 입증하였다.
  • 이 설정에서 합리성, 마지막 반복 수렴, 무지성, 대칭성의 네 가지 성질을 동시에 만족시키는 최초의 알고리즘이다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.