Skip to main content
QUICK REVIEW

[논문 리뷰] Independent and Decentralized Learning in Markov Potential Games

Chinmay Maheshwari, Manxi Wu|arXiv (Cornell University)|2022. 05. 29.
Game Theory and Applications인용 수 6
한 줄 요약

이 논문은 무한 시간 할인 마르코프 퍼텐셜 게임에서, 협력 없이 전체 게임 지식 없이도, 빠른 Q함수 추정과 느린 정책 개선을 위한 이중 시간스케일 비동기 갱신을 통해 독립적이고 분산된 다중 에이전트 강화학습 알고리즘을 제안한다. 이 방법은 거의 확실하게 정적 나시 균형 집합으로 수렴함을 증명할 수 있으며, 협력이나 게임 모델 지식이 없어도 가능하다.

ABSTRACT

We study a multi-agent reinforcement learning dynamics, and analyze its asymptotic behavior in infinite-horizon discounted Markov potential games. We focus on the independent and decentralized setting, where players do not know the game parameters, and cannot communicate or coordinate. In each stage, players update their estimate of Q-function that evaluates their total contingent payoff based on the realized one-stage reward in an asynchronous manner. Then, players independently update their policies by incorporating an optimal one-stage deviation strategy based on the estimated Q-function. Inspired by the actor-critic algorithm in single-agent reinforcement learning, a key feature of our learning dynamics is that agents update their Q-function estimates at a faster timescale than the policies. Leveraging tools from two-timescale asynchronous stochastic approximation theory, we characterize the convergent set of learning dynamics.

연구 동기 및 목표

  • 협력 없이 또는 게임 모델 지식이 없는 다중에이전트 시스템에서 나시 균형을 학습하는 데 도전하는 것.
  • 마르코프 퍼텐셜 게임에서 정적 나시 균형으로 수렴하는 분산형, 독립적 학습 다이내믹스를 설계하는 것.
  • 에이전트가 상대방이나 전이 동역학을 알지 못하고 자신의 보상과 상태만 관측하는 최소 정보 조건에서도 수렴 가능하게 하는 것.
  • 표준 가정 하에 이중 시간스케일 확률적 근사 프레임워크를 사용하여 거의 확실한 수렴을 증명하는 것.

제안 방법

  • 에이전트들은 관측된 보상과 상태 전이를 바탕으로 더 빠른 시간스케일에서 자신의 조건부 보상에 대한 Q함수 추정치를 유지하고 갱신한다.
  • 정책은 현재의 Q추정치에서 유도된 최적의 한 단계 이탈 전략을 기반으로 더 느린 시간스케일에서 갱신된다.
  • 학습은 비동기적으로 이루어지며, 각 단계에서 실현된 상태-행동 쌍의 Q값과 해당 정책만 갱신되며, 방문 빈도에 기반한 이질적인 스텝 사이즈를 사용한다.
  • 각 단계에서 균일한 랜덤 행동과 정책을 혼합하여 탐색을 보장한다.
  • 알고리즘은 이중 시간스케일 확률적 근사 프레임워크를 활용하며, 정책 진화를 연속시간 동역학으로 모델링한다.
  • 연속시간 극한의 분석과 표준 가정 하에 이산시간 동역학과의 등가성을 통해 수렴성을 확립한다.

실험 결과

연구 질문

  • RQ1협력 없이 또는 게임 모델 지식 없이도, 마르코프 퍼텐셜 게임에서 독립적이고 분산된 에이전트가 정적 나시 균형으로 수렴할 수 있는가?
  • RQ2비동기적이고 자기 중심적인 정책 갱신을 포함하는 이중 시간스케일 학습 다이내믹스는 마르코프 퍼텐셜 게임에서 나시 균형으로 수렴하는가?
  • RQ3추정된 Q값에 기반한 최적의 한 단계 이탈 전략이 분산 환경에서 수렴을 이끌 수 있는가?
  • RQ4이 분산 다중에이전트 강화학습 환경에서 정책 갱신의 거의 확실한 수렴을 보장하는 조건은 무엇인가?

주요 결과

  • 제안된 학습 다이내믹스는 무한 시간 할인 마르코프 퍼텐셜 게임에서 거의 확실하게 정적 나시 균형 집합으로 수렴한다.
  • 이중 시간스케일 확률적 근사 프레임워크를 통해 수렴성이 확립되었으며, 이로써 이산시간 갱신과 연속시간 동역계를 연결한다.
  • 정책 갱신 규칙으로 정의된 연속시간 동역계는 나시 균형 집합으로 수렴하며, 이는 이산시간 알고리즘이 거의 확실하게 수렴함을 의미한다.
  • 이 방법은 협력, 상대방의 보상 지식, 시뮬레이터 접근이 필요 없으며, 국소적 관측인 보상과 상태만으로도 작동한다.
  • 분석을 통해 극한에서의 모든 정책 프ofile은 나시 균형이어야 하며, 그렇지 않으면 어떤 이탈도 엄격히 더 높은 값을 가져와 균형 조건과 모순된다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.