Skip to main content
QUICK REVIEW

[논문 리뷰] Learning in Nonzero-Sum Stochastic Games with Potentials

David Mguni, Yutong Wu|Research Portal (King's College London)|2021. 03. 16.
Reinforcement Learning in Robotics참고 문헌 60인용 수 10
한 줄 요약

이 논문은 연속 상태-행동 공간을 가진 비제로 합 스토케스틱 게임을 위한 새로운 다중 에이전트 강화 학습 알고리즘인 SPot-AC를 제안한다. 이 알고리즘은 스토케스틱 퍼텐셜 게임(SPGs)을 활용하여, 다항 시간 내에 나시 균형에 수렴함을 증명하고, 복잡한 작업인 조율 주행 및 대규모 사적인 라우팅에서 기존 최고 수준의 방법들인 MADDPG와 COMIX를 능가한다.

ABSTRACT

Multi-agent reinforcement learning (MARL) has become effective in tackling discrete cooperative game scenarios. However, MARL has yet to penetrate settings beyond those modelled by team and zero-sum games, confining it to a small subset of multi-agent systems. In this paper, we introduce a new generation of MARL learners that can handle nonzero-sum payoff structures and continuous settings. In particular, we study the MARL problem in a class of games known as stochastic potential games (SPGs) with continuous state-action spaces. Unlike cooperative games, in which all agents share a common reward, SPGs are capable of modelling real-world scenarios where agents seek to fulfil their individual goals. We prove theoretically our learning method, SPot-AC, enables independent agents to learn Nash equilibrium strategies in polynomial time. We demonstrate our framework tackles previously unsolvable tasks such as Coordination Navigation and large selfish routing games and that it outperforms the state of the art MARL baselines such as MADDPG and COMIX in such scenarios.

연구 동기 및 목표

  • 팀 및 제로 합 설정을 초월한 비제로 합 스토케스틱 게임에 대해 효과적인 다중 에이전트 강화 학습(MARL) 방법의 부족을 해결한다.
  • 자율 주행차 및 네트워크 라우팅과 같은 실제 응용 분야에서 흔한 연속 상태-행동 공간에서의 학습을 가능하게 한다.
  • 에이전트 수에 따라 조합적 복잡도가 증가하지 않는 확장 가능한 MARL 알고리즘을 개발한다.
  • 연속적 스토케스틱 퍼텐셜 게임(c-SPGs)에서 나시 균형으로의 수렴에 대한 이론적 보장을 제공한다.
  • 알 수 없는 환경으로 일반화되며 확장성을 유지하는 분산형 액터-크리틱 기반 학습 프레임워크를 설계한다.

제안 방법

  • 단계별 에이전트 상호작용이 퍼텐셜 게임 성질을 가지는 연속적 스토케스틱 퍼텐셜 게임(c-SPGs)을 수학적으로 정의한다.
  • c-SPGs를 마르코프 결정과정(MDP)으로의 이중 표현으로 설정하여, 나시 균형을 MDP 해법을 통해 계산할 수 있도록 한다.
  • 알 수 없는 c-SPG 환경에서 나시 균형 전략을 학습하는 분산형 액터-크리틱 알고리즘인 SPot-AC를 제안한다.
  • 알려진 환경 모델을 위해 효율적인 나시 균형을 계산하는 데 사용할 수 있는, 피팅된 Q-학습 변형인 SPot-Q를 도입한다.
  • 퍼텐셜 함수 구축을 통해 에이전트 상호작용을 분리하고, 중심화된 크리틱과 유사한 메커니즘을 통해 균형 수렴을 보장한다.
  • 퍼텐셜 함수의 작은 추정 오차에 대해 방법의 강건성을 증명하여, 진정한 나시 균형에 가까운 근사치를 제공함을 보여준다.

실험 결과

연구 질문

  • RQ1팀 및 제로 합 설정을 초월한 연속적 비제로 합 스토케스틱 게임에서 나시 균형으로 수렴하는 MARL 알고리즘을 설계할 수 있는가?
  • RQ2스토케스틱 게임에서의 퍼텐셜 게임 구조가 MDP 이중성에 의해 나시 균형의 계산 가능성을 높이는가?
  • RQ3분산형 액터-크리틱 기반 MARL 알고리즘이 에이전트 수에 따라 효율적으로 확장되면서도 수렴 보장을 유지할 수 있는가?
  • RQ4제안된 방법은 조율 주행 및 대규모 사적인 라우팅과 같은 실제 세계 기반 작업에서 어떻게 성능을 발휘하는가?
  • RQ5퍼텐셜 함수의 추정 오차가 계산된 나시 균형의 정확도에 얼마나 큰 영향을 미치는가?

주요 결과

  • SPot-AC는 연속적 스토케스틱 퍼텐셜 게임에서 다항 시간 내에 나시 균형에 수렴함을 엄밀히 증명한다.
  • 이 방법은 이전에 해결이 어려웠던 작업들—예를 들어 조율 주행 및 대규모 사적인 라우팅 게임—에서 뛰어난 성능을 발휘한다.
  • 복잡한 연속적 작업에서 SPot-AC는 MADDPG 및 COMIX와 같은 최신 MARL 기준선보다 수렴 속도와 최종 성능 면에서 뛰어나다.
  • 이론적 분석을 통해 퍼텐셜 함수가 작은 오차로 추정될 경우 SPot-AC가 진정한 나시 균형에 매우 가까운 근사를 제공함을 보여준다.
  • 이중 MDP 표현은 고정점 문제를 해결 가능한 MDP로 변환함으로써 나시 균형의 효율적 계산을 가능하게 한다.
  • SPot-AC의 분산형 변형은 에이전트 수에 따라 효과적으로 확장되며, 중심화된 크리틱에서 발생하는 조합적 폭발을 피한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.