Skip to main content
QUICK REVIEW

[논문 리뷰] Convergence of Multi-Agent Learning with a Finite Step Size in General-Sum Games

Xinliang Song, Tonghan Wang|arXiv (Cornell University)|2019. 03. 07.
Reinforcement Learning in Robotics참고 문헌 24인용 수 4
한 줄 요약

이 논문은 일반합 게임에서 유한한 단계 크기로 내쉬 균형 수렴을 보장하는 경사 기반 다중 에이전트 학습 알고리즘인 GA-SPP를 제안한다. 기존 방법과 달리, 무한소 학습률이 필요 없이 $m\times n$ 양의 준정적 행렬 게임, $2\times n$ 게임, $2\times 2$ 게임에서 내쉬 균형으로의 수렴을 보장한다.

ABSTRACT

Learning in a multi-agent system is challenging because agents are simultaneously learning and the environment is not stationary, undermining convergence guarantees. To address this challenge, this paper presents a new gradient-based learning algorithm, called Gradient Ascent with Shrinking Policy Prediction (GA-SPP), which augments the basic gradient ascent approach with the concept of shrinking policy prediction. The key idea behind this algorithm is that an agent adjusts its strategy in response to the forecasted strategy of the other agent, instead of its current one. GA-SPP is shown formally to have Nash convergence in larger settings than existing gradient-based multi-agent learning methods. Furthermore, unlike existing gradient-based methods, GA-SPP's theoretical guarantees do not assume the learning rate to be infinitesimal.

연구 동기 및 목표

  • 에이전트들의 동시 학습이 수렴을 약화시키는 비정적 환경에서의 다중 에이전트 학습 문제에 대응한다.
  • 기존 경사 기반 방법들이 이론적 수렴을 위해 무한소 학습률이 필요하다는 한계를 극복한다.
  • 더 넓은 일반합 게임 클래스에서 내쉬 균형으로의 수렴에 대해 더 강력한 이론적 보장을 제공한다.
  • IGA-PP 및 초거꾸기 경사 방법과 같은 기존 정책 예측 기반 접근법보다 향상된 실용성과 이론적 기반을 갖춘 알고리즘을 개발한다.
  • 학습률과 전략 투영에 대한 가정을 완화함으로써 더 강건하고 확장 가능한 복잡한 환경에서의 다중 에이전트 학습을 가능하게 한다.

제안 방법

  • 상대의 전략을 예측하고 이를 기반으로 정책을 조정하는 새로운 경사 상승 알고리즘인 경사 상승법과 수축 정책 예측(GA-SPP)을 도입한다.
  • 정책 업데이트 빈도와 다를 수 있는 수축 예측 길이를 사용하여 더 큰 유연성과 더 강력한 이론적 보장을 확보한다.
  • 각 단계에서 예측된 상대 전략을 유효한 확률 단체에 투영함으로써 전략의 타당성을 보장하고 내쉬 수렴을 지원한다.
  • 형식적으로 $m\times n$ 양의 준정적 행렬 게임, $2\times n$ 일반합 게임의 부분집합, $2\times 2$ 일반합 게임에서 GA-SPP의 내쉬 수렴을 증명한다.
  • 전략 타당성을 업데이트 중 유지하기 위해 볼록 투영 연산자 $\Pi_{\bm{\Delta}}$ 및 $P_{\bm{\Delta}}(\bm{x}, \bm{v})$를 활용한다.
  • 이론적 수렴 보장을 훼손하지 않고 유한한 학습률 $\eta$를 통합함으로써 이전의 무한소 단계 크기 가정을 깨뜨린다.

실험 결과

연구 질문

  • RQ1경사 기반 다중 에이전트 학습 알고리즘이 일반합 게임에서 유한한 학습률로 내쉬 수렴을 달성할 수 있는가?
  • RQ2GA-SPP는 어떤 일반합 게임 클래스에서 내쉬 균형으로의 수렴을 보장하는가?
  • RQ3수축 정책 예측은 IGA-PP 및 초거꾸기 경사와 같은 기존 방법에 비해 수렴 안정성과 이론적 보장에 어떻게 기여하는가?
  • RQ4예측된 전략을 유효한 전략 공간에 투영하는 것이 내쉬 균형으로의 수렴을 향상시키는가?
  • RQ5GA-SPP는 이론적 범위를 초월한 경험적 설정에서 GIGA-WoLF 및 IGA-PP와 같은 기존 알고리즘을 능가할 수 있는가?

주요 결과

  • GA-SPP는 $m\times n$ 양의 준정적 행렬 게임에서 유한 단계 크기로 내쉬 수렴을 보장하는 최초의 경사 상승 기반 다중 에이전트 학습 알고리즘이다.
  • GA-SPP는 이전 방법보다 더 넓은 게임 클래스에서 내쉬 균형으로의 수렴을 보장하며, 이는 $2\times n$ 일반합 게임과 $2\times 2$ 게임을 포함한다.
  • 경험 결과에 따르면 GA-SPP는 고전적 게임인 갈등의 딜레마, 치킨 게임, 성별 전쟁, 가위-바위-보에서 내쉬 균형으로 수렴한다.
  • 셰플리 게임과 $2\times 3$ 게임에서 GA-SPP는 GIGA-WoLF가 실패하는 상황에서도 내쉬 균형으로 수렴하며, 수렴 안정성에서 IGA-PP를 능가한다.
  • IGA-PP는 예측 길이에 민감하여 비균형 전략으로 수렴할 수 있는 반면, GA-SPP는 다양한 예측 길이에서도 내쉬 균형으로 수렴을 유지한다.
  • 세 명의 참가자가 있는 매칭 펜니 게임에서는 일정한 예측 길이로 GA-SPP가 수렴하지 못하며, 이는 높은 비선형성 또는 혼돈 동역학에서의 한계를 시사한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.